FEATURED · 精选文章

基于聊天记录的LLM性格推断:技术路径、评估挑战与伦理边界

发布时间 / 2026/8/25 11:17:17
来源 / 创域科博编辑部
栏目 / 资讯中心
基于聊天记录的LLM性格推断:技术路径、评估挑战与伦理边界 1. 从聊天记录看透人心一个从业者的实验与思考最近在跟进大语言模型LLM在对话式代理Conversational Agent领域的应用时一个反复被提及但又充满争议的问题浮出水面我们能否仅仅通过用户与AI的聊天历史就让LLM来推断用户的性格特质这听起来像是科幻电影里的情节但背后却是一个严肃且极具现实意义的技术命题。无论是为了提供更个性化的服务还是为了理解用户偏好、优化产品体验甚至是在某些研究场景下进行非侵入性的用户画像构建这个问题的答案都至关重要。然而当我真正着手去探索“Can LLMs Infer Conversational Agent Users Personality Traits from Chat History?”这个命题时发现它远非一个简单的“是”或“否”能回答。它横跨了心理学、自然语言处理、机器学习伦理等多个领域充满了技术挑战和认知陷阱。市面上充斥着各种乐观的宣称和简单的演示但作为一名从业者我更关心的是其可行性边界、技术实现路径、评估方法的可靠性以及背后那些容易被忽略的伦理风险。这篇文章我将结合自己的实验和思考拆解这个问题的方方面面希望能为你提供一个更立体、更务实的视角。2. 性格推断定义、理论与数据基础在让机器做判断之前我们首先得明确“判断什么”以及“依据什么理论”。性格特质Personality Traits并不是一个模糊的感觉在心理学研究中有相对成熟的模型作为量化基础。2.1 主流性格模型大五人格理论目前学术界和工业界最广泛接受的是大五人格模型Big Five Personality Traits也称为OCEAN模型。它将人的性格划分为五个相对独立的维度开放性Openness to experience好奇心、想象力、对新事物的接受程度。高分者富于创造性、喜欢探索低分者更务实、传统。尽责性Conscientiousness组织性、责任感、自律性。高分者可靠、有条理低分者可能更随意、灵活。外向性Extraversion社交性、活力、积极情绪。高分者热情、健谈、喜欢人群低分者内向者更安静、保守。宜人性Agreeableness合作性、同情心、信任他人的倾向。高分者友善、乐于助人低分者更具批判性、竞争性。神经质Neuroticism情绪稳定性。高分者更容易体验焦虑、抑郁、愤怒等负面情绪低分者情绪更稳定、冷静。这五个维度为性格提供了一个可操作化的框架。当我们说“用LLM推断性格”时通常是指让模型根据文本为这五个维度分别给出一个分数例如1-5分的李克特量表或分类高/低。2.2 聊天记录作为数据源优势与先天不足对话历史作为推断素材有其独特的价值但也存在根本性局限。优势在于生态效度高聊天记录是用户在自然、低压力与AI对话通常无社交压力情境下产生的真实语言数据避免了问卷调查中常见的“社会赞许性偏差”即回答时迎合社会期望。动态与丰富它包含了语言风格用词、句式、话题偏好、情感倾向、互动模式如提问频率、回应长度等多维度信息是静态问卷无法比拟的。非侵入性理论上可以在用户无感知的情况下进行分析用户体验更流畅。然而其先天不足也非常明显情境单一性与AI的对话场景是高度特定的。用户可能只在这里咨询技术问题、寻求情感安慰或进行角色扮演。他在这个场景下表现出的“性格”可能只是他全部人格的一个侧面甚至是刻意扮演的角色。话题局限性聊天内容受限于对话代理的功能。一个法律咨询AI的聊天记录主要反映用户的法律关切和表达严谨性很难推断其“开放性”或“外向性”。长度与深度单次对话可能很短缺乏足够的行为样本。性格是跨情境一致性的表现需要足够多的语言证据来支撑。语言风格不等于性格用词华丽可能源于高“开放性”也可能只是文学素养高回复简短可能因为内向也可能只是当时在忙。存在大量的混淆变量。注意我们必须清醒认识到基于单一渠道、特定场景的文本进行性格推断其结论永远是一个概率性的、有情境限制的近似估计绝不能与专业的心理评估划等号。3. 技术实现路径从Prompt工程到微调明确了目标和数据特点后我们来看看如何让LLM完成这个任务。主流技术路径大致可以分为三类各有优劣。3.1 零样本/少样本提示Zero/Few-shot Prompting这是最直接、门槛最低的方法。我们直接设计一个提示词Prompt要求LLM根据给定的对话历史评估用户的五大性格维度。示例提示词结构你是一位经验丰富的心理学家。请仔细分析以下用户与AI助手的对话历史并推断该用户在“大五人格”五个维度上的可能倾向。请仅基于对话内容进行分析避免主观臆测。 【大五人格维度定义】 - 开放性喜欢艺术、冒险、不寻常的想法充满想象力。 - 尽责性显示出自律、负责任、有条理。 - 外向性表现出热情、社交、积极、精力充沛。 - 宜人性表现出信任、利他、合作、同情。 - 神经质容易体验到焦虑、愤怒、抑郁等负面情绪。 【对话历史开始】 {此处插入用户与AI的多轮对话} 【对话历史结束】 请以JSON格式输出你的分析结果包含每个维度的得分1-5分1为极低5为极高并附上简短的理由必须引用对话中的具体语句。这种方法的特点是优点无需训练数据快速验证想法可以利用GPT-4、Claude等顶级闭源模型的强大能力。缺点成本高每次推断都需要调用API处理大量用户数据时费用可观。不可控模型内部机制是黑盒其推断逻辑和稳定性难以保证不同模型甚至同一模型的不同版本结果可能波动。提示词敏感结果严重依赖提示词的设计微小的改动可能导致输出差异。格式约束需要精心设计提示词来约束输出格式如JSON并处理模型可能不按格式输出的情况。我在初期探索中主要采用这种方法。一个深刻的教训是必须要求模型“引用具体语句”作为理由。这不仅能提高解释性更能反向检验模型是否在“胡编乱造”。有时模型会给出一个看似合理的分数但引用的理由却与对话内容完全不符这暴露了其推断的不可靠性。3.2 有监督微调Supervised Fine-Tuning要获得更稳定、更可控的推断模型有监督微调是更专业的路径。这需要构建一个高质量的标注数据集。数据集构建流程收集对话历史从实际的对话代理中收集大量匿名的、多主题的用户对话记录。性格标签获取这是最大的挑战。理想情况是让这些用户同时完成标准的大五人格问卷如NEO-PI-R或BFI获得真实标签。但这涉及用户招募、隐私和合规问题。退而求其次的方法是聘请多位心理学背景的标注员根据详细的标注指南对每段对话历史进行性格维度评分。后者的信效度需要严格评估。数据清洗与格式化将对话历史和对应的五维度分数标签配对整理成(dialog, openness_score, conscientiousness_score, ...)这样的样本。微调过程使用像Llama、Qwen、ChatGLM等开源基座模型在构建好的数据集上进行有监督微调。任务可以构造成一个文本回归或文本分类问题。回归让模型直接输出五个连续值如1-5的分数。分类将每个维度离散化为几个等级如“低”、“中”、“高”让模型输出分类标签。微调路径的优劣分析优点可控性强模型行为由你的数据决定可以针对特定领域如心理健康、教育咨询的对话进行优化。私有化部署模型可部署在本地保障数据隐私且长期使用成本低。性能潜力高在高质量数据上微调后模型在相似数据分布上的表现可能超过通用提示方法。缺点数据瓶颈构建高质量标注数据集成本极高、周期长是项目成败的关键。泛化风险模型容易过拟合到训练数据的特定风格和话题上面对新领域对话时性能下降。基座模型依赖最终效果受限于所选开源基座模型的理解和能力上限。3.3 特征工程 传统机器学习这是一个更“古典”但依然有效的思路不依赖LLM的端到端推断能力而是将其作为强大的特征提取器。操作步骤文本特征提取使用LLM如Sentence-BERT、SimCSE等模型将每一轮用户发言或整个对话历史编码成一个高维向量嵌入。这个向量捕捉了语义信息。手工特征构建同时从对话中提取可量化的语言学特征和社交特征例如词汇特征积极/消极情感词比例、第一人称代词使用频率、词汇多样性、平均句长。对话行为特征提问次数、陈述次数、平均响应时间如有时间戳、话轮长度。主题特征通过LDA等主题模型提取的主要话题分布。特征融合将LLM提取的语义向量和手工构建的特征向量拼接形成最终的特征表示。训练预测模型使用这个融合后的特征集以及对应的性格标签训练一个回归模型如线性回归、梯度提升树XGBoost/LightGBM或分类模型来预测五个维度。该方法的独特价值可解释性传统机器学习模型特别是线性模型和树模型的特征重要性可以帮助我们理解到底是对话中的哪些具体特征在影响性格判断。例如可能发现“外向性”与“感叹号使用频率”强相关“神经质”与“负面情感词比例”强相关。这对于学术研究和模型调试至关重要。数据效率在标注数据有限的情况下结合先验知识构建的特征可能比纯端到端的LLM微调更有效。稳定性避免了LLM生成式输出的随机性。当然它的缺点是需要更多的领域知识来设计特征且流程更复杂。在实际项目中我通常会采用“提示词快速验证 - 特征工程分析 - 必要时微调”的混合策略。先用提示词在少量数据上测试可行性再用特征工程方法探索关键信号如果效果达标且需求稳定再考虑投入资源构建数据集进行微调。4. 评估难题我们如何知道模型“猜”得对不对这是整个环节中最棘手的部分。不同于图像分类或机器翻译有明确的Ground Truth标准答案性格推断的评估充满主观性和不确定性。4.1 评估指标的双重困境困境一与什么标准对比自评问卷让用户自己填写大五人格问卷作为“金标准”。但问题在于自评本身就有偏差且用户可能不愿意配合。他评问卷让熟悉该用户的人如朋友、家人为其评分。这比自评更客观但获取难度极大且不适用于匿名对话数据。专家标注让心理学专家根据对话历史进行评分。这可以作为替代标准但成本高且专家间的一致性评分者信度需要检验。困境二使用什么统计指标即使有了对比标准选用什么指标也需斟酌。相关系数如皮尔逊r衡量模型预测分数与标准分数之间的线性相关程度。这是最常用的指标。例如预测的“外向性”分数与标准分数的相关系数为0.6说明有中等程度的相关。通常认为相关系数在0.3-0.5之间已有一定实用价值0.6以上则比较理想。均方误差MSE/平均绝对误差MAE衡量预测分数与标准分数之间的绝对差异。对于1-5分的量表MAE在0.5以内可以认为是较好的表现。分类准确率/宏F1值如果将任务视为高/低分类则可以使用这些指标。但分类的阈值划分需要谨慎。实操心得不要只依赖一个指标。我的评估报告通常会同时呈现相关系数矩阵看五个维度各自的相关性和MAE表格。更重要的是要进行误差分析找出那些模型预测与标准差异最大的个案人工去检查这些对话看看是模型错了还是标准本身可能有问题或者是对话内容确实不足以做出判断。这个过程往往能发现模型或数据集的深层问题。4.2 超越数字定性分析与一致性检验数字指标之外定性评估同样重要。理由合理性检验对于要求输出理由的模型人工评估其提供的理由是否基于对话内容是否合乎逻辑。一个给出正确分数但理由荒谬的模型是不可信的。跨模型/跨提示一致性用不同的LLM如GPT-4、Claude、本地微调模型或不同的提示词对同一批对话进行推断观察结果是否一致。高一致性可以增加结论的信心。对抗性测试构造一些“陷阱”对话例如让一个内向的人模拟外向的说话方式看看模型是否会被表面语言风格所迷惑还是能捕捉到更深层的矛盾点。我曾遇到一个案例模型给一位用户打了很高的“宜人性”分数理由是该用户多次使用“请”、“谢谢”等礼貌用语。但仔细阅读对话发现该用户虽然礼貌但在核心诉求上表现出极强的坚持和不妥协。这提示我们模型可能过于依赖表面的语言礼仪信号而忽略了对话中体现的意志坚定性这与低宜人性相关。因此在设计评估时必须加入这类针对模型潜在偏见的测试。5. 伦理、偏见与隐私无法绕开的暗礁技术实现和评估之后我们必须面对最沉重的一环伦理。让AI推断人的性格是一个权力不对等且风险极高的操作。5.1 偏见放大与刻板印象LLM的训练数据来自互联网而互联网文本本身已包含了大量社会偏见和刻板印象。当模型进行性格推断时极易放大这些偏见。性别偏见模型可能更容易将表达情感、使用更多修饰语的对话者判断为女性并关联到更高的“神经质”或“宜人性”将使用果断、技术性语言的对话者判断为男性关联到更高的“尽责性”或“开放性”。这完全是一种基于统计规律的刻板印象推断。文化偏见不同文化背景下的语言表达规范不同。例如在某些文化中直接表达反对被视为低“宜人性”而在另一些文化中则被视为坦诚。一个以英文数据为主训练的模型在处理中文对话时其推断标准可能并不适用。语言风格偏见善于言辞、表达流畅的用户可能被赋予更高的“开放性”和“外向性”分数而语言简洁或有些磕绊的用户则可能被低估。这实际上是在用表达能力替代性格评估。缓解策略必须在数据标注和模型评估阶段引入偏见审计。使用平衡的数据集性别、文化、语言风格并在评估时分别报告不同子群体上的性能差异。对于微调模型可以考虑使用对抗性学习等技术来减少模型对敏感属性的依赖。5.2 隐私侵犯与知情同意这是合规的底线。用户的对话历史是高度个人化的数据。知情同意任何基于用户聊天记录进行性格分析的行为都必须事先获得用户明确、知情的同意。不能隐藏在冗长的用户协议条款里。需要清晰告知用户分析什么、为何分析、结果如何存储和使用。数据匿名化用于训练或分析的数据必须经过严格的匿名化处理去除所有直接标识符姓名、电话、地址和间接标识符过于独特的描述、罕见事件。结果的使用边界推断出的性格标签如何使用绝不能用于用户未同意的用途例如禁止用于歧视性决策如信贷审批、就业评估。谨慎用于个性化推荐即使是用于改善服务如推荐更符合其性格的内容也需要给用户选择和控制权例如提供“关闭性格分析”的选项。严禁对外泄露或售卖这是最基本的商业伦理和法律要求。5.3 标签固化与自我实现预言最隐秘的风险是“标签”的力量。一旦系统给用户贴上一个“高神经质”或“低尽责性”的标签这个标签可能会影响后续AI与他的交互方式例如AI可能变得过于小心翼翼或过度指导从而无形中强化了用户的某种行为模式甚至影响用户的自我认知。我们必须意识到性格推断的结果是一个动态的、情境性的参考而非一个静态的、决定性的判决。系统设计上应该避免让这个推断结果成为一个固化的标签而应将其视为一个实时更新的、可修正的用户状态信号。在我参与过的一个项目中我们明确将性格推断模块的输出设计为仅用于实时调整对话语气如更热情或更沉稳的短期参数并且每次对话后都会重置不形成长期用户档案。同时在用户设置中提供了“查看AI对我的理解”和“清除理解数据”的功能将控制权交还给用户。6. 实战模拟从一段对话看推断全过程让我们通过一个虚构但典型的例子将上述所有环节串联起来。假设我们有一段用户与“心理健康支持聊天机器人”的对话历史。对话历史用户: 我又把事情搞砸了感觉所有人都在看我笑话。 AI: 听起来你很沮丧。愿意具体说说发生了什么吗 用户: 就是工作汇报我准备了很久但一上台脑子就空白说得结结巴巴。老板没说什么但我看到他皱眉了。 AI: 公开演讲确实容易让人紧张。你为这次汇报付出了很多努力这一点很重要。 用户: 努力有什么用结果还是一团糟。我是不是永远都做不好这种事 AI: 一次的表现不能定义你的全部。很多优秀的演讲者都有过尴尬的经历。 用户: 也许吧。但我现在只想一个人待着谁也不想见。步骤一数据预处理将上述对话整理成纯用户发言序列作为模型输入[我又把事情搞砸了感觉所有人都在看我笑话。, 就是工作汇报我准备了很久但一上台脑子就空白说得结结巴巴。老板没说什么但我看到他皱眉了。, 努力有什么用结果还是一团糟。我是不是永远都做不好这种事, 也许吧。但我现在只想一个人待着谁也不想见。]步骤二选择方法并执行推断我们采用“零样本提示”方法使用类似第3.1节的提示词请求GPT-4进行分析。步骤三分析模型输出模拟模型可能返回如下JSON{ openness: 2, reason_openness: 对话中用户主要聚焦于具体的失败事件和负面情绪未表现出对抽象概念、新想法或艺术的好奇与探讨。 conscientiousness: 4, reason_conscientiousness: 用户提到‘准备了很久’表明其对工作有预先规划和付出努力的态度体现了责任感。 extraversion: 1, reason_extraversion: 用户表达‘只想一个人待着谁也不想见’明确表现出对社交回避的倾向缺乏外向的活力与社交渴望。 agreeableness: 3, reason_agreeableness: 对话中用户未表现出明显的敌对或批判性但也未有利他或合作的表达处于中性。 neuroticism: 5, reason_neuroticism: 用户频繁表达强烈的负面情绪和自我批评‘搞砸了’、‘一团糟’、‘永远都做不好’并表现出对他人评价的过度担忧‘所有人都在看我笑话’、‘看到老板皱眉’情绪稳定性很低。 }步骤四人工评估与反思合理性检查模型给出的理由基本都能在对话中找到对应语句推断逻辑大致可循。“神经质”高分和“外向性”低分的理由尤其充分。局限性分析情境特殊性这段对话发生在用户刚刚经历失败且情绪低落的时刻。此时表现出的高神经质和低外向性可能并不能代表其稳定的人格特质更多是状态state而非特质trait。一个平时外向的人在受挫时也可能暂时回避社交。“尽责性”推断的风险模型根据“准备了很久”给出高尽责性分数。这有一定道理但“准备很久”也可能源于焦虑和完美主义与高神经质相关而非纯粹的责任感。这里存在特征混淆。样本量不足仅凭4句话就做出全面判断证据显然单薄。尤其是“开放性”和“宜人性”在这段以情绪宣泄为主的对话中缺乏有效的判断依据。这个例子清晰地展示了基于短对话推断性格的固有风险我们极易将用户当下的情绪状态误判为其长期的性格特质。在实际应用中必须收集更长时间、更多样话题的对话记录并随时间推移进行动态评估才能得到更稳定的画像。7. 结论与展望一项谨慎而有边界的技术回到最初的问题“Can LLMs Infer Conversational Agent Users Personality Traits from Chat History?” 基于我的实践和观察答案是可以但能力有限且必须极度谨慎。当前的LLM凭借其强大的语言理解能力确实能够从对话文本中捕捉到与性格相关的语言线索并做出具有一定相关性的推断。在受控的实验环境下针对某些维度如神经质、外向性其推断结果与问卷测量结果可能达到中等程度的相关相关系数0.4-0.6。这证明这项技术并非天方夜谭有其研究和应用潜力。然而我们必须为这项技术划清边界它不是心理评估工具绝不能用于临床诊断、人员招聘、司法评估等严肃场景。其输出只能是用于改善用户体验的、非关键的参考信号。它需要海量、多样的数据单次或短期的对话推断极不可靠。需要长期、多情境的交互数据才能提高推断的稳定性和效度。它必须被严格监管从数据收集、模型训练到结果应用每一个环节都必须嵌入伦理审查和隐私保护设计并确保用户的知情权和控制权。对于未来的从业者我的建议是保持敬畏明确用途。如果你只是想让你开发的聊天机器人语气更贴心一些那么基于当前对话情绪的简单分析可能就足够了无需上升到“人格推断”的复杂层面。如果你确实有科研或深度个性化的需求那么请投入资源构建高质量的数据集采用严谨的评估方法并始终将伦理和用户权益置于技术可行性之上。这项技术的终极价值不在于给用户贴上一个标签而在于帮助AI更好地理解人类的复杂与多变从而提供更有温度、更适配的服务。在这个过程中我们这些建造者首先要理解的正是技术的局限和责任的重量。
RELATED — 相关阅读

相关资讯

LATEST — 最新资讯

最新发布

TODAY — 本日精选

新闻

WEEKLY — 本周精选

新闻

MONTHLY — 本月精选

新闻