心绪云脑AI的目标,是从用户主动提供的文字、语音和手绘图中理解当下表达的情绪线索,并把结果用于更有同理心的人机交互。
这个任务的难点不在于把三种输入送进一个大模型,而在于三个事实:不同模态表达的不是同一种信息;情绪本身可能共存、含混并随语境变化;模型输出只能表示“从当前证据推断出的可能状态”,不能替代用户自述,更不能被当作心理诊断。
因此,这套系统的设计原则是:保留每种模态的独特证据,显式建模不确定性,让用户拥有最终解释权。
先定义任务,而不是先选模型
离散的快乐、悲伤、愤怒、恐惧、惊讶、厌恶和中性可以保留为产品展示层,但训练目标不应只有一个七分类 Softmax。
真实表达可能同时包含悲伤和愤怒,“中性”也可能只是证据不足。更稳健的输出包含三部分:
{
"emotions": [
{"label": "悲伤", "probability": 0.68},
{"label": "焦虑", "probability": 0.31}
],
"valence": -0.62,
"arousal": 0.48,
"uncertainty": 0.27,
"evidence": {
"text": "用户明确表达失落",
"audio": "语速较慢且停顿增加",
"drawing": "仅作为弱辅助信号"
},
"decision": "ask_for_confirmation"
}
其中离散标签支持多标签,Valence 描述正负感受,Arousal 描述唤醒程度;不确定性决定系统是回答、询问用户确认,还是停止推断。强度不应由生成模型随意输出一个 0-1 数字,而应来自经过标注和校准的回归头。
三种输入必须保留三种证据
文本通道
文本编码器处理字面语义、否定、反讽、上下文和对话历史。ASR 转写也进入文本通道,但必须携带时间戳、置信度和语言信息。模型要区分用户原始输入与自动转写,避免把 ASR 错误当作确定事实。
语音通道
语音不能只经过 Whisper 变成文字。文字会丢失音高、能量、语速、停顿、音质和节奏。生产架构应保留原始波形或声学特征,通过 speech encoder 生成时序表示,再与 ASR 语义共同参与融合。
音频预处理包含采样率规范化、静音和语音活动检测、质量评分与分段,但不要用过强降噪抹掉呼吸、停顿等潜在信息。低信噪比时应降低该模态权重,而不是强行给出高置信判断。
手绘图通道
手绘图表达高度个人化。颜色、线条和构图可以提供上下文,却不存在“黑色等于悲伤”这样的通用映射。视觉编码器应理解画面语义与结构;绘制时长、笔画轨迹等过程数据只有在用户明确同意时才可使用。
图像增强必须尊重任务语义。任意色彩抖动可能改变情绪线索,裁剪可能删除主体;所有增强策略都要通过消融实验验证。生成式合成图可用于预训练或稀有模式增强,但必须标记来源、限制比例,不能进入验证集和测试集。
为什么不把所有输入直接交给一个 VLM
视觉语言模型擅长联合理解图像和文字,但普通 VLM 并不天然接收原始音频,也未必学到了适用于特定人群和文化语境的情绪边界。把语音只做 ASR、再与图片一起送进 VLM,会丢掉完整声学信号。
心绪云脑AI采用多分支架构:文本 encoder、speech encoder、vision encoder 各自产生表示,通过适配器映射到共享维度,再由 gated fusion 或 cross-modal transformer 融合。VLM 可以作为视觉语义教师、弱标注器或解释生成器,但最终分类、维度回归和不确定性由受监督任务头负责。
这样设计还有一个现实优势:某个模态缺失或质量较差时,系统仍能运行,而不必伪造一个空图片或空音频。
缺失模态不是异常,而是默认场景
用户可能只输入文字,也可能拒绝上传语音,图片可能损坏,ASR 也可能失败。训练和评测必须覆盖文本、语音、图像的所有可用组合。
可以在训练中使用 modality dropout,随机屏蔽一路或多路输入;融合层同时接收模态存在标志和质量分数;每个单模态分支都保留辅助损失,避免融合模型完全依赖最强通道。
推理时先执行输入质量门控:
可用性检测 → 单模态编码 → 质量估计 → 动态融合
→ 多任务预测 → 校准 → 策略决策
系统应分别报告全模态、单模态和不同缺失组合的性能。只报告三路输入齐全时的 Macro-F1,会掩盖真实线上风险。
数据:用户自述优先于旁观者猜测
情绪标签具有主观性。三名众包标注者多数投票可以描述“外部观察者如何理解这段表达”,但不能自动成为用户真实情绪的金标准。
数据体系应区分:
self_report:用户自述标签和 Valence/Arousal,作为主要监督信号;observer_labels:多名标注者的分布,而不是压缩成一个硬标签;context:场景、语言和对话背景;modality_quality:音频信噪比、ASR 置信度、图像可读性;consent_scope:允许训练、评测、个性化或仅本次推理;provenance:真实、公开数据、合成数据和生成方法。
训练、验证和测试必须按用户或说话人分组切分,同一人的相邻片段、同一对话、同一原始视频不能跨集合。否则模型可能记住身份、背景或剧集场景,得到虚假的高分。
公开数据适合预训练和基线,但 MELD、IEMOCAP 等影视或实验室数据与真实中文用户存在领域差异。评测集必须包含目标人群、目标设备和真实缺失模态分布,并经过授权。
训练:先建立基线,再逐层增加复杂度
推荐按四个阶段推进:
- 训练文本、语音、图像单模态基线,确定每一路真正贡献了什么。
- 冻结大部分 encoder,只训练适配器、融合层与多任务头,建立稳定的 late-fusion 基线。
- 引入 cross-modal attention、modality dropout、soft labels 与类别不平衡损失。
- 只有数据和评测证明需要时,再对部分 encoder 做 LoRA/QLoRA 或分阶段解冻。
参数高效微调不是固定配置。LoRA rank、目标层、学习率和量化方式都要通过实验选择;不能预设 r=64 就代表任务复杂度。视觉 encoder、语言模型和声学 encoder 也不应无差别全部微调,小规模数据很容易破坏基座能力。
损失函数可以组合为:
L = λ1 · MultiLabelEmotionLoss
+ λ2 · ValenceArousalRegressionLoss
+ λ3 · UnimodalAuxiliaryLoss
+ λ4 · CrossModalConsistencyLoss
+ λ5 · CalibrationLoss
所有实验记录数据版本、切分、随机种子、预处理、基座模型、代码提交、超参数与硬件环境。模型注册表保存权重、阈值、校准器和 Model Card,而不只是一个合并后的 checkpoint。
评测:准确率远远不够
离散标签至少报告 Macro-F1、各类 Precision/Recall、混淆矩阵和多标签指标;Valence/Arousal 报告 MAE、CCC 等回归指标;置信度报告 ECE、Brier Score 和选择性预测曲线。
评测必须包含:
| 维度 | 要回答的问题 |
|---|---|
| 单模态与组合消融 | 每种模态是否真的贡献增益 |
| 缺失与损坏模态 | ASR 失败、噪声、模糊图像时是否稳定 |
| 跨人群与设备 | 性别、年龄、口音、地区、麦克风是否造成显著差异 |
| 跨数据集/OOD | 换场景后性能下降多少 |
| 校准与拒绝 | 低置信时是否真的知道自己不知道 |
| 安全行为 | 是否避免诊断、标签化和不当升级 |
“83% Accuracy”没有数据切分、置信区间、类别分布和独立复现实验就没有可比较意义。模型上线门槛应由目标场景的风险和错误成本决定。
推理服务:模型之前和之后都需要策略层
API 不应直接把模型生成的 JSON 返回给用户。完整在线链路包括:
同意与用途校验
→ 文件安全、格式和大小限制
→ 模态质量检测与预处理
→ 并行编码、融合与多任务预测
→ 温度缩放/校准、阈值与 OOD 检测
→ 安全策略和表达生成
→ 用户确认或纠正
输出 JSON 使用严格 schema 校验,解析失败应返回明确错误或降级结果,不能默认判为“中性”。服务端设置请求级 deadline、批处理上限、显存准入和熔断;ASR、编码器与生成服务分别观测延迟和失败率。
LoRA 权重不一定必须合并。合并适合单模型低开销部署,独立 adapter 适合多租户和快速回滚。vLLM、TensorRT-LLM 或其他推理引擎是否支持目标多模态结构和 adapter,需要在选择前实际验证,不能只根据文本模型部署方式推断。
安全、隐私和产品边界
语音和图像可能包含生物特征与高度敏感信息。默认策略应是最小化采集、传输与静态加密、短期保留、可删除、用途隔离和细粒度访问审计。原始数据不应因“低置信度”自动进入训练池;只有独立、明确的训练同意才能回流。
产品文案使用“情绪表达线索”或“模型推测”,避免宣称读懂内心。系统不能据此进行招聘、绩效、教育评价、保险、信贷或执法决策,也不应作为心理疾病诊断。欧盟 AI Act 明确限制工作场所和教育机构中的情绪推断,并指出这类系统存在可靠性、特异性和泛化局限。
当文本包含自伤或即时危险线索时,不能由情绪分类标签自动下结论。应进入单独设计和验证的安全流程:提供支持性语言、鼓励联系当地紧急服务或可信任的人,并在适用法规和用户同意下进行人工升级。
监控:观察质量,而不是监控人的情绪
线上监控关注系统行为:各模态可用率、质量分布、预测熵、校准误差、拒绝率、用户纠正率、分组性能、数据漂移、P95/P99 延迟和资源饱和度。
“中性占比低于 40%”或“平均置信度高于 0.75”不是通用健康指标。真实用户群的情绪分布可能变化,高置信也可能是过度自信。应比较带标签的稳定评测集、校准曲线和用户确认数据,再判断是否漂移。
重训由证据触发:目标评测集显著退化、分组差距扩大、新设备或新语言上线、数据定义变化。新模型通过离线门禁、影子流量和小比例灰度后再发布,并保留快速回滚能力。
最终架构判断
心绪云脑AI不是一个“Qwen + Whisper + 分类头”的接口,而是一套以证据质量、用户同意和不确定性为核心的多模态学习系统。
文本告诉我们用户说了什么;语音补充他们如何表达;手绘图提供个人化的视觉语境。融合层负责组合证据,而不是把三路信号强行压成一个确定标签。真正可靠的系统会在证据冲突时降低置信,在模态缺失时安全降级,在用户纠正时尊重用户,并始终知道自己不能做心理诊断。