研究 / 02
MessCleaner
面向购买决策的 eWOM 真实性人机协同判断
MessCleaner 把碎片化 eWOM 整理成可追溯证据,让 AI 真实性判断可被检查和修改,并让用户继续负责解释证据、做出最终购买决策。
- Noisy eWOM
- Organized evidence
- Human–AI judgment
- Purchase decision
- 研究问题
- 消费者与 AI 如何协同判断人工撰写的 eWOM 反映的是真实消费体验还是促销意图,同时保留不确定性与用户控制?
- 研究路径
- 我们先通过形成性研究理解消费者评估 eWOM 的困难,再比较 40 位消费者与六个 AI 系统的真实性判断,归纳人与 AI 的判断维度。这些发现支撑 MessCleaner 的设计,并在 32 人的组内实验中进行评估。
- 贡献
- MessCleaner 把碎片化 eWOM 变成结构化、可追溯的证据;揭示 AI 真实性判断背后的维度、证据与不确定性;让用户比较并修改这些判断;再把审阅后的证据综合起来,支持而非替代购买决策。
图 1
Noisy eWOM → Organized evidence → AI judgment ↔ Human revision → Purchase decision
/research/messcleaner/fig-1-overview.svg
eWOM 需要的不只是摘要
这里的问题不是检测虚假评论,而是判断人工撰写的内容体现的是真实消费体验,还是有策略的促销表达。
消费者依赖 eWOM 降低不确定性、比较使用体验,并在购买前形成预期;但 eWOM 异质、碎片化,且来源难以辨识。用户必须判断哪些信息相关、可信、有用,并且真正基于实际体验。
AI 越来越多地过滤、摘要和评估产品信息,但消费者仍需决定何时依赖 AI 评估、何时质疑它,以及如何把它与自己的判断结合起来。人类与 AI 评估者可能关注不同线索,并得出不同结论。
当用户能够检查、比较并修改 AI 判断,而不是直接接受它们时,这些差异就可以成为协同评估的资源。
判断框架
MessCleaner 首先把人类与 AI 真实性判断的结构显式化。
图 2
Data → Judgments → Criteria → Shared / Divergent / Complementary → Framework
/research/messcleaner/fig-2-framework.svg
研究者构建了平衡的 eWOM 语料,请 40 名参与者和六个常用 AI 系统对体验真实性与促销意图进行分类并解释理由。对理由编码后得到 9 个人类判断维度和 8 个 AI 判断维度,并比较其中共享、独特与互补的线索。
设计原则
系统应整理证据、显露判断,而不是替用户给出最终真假结论。
把碎片化 eWOM 变成可用证据
MessCleaner 应将分散信息组织成与决策相关的结构化证据,同时保留来源与上下文,以便用户追溯和比较。
支持真实性判断,但不取代用户
系统应帮助用户检查可能的促销内容、比较可信线索,在真实性不确定时仍保留有用信息,并把真实性评估当作决策支持而非最终结论。
用 AI 做结构化整理和轻量筛查
AI 应按与决策相关的维度组织大量 eWOM,标出需要注意的内容,并概括反复出现的收益、抱怨、副作用和风险。
让 AI 评估可解释、透明且可控
系统应揭示证据与推理线索,让判断标准可见,并允许用户修改或确认 AI 评估,同时保留对最终购买决策的控制。
系统工作流
MessCleaner 把证据构建、真实性判断和决策综合分开,而不是把它们压成一个 AI 答案。
图 3
Evidence Foundation → Evaluation Framework → Human–AI Judgment → Decision Synthesis
/research/messcleaner/fig-3-workflow.svg
Evidence Foundation
检索、去重,并把与产品相关的帖子和评论线程整理成 eWOM 证据池。
Evaluation Framework
生成候选产品评价维度;用户选择六个维度,证据被组织进对应的 eWOM 卡片。
Human–AI Judgment
将卡片分为真实体验、可疑营销或不确定信息;展示支持证据和 AI 判断维度;允许用户修改评估。
Decision Synthesis
按用户选定的维度综合经用户修正的证据,以支持最终购买决策。
检查 eWOM
用户可以同时检查 AI 的分类和底层证据,并在自己的解释不同时改写分类。
图 4
完整界面:A–J
/research/messcleaner/fig-4-interface.png
01
产品输入与筛选
用户指定产品或品牌、启动分析,并用情感筛选浏览收集到的内容。
Product input and filtering
/research/messcleaner/fig-4-input.png
02
评价维度
候选产品评价维度用来组织证据;用户选择六个,并可根据自己的优先级替换或调整。
Evaluation dimensions
/research/messcleaner/fig-4-dimensions.png
03
eWOM 卡片与 AI 判断
在每个维度内,卡片被分为真实体验、可疑营销或不确定信息。相关 AI 判断维度解释每次评估。
eWOM cards and AI Judgment Dimensions
/research/messcleaner/fig-4-cards.png
04
人工检查与重分类
打开卡片可看到原始多用户对话和 AI 评估。用户可以检查相关证据、在类别间移动卡片,或排除不相关、不可靠的卡片。
Human inspection and reclassification
/research/messcleaner/fig-4-revision.png
决策综合
审阅后的证据被带入产品级视图,而不是被一份新的不透明摘要替换。
图 5
Authentic vs marketing / Consensus vs conflict / Radar / Risks / Personalized support
/research/messcleaner/fig-5-synthesis.png
界面比较来自真实体验和可疑营销的证据,标出一致与冲突,并概括共同点、关键差异和尚未解决的不确定性。总体视图再把维度级发现整合为基于证据的产品图景。
维度证据
按选定产品维度保留真实体验与可疑营销的对照。
共识、冲突与不确定性
一致发现、冲突主张和尚未解决的不确定性被分开呈现,而不是被抹平。
总体评估与个性化支持
总体评估、雷达图、关键发现与风险,以及个性化决策支持,都建立在用户已经审阅过的证据上。
研究设计
我们将 MessCleaner 与无辅助基线以及通用 AI 支持条件进行比较。
每位参与者在全部三种条件下各完成一次购买决策任务。条件顺序覆盖全部六种平衡次序:ABC、ACB、BAC、BCA、CAB、CBA。
图 6
三条平行轨道,平衡次序用连接线表达
/research/messcleaner/fig-6-study.svg
主要发现
四个问卷维度使用同一七点量表,便于在条件之间横向比较。
D1 · eWOM Structuring and Evidence Organization
/research/messcleaner/fig-7-d1.svg
D2 · Credibility Judgment and Evidence Identification
/research/messcleaner/fig-7-d2.svg
D3 · AI Explanation, Transparency, and Control
/research/messcleaner/fig-8-d3.svg
D4 · eWOM Synthesis and Decision Quality
/research/messcleaner/fig-8-d4.svg
MessCleaner 帮助参与者把碎片化 eWOM 组织成与决策相关的结构化证据,并识别哪些信息真正重要。
证据
在 Overall eWOM Understanding 和 Information Organization 上,MessCleaner 的评分高于 Basic AI 和 Baseline。在 Valuable Information Identification 上,MessCleaner 同样优于两种条件,而 Basic AI 与 Baseline 没有差异。
解释
降低信息加工负担,和帮助用户判断哪些证据重要,是两种不同的支持;通用摘要并不总能做到后者。
MessCleaner 支持用户区分真实体验、可疑营销和不确定信息,并检查、修改 AI 判断。
证据
在 authentic/promotional distinction、promotional signal identification 和 insufficient evidence recognition 上,MessCleaner 均优于 Basic AI 和 Baseline。其 Authenticity Judgment Confidence 也高于两种条件,同时保留了明确的不确定信息类别。
解释
信心并不要求隐藏不确定性;显式的不确定性可以标出需要继续检查的位置。
参与者报告更清楚理解 AI 评估、更有选择地依赖、更强的感知控制,以及最终决策更扎根于已审阅证据。
证据
与 Basic AI 相比,MessCleaner 在 AI Judgment Understanding(6.13 vs 5.47)、AI Reference-Dimension Visibility(6.56 vs 5.50)、Trust Calibration、Avoiding Blind Acceptance 和 Perceived Control 上评分更高。Decision Grounding:MessCleaner 6.19,Basic AI 5.19,Baseline 5.25。Decision Quality:MessCleaner 6.44,Basic AI 5.66,Baseline 4.88。
解释
系统通过把用户已经检查并修改过的证据继续向前传递来支持决策,而不是要求他们信任一个脱离证据的 AI 结论。
研究贡献
真实性框架
揭示人类与 AI 真实性判断如何重叠、又如何不同。
来自 40 位消费者和六个 AI 系统的判断,呈现出共享、分歧与互补的判断维度。
协同判断
把 AI 真实性评估变成可检查、可修改的对象。
MessCleaner 揭示 AI 推理、支持证据和不确定性,让用户把 AI 解释与自己的解释比较,并修改分类。
决策综合
把审阅后的证据带入最终决策,而不取代人类判断。
系统综合结构化证据,同时保留其来源、判断差异和不确定性,让用户继续对最终购买决策负责。