研究 / 02

MessCleaner

面向购买决策的 eWOM 真实性人机协同判断

  • 人机协作
  • eWOM 真实性
  • 决策支持

MessCleaner 把碎片化 eWOM 整理成可追溯证据,让 AI 真实性判断可被检查和修改,并让用户继续负责解释证据、做出最终购买决策。

  1. Noisy eWOM
  2. Organized evidence
  3. Human–AI judgment
  4. Purchase decision
研究问题
消费者与 AI 如何协同判断人工撰写的 eWOM 反映的是真实消费体验还是促销意图,同时保留不确定性与用户控制?
研究路径
我们先通过形成性研究理解消费者评估 eWOM 的困难,再比较 40 位消费者与六个 AI 系统的真实性判断,归纳人与 AI 的判断维度。这些发现支撑 MessCleaner 的设计,并在 32 人的组内实验中进行评估。
贡献
MessCleaner 把碎片化 eWOM 变成结构化、可追溯的证据;揭示 AI 真实性判断背后的维度、证据与不确定性;让用户比较并修改这些判断;再把审阅后的证据综合起来,支持而非替代购买决策。

图 1

Noisy eWOM → Organized evidence → AI judgment ↔ Human revision → Purchase decision

/research/messcleaner/fig-1-overview.svg

系统按产品评价维度组织碎片化帖子与评论。用户检查 AI 生成的真实性评估、支持证据和推理线索,必要时修改分类,再把审阅后的证据综合为有依据的购买决策。来源:图 1

eWOM 需要的不只是摘要

这里的问题不是检测虚假评论,而是判断人工撰写的内容体现的是真实消费体验,还是有策略的促销表达。

消费者依赖 eWOM 降低不确定性、比较使用体验,并在购买前形成预期;但 eWOM 异质、碎片化,且来源难以辨识。用户必须判断哪些信息相关、可信、有用,并且真正基于实际体验。

AI 越来越多地过滤、摘要和评估产品信息,但消费者仍需决定何时依赖 AI 评估、何时质疑它,以及如何把它与自己的判断结合起来。人类与 AI 评估者可能关注不同线索,并得出不同结论。

当用户能够检查、比较并修改 AI 判断,而不是直接接受它们时,这些差异就可以成为协同评估的资源。

判断框架

MessCleaner 首先把人类与 AI 真实性判断的结构显式化。

图 2

Data → Judgments → Criteria → Shared / Divergent / Complementary → Framework

/research/messcleaner/fig-2-framework.svg

人类与 AI 判断先被分别分析,再将其标准对齐为共享、分歧或互补。这些关系构成 MessCleaner 使用的真实性判断框架。来源:图 2

研究者构建了平衡的 eWOM 语料,请 40 名参与者和六个常用 AI 系统对体验真实性与促销意图进行分类并解释理由。对理由编码后得到 9 个人类判断维度和 8 个 AI 判断维度,并比较其中共享、独特与互补的线索。

设计原则

系统应整理证据、显露判断,而不是替用户给出最终真假结论。

  1. 把碎片化 eWOM 变成可用证据

    MessCleaner 应将分散信息组织成与决策相关的结构化证据,同时保留来源与上下文,以便用户追溯和比较。

  2. 支持真实性判断,但不取代用户

    系统应帮助用户检查可能的促销内容、比较可信线索,在真实性不确定时仍保留有用信息,并把真实性评估当作决策支持而非最终结论。

  3. 用 AI 做结构化整理和轻量筛查

    AI 应按与决策相关的维度组织大量 eWOM,标出需要注意的内容,并概括反复出现的收益、抱怨、副作用和风险。

  4. 让 AI 评估可解释、透明且可控

    系统应揭示证据与推理线索,让判断标准可见,并允许用户修改或确认 AI 评估,同时保留对最终购买决策的控制。

系统工作流

MessCleaner 把证据构建、真实性判断和决策综合分开,而不是把它们压成一个 AI 答案。

图 3

Evidence Foundation → Evaluation Framework → Human–AI Judgment → Decision Synthesis

/research/messcleaner/fig-3-workflow.svg

工作流从证据检索与结构化,进入可修改的人机判断过程,再把审阅后的证据带入决策综合。来源:图 3
  1. Evidence Foundation

    检索、去重,并把与产品相关的帖子和评论线程整理成 eWOM 证据池。

  2. Evaluation Framework

    生成候选产品评价维度;用户选择六个维度,证据被组织进对应的 eWOM 卡片。

  3. Human–AI Judgment

    将卡片分为真实体验、可疑营销或不确定信息;展示支持证据和 AI 判断维度;允许用户修改评估。

  4. Decision Synthesis

    按用户选定的维度综合经用户修正的证据,以支持最终购买决策。

检查 eWOM

用户可以同时检查 AI 的分类和底层证据,并在自己的解释不同时改写分类。

图 4

完整界面:A–J

/research/messcleaner/fig-4-interface.png

界面让分类始终连接原始对话证据,并让用户直接控制如何修改 AI 判断。来源:图 4
  1. 01

    产品输入与筛选

    用户指定产品或品牌、启动分析,并用情感筛选浏览收集到的内容。

    Product input and filtering

    /research/messcleaner/fig-4-input.png

  2. 02

    评价维度

    候选产品评价维度用来组织证据;用户选择六个,并可根据自己的优先级替换或调整。

    Evaluation dimensions

    /research/messcleaner/fig-4-dimensions.png

决策综合

审阅后的证据被带入产品级视图,而不是被一份新的不透明摘要替换。

图 5

Authentic vs marketing / Consensus vs conflict / Radar / Risks / Personalized support

/research/messcleaner/fig-5-synthesis.png

决策综合保留用户已经检查过的区分和不确定性,使最终判断仍然落在可追溯证据上。来源:图 5

界面比较来自真实体验和可疑营销的证据,标出一致与冲突,并概括共同点、关键差异和尚未解决的不确定性。总体视图再把维度级发现整合为基于证据的产品图景。

  1. 维度证据

    按选定产品维度保留真实体验与可疑营销的对照。

  2. 共识、冲突与不确定性

    一致发现、冲突主张和尚未解决的不确定性被分开呈现,而不是被抹平。

  3. 总体评估与个性化支持

    总体评估、雷达图、关键发现与风险,以及个性化决策支持,都建立在用户已经审阅过的证据上。

研究设计

我们将 MessCleaner 与无辅助基线以及通用 AI 支持条件进行比较。

N
32
设计
组内设计
条件
Baseline / Basic AI / MessCleaner

每位参与者在全部三种条件下各完成一次购买决策任务。条件顺序覆盖全部六种平衡次序:ABC、ACB、BAC、BCA、CAB、CBA。

图 6

三条平行轨道,平衡次序用连接线表达

/research/messcleaner/fig-6-study.svg

每个条件都包含一次购买决策任务和任务后问卷,最后进行半结构化访谈;条件顺序在参与者之间平衡。来源:图 6

主要发现

四个问卷维度使用同一七点量表,便于在条件之间横向比较。

D1 · eWOM Structuring and Evidence Organization

/research/messcleaner/fig-7-d1.svg

D2 · Credibility Judgment and Evidence Identification

/research/messcleaner/fig-7-d2.svg

eWOM 结构化与证据组织、可信判断与证据识别的问卷结果。评分使用从 Very low 到 Very high 的七点李克特量表。来源:图 7

D3 · AI Explanation, Transparency, and Control

/research/messcleaner/fig-8-d3.svg

D4 · eWOM Synthesis and Decision Quality

/research/messcleaner/fig-8-d4.svg

AI 解释、透明与控制,以及 eWOM 综合与决策质量的问卷结果。评分使用同一七点量表。来源:图 8
  1. MessCleaner 帮助参与者把碎片化 eWOM 组织成与决策相关的结构化证据,并识别哪些信息真正重要。

    证据

    在 Overall eWOM Understanding 和 Information Organization 上,MessCleaner 的评分高于 Basic AI 和 Baseline。在 Valuable Information Identification 上,MessCleaner 同样优于两种条件,而 Basic AI 与 Baseline 没有差异。

    解释

    降低信息加工负担,和帮助用户判断哪些证据重要,是两种不同的支持;通用摘要并不总能做到后者。

  2. MessCleaner 支持用户区分真实体验、可疑营销和不确定信息,并检查、修改 AI 判断。

    证据

    在 authentic/promotional distinction、promotional signal identification 和 insufficient evidence recognition 上,MessCleaner 均优于 Basic AI 和 Baseline。其 Authenticity Judgment Confidence 也高于两种条件,同时保留了明确的不确定信息类别。

    解释

    信心并不要求隐藏不确定性;显式的不确定性可以标出需要继续检查的位置。

  3. 参与者报告更清楚理解 AI 评估、更有选择地依赖、更强的感知控制,以及最终决策更扎根于已审阅证据。

    证据

    与 Basic AI 相比,MessCleaner 在 AI Judgment Understanding(6.13 vs 5.47)、AI Reference-Dimension Visibility(6.56 vs 5.50)、Trust Calibration、Avoiding Blind Acceptance 和 Perceived Control 上评分更高。Decision Grounding:MessCleaner 6.19,Basic AI 5.19,Baseline 5.25。Decision Quality:MessCleaner 6.44,Basic AI 5.66,Baseline 4.88。

    解释

    系统通过把用户已经检查并修改过的证据继续向前传递来支持决策,而不是要求他们信任一个脱离证据的 AI 结论。

研究贡献

  1. 真实性框架

    揭示人类与 AI 真实性判断如何重叠、又如何不同。

    来自 40 位消费者和六个 AI 系统的判断,呈现出共享、分歧与互补的判断维度。

  2. 协同判断

    把 AI 真实性评估变成可检查、可修改的对象。

    MessCleaner 揭示 AI 推理、支持证据和不确定性,让用户把 AI 解释与自己的解释比较,并修改分类。

  3. 决策综合

    把审阅后的证据带入最终决策,而不取代人类判断。

    系统综合结构化证据,同时保留其来源、判断差异和不确定性,让用户继续对最终购买决策负责。