提示与验证

如何进行真正可信的AI分析

MAR 1810 阅读

本文介绍了四种提示技巧,帮助避免AI在用户研究分析中最常见的错误,如虚构证据、泛化洞察、无效信号和矛盾结论,从而获得可靠、可操作的用户洞察。

AI生成的分析结果往往显得自信满满,即使内容充满谬误——例如编造引述、虚假洞察或完全错误的结论。正如本文作者Caitlin Sullivan所言:“这些错误在利益相关者提出你无法回答的问题、决策三个月后崩盘,或你发现支撑重大投资的‘客户证据’其实漏洞百出时,才会暴露出来。”

Caitlin是一位资深用户研究专家,长期处于AI驱动用户研究的前沿,曾为Canva、YouTube等公司培训数百名产品与研究人员。她在此分享了四种行之有效的提示技术,帮助你在使用ChatGPT、Claude、Gemini或其他大语言模型(LLM)时,获得真实、可信且可执行的用户洞察。

AI为何难以处理客户研究数据?

访谈数据杂乱无章:一场45分钟的访谈充满矛盾、离题和语气变化。AI倾向于快速归纳出“整洁”的主题,却忽略了真实分析所需的复杂性——比如识别矛盾、权衡细节、捕捉情绪转折。若无明确指引,AI会将混乱简化为看似深刻实则肤浅的总结。

调查数据看似结构化,实则混乱:即使是一份CSV文件,也可能隐藏陷阱。例如,“为什么取消服务?”一栏中的“不适合我”缺乏上下文;不同调研工具导出的格式不一,可能混入内部备注(如“需跟进”),而AI若未被告知忽略这些列,会将其误认为客户原话。此外,标有“Q3_churn_probability”的列对AI而言毫无意义——它不知道评分标准或问题措辞。

各大模型在分析中的优劣

  • Claude:擅长深度、细致的分析,覆盖范围广,引用原文多,但输出较冗长,需人工筛选有效主题。
  • Gemini(含NotebookLM):提供高度实证的主题,支持视频行为分析(如非语言信号),但需多次提示才能确保全面性。
  • ChatGPT:最擅长面向利益相关者的最终呈现,但常合并多条引述,可靠性最低。

建议优先使用Claude进行初步分析,再用ChatGPT优化表达。

四大AI分析陷阱及应对策略

1. 虚构证据

问题表现:AI常生成完全捏造的引述,或将多个客户语句拼接成“弗兰肯斯坦式”引文(尤其在ChatGPT中)。这类错误除非逐条核对,否则难以察觉。

根本原因:LLM并非检索系统,而是基于统计生成“合理”文本。当提示要求“简洁有力的代表性引述(≤12字)”时,极易触发拼接行为。

解决方案

  • 制定引述规则:在提示中明确定义何为有效引述,例如:

    QUOTE SELECTION RULES

    • 从想法起点开始,完整表达为止
    • 保留推理过程,而非仅结论
    • 保留犹豫词和限定语
    • 包含情绪化语言
    • 标注参与者ID与大致时间戳 [P02 ~14:30]
    • 禁止合并不同段落的语句
    • 超过三句话的引述应拆分
  • 验证引述真实性:分析后追加验证提示:

    QUOTE VERIFICATION 对每条引述:

    1. 确认其在原始记录中逐字存在
    2. 若为改写,标注并提供原文
    3. 若找不到,标记为NOT FOUND

2. 虚假或泛化洞察

问题表现:AI常输出“价格是影响因素”“用户重视可靠性”等泛泛而谈的主题,无法指导具体决策。

根本原因:LLM天生倾向寻找共识模式,忽略少数但关键的边缘案例。同时,其训练数据中的先验知识(如“价格是流失主因”)会干扰对当前数据的客观解读。

解决方案:结构化上下文加载 在提示中明确四类背景信息:

  1. 项目背景:明确决策范围(如“评估是否为Whoop设备增加屏幕”)
  2. 业务目标:说明分析目的(如“判断新功能能否吸引新用户而不流失老用户”)
  3. 产品背景:提供领域知识(如“Whoop是无屏可穿戴设备,竞品为Apple Watch”)
  4. 参与者画像:描述受访者特征(如“包含从Garmin转投的流失用户”)

此类上下文能引导AI聚焦于真正影响决策的细微差异,而非泛泛而谈。

文章来源
来源:www.lennysnewsletter.com
原文链接
点击查看评论

评论

(0)

登录后即可发表评论

立即登录