提示与验证

如何开展真正可信的 AI 分析:四种预防常见错误的提示技巧

MAR 1712 阅读

本文探讨了 AI 在用户研究数据分析中常见的四大失败模式,包括虚构证据、虚假或通用洞察、无效信号及矛盾信息。作者提供了具体的提示词策略和验证方法,帮助产品经理确保 AI 生成的结论真实可靠,避免基于错误数据做出决策。

四种预防 AI 常见错误的提示技巧

Caitlin Sullivan 的头像

Caitlin Sullivan

2026 年 2 月 17 日

👋 大家好,我是 Lenny。每周我会回答读者关于构建产品、推动增长和加速职业生涯的问题。更多信息请查看:Lenny 播客 | Lennybot | How I AI | 我最喜欢的 AI/PM 课程公开演讲课程面试准备助手


AI 面临的最大问题在于,其输出总是显得十分自信——即便内容全是谎言:伪造的引用、虚假的见解以及完全错误的结论。正如本期客座作者 Caitlin Sullivan 所说:“这些错误往往在利益相关者提出你无法回答的问题、决策在三个月后崩溃,或者你发现主要投资背后的‘客户证据’其实存在巨大漏洞时才暴露出来。”

作为用户研究的资深专家,Caitlin 一直处于利用 AI 进行用户研究的前沿。她已在大型和小型公司培训了数百名产品和研究人员,教授他们如何进行高效的 AI 驱动型客户调研,并曾为 Canva、YouTube 等公司的团队提供建议。下文,她将分享她的四项最有效的技巧,助你在 ChatGPT、Claude、Gemini 或你的任何 LLM 模型中获得真实、可信且具有可操作性的用户洞察。

For more from Caitlin, find her on LinkedIn and in her new course, Claude Code for Customer Insights.


每个人都在用 AI 分析客户数据。但每个人也都在得到充满糟粕的答案:幻觉、错误结论和仅仅复述你所提供信息的“见解”。

将相同的客户对话记录放入两个模型中,你会得到一个自定义体验的冒险。每个模型会给你一个不同的叙事、不同的“证据”和截然不同的产品推荐,而且自信程度一致。以下是该实验中得出的两个真实输出。一个是误导性的,一个是可信的。你能分辨出哪个是哪个吗?

实验输出对比图

当它们并排显示时,你可能会发现左侧输出的问题。但在实际工作中并非如此。你只得到一个输出,它读起来很自信,于是你在此之上构建了下一个决定,永远看不到缺失的内容。这正是为什么验证至关重要的原因。

区分这两个答案的关键在于我的工作流中的关键步骤,旨在解决 AI 分析的常见故障模式。这些步骤迫使 LLM 保持客户的原话,深入挖掘超越表面模式,并捕捉客户故事中的矛盾点,以免最终建议出现偏差。没有这些检查,虚假但看似可信的见解就会被放入演示文稿,以_错误_的方向影响百万美元级的决策。

在本文章中,我将展示如何获取可信赖的相关且经过验证的见解。你将了解四种悄然破坏 AI 支持的洞察力的故障模式:

  1. 虚构的证据
  2. 虚假或通用的洞察
  3. 无法指导更好决策的“信号”
  4. 相互矛盾的洞察

我还将传授我的提示技巧,以防这些错误在导致错误最终决策之前发生。这些策略适用于 Claude、ChatGPT、Gemini,以及任何定性或混合数据的访谈、调查。

为什么 AI 难以处理客户研究数据

在我们深入故障模式之前,你需要理解这类数据对 AI 来说究竟有什么难点。模型在访谈和调查中失效的方式各不相同。

访谈是非结构化且杂乱的。

一场 45 分钟的研究访谈是一段混乱、漫无目的的对话。参与者可能会自相矛盾。他们会跑题。他们在第 8 分钟说了一件重要的事,却在第 35 分钟完全重新解释了这件事。

LLM 的处理方式是强加结构并稍快于预期地得出结论。它们立即找到清晰的主题,提取最符合主题的引语,生成整洁的摘要,然后就结束任务。

但真正的分析需要沉浸在杂乱之中,注意矛盾,权衡跑题内容,并捕捉语气变化。如果没有明确指导,AI 会将这一切扁平化为_看起来像_见解的东西,却忽略了实际上最重要的部分。

即使问卷看起来是结构化的,它们也不是。

你可能认为 CSV 很容易解析。行和列——这有什么复杂的呢?很多。

200 条关于“为什么取消?”的回答的一列数据和访谈数据一样乱;甚至更糟,因为你没有任何背景信息。在访谈中,你记得他们犹豫过,或者刚刚抱怨了某个特定功能。在问卷调查中,你只会得到“不适合我”,除此之外一无所知。

你的 CSV 可能也没有你想的那样干净。不同的工具导出方式不同。SurveyMonkey 可能会把问题文本放在表头,而 Qualtrics 导出的表头带有内部代码。一些导出文件甚至包含元数据列——时间戳、内部标签——就坐在客户响应旁边,却没有明确的区分。如果你不告诉 AI 哪些列包含客户的声音,哪些应该忽略,它就会分析一切作为信号。我曾见过 AI 将内部笔记(“标记为跟进”)当作客户说的话。

即使是“结构化”列也隐藏着复杂性。“Q3_churn probability”的表头告诉 AI 关于规模、问题措辞的任何信息都没有,也不知道 5/5 是好还是坏。

在分析访谈时,AI 模型需要结构、证据提取和矛盾检测方面的帮助。在问卷调查中,它们需要解释、列消歧义以及理解稀疏响应实际含义的帮助。

下面的四个故障模式同时影响这两种数据类型以及任何类似的数据。修复这些问题通常能将 AI 分析结果的可靠性和相关性提升 10 倍。

每种 LLM 的最佳用途

并非所有的 LLM 在分析工作上都是平等的。我在 Claude、ChatGPT 和 Gemini 上运行过超过 100 次相同的分析流程,并与 Maze 等发现工具的产品团队合作测试跨模型的提示词,看看什么能交付结果。

以下是你需要了解的关于每个模型的信息:

Claude: 最佳用于具有深度和细微差别的彻底分析。提供更多引语并覆盖更多领域,且无需太多引导。代价是:它会给你整个头脑风暴,因此主题并不总是“被证实的”——你得到的是广度,而不仅仅是安全模式。

Gemini(以及 NotebookLM): 最佳用于高度证据支持的主题,以及现在的视频分析。给你的主题更少,但基础更扎实。期待多次提示以获得完整性,并请求更长引语。独特优势:它可以分析非语言行为,这是其他模型目前无法做到的。

ChatGPT: 最佳用于最终框架搭建和利益相关者沟通。最具创造性——包括在“逐字引用”方面,遗憾的是。对于真实证据可靠性最低(组合引用),但擅长为特定受众打包相关发现。

让我举一个例子:

模型对比图

想了解这个示例使用的逐字稿吗?点击此处

除非我给这些模型更多的指令,否则输出存在显著差异。主题有重叠,但 ChatGPT 错过了用户对价值/价格敏感度的反应,且三个模型给出的信心评分和引语各不相同——有的是逐字的,有的是总结的。

当我们能够并排看到这三者时,这一点就很明显,但大多数团队只有一个 LLM 企业账户,不会看到他们使用的那一个的缺点。ChatGPT 总结和混淆逐字引用,Claude 对信心评分更保守,而 Gemini 经常选择过短的客户声音片段。

我的建议: 如果有选择,请在分析工作上使用 Claude。它在扎根于实际数据的同时覆盖更广的范围。你得到深度和广度,而不需要太多引导。缺点是它不会为你过滤。你经常会得到经过验证的模式和未成形的假设平等地呈现,你需要验证主题是否有足够的证据支持。但这比你为了确保分析伙伴没有遗漏某些内容而提示三次要好得多。

关于示例的说明: 为了保持一致性,本文中的示例通常使用 ChatGPT。它仍然是我客户团队和学生中最广泛使用的模型,也是最容易陷入我所涵盖的具体故障模式的模型。修复方案有效,并能改善所有三种模型的结果。

AI 数据分析欺骗你的四种方式及其修复方法

在对客户服务发现流程进行测试超过 2000 小时后,我发现 AI 分析存在四种不同的故障模式——并且每种都有可靠的修复方法,在平台、数据类型、模型和工作流方面始终如一地有效。

故障模式 #1:虚构证据

问题表现形式

尽管大多数推理模型都有了巨大的改进,幻觉仍然普遍存在。当我观察产品人员进行分析时,我经常看到两种类型的幻觉:

  • 完全虚构的引用(在所有三大 LLM 中仍会发生)
  • 弗兰肯斯坦式引语,由多个来源拼凑而成,在一定程度上代表了用户的说法……但这实际上不是他们的原话(特别是在 ChatGPT 中非常常见)

这两种类型除非你手动检查每一个引语,否则都不会被注意到,但两者通常都是由_you 的提示方式_引起的。你可以相当容易且意外地触发 ChatGPT 以多种方式合并多个客户引语,从而损害我们对客户所说话语的理解。当你添加诸如“max. 100 words”或“for each theme, give a punchy and representative quote that captures it (≤12 words)”之类的短语时,你几乎总是会得到混合体。下面示例中高亮部分是这种组合,而不是客户的真实原话。

引用错误示例

为什么会发生这种情况

LLM 不像搜索引擎那样检索引用;它们生成在上下文中统计上可能的文本。生成和检索本质上是不同的。模型预测引语应该是什么样的。如果上下文是关于电话检查挫败感,它会生成合理的电话检查挫败感语言。有时这与原始内容匹配,有时接近错误,有时则是编造的。

“Verbatim”(逐字)也是一个模糊的词,用来提示模型。精确字符?标点可以不同吗?填充词呢?引语从哪里开始和结束?模型会用你从未看到的假设填补这些空白。甚至参与者 ID 和时间戳都可以伪造。引用如“[P03, 14:30]”看起来很权威,但如果引语是编造的,那就毫无意义。

解决方案:引语选择规则 + 验证

无论你的模型、数据类型或工作流程如何,解决此问题的方案有两个部分。首先,定义有效的引语看起来是什么样——你的引语“规则”——消除允许 AI 填补空白的歧义。然后验证 AI 分析结果中的引语是否确实存在,然后才允许模型使用它们。

1. 定义你的引语“规则”

将此添加到你的分析提示中:

QUOTE SELECTION RULES

  • Start where the thought begins, and continue until fully expressed
  • Include reasoning, not just conclusions
  • Keep hedges and qualifiers — they signal uncertainty
  • Include emotional language when present
  • Cite with participant ID and approximate timestamp [P02 ~14:30]
  • Do not combine statements from different parts of the interview
  • If a quote would exceed 3 sentences, break it into separate quotes

这消除了歧义。模型现在知道“verbatim”对你来说意味着_什么_:从哪里开始,到哪里结束,包含什么,不要组合什么。

我总是鼓励客户团队和课程参与者批判性地思考什么对他们的引语是“好”的。你很可能马上就会从我提供的提示片段中得到更好的结果(它是我最喜欢的复制粘贴项),但如果加上你自己的定义,结果会更好。

2. 在使用前验证

初始分析后,使用以下验证提示让 LLM 确认这些是真实引语:

QUOTE VERIFICATION

For each quote in the analysis above:

  1. Confirm the quote exists verbatim in the source transcript
  2. If the quote is a close paraphrase but not exact, flag it and provide the actual wording
  3. If the quote cannot be located, mark as NOT FOUND

Output format:

  • Quote: [the quote]
  • Status: VERIFIED / PARAPHRASE / NOT FOUND
  • If paraphrase: Actual wording: [what they said]
  • Location: [Participant ID, timestamp, or line number]

当你运行那个时会发生什么:

验证结果示例

前一个 ChatGPT 输出中的大部分引语都是改写过的,而非原始逐字客户陈述。这是在要求少量引语的情况下发生的,所以想象一下当你挖掘 20 份访谈并获得同样多的模式时会发生什么。

没有验证,“引语”就像这样会被归因于真实参与者的演示文稿中。有时没什么大不了的。其他时候,这是在产品语言和强烈共鸣之间的区别,还是不转化的信息。

这通常只需要额外的五分钟,取决于你要处理多少数据。但它捕获的错误会破坏产品决策背后的证据。

故障模式 #2:虚假或通用洞察

问题表现形式

AI 找到的主题太宽泛和通用而无法采取行动,或者受到你无意中预置的影响。在访谈中,你会得到任何产品类别都能描述的主题。我经常听到 PM 这样说:“AI 分析只是告诉了我已经知道的事情”或“这些洞察太通用了。我无法采取任何行动。”

他们会得到这样的输出:

  • “价格是决策的一个因素”
  • “人们重视可靠性”
  • “用户希望获得更实时信息”

这确实是真话,但对于艰难的决策来说是徒劳的——我们需要比那更深。这些主题可以从许多研究中得来。由于我是在处理我的假 Whoop 数据,它们也可以轻松来自任何可穿戴设备研究。

这类主题并没有告诉我们_你的_用户是否想要_这个_新探索功能来证明投资的合理性,或者增加它会疏远那些因为你是与众不同的而选择你的客户。

为什么会发生这种情况

AI 默认寻找_共识_,因为 LLM 是模式查找机器。它们浮现容易浮出水面的(明显的)模式,找到多个参与者提到的内容,然后生成一个模式匹配的主题。

真正最重要的洞察可能是只有少数人在这一批访谈中说了某事,但如果被更多客户分享,将是一个值得注意的业务信号。或者最重要的洞察甚至可能是一些人说他们想要和他们行为表明之间的张力。

LLM 也带来训练时的先验。如果模型在数千次流失分析中看到价格是头号主题,即使你的全数据集不支持,它也会加权至价格。

在调查中,这种肤浅模式匹配的倾向甚至更糟。当有人写下“不适合我”时取消,AI 必须猜测这意味着什么。没有指导,它很可能会将该响应与其他响应归类为通用的“价值感知”主题。但“不值得”可能意味着:

  • 相对于所得过于昂贵
  • 数据量太大且我不是够严肃的运动员
  • 我不想要另一个充电设备
  • 我需要屏幕,而 Whoop 没有

这是一个有四个完全不同的产品决策意义的响应。将那种模糊性乘以数百个调查响应,你的“主题”就变成了使决策不那么容易的毫无意义的平均值。

LLM 被训练寻找共识和压缩信息。具体性和有价值的边缘案例丢失了。如果你的提示提到“定价问题”,注意有多少响应突然被编码为与定价相关。

在某些情况下,这可能是有益的,因为模型确保所有输出与你正在处理的特定事物相关。但在许多情况下,它可能从一开始就偏向于选择性挑选。

举个例子:

泛化主题示例

这些可以描述任何可穿戴设备研究。我们不能从中做出硬件决策。

另一个例子:

我要求 ChatGPT 为我找出流失调查问题“Whoop 未能支持你希望做什么?”的主题簇和计数。

下面的结果是我们也无法做出此决策的集群。所以 18% 的流失受访者需要“更可操作的指导”,听起来像是工作需求。但是该集群内的方向太多了,我们无法更容易地做出决策。Whoop 应该关注更清晰的指标还是锻炼计划,还是两者都要?此外,这与我们的屏幕决策大多无关。

调查结果集群

当我们询问 AI 对调查响应进行聚类时,我们需要给它提供清晰的方向和上下文,否则我们会留下中间决策的空间和更多手动工作。

解决方案:真正引导解释的上下文加载

大多数人习惯的提示框架具有角色、上下文、任务、格式等部分。对我们大多数人来说,上下文意味着在提示中包含几行背景信息,通常在开头附近。当我们使用 AI 进行分析时,这通常关注当前客户发现的要点。想想:目标、假设和我们正在处理的产品的哪一部分。

在过去的一年中,我看到越来越多的人将提示的“上下文”部分变成了四段关于我们工作的任何想法,通常是在午餐时以思维流的形式讲述。

但无论是三行目标还是整个未结构化的背景故事都不够好。有效的上下文加载_至少_有四个组成部分,塑造 AI 如何解释以下内容:

  1. 项目上下文告诉 AI 范围和风险。“探索是否添加屏幕”是一个具有约束的具体决策。“做客户调研”很模糊,所以 AI 默认进行通用分析,因为你没有给它框架。
  2. 业务目标告诉 AI 你想要实现什么。如果你需要知道某个功能是否会吸引新用户还是疏远现有用户以便优先考虑构建它,就说出来。AI 将加权证据以回答_你的_问题并解决_你的_决策,而不是它假设你正在做出的决策。
  3. 产品上下文给 AI 领域知识。没有它,AI 一般性地解释“我想看我的数据”。有了它,AI 理解这句话是在一个无屏可穿戴设备与 Apple Watch 竞争的背景下——一种完全不同的解释。
  4. 参与者概况告诉 AI 谁在说话。“我需要实时数据”来自流失的 Garmin 切换者的意思不同于从从未尝试过竞争对手的忠诚用户那里说出同样的话。AI 只有在知道证据来自哪里才能正确加权证据。

好消息是,我在提示上下文中看到人们添加的大部分信息都是多余的。你通常不需要你认为那么多信息,但它需要清晰、直接且相关的信息,比如上述四项。

对于访谈,将此上下文放入分析提示中(或用作单个提示):

文章来源
来源:www.lennysnewsletter.com
原文链接
点击查看评论

评论

(0)

登录后即可发表评论

立即登录