ARTICLE · 人工智能

买家背景在一个市场中移动了前 10 个结果中的 6 个。我在一个无关市场再次运行,结果移动了 4 个。

作者:Lana Plouffe 来源:DEV Community: machinelearning 2026-08-07 13:01 8 分钟 7 阅读 1876 字
AI 评测LLMAI 搜索上下文工程提示词工程
一语总结

买家背景在另一个市场使 10 个答案中的 4 个发生变化,并将预选产品推入前 15 名。

AI 总结

作者运行公共排行榜,记录 AI 答案引擎在 44 种购买问题表达中推荐的产品。在 CRM 实验表明添加买家背景将 SuiteCRM 的提及数从 0 提升到 83 之后,本文尝试在呼叫中心软件上进行预注册复制,这是一个与 CRM 无关的类别。44 个榜单问题中的每一个都被改写成孪生问题,增加行业、现有系统细节和合规约束,同时规则禁止提及产品类别或供应商。VICIdial 在任何 API 调用之前被选定,在榜单 75 个产品中排名第 68,在添加背景后升至 17/132 和 26/132 的提及率,并进入前 15 名。更广泛的结果是:普通的前十名是稳定的(重复测试为 10/10),但买家背景在该市场移动了 10 个中的 4 个,在 CRM 中移动了 10 个中的 6 个。更大的影响在于名单——出现了 88 个通用问题从未提及的产品,主要是自托管电话系统栈(3CX、Asterisk、FreePBX)。作者公开了原始运行数据,讨论了引擎的不对称性,并列出了局限性,包括 n=2 和问题改写的主观性。

核心要点
  1. 上下文将产品名单从 75 个扩展到 127 个;其中 88 个是新增的,以 3CX、Asterisk 和 FreePBX 为首。

    添加行业和约束细节会浮现出通用问题无法触及的自托管电话系统类别,而现有领导者保持不变。

  2. VICIdial 在 API 调用前被选中,从 1/132 上升到 17/132 和 26/132,从第 68 名进入前 15 名。

    预注册目标在无关市场复现,因此 CRM 的结果并非单一类别的偶然。

  3. ChatGPT 将被追踪的产品提升至 11/44,Gemini 为 6/44,Perplexity 接近零,与 CRM 运行中的不对称性一致。

    不同引擎在“上下文应改变答案多少”上的分歧大于对答案本身的分歧,且这一排序在复制中仍然成立。

  4. n=2、主观改写、特定榜单提取,以及“被提及”而非“被推荐”,这些问题限制了结论的解释范围。

    作者明确表示,这是一次复制而非定律,改写步骤仍是方法中最薄弱的环节。

买家背景在一个市场中移动了前 10 个结果中的 6 个。我在一个无关市场再次运行,结果移动了 4 个。

作者运行公共排行榜,记录 AI 答案引擎在 44 种购买问题表达中推荐的产品。在 CRM 实验表明添加买家背景将 SuiteCRM 的提及数从 0 提升到 83 之后,本文尝试在呼叫中心软件上进行预注册复制,这是一个与 CRM 无关的类别。44 个榜单问题中的每一个都被改写成孪生问题,增加行业、现有系统细节和合规约束,同时规则禁止提及产品类别或供应商。VICIdial 在任何 API 调用之前被选定,在榜单 75 个产品中排名第 68,在添加背景后升至 17/132 和 26/132 的提及率,并进入前 15 名。更广泛的结果是:普通的前十名是稳定的(重复测试为 10/10),但买家背景在该市场移动了 10 个中的 4 个,在 CRM 中移动了 10 个中的 6 个。更大的影响在于名单——出现了 88 个通用问题从未提及的产品,主要是自托管电话系统栈(3CX、Asterisk、FreePBX)。作者公开了原始运行数据,讨论了引擎的不对称性,并列出了局限性,包括 n=2 和问题改写的主观性。

文章金句

"

添加买家背景并不会主要改变现有产品的排序,而是让该品类向通用问题无法触及的一类产品敞开。

"

两个市场只是一次复制,而非定律。它告诉我 CRM 的结果并非单一类别的偶然;但它不能告诉我其他任何地方的效果大小。

"

如果你在任何规模上评估 LLM 输出,这一交互作用就是你必须考虑的因素。