更正2026-09-30① 原文写「我们给苏州一家电子元器件制造商……做过一轮」现更正为这一轮监测是这家制造商自己跑的我们只提供工具。② 原文含摘要写 2026-06-21 至 07-10、344 条监测问题、525 次有效实测现更正为 2026-06-30 至 07-1011 天窗口、43 条监测问题、524 次有效实测。③ 原文写综合提及率 50%下文「50% 这个均值」同此现更正为 49.2%258/524只算这家厂商的国内品牌524 次里有 22 次回答不完整正文不足 100 字其中豆包 13 次一律按未提及计入。④ 原文分引擎表与下文写通义千问 85%、Claude 74%、文心一言 67%、豆包 41%、ChatGPT 17%、DeepSeek 12%、Gemini 4%现更正为 87%、70%、68%、39%、15%、11%、2%同一口径其余 3 格不变。⑤ 原文写「厂家推荐」类命中 54%–75%现更正为 52.7%238/452。⑥ 原文写「选型知识」类 19 问只命中 1 次5%现更正为实测最多的一道选型题跑了 19 次只被提到 1 次。⑦ 原文写新榜「对 47.4 万篇次豆包引用的实证」、「唯一显著的变量是标题与提问意图的匹配度0.23」现更正为47.4 万篇次是新榜累计采集的信源其中豆包引用 17.6 万篇次0.23 是已被豆包引用的今日头条文章里相关性相对最高的一项新榜原文称这只是弱相关。用户在豆包里问「网络变压器厂家推荐」AI 的回答就是你的新首页——但多数品牌从没实测过 AI 到底怎么答。规模摆在那里CNNIC 第 57 次报告2026-02显示国内生成式 AI 用户已达 6.02 亿普及率 42.8%年增 141.7%知乎研究院白皮书经中新网报道的数字更直接——81% 的消费者会部分采纳 AI 建议完成购买。所谓提及率基线测试就是在固定时间窗内、用固定问题集对多个 AI 引擎实测品牌被提及情况得到一组可对比、可复测的基准数据。这篇给一套可复现的流程问题集设计、记录表结构、执行规范、指标计算。全程可手工执行文末算一笔自动化的账。一、确定测试矩阵12 个引擎国内 8 个豆包、DeepSeek、Kimi、通义千问、文心一言、腾讯混元、智谱清言、阶跃星辰。海外 4 个ChatGPT、Claude、Gemini、Perplexity。优先级按真实流量排。QuestMobile 2026Q1AI 原生 App 月活合计 4.46 亿豆包 3.45 亿、通义千问 1.66 亿、DeepSeek 1.27 亿。资源有限就按月活从高到低保覆盖豆包、通义千问、DeepSeek——用户在哪测试就在哪。二、设计问题集三类问题别只测一类A 类·品牌直查「XX 公司怎么样」「XX 的产品质量如何」。测的是 AI 对品牌的基础认知。B 类·厂家推荐「国内网络变压器厂家推荐」「RJ45 连接器供应商哪家靠谱」。测竞争位次是转化最近的一类。C 类·选型知识「网络变压器怎么选」「千兆网口该用什么规格」。测内容渗透——用户决策前一定会问答案里引没引你的内容差别巨大。问题来源客服与销售的问题日志、搜索词报告、竞品官网 FAQ。每类不少于 15 问总量 40 问起步。措辞按真实用户口吻写别堆关键词。新榜 2026 年 5 月发布的一项抽样研究165 个提问词累计采集信源 47.4 万篇次其中豆包引用 17.6 万篇次发现在已被豆包引用的今日头条文章里引用次数与账号粉丝数的相关性近乎为零相关性相对最高的是标题与提问关键词、意图是否对得上系数 0.23但新榜原文也说这只是弱相关——AI 匹配的是意图不是名气。测试问题越贴近真实提问测出的基线才越接近真实场景。三、记录表一行一个观测点建一张 CSV字段如下test_date,engine,question_id,category,mentioned,cited,position,competitors,notes 2026-07-01,doubao,B-03,厂家推荐,1,0,2,品牌X;品牌Y,列表第2位 2026-07-01,deepseek,B-03,厂家推荐,0,0,-,品牌X;品牌Z,推荐竞品、本品牌缺席判定规则要提前写死否则多人执行口径会漂mentioned回答正文出现品牌全称、常用简称或产品线名记 1仅出现在引用链接里不算。cited引用来源指向品牌自有域名记 1。提及和引用是两件事必须分开记。position出现在推荐列表第几位。无效样本拒答、超时、明显答非所问——剔出分母单独标注不许静默丢弃。每次回答全文存档截图或文本。后续做内容优化靠的是回读原文不是看分数。四、执行规范控制变量每个问题新开会话避免上下文污染。保持日常登录态、记录是否开启联网检索——这才是真实用户看到的版本。同一问题至少跑 3 轮建议连续 3 天各一次。大模型输出非确定性联网检索结果也每天在变单次抽测没有统计意义。固定时段执行记全日期与引擎版本。五、指标计算综合提及率 Σmentioned ÷ 有效实测次数分引擎提及率、分类别提及率以及最有信息量的引擎 × 类别交叉表竞品声量聚合competitors字段看谁在替你回答六、一份真实基线长什么样苏州一家电子元器件制造商网络变压器 / RJ45 连接器自己用监测工具跑过一轮2026-06-30 至 07-1011 天窗口43 条监测问题、524 次有效实测综合提及率 49.2%258/524只算这家厂商的国内品牌单一厂商读数非行业代表性抽样。分引擎引擎提及率引擎提及率通义千问87%Kimi53%腾讯混元83%豆包39%Claude70%ChatGPT15%文心一言68%DeepSeek11%智谱清言63%Gemini2%49.2% 这个均值没什么用交叉之后才见真相「厂家推荐」类命中 52.7%238/452「选型知识」类实测最多的一道题跑了 19 次只被提到 1 次——AI 正在用别人的内容教育它的客户。DeepSeek 在同类问题里点名推荐了其他品牌该品牌缺席而豆包提及率 39%恰是月活最大的 AI 原生 App3.45 亿DeepSeek11%月活也有 1.27 亿QuestMobile 2026Q1——短板正好砸在用户最多的入口上。这就是基线测试的价值告诉你短板具体在哪个引擎、哪类问题。七、手工与自动化的成本账12 引擎 × 40 问 × 3 轮 1440 次对话按每次含记录 2 分钟算约 48 小时。基线测一次手工可行按日追踪就不现实了。我们后来把这套流程做成了桌面应用自定义问题集、按日自动实测、Visibility Score 打分、竞品声量对比、引用来源追溯逻辑与本文一致只是把 1440 次对话交给机器。利益相关上面这款桌面应用为作者所在团队的产品。方法本身是开放的手工执行同样成立。本文数据来自作者所属公司自建 GEO 监测工具的生产环境实测文字由 AI 辅助创作、作者审校发布。