1. 先说实话我为什么在2025年All in AI搜索GEO做了七八年搜索优化我见过百度爬虫一天来几次也盯着Google算法更新熬过夜。但真正让我觉得“流量逻辑要变天”的是2024年AI搜索开始大规模渗透普通用户的搜索习惯。不管是Perplexity、ChatGPT Search还是国内的Kimi、豆包、文小言用户输入问题的方式从“关键词堆砌”变成了“自然语言提问”搜索结果也从“十条蓝色链接”变成了“一段带引用的综合回答”。这个变化意味着什么举个例子以前你搜“上海哪家律所做涉外纠纷比较专业”百度给你10个链接你一个一个点开看。现在你问Kimi同样的问题它直接给你一段话“综合多家平台评价A律所和B律所在涉外纠纷领域口碑较好其中A律所代理过XX案件……”用户可能根本不会点进任何网站就选了A律所。你的官网在不在那10个链接里根本不重要重要的是AI在生成那段话时有没有引用你的内容。这就是GEOGenerative Engine Optimization生成式引擎优化要解决的问题。GEO不是传统的SEO它优化的对象不是关键词排名而是“AI模型在生成回答时是否引用、如何引用你的内容”。我们团队从2024年底开始在上海落地了一套GEO系统从问题集设计、多模型监测到引用追踪踩了不少坑也沉淀了一套可复用的方法。这篇东西就是来复盘这套实践的适合正在做品牌数字化、内容策略、搜索优化的朋友尤其是那些“官网流量不错但AI搜索里完全隐形”的团队。2. 问题集设计GEO系统的地基决定你后面所有工作的下限很多人以为GEO的第一步是“写内容”其实不是。第一步是设计问题集。问题集就是你想在AI搜索里被问到、并且希望AI能引用你内容的问题列表。它决定了两件事一是监测目标我们到底要监测哪些问题二是内容生产的选题方向。问题集设计得粗后面全白搭。2.1 问题集不是拍脑袋而是“用户意图地图”我们当时犯过的第一个错是让内容运营直接列问题。运营同学列了80个问题看着都挺对但一问“为什么是这些问题”答不上来。后来我强制团队用三层逻辑来拆解问题集。第一层叫“核心转化问题”就是那些离钱最近的问题。比如做B2B软件核心问题是“XX软件多少钱”“XX软件和竞品有什么区别”“XX软件适合什么企业用”。这些问题用户问了之后大概率会去注册、试用、咨询甚至是直接购买。第二层叫“信任建立问题”比如“XX软件安全吗”“XX软件的口碑怎么样”“XX软件的客户案例有哪些”。这类问题不直接产生转化但用户问了说明他已经在认真考察你了。第三层叫“行业泛问题”比如“2025年企业协同软件怎么选”“SaaS工具部署方式有哪些”。这类问题不直接带品牌词但在AI搜索里是巨大的流量入口。三层问题拆完之后还要做一步关键动作去各个AI搜索引擎的首页推荐问题、相关提问里搜集真实问法。你会发现用户的问法和你的业务表达完全不一样。我们做企业服务的内部习惯叫“客户成功体系”但用户问的是“买了没人教怎么办”。AI搜索理解自然语言但它的语料库来自全网如果你的内容里没有这些“用户味”的表达它就很难把你的内容关联到这些问题上。实操提示问题集不用一次到位但要建立版本管理。我们用一个飞书表格维护问题集字段包括问题原文、问题类型、目标人群、对应内容资产、监测模型、优先级、最后更新日期。每周复盘一次根据新出现的用户提问和业务变化往里加。2.2 问题权重与场景分级别把精力浪费在“自嗨型问题”上问题集不是100个问题平均发力。AI搜索的监测成本、内容生产成本都是实打实的必须要给问题分级。我们采用了一种简单的“三轴评分法”。第一个轴是“商业价值”也就是这个问题带来的流量有多接近转化。第二个轴是“AI可见度”也就是说这个问题在AI搜索里被回答时是否经常有固定的答案来源如果AI回答总是引用官方文档或百科你很难插入说明优化空间低。第三个轴是“内容竞争力”也就是看你自己有没有能力生产出比现有AI引用来源更好的内容。三个轴各打1到5分最后把总得分排个序。得分前30%的问题作为“S级问题”要投入80%的监测和内容资源。得分中间40%是“A级问题”常规监测、按月更新内容。剩下30%是“B级问题”季度性关注不主动投入。这个方法看起来简单但解决了一个真问题团队所有人对“优先级”有了统一的数字共识不用每次争论“这个客户反馈的问题到底重不重要”。比如我们有个客户是做儿童英语培训的“某某英语怎么样”这个问题商业价值极高但AI可见度也极高回答引用全是大众点评和知乎内容竞争力评分很低。直接定成S级然后专门给这个客户做了一组可被引用的测评类内容资产后面再说效果。2.3 负面问题与舆情防御GEO系统里必须有的“暗面”问题集里绝对不能只放正向问题。AI搜索时代品牌最大的风险不是某个用户发帖骂你而是AI在回答里把你的负面信息当作“综合结论”引用出来而且那个结论还是错的。更麻烦的是AI的引用来源可能是一些低质量内容农场但用户就是信。我们在问题集里专门设计了“防御型问题”分类。比如品牌词加风险词组合“XX公司裁员”“XX公司退款难”“XX公司是不是骗子”。这些问题的监测优先级有时候比正向问题还高因为你必须知道自己被AI“黑”了。防御型问题的处理不是不回应而是通过生产高质量的反向内容去改变AI的引用结构。具体做法后续讲内容策略时细说这里想强调的是一定要有人专门盯这部分数据。3. 多模型监测你不能只守着ChatGPT和百度看GEO系统里最容易被低估的环节就是监测。原因很简单主流的AI搜索引擎太多了而且它们的回答逻辑、语料来源、引用偏好都不一样。你以为优化了Perplexity结果用户用的是Kimi你以为在文小言里已经被引用结果豆包还是只字不提。所以多模型监测不是可选项是必选项。3.1 监测矩阵怎么搭模型、问题、频次的三角关系我们内部把监测矩阵叫“9宫格”。横轴是问题集里的代表性问题纵轴是AI模型列表第三维是监测频次。不建议一开始就搞全量监测我们踩过的坑是第一天就上了60个问题、6个模型结果每天被大几千次API调用和报告刷屏团队直接崩溃。后来收敛到每天监测S级问题30个、覆盖4个主流模型一周跑一次完整的问题集。具体操作上我们没有自己开发爬虫去抓各家AI的回答因为工作量和反爬风险都不低。我们是先人工在ChatGPT、Perplexity、Kimi、豆包四个主流模型上跑了一轮发现回答结构和引用格式差异极大比如Perplexity会明确用小标号列出引用来源Kimi倾向于插入“根据某网站的信息”这类表述豆包如果某个来源可信度高会整段直接采用。基于这个观察我们把监测工具从“通用脚本”改成了“半自动化人工标注”用脚本自动发起提问并抓取回答文本然后由人工在标注平台上对回答进行分类和引用判断。注意千万别迷信“全自动监测”。AI搜索的回答是生成式的同一个问题同一个模型不同时间问可能答案完全不一样。机器只能负责抓取和初筛最终判断“有没有引用你、引用的是正面还是负面、引用位置靠前还是靠后”必须要人工看一遍。我们后来统计人工复核一篇回答平均只要几十秒但准确率比纯算法判读高很多。3.2 评测维度与打分机制怎么量化“AI搜索里做得好不好”光记录“有没有被引用”是不够的你需要一套打分机制来量化GEO的效果。我们设计了一个五维评分模型给每一条AI回答打分。第一个维度是“可见性”AI回答里是否提到你的品牌或内容来源没提到0分提到但没展开给1分作为核心答案之一给2分。第二个维度是“引用位置”在回答前三分之一出现给满分中间给一半最后才出现给低分。第三个维度是“引用情感”AI对你的描述是正向、中性还是负向。第四个维度是“事实准确性”AI引用你的内容是否准确传达了你的观点这一点很容易被忽略——AI歪曲你的意思有时候比不引用更伤。第五个维度是“来源链接可见性”就是看AI回答里能不能让用户直接看到你的链接。五维加总单个问题单模型满分10分。然后横向对比每个模型的平均分纵向对比每周的趋势变化。今天有些第三方GEO工具会直接输出一个“AI可见度评分”但我们在实践中发现不同工具的标准都不太一样做内部趋势监测可以做跨品牌对比要谨慎。自己起一套打分体系虽然费点时间但团队内部对“好不好”有完全一致的定义这比任何第三方工具都重要。3.3 自动化监测的边界减少人工但不能完全甩手后面我们又迭代了一版把监测流程接到飞书多维表格里。每天晚上11点自动化脚本触发对S级问题发起提问抓取回答文本初筛出“包含品牌名”“包含竞品名”“回复异常”三类结果。所有结果同步到飞书机器人第二天早上团队打开就能看到日报。但仍然有一件事必须人工做对异常结果的深度解读。比如某天监测发现某个AI模型突然在一周内三次回答同一个客户问题都是引用竞品。你要去看到底是竞品发了重磅稿还是AI模型本身更新了语料库。这没有现成的自动化方案只能靠运营和内容团队去分析。自动化监测的意义是帮你“发现异常”而非“替代决策”。4. 引用追踪从“被提到”到“被引用”再到真实转化做GEO最大的成就感不是看着AI报告里出现你品牌名而是这个引用真的给你带了流量和转化。但“被提到”和“被引用”之间有巨大的鸿沟。我们花了很长时间才想明白这件事。4.1 引用归因AI是怎么看到你的内容的先搞清楚AI搜索的引用机制。主流AI搜索引擎的答案来源大致有三类一是实时网页检索抓取的结果二是知识图谱或结构化数据库里的信息三是预训练语料里已经存在的知识。这三类来源对内容的要求完全不一样。第一类实时检索最容易理解AI会临时抓取网页然后生成回答。想让AI在这一层引用你核心是你的页面可以被检索、正文包含清晰的实体信息、并且内容结构适合被抽取。第二类知识图谱类来源通常来自维基百科、行业目录、权威数据平台等结构化数据。想进入这一层你需要在权威平台上有稳定的实体信息换句话说你的品牌词条、公司信息、产品目录要做得足够规范。第三类预训练语料最隐蔽AI训练时会吸收全网内容但你可能无法追溯。想在这一层增加概率唯一的路径就是长期输出高质量内容让它成为整个互联网语料的一部分。我们做引用追踪时第一步先给所有内容资产加上一个统一的追踪标记。比如官网页面的Meta信息、正文里的品牌名写法、发布到各个平台的品牌词统一用“全称简称”的固定格式。这样做的好处是两个方便在AI回答的原始文本里搜索品牌名也能辅助判断AI是通过哪个网页抓取的。追踪标记看起来是个小动作但能极大提高后续归因的准确度。4.2 引用质量评估不是所有引用都是好的有一段时间我们特别兴奋因为某个客户的品牌名大量出现在AI回答里。结果点开一看AI在回答“XX公司怎么样”时引用的是一篇三年前的负面帖子而帖子里的信息早就过时了。这种爆发的引用质量反而是一个严重风险。我们在引用追踪体系里增加了一个“引用质量分类”分五个等级。第一类“官方语义引用”AI直接引用你自己官网或官方账号的内容信息准确。第二类“第三方赞同引用”AI引用的是行业媒体、专业测评对你的正面描述。第三类“中立信息引用”AI只是在列举公司名单、融资历史时提到了你。第四类“过时或断章取义”AI引用了你的旧内容或者理解有偏差但没造成严重负面影响。第五类“负面引用”AI把你的负面口碑作为回答主结论。每周我们都会统计五类引用的占比。一个健康的GEO状态应该是第一类、第二类占比持续提升第五类持续下降。如果第五类突然增加那不是优化问题是舆情问题需要立刻启动危机响应通过发布解释性内容、补充正面信息去稀释负面引用。4.3 从引用到转化AI搜索里隐藏的路径最后回到团队最关心的问题GEO带来的流量到底能不能变成客户我们做了一个比较原始但有效的方法叫“手动端到端追踪”。当AI回答里出现一个客户链接时我们不仅记录这个回答本身还会模拟用户的下一步动作实际点击链接、访问落地页、测算路径。因为AI搜索里的用户出现了一种新的行为模式叫“无点击决策”——他们读完AI的回答就直接去官网搜索或去线下门店了中间的转化路径根本不会经过传统网站统计工具的监测。为了捕捉无点击决策的转化我们为S级问题配套设计了专门的可被引用的“决策型页面”这种页面不追求SEO收录的丰富度而是追求用户读到AI总结后想进一步确认的那几个点的答案。比如AI引用你“有7天无理由退款”用户点进你的页面他只想确认“怎么申请退款”那页面顶部就必须有这个信息。这和传统落地页“让用户留资”的逻辑完全不一样AI搜索引来的流量已经带着预期了你要做的是用最短路径兑现AI回答里的每一个承诺。实操技巧每个S级问题背后至少准备一个“决策型页面”。页面的标题、正文里自然重复核心答案便于AI二次抓取页面结构做到用户从AI点进来后10秒内能找到他想要的答案。这个页面既是给用户看的也是给AI看的。5. 落地过程中的四个坑以及我们的排查思路这套GEO系统从0到1跑了差不多一个季度中间遇到的问题比想象中多。挑四个最有代表性的把当时怎么排查、怎么解决的记在这里。5.1 坑一问题集过宽监测成本直接爆炸刚开始我们把问题集扩大到150个每个问题对应5个模型每周跑一次结果光API成本和人工标注工作量就压垮了团队。后来复盘核心问题是没做“问题分级”就去监测。排查思路很简单把150个问题按商业价值、AI可见度、内容竞争力排序砍掉所有单维度分低于3分的问题只保留30个。同时把频次调整成“S级日常监测A级周度监测B级月度抽检”。成本直接降到原来的四分之一有效数据反而更集中了。这个坑给我们的教训是GEO监测不是“越多越好”而是“越聚焦越准”。5.2 坑二模型回答不稳定怎么判断优化到底有没有生效AI搜索的生成结果天然有随机性同一个问题上午问和下午问答案都不一样。我们一度出现“上周被引用了这周不见了”的现象团队差点以为系统出了问题。排查后的结论是AI模型的答案服从一种“概率分布”单次回答只是抽样不能代表真实状态。正确的做法是每个监测问题在同一模型上重复问3次取回答结果中是否提及你的概率。比如一个S级问题的可见率从40%涨到70%说明优化真实生效了如果单次问看到了再次问又没了那只是随机波动不用太在意。我们还专门定了个规则低于30%可见率的问题不调优算法先调内容资产的质量。5.3 坑三AI引用了旧官网里的过时信息有一次S级问题打分明细里突然出现“中性信息引用”占比大幅上升点开一看AI引用的是客户旧官网上已经下线的产品介绍。旧页面虽然不对外了但搜索引擎可能还没彻底剔除或者AI训练语料里还残留着旧信息。解决方法是做了一次“全网内容资产盘整”。把所有已下线的产品页、旧版新闻稿、过时案例全部梳理能彻底删除的删除不能删除的加noindex标记和新的说明性内容。同时在高权重的新页面里系统性地重复核心卖点让AI有更大概率抓到新内容。这件事做完之后过时引用明显减少。提醒所有正在做GEO的团队先盘内容资产再谈优化别让旧页面偷走你的分数。5.4 坑四不同模型对同样的内容反应截然不同我们给客户规划了一批高质量的测评内容发布后在Kimi上明显提升了可见率但ChatGPT基本没变化。团队一开始以为内容质量不行后来才发现ChatGPT对实时网页检索的依赖更强而Kimi更倾向于从预训练语料和结构化信息中提取内容。所以同一套内容在Kimi眼里是“新知识”在ChatGPT眼里还只是“另一个新网页”需要等其他权威站点引用后才会大幅加权。这个坑带来的调整是内容策略不再“一刀切”而是按模型分渠道。面向Kimi、豆包等中文模型的优化重点放在语料覆盖和权威站点引用面向ChatGPT、Perplexity的优化重点放在让官网和第三方站点之间形成内容互引提高实时检索的权重。6. 给准备入局GEO的团队团队配置与工具选型参考最后分享一下团队配置和工具选型的思路。GEO不是一个人能扛起来的活它横跨内容、数据分析、技术和舆情监测。我们现在的团队是四个人一个内容策略负责人负责问题集和内容资产的规划一个数据分析师负责监测脚本、打分体系和飞书看板一个内容编辑专门写可被引用的决策型内容一个运营盯防御型问题和舆情反馈。如果预算有限最核心的Roles至少要有两个内容策略和数据分析。工具层面我们不使用那种几百块一个月的“AI可见度一键检测工具”因为刚才说过各家标准不一致。自主可控的方案是用飞书多维表格做问题集和打分记录配合一个简单的Python脚本定时调用AI模型的开放API完成提问和回答抓取再用DeepSeek的API对抓取文本做一些初筛分类。整个技术栈不复杂但对团队的数据处理能力有一定要求。如果完全没有开发能力退一步的方案是用各家AI产品的网页版手动提问人工记录再把结果录入在线表格。只是频次和覆盖度会低很多。关于“北京AI搜索推广”这类需求的出现其实说明GEO的行业热度正在从一线城市向外扩散越来越多企业开始意识到AI生成式回答正在成为用户决策的核心信息源。这和我之前判断的方向一致——未来谁能在AI的实时检索、知识图谱、预训练语料三个层面都留下高质量信息谁就能在下一轮流量分配里真正站稳脚跟。7. 写在最后我不建议任何人把GEO当成一锤子买卖做了这套系统之后我的一个核心感受是GEO不是一个“做完就见效”的项目它更像持续运营的生意。AI搜索的模型在迭代语料在更新用户的问题也在变化今天有效的优化明天可能就被新的信息淹没。我能给出的最朴素建议是不要把GEO当成技术项目把它当成一项长期的内容资产运营每周看趋势、每月调策略、每季度做一次大复盘。还有一件事必须提醒GEO最忌讳粉饰太平。如果你的产品本身口碑波动、服务有明显短板AI搜索会非常诚实即使你的内容生产得再漂亮负面视角的回答依然会存在。所以GEO的上限不是由内容策略决定的而是由产品真实质量为前提的。把所有内容优化的钱都花在包装上不如拿出一部分来解决真实的产品问题AI搜索时代好产品本身就是最好的优化素材。