6 亿人在问 AI
你的品牌在答案里吗
一份关于中国市场 GEO 的冷静观察
2026 年 5 月 11 日,千问与淘宝全面打通。
有人试着对它说:帮我挑一款黄色马克杯,要小猫图案,容量 300 毫升左右。
几秒钟后,三款商品推到面前,可以直接下单。
现在假设你是卖马克杯的商家。请回答一个问题:怎么让自己出现在这三款里?
你大概会想到去找一家「GEO 服务商」。然后你会看到一堆很提气的数字:中国 GEO 市场 2026 年规模 30 亿、180 亿、286 亿,渗透率 71%,超六成企业已经布局,复合增速三位数……
先别急。这几个数字之间,差了将近十倍。
一、先把水分拧干
关于中国 GEO 市场规模,不同机构给出 30 亿、180 亿、286 亿三个版本。同一年、同一个市场,差了近一个数量级。
更要紧的是它们的出处。这些数字大量出现在《XX 科技 GEO 全链路交付体系解析》《XX GEO 以行业知识图谱构筑 AI 信源新基建》这类文章里——都是 GEO 服务商自己投放的营销稿。
这不完全算欺骗,更像一种行业本能。一门生意如果核心能力是「让你看起来值得被引述」,那它最顺手的应用对象就是它自己。看到满屏的「行业爆发」「超六成企业已纳入预算」时,你看到的未必是市场报告,很可能只是这门手艺的样品展示。
而且在中国,这层包装下面还有一层更老的东西。
国内 GEO 行业相当一部分的实际交付物,是「央媒 + 门户 + 行业媒体」的稿件投放,加上结构化改写和百科词条维护。剥掉 AI 的外衣,这是做了二十年的软文发稿生意。这不是我的刻薄评价,你去看这些服务商的产品清单就明白了:发稿套餐、媒体资源库、稿件代写、收录查询。
这门老生意在 AI 时代确实获得了新的溢价——因为 AI 确实偏好第三方信源,尤其是有权威背书的信源。但溢价不等于质变。
监管已经注意到这件事。2026 年 4 月,中央网信办启动「清朗·整治 AI 应用乱象」专项行动,在「AI 数据投毒」这一条里明确点名「使用 GEO(生成式搜索引擎优化)技术恶意营销」;**阶段处置违规 AI 产品 1.4 万余款,清理违法违规信息 600 余万条。
注意措辞的边界:被定性的是「恶意营销」,不是 GEO 本身。同一份文件里还有一句方向相反的要求——平台要整改「对引用信源缺乏交叉验证」的问题。
一句话翻译:要打的是造假,要奖的是可验证。这两者之间的地带,才是 GEO 真正的生存空间。
所以本文不采用任何一个来自 GEO 服务商软文的市场数字。地基是假的,上面盖什么都是歪的。
二、真实的地基:6 亿人在问,但 AI 自己还没赚到钱
剥掉泡沫,地基还在吗?在。但中国的情况比海外更矛盾——需求侧热得发烫,供给侧冷得出奇。
先看需求侧。CNNIC 第 57 次《中国互联网络发展状况统计报告》(2026 年 2 月发布)的数据:
网民规模 11.25 亿,普及率 80.1%
生成式 AI 用户规模 6.02 亿,普及率 42.8%,半年增长 3.53 亿(增幅 141.7%)
其中 4.57 亿用户习惯用 AI 解答专业、商业、生活类问题
网络购物用户 9.37 亿,2025 年全国网上零售额 15.97 万亿元
已完成备案的生成式 AI 服务 748 款
6 亿人在用 AI 问问题,其中 4.57 亿在问「该选哪个」。这个规模下,品牌在 AI 答案里的存在与否,不可能不重要。
再看应用格局(QuestMobile 2026 年 6 月数据):豆包月活 3.82 亿居首,通义千问 1.67 亿第二,DeepSeek 1.3 亿第三;腾讯元宝月活 1.14 亿、日活超 5000 万。
现在看供给侧,画风突变。
据《晚点 LatePost》报道,2026 年上半年 DAU 已达 2 亿的豆包,每天收入不足 100 万元,主要来自内嵌抖音商城的电商佣金;而它每天消耗的算力成本是数千万元量级。2026 年 5 月,豆包才**次在 App Store 上线付费订阅,***年费 5088 元。
把国内头部模型公司的收入摆在一起看,会更清楚:
| 公司 | 年化收入(约) | 收入结构 |
| 豆包(字节大模型业务) | 40 亿美元 / 约 272 亿元 | 据推算约九成不来自 C 端 |
| 智谱 | 10 亿美元 / 约 68 亿元 | 全部来自 API 与 Coding Plan,无 C 端产品收入 |
| 阿里通义 + 百炼 | 80 亿元+ | 主要为云与政企 AI 相关收入 |
| DeepSeek | 4–5 亿美元 / 约 27–34 亿元 | 约九成来自 API,C 端免费 |
| Kimi(月之暗面) | 3 亿美元 / 约 20 亿元 | API 收入占七成以上 |
(以上为媒体与机构报道口径,各家公司披露程度不一,只能作为量级参考。)
看出来了吗?中国大模型**梯队,本质上是一支「B 端卖铲子的队伍」。它们几乎都不靠 C 端流量赚钱。
这个事实,决定了中国 GEO 的整条逻辑链。请记住它,后面每一节都会回到这里。
三、中国没有「广告位」,只有「分佣」
这是中美市场最根本的一处结构差异,也是最容易被忽略的一处。
海外是怎么走的?OpenAI 在 2026 年把 ChatGPT Ads 做成了 10 亿美元年化收入的生意,但同时把一条原则写进了官方说明:广告不影响 ChatGPT 给出的答案,广告系统与聊天模型运行在相互隔离的系统上。于是海外形成了清晰的两层结构:
答案层(不可购买,靠 GEO 争取)+ 广告位(可购买,靠预算争取)
这正是 SEO 与 SEM 关系在 AI 时代的重演。GEO 的价值,很大程度上来自「答案层买不到」这件事。
中国不是这个结构。
中国的 AI 应用至今没有形成成熟的广告变现。豆包只有抖音商城的电商佣金;DeepSeek C 端免费;Kimi 甚至因算力紧缺暂停过 C 端新用户订阅。
那么中国的 AI 平台怎么从 C 端赚钱?目前**跑通的路径是:AI 导流 → 电商成交 → 分佣。
这个差异带来的后果,比表面看起来严重得多:
**,「答案层买不到」这个前提,在中国并不成立——但也不是以广告的形式。
中国的 AI 答案层和商业化是深度绑定的,不是隔离的。千问推荐淘宝商品、豆包推荐抖音商城商品,背后是同一家公司的交易闭环。你很难指望平台在「推荐什么」这件事上保持与自身电商利益完全无关的姿态。
反过来说,中国平台也没有像 OpenAI 那样必须维护「答案中立性」的商业动机——因为它根本没在答案旁边卖广告,它靠的是成交。
第二,链路短到可怕,所以位置更值钱。
海外:ChatGPT 推荐 → 用户可能点出去 → 辗转下单。
中国:千问推荐 → 直接在淘宝下单,支付宝付款,全程不离开对话。
有报道称,支付宝在 2026 年 2 月单周处理了 1.2 亿笔 AI Agent 交易。当「被推荐」到「被购买」之间只剩一次点击,这个位置的商业价值,比海外更高,而不是更低。
第三,也是最容易误解的一点:这恰恰意味着,传统意义上的「内容优化」,可能不是主要杠杆。
下一节展开。
四、一个反直觉的判断:在 AI 购物里,GEO 可能不是主要变量
这是本文最想说的一句,也是和市面上大部分 GEO 说法冲突最厉害的一句。
当千问要在 40 亿商品的淘宝库里挑三款马克杯,它依据的是什么?
不是某篇软文,不是百科词条,也不主要是结构化标记。它依据的是电商平台的内部数据:商品标题与属性是否规范、价格、销量、评分、评价内容、退货率、发货速度、店铺权重、历史转化率。
这些全是电商经营指标,不是内容指标。
换句话说:
在中国的 AI 购物场景里,「GEO」已经在很大程度上被「电商运营」吸收了。
你优化不了 AI,你只能优化自己的商品力和店铺数据。
这一点,平台自己比谁都清楚,而且已经在替商家做了:
天猫把「生意管家」升级为 agentic AI,等于给每个卖家配了一支 AI 团队,覆盖店铺分析、广告投放、视觉生成、客服、售后
京东免费开放十余款 AI 工具,覆盖选品、客服、直播、运营;数字人 JoyStreamer 累计服务超 7 万商家
阿里妈妈「AI 万相」**经营智能体在 618 全面落地
据报道,淘系商家中约 70% 已在使用 AI 工具辅助经营
平台自己就把「让商家被 AI 选中」这件事产品化了,而且是免费的。
那么第三方 GEO 公司在这里的空间在哪?我的判断是:不大。这跟海外很不一样——海外好歹还有 Shopify 生态的第三方服务商空间,而中国的**平台是全包式的。
商务部研究院副研究员洪勇有一个提法我很认同:AI 可能让电商竞争的底层逻辑,从「流量竞争」转向「决策权竞争」。
如果竞争的是「决策权」,那么决定胜负的是决策依据——而决策依据,握在平台的商品库和算法手里。
五、那中国的 GEO 战场到底在哪
既然电商场景被平台内化了,那 GEO 在中国还能做什么?
我的判断是:真正有价值的战场在非交易场景。这些场景没有商品库、没有销量排序、没有一键下单,AI 只能依靠语料和信源来判断——这才是内容真正起作用的地方。
战场一:B2B 与专业服务选型
「国内有哪些靠谱的 CRM 供应商」「XX 行业的 ERP 该怎么选」「这家咨询公司口碑怎么样」——这类问题没有销量数据可依,AI 只能综合全网信息给出判断。多伦多大学 Chen 等人的研究发现,AI 搜索的引用严重偏向第三方内容(多个垂直领域 67%–92%),在 B2B 和软件品类上尤其明显。这是 GEO 真正有效的战场。
战场二:本地生活
美团把 AI 助手「问小团」直接放在 App 顶部搜索框,解决的是「吃什么、去哪儿、怎么安排」这类模糊决策。这类需求高度依赖评价内容、社区讨论和实时信息,同样不是商品库能直接覆盖的。
战场三:品牌认知与舆论
「XX 公司怎么样」——这类问题 AI 会给出一个综合性描述,而这段描述可能由几年前的一条差评、一篇旧报道、或者竞对的负面物料主导。这是每个品牌都无法回避的资产,而且一旦形成很难扭转。
战场四:医疗、教育、金融、法律等高决策成本领域
这些领域的共同点是:用户会反复问,AI 的回答高度依赖权威信源,而错误信息代价极高。这既是机会,也是监管最关注的地带。
中国市场还有两条特殊规则必须单独讲:
其一,权威信源的定义不同。在中国,央媒、政府背景媒体、行业主管机构、上市公司公告、司法与监管信息的权重,远高于一般商业媒体和自媒体。这既是机会(合规路径清晰),也是陷阱(它与「发稿生意」只有一线之隔)。
其二,入口高度分散。DeepSeek、豆包、通义、元宝、Kimi、文心各有各的性格和信源偏好,同一个问题在不同 App 里可能得到不同答案。这意味着中国的 GEO 天然是多平台的,工作量比海外大得多,也更难做出统一的效果承诺。
六、一个正在发作的行业病:没人能证明自己有用
说完战场,必须说这个行业最要命的问题。而且这个问题在中国可能比海外更严重。
AI 的答案,是不可复现的。
2026 年 1 月,Rand Fishkin 与 Gumshoe.ai 做了一次规模空前的实验:600 名志愿者,把 12 个品牌推荐类 prompt 在 ChatGPT、Claude 和 Google AI 上跑了 2,961 次。结果是——两次得到相同品牌列表的概率不到 1%;得到相同列表且顺序相同的概率接近千分之一。
Fishkin 的结论很不客气:任何提供「AI 排名位置」的工具都是胡扯。
这不是孤证。一项 arXiv 研究发现,同一 prompt 重复运行,返回品牌的重叠度只有 45%–59%。Ahrefs 发现 Google 的 AI Mode 与 AI Overviews 对同一查询引用不同来源的比例高达 87%。
根源在于语言模型不是查表系统,它逐 token 生成,每个词都从一组「说得通的选项」里采样。加上联网检索,随机性又被放大两次。
噪声比效应大。同一项 arXiv 研究给出的置信区间典型跨度是 3 到 7 个百分点——这意味着看板上「AI 可见度从 8% 涨到 11%」,与随机波动无法区分。
有人给这种做法起了个名字:精度洗白(precision laundering)——把空洞的测量跑得足够频繁,让噪声互相抵消,产出一个带小数点的、看起来很科学的数字,冒充知识。
为什么我说中国可能更严重?因为多平台分散。海外主要盯 ChatGPT 和 Google 两家,中国要同时盯六七个入口,每个入口的采样量和稳定性只会更差,而服务商往往还承诺「全平台覆盖」。
再加上归因天然的困难:AI 曝光大多是零点击的,大量影响决策的交互不留下任何 referral 痕迹。
结果就是一句话:国内多数 GEO 项目的续费,靠的是信任和焦虑,而不是数据。在预算宽松时这没问题,一旦收紧,这是**个被砍的科目。
这才是 GEO 当前真正的瓶颈。它跟 AGI 无关,不用等未来——现在正在发作。
七、AGI 不是那个开关
现在可以谈 AGI 了,但得先把概念拆开。
「AGI 什么时候来」是个糟糕的问题,因为没有人对 AGI 是什么达成共识。OpenAI 用五级框架,DeepMind 用六级,Anthropic 用安全等级;Yann LeCun 认为当前 LLM 架构根本走不到 AGI;Sam Altman 本人说 AGI「不是个有用的词」——每次模型跨过一条线,终点就被重画一次。
预测的分歧大到近乎荒谬:从「2026 年底」(马斯克)到「研究者中位数 2047」(AI Impacts 对 2,778 名研究者的调查),中间散布着 Amodei(2026–2027)、Suleyman(2027)、Hassabis(2031–2036)。国内几家(DeepSeek、智谱、月之暗面)近期的公开表述也都相当激进,但同样只是表述。
在这种分歧下,任何「AGI 到来后 GEO 就会……」的断言,都是伪精确。
更有用的问法是:哪些具体能力在侵蚀旧的 GEO 方法论?我的答案是三条独立曲线,它们的时间常数完全不同:
曲线一:抗操纵与交叉验证能力。驱动力是模型的常规迭代、平台的主动反制、以及监管——不需要 AGI。你在 50 个站点发同源稿件,在旧模型眼里是 50 个独立背书,在新模型眼里是 1 篇稿子的 50 个副本,甚至可能被识别为操纵信号而负向加权。
曲线二:Agent 工具调用与商业协议成熟度。也不需要 AGI。这一条中国跑得比海外快:千问 × 淘宝、豆包 × 抖音商城、美团「问小团」、京东「京言」、微信「小微」、支付宝「阿宝」——** App 把发现、沟通、支付、履约放在同一个环境里,AI Agent 能走完全流程。相比之下,海外 ChatGPT + Shopify 的组合,购买流程往往还要跳出到独立站点。结构上看,中国的闭环更完整。
曲线三:效果可证明性。仍在低谷,而且是当前最紧的约束。
所以真正会发生的事,不是某天 AGI 降临、行业应声崩塌,而是这三条曲线各自推进,在不同时间点把不同的玩家挤出局。
对中国的 GEO 公司来说,还有一个额外变量:监管的权重更大。清朗行动已经点名 GEO 恶意营销,中国商务广告协会也在推进 GEO 团体标准。在中国做这门生意,合规不是成本项,是生死线。
八、那国内的企业现在该做什么
市面上很多 GEO 建议有个通病:正确但没法用。务实一点,按类型分:
如果你是电商商家
最重要的一句话:别把 GEO 当营销项目,把它当商品数据治理项目。
在千问推荐淘宝商品、豆包推荐抖音商品的逻辑里,能影响的变量是:商品标题与属性是否规范完整、主图与详情是否信息充分、价格是否有竞争力、销量与评分、退换货与发货表现。
这些全是电商基本功。平台(天猫生意管家、京东 AI 工具)已经在免费帮你做了,先用起来。
如果你还想在 AI 问答场景里增加曝光,那属于品牌动作,不属于效果投放——用品牌的预算和心理预期去做,不要用效果投放的 ROI 去考核它。
如果你是 B2B、专业服务、医疗教育金融
这是 GEO 真正有效的战场。按信号建立的先后顺序来:
1. 先把实体定义建清楚——你是谁、做什么、服务谁、和什么相关。官网、百科、行业数据库、工商信息保持一致。
2. 再获取第三方验证——真实的客户案例、可查的行业报告、可交叉验证的数据。注意,同源稿件发五十遍,在新模型眼里是一篇稿子的五十个副本,不是五十个背书。
3. 最后培育真实的社区讨论——知乎、垂直论坛、行业社群里的真实讨论,权重可能超出你的预期。
顺序很重要:先有实体,后有验证,最后有讨论。跳过**步,后面很难复合。
所有企业都适用、却被严重低估的一条:防御
如果只能从这篇文章带走一个动作,我建议是这条。
绝大多数 GEO 讨论的是「怎么让 AI 推荐我」,但有一半价值在防守:
纠正事实错误:AI 把你的产品参数、成立时间、资质、业务范围说错了
对抗陈旧叙事:几年前的一条差评、一次旧报道,可能至今仍在主导 AI 对你的描述
清除投毒:识别并反击恶意信息注入
跨平台一致性监控:同一个品牌在 DeepSeek、豆包、通义、元宝里的说法,可能完全不是一回事
为什么值得单独说:
合规正当性无懈可击。你不是在收买守门人,是在纠正记分牌上的错字。在监管、平台和用户眼里,性质完全不同。
需求是持续性的。模型每次更新、检索策略每次调整,都可能产生新的错误描述。这是常态运维,不是一次性项目。
而且它大概率随模型变强而增值。模型对准确性和可验证性的要求越高,「确保事实被正确采信」就越重要。在整个 GEO 版图里,这是少数不太可能因模型进步而贬值的方向——当然,这也只是我的判断。
采购 GEO 服务时,问一个问题就够了
「你能保证什么?如果保证了,请说明用什么方法、跑多少次采样来区分效果与随机波动。」
答不上来的,大概率是在卖焦虑。
尾声:一句实话
回到最初那只黄色马克杯。
我的判断是:这门需求不会消失,而且在中国,它的长期价值可能比多数人估计的更高——因为 6 亿人在问,因为链路短,因为决策权正在迁移。
主要来源
官方与监管:CNNIC 第 57 次《中国互联网络发展状况统计报告》、中央网信办「清朗·整治 AI 应用乱象」专项行动及**阶段进展、商务部等六部门《关于更好服务实体经济 推进电子商务高质量发展的指导意见》
市场与平台数据:QuestMobile 2026 年 AI 应用月活数据、《晚点 LatePost》关于豆包 C 端收入的报道、虎嗅等媒体关于国内大模型 ARR 的报道、公开报道的 AI 购物进展(千问 × 淘宝、豆包 × 抖音商城、美团「问小团」、京东「京言」、支付宝「阿宝」、微信「小微」)
测量方法论研究:Rand Fishkin 与 Gumshoe.ai 的 2,961 次运行实验、相关 arXiv 研究、Ahrefs 引用来源差异研究、《Earned Media Bias in AI Search》(Chen et al.,多伦多大学)
本文未采用任何来自 GEO 服务商营销稿的市场规模数据。文中行业判断均为作者观点,已尽量标注不确定性。