首份办公 Agent 用户行为调查解读:Vibe Coding 之外,办公 Agent 或将成为主流
首份办公 Agent 用户行为调查解读:Vibe Coding 之外,办公 Agent 或将成为主流
过去两年,AI 应用最确定的主流场景是 Vibe Coding——用自然语言指挥 AI 写代码。Cursor、Claude Code、各类代码助手把编程变成了一场对话,也让"AI 真正干活"第一次有了千万级的用户验证。但编程终究是一部分人的工作。绝大多数职场人的日常是写文档、做表格、整理信息、跑流程——这个体量大得多的场景,正在成为 AI 的下一个主战场。
9月7日,国内首份《中国办公Agent用户行为不完全报告》在北京发布,出品方是网易有道旗下开源桌面端办公 Agent 产品 LobsterAI。这是国内第一次有人用真实产品数据(上线8个月、用户超100万,据报告),而不是问卷,来回答"办公 Agent 到底被谁在用、拿来做什么、用到了什么深度"。
先看几个数字:近60%的 token 消耗发生在常规办公时间之外;12.2%的模型调用不需要人实时发起;新模型上线3天,用户渗透率接近50%;过半调用给了价格只有旗舰三分之一的经济型模型。这些数字放在一起,指向本文的判断:继 Vibe Coding 之后,办公 Agent 很可能成为 AI 应用的下一个主流形态。
一、发展速度:三个维度的事实
1.1 用得快:渗透曲线进入陡峭段
据报告,LobsterAI 上线8个月用户突破100万。这个数字放在整个软件行业不算最激进,但考虑到办公 Agent 是一个2025年才真正成型的品类,它说明需求是真实的。
更有信息量的是分布结构。

报告原图:用户地域分布(图源:证券之星《潮汐商业评论》发布稿)
北京、上海、杭州、广州、深圳五个城市合计只占用户量的27%左右,而 Top10 城市之外的用户占比高达62.79%——办公 Agent 的使用已经越过了一线城市和科技行业的圈子。海外用户占比12.75%,其中美国以2.73%领跑,澳大利亚、越南、马来西亚、日本也形成了颇具规模的用户群体,而这些市场几乎没有投放。
中国的整体背景板同样在放大。CNNIC 数据显示,截至2025年12月,我国生成式 AI 用户规模达6.02亿,普及率42.8%。金山办公披露的数据是另一个注脚:WPS AI 月活从2024年底的1968万涨至2025年底的8013万,一年增长307%。办公场景的 AI 渗透,无论基数还是增速,都已经到了不能忽视的量级。
1.2 用得深:头部效应与付费黏性
用户多只是一个维度,更关键的是用得有多深。

报告原图:算力消耗的头部集中(图源:证券之星《潮汐商业评论》发布稿)
据报告,前20%的用户消耗了87.4%的算力,前5%的用户独占了53.5%的 token 消耗。工具类产品多少都会有头部集中,但这个浓度仍明显偏高——它说明有一批用户已经把 Agent 当成生产系统在跑,而不是聊天玩具。

付费行为同样指向深度使用。据报告,付费用户在 token 消耗、任务量和月活跃天数上分别达到免费用户的6.2倍、5.2倍和3.0倍。

合理的解读是重度使用驱动了付费,而非付费带来重度使用。不过需要说明:这是横截面数据上的相关性,"因果方向"是发布方的解读,读者可以保留自己的判断。
任务的"重量"也在变化。据报告,单次任务规模在5个月内增长3.1倍,8月环比增幅达53%。

报告原图:单次任务规模增长(图源:证券之星《潮汐商业评论》发布稿)
用户敢于把越来越复杂、越来越长周期的工作交给 Agent,这是信任度最直接的证据。
1.3 用法变:从"你问它答"到"你派它干"
这可能是整份报告里最有意思的发现。

近60%的 token 消耗发生在常规办公时间之外:工作日晚间占34.3%,周末占25.6%。24小时使用曲线上,上午10点和下午15-16点是双高峰,晚22点有一个小回升,凌晨0点仍有3.7%的调用量。
另一半关键数据是:12.2%的模型调用并非由人实时发起。据报告,定时任务的单条指令平均带动64次模型调用,是人工任务(10.6次)的6倍。微信、钉钉等聊天窗口成了"任务第二入口",占比17.9%——用户在聊天框里发一条消息,Agent 就开始工作。
这不是 LobsterAI 一家的产品特色。2026年7月,MCP 协议(Model Context Protocol,连接 Agent 与工具/数据的事实标准)在新版本中把"Tasks 长时任务"写进了协议层,SDK 月下载量以亿计;8月26日,OpenAI 把 ChatGPT 的定时任务向全部免费用户开放(ChatGPT 周活约9亿),并从定时执行升级为事件驱动;Cursor 的云 Agent 支持订阅事件源自动唤醒,“自动跟进到自己创建的 PR 直到修完”;Manus、Claude 等产品也都有定时任务功能。当全行业同时把"没人发起的调用"做成默认功能时,这就是一次形态切换:AI 正在从"你问它答"的工具,变成"你派它干"的协作系统。
二、速度从哪里来:四个支撑因素
快速发展不是凭空来的。把报告数据和行业公开事实放在一起,至少能识别出四个支撑因素。
2.1 模型成本:办公负载不需要旗舰配置

报告原图:模型调用分布(图源:证券之星《潮汐商业评论》发布稿)
据报告,DeepSeek V4 Flash 以52.2%的占比位居模型调用榜首,若加上其视觉实验版本,合计超过75%。
这个结果值得停留一下:它意味着在办公场景里,顶尖大模型并不是决定性因素。真正决定调用选择的,是性价比、并发能力和稳定性。按 DeepSeek 官方定价(2026年8月17日起生效),V4-Flash 的输出价格为每百万 tokens 9元(高峰时段),是 V4-Pro(27元)的三分之一;并发上限2500,是 Pro(500)的5倍;闲时价格再降一半。官方对 Flash 的定位是"更快捷高效的经济之选",而其正式版在多项 Agent 能力基准上甚至超过了 Pro 预览版。
办公 Agent 的负载特征是高并发、碎片化、成本敏感,恰好是轻量模型的主场。把简单任务路由给便宜模型,在行业内已被验证为成熟的成本工程:开源项目 RouteLLM 的测试显示,路由最高可降低85%成本、保持95%的 GPT-4 性能;Cursor 甚至为自己的模型路由机制专门发布了技术说明。当调用次数以"一条指令带动64次调用"的量级增长时,能不能把单位成本压下来,直接决定了这类产品能不能成立。
2.2 任务结构:Vibe Coding 的方法论正在溢出到办公

据报告,泛"编程"与调试以38.5%的占比在任务类型中遥遥领先,第二名文档写作只有10.1%,第三名数据与表格8.8%。
这组数据可以看作 Vibe Coding 方法论的外溢:普通用户未必懂编程,但他们发现,让 Agent 写一段脚本去操作文件、表格或 API,比用自然语言描述十步操作更精确。学术界把这称为 CodeAct 路线——UIUC 团队2024年的论文显示,用可执行代码作为行动语言,任务成功率最高提升20%;HuggingFace 的 smolagents 框架实测,代码动作比 JSON 工具调用少约30%的模型调用。编程能力在这里不是职业,而是办公问题的通用解法。
不过,这个38.5%需要小心读。报告披露的三类任务合计只有57.4%,剩余42.6%的任务类型没有披露——也就是说,非代码任务的真实占比落在19%到61.5%之间,区间相当宽。此外,软件开发/IT 行业贡献了38.9%的 Agent 任务,早期用户里技术从业者偏多,编程占比中含有明显的用户结构因素。
还有一组口径差异值得留意。从消费者会话数看,通用 AI 助手的增量正在流向非代码任务:发表于 NBER 的 OpenAI 使用研究(覆盖全球约10%成年人)显示,非工作相关消息占比从53%升至70%以上,写作占工作相关消息的40%;Anthropic 的分期报告也显示编程占比从37.2%微降至36%。但从企业支出口径看,结论相反:Menlo Ventures 的年度报告显示,编程类支出占企业部门级 AI 支出的比重升至55%。会话数说非代码在涨,支出说编程在涨——两者并不矛盾,因为它们数的本来就不是同一个东西。对本文的判断而言,这反而构成了支撑:无论哪个口径,办公场景的 AI 使用量都在快速放大,而它的主力形态,正在从"人写提示词"转向"人派任务"。
2.3 协议地基:基础设施恰好就绪
无人值守、跨系统调用之所以能在2026年铺开,一个容易被忽略的前提是协议层在过去一年半里快速成熟。
Anthropic 于2024年11月开源的 MCP 协议,如今由 Linux 基金会旗下的 Agentic AI 基金会中立治理,2026年7月的新版本把长时任务(Tasks)写进协议,并支持无状态的横向扩展;Google 发起的 A2A 协议(Agent 之间互相发现、派活、协作)于2026年3月发布1.0稳定版,已有150多个组织参与,Google Cloud、AWS、Azure 均提供原生支持;"给 Agent 看的项目说明书"AGENTS.md 已被6万多个开源项目采用。MCP、A2A、AGENTS.md 如今收拢在同一家中立基金会下,形成了一个分层的协议栈。
报告里17.9%的任务从 IM 发起,其实是同一个趋势的用户侧注脚:用户早已默认 Agent 是一个可以随时调度的服务,协议标准化只是把这种使用直觉变成了工程现实。
2.4 政策跑道:规则先于乱象
2026年5月,国家网信办、国家发展改革委、工业和信息化部联合公布《智能体规范应用与创新发展实施意见》(国信办发文〔2026〕6号)。这份文件明确把"日常办公"列入"生活娱乐、日常办公等低风险领域",适用合规自测、信息报告等相对轻量的治理方式;同时划清了"仅限用户本人决策、需由用户授权决策和智能体自主决策"的边界,确保用户对自主决策享有知情权和最终决策权。
地方层面,北京市发改委等四部门于2026年7月印发《北京市关于加快智能体引领发展的若干措施》,提出"鼓励发展 Token 经济",探索 TaaS、AaaS 等模式,并配套算力券、Token 券等工具。
换句话说,“无人值守"之所以敢在2026年铺开,很大程度上是因为监管提前给了轨道:办公是明确的低风险场景,自主决策有清晰边界。在国内 AI 的各个细分赛道里,这属于少见的"规则先于乱象”。
三、趋势判断:从对话框到任务队列(推演)
基于以上事实,可以对未来一段时间的走向做几点推演。以下内容属于推演,不是已经发生的事实。
第一,交互重心从对话转向编排,产品差异化从模型层上移到产品层。当12.2%的调用已经不需要人实时发起,对话框的价值正在向"调试界面"收缩——用户在对话框里教 Agent 怎么干活,真正的产出发生在后台的任务队列里。Agent 产品的核心竞争力,会从"接了哪个模型"转向编排能力:任务拆解、状态持久化、失败重试、断点续跑。
第二,计费模式可能从订阅走向按任务计费。轻量模型的低成本、无人值守带来的批量调用,再加上政策文件里明确点名的"Token 经济",三者指向同一个方向:按 token 包月的订阅制,未必适配"一条指令带动64次调用"的使用形态,按任务或按结果计费的产品会更多出现。
第三,代码将进一步成为办公自动化的默认接口。Vibe Coding 已经教会一部分人"用编程的方式思考问题",办公 Agent 会把这种能力隐性地交给剩下的人——用户不需要会写代码,只需要会描述任务。随之而来的沙箱隔离与权限管理需求,会是企业级市场的下一个必答题。
第四,"本地常驻 + 云端推理"的混合架构预计将成为主流形态。异步长任务要求 Agent 是一个常驻进程而不是网页会话;文件访问与数据不出域的要求又把它推向本地。桌面端、开源、可私有化部署——这份报告的主角 LobsterAI 本身就是这个方向的产物,LobsterAI 在企业页面上也已提供私有化部署选项。产品形态与技术需求的这一轮对齐,大概率还会继续。
结语:办公 Agent 拼的不是谁的模型最强
如果只看一个维度,办公 Agent 对算力的胃口已经说明了一切。据报告:付费用户的 token 消耗是免费用户的6.2倍;前5%的用户烧掉了53.5%的 token;近六成的消耗发生在下班后和周末;一条定时指令平均带动64次模型调用。Vibe Coding 的 token 需求来自写代码的那几个小时,而办公 Agent 的 token 需求来自全部24小时——这是一个更宽、更深的消耗场景。
但这个场景有一个和 Vibe Coding 截然不同的竞争逻辑。Vibe Coding 拼的是单点能力的天花板——谁的模型代码能力最强,谁就赢。办公 Agent 不一样:它追求的是稳定、便宜、可调度,是让几十上百次连续调用不出错。这也解释了报告里那个最反直觉的数字——52.2%的调用给了价格只有旗舰三分之一的 DeepSeek V4 Flash,而它在 Agent 能力基准上并不输给更贵的同门 Pro。
所以,决定办公 Agent 竞争的,不是谁家的顶尖模型最强,而是三件事的乘积:生态 × 办公 Agent 本身 × 模型。生态是协议、入口、开源社区与私有化部署——它决定产品能不能嵌进用户的工作流;办公 Agent 自身是编排、任务拆解、技能包与无人值守——它决定活儿干得好不好;模型只是第三个因子,而且是变化最慢、差异最小的一个——够用、便宜、稳定,比"最强"更重要。三个因子相乘,任何一个短板都会让乘积归零,任何一个单项的极致都救不了其他两项的平庸。
Vibe Coding 证明了 AI 能干活,办公 Agent 正在让 AI 学会上班。当过半的调用交给经济型模型、六成的消耗发生在下班时间,这条新主流的轮廓已经清晰:它不依赖最贵的模型,它依赖最顺的流程。
