4类职业6道真题,AI办公三强同卷开考:豆包赢在交付,WorkBuddy赢在细节,真正的差距在卷子外
- 2026-10-05 04:26:41
9月的AI办公圈,三家公司几乎同时把新版本拍上了桌。

字节的豆包工作9月2日上线多Agents并行和操作电脑,一周后补上本地Office编辑、浏览器录制与回放,9月15日又拉上飞书发布「豆包工作伙伴」,让Agent进群领活。阿里千问办公9月7日推出多人工作台,一句话就能生成一个百人在线协作的网页应用——此时它上线刚满月,用户已突破3000万。腾讯WorkBuddy则把9月2日留给了开放平台:超百家生态伙伴、十几个品类的智能硬件,外加9款联名设备。
更新追完之后,AIX财经做了一件打工人更关心的事:挑了市场营销、内容运营、产品经理、前端开发四类职业的真实任务,把三家按在同一张考桌上,同题开考(实测报道2026-09-19发布)。结论先给:豆包工作整体领先,WorkBuddy够稳够细,千问办公中规中矩。
先交代两点:一,下文的实测内容整理自AIX财经的公开报道,我没有逐题复测,本文的价值不在考分本身,而在考分背后的选型逻辑;二,利益相关披露——我是WorkBuddy个人用户,与文中三家厂商均无商业合作,本文对三家的评述均以该报道为准。
一、9月这场军备竞赛,先看时间线
这一轮更新有一个共同方向:办公Agent正在钻进更多真实的工作场景——电脑里的文件、群聊里的讨论、随身设备录下的信息,都可能成为它理解任务的线索。当功能越来越像,普通用户到底怎么选?这才有了一场难得的同卷考试。
二、四轮考试,三家各赢了几轮
第一轮,市场营销:豆包赢在交付形式。竞品分析一题,千问像细致的秘书,动手前先确认格式和对标品牌,但交卷内容单薄;WorkBuddy先把调研过程摊开给你看——为什么选这三家对标——报告维度最多,结尾附数据来源和口径说明,方便核对,到了市场机会部分还列出5个切入方向——竞品报告最怕的就是只罗列、不给方向;豆包直接调多Agents并行,几个子Agent分头调研,还用图表和时间轴做横向对比,交了网页版和飞书文档两个版本。到了海报加15秒预热视频一题,差距更明显:豆包主动调用专门的视频模型和文生图模型,情节线、镜头推进、配乐旁白都齐,最像一支完整的新品预告;千问更像让海报动起来;WorkBuddy画面丰富但中规中矩。
第二轮,内容运营:豆包交得最厚,WorkBuddy交得最快。热点汇总加选题策划,WorkBuddy 11分钟交卷,按模型、资本、政策分类,覆盖面够用,但选题偏泛;千问直接在对话框里作答,信息量最小;豆包用上新上线的操作浏览器功能,自己打开5个网页查资料,交来热点矩阵图加策划案,5个选题三家里最细。第二道题更微妙:分析AI账号上周传播度最高的文章——公众号的真实阅读数据,谁也拿不到。WorkBuddy老实承认了,用头部媒体跟进数量、站外扩散广度、事件延续天数合成了传播指数,还补充了四家媒体的选题偏好;豆包从135篇里筛出18篇,并把已查证的数据和估算内容分开标注——这个习惯值得点赞;千问用跨平台转载数、首页推荐位、搜索热度交叉判断,比第一轮完整不少。
给内容运营的读者一条可以直接抄的指令:
「从机器之心、量子位上周的文章里选3篇值得跟写的:先说明你判断传播度的方法和数据局限,再拆每篇的选题类型和亮点,最后给我们号的差异化切入角度。」
让它先交代方法和局限,产出质量会明显上台阶——「先交代方法再用数据」,是这轮实测里最值得偷师的习惯,三家里谁被问到要害,谁就开始老实。
第三轮,产品经理:WorkBuddy快且细。奶茶点单小程序,WorkBuddy 6分钟交卷,功能最丰富,自己加了热门榜单;豆包用了20分钟,但审美最好——banner会滑动切换,占位图全是同类饮品,毫不违和;千问15分钟,功能齐全但一股网页味。数据看板加归因分析一题,WorkBuddy写得最细:直接原因和根本原因分开讲,建议按优先级排序,还主动交代了哪些结论缺数据验证、各项指标用的什么口径;豆包强在下月目标——每个数为什么这么定讲得很透,还配了监控指标;千问偏简洁,给完目标没有延伸。这一轮,测试方投了WorkBuddy。
第四轮,前端开发:豆包完成度最高。经典的「骑自行车的鹈鹕」动画,千问翻车——鹈鹕没握车把、双脚踩同侧踏板,不符合物理规律;WorkBuddy有巧思,给鹈鹕系红围巾、嘴里衔小鱼,可惜细节没兜住,围巾贴脸、小鱼穿模;豆包建模自然、无穿模,骑车还分悠闲、正常、飞驰三档速度。科技峰会报名网站一题,豆包最像一个真实存在的网站,票种权益写得清清楚楚;WorkBuddy功能可用但稳定性不足;千问动用了多人工作台新功能,网页支持百人同时报名、后台管名单。
一句话收拢:卷面上豆包赢了三局,WorkBuddy赢了一局半,千问没赢但也没崩。
三、所以呢?先解决「怎么选」
注意,这张表给的是「什么场景选谁」,不是「谁最强」的裁决——它们仨目前不存在替代关系,选错生态比选错分数更亏。
四、老板们真正该看的,是考卷外的三件事
信号一:大厂在收拢。7月20日,腾讯把QClaw部分业务和团队调整进WorkBuddy所在的部门;7月底,字节把飞书产品团队与豆包产品团队整合;8月3日,阿里把QoderWork、MuleRun、悟空整合成千问办公开启公测;8月25日,豆包工作正式发布。原本各自为战的办公Agent,正在收拢成三张王牌。过去你在应用商店里挑几十个AI工具的日子,快结束了。对普通用户来说,收拢不全是坏事:工具少而强,试错和迁移成本反而降了——但代价是,以后没得挑,只能选边。
信号二:胜负手从功能变成了上下文。三家的基础功能已经越来越像——都能查资料、生成文档、分析数据、做网页,也都在补连接器和电脑操作。真正拉开差距的,是它们背后的工作环境:豆包工作身后是飞书的群聊、文档、项目和组织关系;WorkBuddy一边接入腾讯的IM、文档、邮箱、会议和知识库,一边把入口延伸到手机、眼镜和耳机;千问办公背后站着钉钉、阿里云和企业客户体系。模型能力的领先,几个月就会被追平;但企业内部的数据、权限、业务系统和已经形成的工作流,没那么容易复制。这也是为什么三家的更新都往「进群」「接硬件」「连办公套件」方向走——都在抢同一个东西:接触你真实工作的权限。
信号三:收费的地方变了。当写方案、做PPT、生成网页逐渐成为基础能力,真正更容易收费的部分,会变成企业席位、专业能力、私有数据和业务系统接入。这也在挤压通用办公Agent创业公司的空间——继续和大厂比入口、比免费额度,成本会越来越高;法律、金融、医药这些需要专业数据和复杂流程的场景,反而留下了差异化空间。大厂把通用能力做得越便宜,创业公司越得往行业深处走。
五、泼冷水:这份考卷本身,有四个问题
第一,样本太小。四类职业、六道题、单人单次实测,不是跑分,不能当基准测试引用。同一道题换个brief重跑,结果可能不一样。
第二,「传播度」这道题,三家都在自造指数。公众号真实阅读数据谁也拿不到,WorkBuddy的传播指数、千问的交叉判断、豆包的分类筛选,方法都合理,但没有一个是可核验的。凡是AI自己合成的指标,引用前都要留个心眼。
第三,排名会过期。9月的更新密度摆在这里,这个月豆包领先,下个月未必。拿「上个月的考分」做「下个季度的采购决策」,是这类文章最容易被误用的地方。
第四,所有「能用」都离「能上线」有距离。豆包的海报有文字挤压,WorkBuddy稳定性不足,千问物理规律翻车——测试里最好的成品,也还是初稿水平,正式使用前仍需人工把关。
价值层还有一句更要紧的:考分不等于你的收益。别人家的Agent替你交出漂亮的竞品分析,前提是你的资料、文档、群聊都在它能摸到的地方。Agent的价值上限,取决于它背后接的是不是你的真实工作环境——你用飞书,豆包工作伙伴进群就能领活;你泡在微信和企业微信里,WorkBuddy的连接器和硬件入口才够得着你;你的公司在钉钉上,千问的多人工作台才有意义。选型这道题的答案,其实在考卷外:先看你自己的工作流长在哪,再决定让谁来答题。
六、行动清单
1. 本周:对着上面的决策矩阵锁定1-2个候选,拿你最高频的一个真实任务(不是演示任务)各跑一遍,只看「谁的产出你改得最少」。别用公开的演示题——那些题三家都练熟了,差别只出在你自己的脏活上。
2. 本季度:盘点自家工作流的「上下文资产」存在哪——文档在飞书还是腾讯文档?沟通在企微还是钉钉?数据看板谁在做?答案出来,生态就出来了。
3. 观望:三家的企业版定价和席位政策还在快速变动期,网上流传的各种报价和优惠信息,找到官方渠道核实前一律不采信。
写在最后
这场「同卷考试」最有趣的地方在于:三家答的是同一套题,但决定它们三个月后命运的,是考卷外那看不见的东西——谁家的群聊、文档、会议和业务系统,愿意把门打开。
「同卷考试」这个词,往后会越来越常见:功能是卷子,上下文才是考场。卷子人人会做,考场只有一个。
你的工作流泡在哪家生态里?这票你投给谁。