Skip to content
围炉聊科技微信公众号二维码关注公众号,获取新文章推送
添加我为微信朋友扫描二维码,添加我为朋友

实测 4 款办公智能体:WorkBuddy / Trae Work / 百度搭子 / 千问办公,百度搭子短板明显

一、为什么做这次实测

市面上打着"AI 办公""智能体"旗号的产品不少,作为常年和智能体打交道的我也一直在找使用起来最趁手的智能体,最近几个月挑了几款,其中以下4 款是用的相对比较多的:

  • WorkBuddy:跨平台 AI 工作台,支持连接外部服务、MCP、自选模型与自定义 API Key。
  • Trae Work:字节系 AI 原生工具,支持多模型切换与自定义 API Key。
  • 千问办公(QwenWork):阿里通义千问系的一站式办公智能体,深度绑定钉钉,主打"对话即交付"。
  • 百度搭子(DuMate):百度的桌面级办公智能体,主打跨软件端到端自动化、本地沙箱运行。

实测过程中,我经常用同一类任务派给各家,重点观察:能不能干完、卡住后能不能自愈、会不会老老实实按我给的步骤走。

结论先说:同一任务,WorkBuddy、Trae Work、千问办公都跑通了,唯独百度搭子经常卡死绕不出来;再加上它在"按步骤执行"和"模型透明"两件事上也明显掉队,综合短板最突出。

二、参测产品速览

产品厂商定位模型可见 / 可选自定义 API Key
WorkBuddy腾讯通用 AI 工作台(连接 / MCP / 技能)✅ 可选,支持自定义
Trae Work字节AI 原生开发 / 办公工具✅ 多模型切换
千问办公阿里一站式办公 Agent,深度绑钉钉固定千问系列基座,未见第三方选择器未见(本次未深测)
百度搭子百度桌面级跨软件办公智能体❌ 不可见、无选择项

说明:百度搭子官方资料里写的是"统一入口调度不同模型、工具和专业智能体",并宣称自研 Harness 引擎在相关任务里"任务完成率 99% 以上"。下面是我真实遇到的情况,和这个宣传口径有落差——所以更需要拿实测说话。

三、最扎心的一幕:同一个"做短视频"任务,结局完全不同

我给几家智能体派了同一个目标:制作一条短视频

过程是这样的——

百度搭子接到任务后,在推进到某一个子环节时,卡在一个具体问题上反复绕,始终跳不出来。它不停地用同一种失败的路径去试,然后尝试在自己的沙箱里安装各种其他方案,也没主动停下来向我确认。我等了很久,判断它已经陷入死循环,只能手动终止任务 接着我把完全相同的任务分别交给 WorkBuddy、Trae Work。结果很干脆:他们都顺着流程把短视频做出来了,遇到的问题都自己通过找问题根因解决了,没有哪一个需要我中途救场。 下图是WorkBuddy在搭子遇到问题后接手处理 下图是Trae Work在其中另一次任务中找到了问题根因并解决 这一幕足以说明问题:任务本身并非无解。同一道题,其他家能答完,一家答到一半近乎卡死——差别不在任务难度,而在智能体自身的任务规划与错误恢复能力。百度搭子官方说的"99% 完成率",在我这个具体场景里显然没有兑现。

四、短板一:任务卡死,缺乏自愈能力

一个能用的办公智能体,遇到一步走不通,至少应该分析一下问题根因,之前类似的任务为什么能走通。百度搭子在任务中虽然有尝试解决,但是是选择了一套非常费力的全新方案,——这也是长程任务最怕的状态。一旦陷进循环,用户只能靠"终止任务"手动抢救,体验和"全自动交付"的宣传相去甚远。

反观同任务的另外三家,至少都平稳跑到了交付,没有暴露同类循环卡死。

五、短板二:明明写了 skill.md 步骤,它却当没看见

更让我意外的是另一件事。我有一份把任务拆成明确步骤skill.md(相当于给智能体的标准作业流程),比如明确指定了最后一段视频复用现有的,百度搭子在按这份 skill.md 执行时却又自己重新生成了一遍新的。

对于一个主打"按流程自动执行"的办公智能体来说,这几乎是信任层面的硬伤:

  • 你不按我写好的步骤走,我就没法预测你会产出什么
  • 流程不可控,结果就不可复现,团队协作里更没法沉淀标准;
  • 相比之下,WorkBuddy、Trae Work、千问办公在同样的 skill.md 约束下,基本是按步骤推进的,没出现明显的漏步。

指令遵循(instruction following)和工具纪律,是办公自动化的地基。地基松了,上面再花哨也不可信。

六、短板三:模型不可见、不可选、不能自定义

第三处短板在"控制权"上。

百度搭子背后到底用的哪个模型,界面上完全看不到,也没有任何选择入口。你不知道自己在跟谁对话,自然也没法针对任务挑模型、也没法用自己的额度。 而 WorkBuddy、Trae Work 这类产品,不但能切换模型,还能自己配置 API Key 接入自定义模型 这带来的好处是实打实的:

  • 透明:清楚知道智能体的"大脑"是谁,出了问题能归因;
  • 可控:简单任务用便宜模型、难任务用强模型,按场景调度;
  • 成本与合规:自带 Key、走自己的账号配额,企业场景还能对接私有/合规模型。

把模型藏起来、不给选择、不给自定义,对用户来说不只是少个开关,而是把最关键的一层控制权收走了。在一个强调"交付可控"的办公场景里,这是体验上的明显退步。

七、横向对比小结

维度WorkBuddyTrae Work千问办公百度搭子
同任务完成(短视频)✅ 完成✅ 完成✅ 完成❌ 经常出现卡死绕不出
遵循 skill.md 步骤✅ 按步骤✅ 按步骤✅ 按步骤❌ 漏步
任务卡死后自愈✅ 平稳跑完✅ 平稳跑完✅ 平稳跑完❌ 在沙箱中长时间试错后被手动终止
模型可见 / 可选固定千问基座,可选项很少❌ 不可见 / 无选项
自定义 API Key未见

八、结论与选型建议

  • 如果你要的是"真能把活干完 + 过程可控 + 模型透明",目前百度搭子短板明显,建议优先 WorkBuddy、Trae Work;千问办公在同一硬任务上也通过了验证,可作为候选。WorkBuddy 9月还有免费的hy3模型可以使用,如果你正在犹豫找哪家的话,我推荐WorkBuddy。
  • 选智能体时,把"能不能看见并选择模型、能不能自带 API Key"当成硬指标——它既是能力问题,也是信任问题。

⚠️ 测评边界:以上结论基于我在 2026-09 用到的特定任务(短视频制作、带 skill.md 的标准流程)和当时版本。智能体产品迭代极快,不同场景结论可能不同;也欢迎用过这几家的朋友补充不同任务的体验。