杰富瑞的分析师团队设计了一套真实办公场景任务集,涵盖五大核心维度:多文件检索(从多份文档中提取关键信息并汇总)、联网研究(基于最新网络信息撰写研究报告)、浏览器操作(自动化完成网页浏览和信息采集)、PPT制作(根据大纲生成完整演示文稿),以及多模态内容生成(图文混排、数据可视化等)。
测试采用“任务完成度+输出质量”双维度评分,满分100分,确保结果客观反映各产品在真实商业环境中的表现。
一、综合排名揭晓
在八款全球主流AI Agent中,阿里千问办公以95分登顶,Anthropic Claude Cowork和OpenAI Codex分列二、三位。完整排名如下:
| 排名 | AI Agent | 得分 | 核心定位 |
|---|---|---|---|
| 1 | 阿里千问办公(Qwen Office) | 95 | 全场景办公AI |
| 2 | Anthropic Claude Cowork | 94 | 企业级协作AI |
| 3 | OpenAI Codex | 92 | 编程与推理AI |
| 4 | Google Gemini for Workspace | 89 | Google生态办公AI |
| 5 | Microsoft Copilot | 87 | Microsoft 365深度集成 |
| 6 | DeepSeek Office | 84 | 高性价比国产办公AI |
| 7 | Perplexity Assistant | 80 | 联网搜索与研究AI |
| 8 | 某头部国际AI产品 | 76 | 综合办公AI |
二、头部产品表现解析
第1名:阿里千问办公(95分)。千问办公在多文件检索中展现出精准的上下文理解能力,PPT制作生成的结构化内容可直接用于商业演示。作为开源模型代表,它被认为填补了DeepSeek等开源模型在办公场景的空白,对非技术人员非常友好。
第2名:Anthropic Claude Cowork(94分)。Claude Cowork在企业级协作任务中表现突出,长文本理解能力优异,处理大量文档时上下文不丢失,是目前企业级AI协作工具的标杆。
第3名:OpenAI Codex(92分)。OpenAI Codex在编程与推理任务中优势明显,复杂任务拆解和多工具调用能力突出,在浏览器操作和PPT制作中展现出较强的泛化能力。
三、国产AI阵营崛起
本次测试有两款国产AI进入榜单。千问办公以95分登顶,DeepSeek Office以84分位列第六。报告指出,千问办公填补了开源模型在办公场景的空白,而DeepSeek Office在性价比和特定场景(如代码生成、数据分析)上表现稳健,适合预算有限的中小团队。
其他国产AI如智谱、Kimi等产品在某些单项任务中表现突出(如Kimi在长文本处理上优势明显),但在综合办公任务评分中未进入本次测试前八。报告认为,随着国产大模型的快速迭代,这一格局有望在后续版本中改变。
四、选型建议:没有最好,只有最适合
杰富瑞的报告强调,AI Agent已具备实战能力,八款工具在真实办公场景中均达到可用水平。选择取决于具体使用场景:
| 用户类型 | 推荐工具 | 核心理由 |
|---|---|---|
| 办公效率优先 | 阿里千问办公 | 综合能力最强,PPT和多文件检索领先 |
| 编程与推理 | OpenAI Codex | 代码生成和复杂推理能力突出 |
| 企业级协作 | Claude Cowork | 长文本和企业级任务表现出色 |
| Google生态用户 | Gemini for Workspace | Gmail、Docs、Drive深度集成 |
| 微软生态用户 | Microsoft Copilot | Word、Excel、Teams无缝衔接 |
| 预算有限团队 | DeepSeek Office | 高性价比,核心功能稳健 |
五、行业观察
杰富瑞的报告表明,AI Agent已从概念验证阶段进入实战应用阶段。对于普通办公用户,千问办公是最稳妥的选择;深度使用微软或Google生态的用户,应选择对应的集成工具;而主要从事编程和推理工作的用户,OpenAI Codex仍是首选。
随着国产AI在办公场景的持续发力,全球AI办公助手的竞争格局正在发生深刻变化。这场由华尔街投行的实测所引发的讨论,或许只是AI重塑办公方式的开始。