证照通途

华尔街实测8款AI Agent:千问办公综合排名第一 | 深度报道
科技 · 深度报道 · AI 行业观察

华尔街实测8款AI Agent:千问办公综合排名第一

2026年8月 | 记者:综合报道 | 来源:杰富瑞(Jefferies)研究报告
2026年8月,华尔街投行杰富瑞(Jefferies)发布了一份引发行业广泛关注的测试报告——对八款全球主流AI Agent进行了真实办公任务实测。结果显示,阿里千问办公以95分排名第一,超过Anthropic Claude Cowork和OpenAI Codex。

杰富瑞的分析师团队设计了一套真实办公场景任务集,涵盖五大核心维度:多文件检索(从多份文档中提取关键信息并汇总)、联网研究(基于最新网络信息撰写研究报告)、浏览器操作(自动化完成网页浏览和信息采集)、PPT制作(根据大纲生成完整演示文稿),以及多模态内容生成(图文混排、数据可视化等)。

测试采用“任务完成度+输出质量”双维度评分,满分100分,确保结果客观反映各产品在真实商业环境中的表现。

一、综合排名揭晓

在八款全球主流AI Agent中,阿里千问办公以95分登顶,Anthropic Claude Cowork和OpenAI Codex分列二、三位。完整排名如下:

排名 AI Agent 得分 核心定位
1 阿里千问办公(Qwen Office) 95 全场景办公AI
2 Anthropic Claude Cowork 94 企业级协作AI
3 OpenAI Codex 92 编程与推理AI
4 Google Gemini for Workspace 89 Google生态办公AI
5 Microsoft Copilot 87 Microsoft 365深度集成
6 DeepSeek Office 84 高性价比国产办公AI
7 Perplexity Assistant 80 联网搜索与研究AI
8 某头部国际AI产品 76 综合办公AI

二、头部产品表现解析

第1名:阿里千问办公(95分)。千问办公在多文件检索中展现出精准的上下文理解能力,PPT制作生成的结构化内容可直接用于商业演示。作为开源模型代表,它被认为填补了DeepSeek等开源模型在办公场景的空白,对非技术人员非常友好。

第2名:Anthropic Claude Cowork(94分)。Claude Cowork在企业级协作任务中表现突出,长文本理解能力优异,处理大量文档时上下文不丢失,是目前企业级AI协作工具的标杆。

第3名:OpenAI Codex(92分)。OpenAI Codex在编程与推理任务中优势明显,复杂任务拆解和多工具调用能力突出,在浏览器操作和PPT制作中展现出较强的泛化能力。

“国产AI在综合办公任务中的竞争力显著提升,预计在后续版本更新中,整体排名将持续攀升。” ——杰富瑞研究报告结论

三、国产AI阵营崛起

本次测试有两款国产AI进入榜单。千问办公以95分登顶,DeepSeek Office以84分位列第六。报告指出,千问办公填补了开源模型在办公场景的空白,而DeepSeek Office在性价比和特定场景(如代码生成、数据分析)上表现稳健,适合预算有限的中小团队。

其他国产AI如智谱、Kimi等产品在某些单项任务中表现突出(如Kimi在长文本处理上优势明显),但在综合办公任务评分中未进入本次测试前八。报告认为,随着国产大模型的快速迭代,这一格局有望在后续版本中改变。

四、选型建议:没有最好,只有最适合

杰富瑞的报告强调,AI Agent已具备实战能力,八款工具在真实办公场景中均达到可用水平。选择取决于具体使用场景:

用户类型 推荐工具 核心理由
办公效率优先 阿里千问办公 综合能力最强,PPT和多文件检索领先
编程与推理 OpenAI Codex 代码生成和复杂推理能力突出
企业级协作 Claude Cowork 长文本和企业级任务表现出色
Google生态用户 Gemini for Workspace Gmail、Docs、Drive深度集成
微软生态用户 Microsoft Copilot Word、Excel、Teams无缝衔接
预算有限团队 DeepSeek Office 高性价比,核心功能稳健

五、行业观察

杰富瑞的报告表明,AI Agent已从概念验证阶段进入实战应用阶段。对于普通办公用户,千问办公是最稳妥的选择;深度使用微软或Google生态的用户,应选择对应的集成工具;而主要从事编程和推理工作的用户,OpenAI Codex仍是首选。

随着国产AI在办公场景的持续发力,全球AI办公助手的竞争格局正在发生深刻变化。这场由华尔街投行的实测所引发的讨论,或许只是AI重塑办公方式的开始。