模型打底、千问办公上桌,阿里再战 AI 局


钉钉之后,阿里又甩出一张办公王牌。
文|白 鸽
编|王一粟
中国AI大模型的参数竞赛,已经进入到万亿规模时代。
8月3日,阿里巴巴正式发布新一代基座大模型Qwen3.8,核心旗舰模型为Qwen3.8-Max,总参数达2.4万亿、单次激活95B、1M上下文长度、支持视觉理解。
就在Qwen3.8发布的同一周,Kimi K3以2.8万亿参数强势开源,MiniMax的M3 Pro也达到2万亿参数级别,并传出即将开源的消息。
此外,包括DeepSeek V4 Pro、文心5.0、MiMo-V2.5-Pro、LongCat-2.0等国产AI大模型也都达到万亿参数级别。
可以看到,2026年的中国AI江湖,万亿参数正从技术里程碑变成头部玩家的入场券。
但参数往往是表象,大模型能否真正“干活儿”,正成为当前行业更加关注的焦点。
而在此次阿里最新的消息中,真正值得关注的,不是阿里又发了一个更大的模型,而是它正在把模型能力一步步翻译成平台能力,再翻译成产业能力,并真正融入到企业工作流程当中。
几乎同一时间,阿里也官宣其旗下企业级Agent产品千问办公开启公测,Qwen3.8也被接入其中,用户可在千问办公对该模型进行体验。
把底座能力交给Qwen3.8,应用入口交给千问办公,两者在钉钉生态中完成合龙。可以看到,阿里正在把大模型能力真正用到场景当中,将其变为真正的生产力。
而在AI办公赛道中,阿里的战略意图也很清晰,不跟腾讯WorkBuddy在C端个人工具赛道硬碰,而是把钉钉和阿里云积累的百万级企业客户作为护城河,做面向企业组织的AI生产力平台。
显然,当底座模型、钉钉入口、企业工作流三者被Qwen3.8与千问办公焊在一起,大模型从参数竞赛到工位扎根的最后一公里,或许也正在被阿里逐渐打通。
超大杯的Qwen3.8 不只是一次参数的跃迁
先看基座大模型的能力。
据阿里披露,Qwen3.8采用稀疏MoE(混合专家)架构与混合注意力机制的联合优化,首次将千问大模型的总参数量拓展至2.4T,激活95B,获得了更高的推理效率、更快的推理速度。
也就是说,2.4万亿是总参数量,95B才是真正被激活、参与计算的量。
用一个通俗的比喻来说:这是一家拥有2400名员工的“超级工厂”,面对新任务时,能精准调度其中95名最“懂行”的骨干员工,用更小的消耗,干更复杂的活。
总参数决定了模型的知识上限,激活参数则决定了每次回答的实际算力消耗。
在权威三方榜单Arena中,Qwen模型整体性能仅次于Anthropic的Claude系列,处于全球第一梯队,在CodeArena编程榜单中,Qwen3.8位居全球第四。

但榜单分数归分数,比起参数,大模型在具体任务中的能力表现更值得关注。
在阿里发布的信息中,关于Qwen3.8模型能力,重点强调的并不在于其通用聊天体验,而是两项能力:Coding(编程)和Cowork(专业办公)。
其中,在编程能力上,Qwen3.8实现了自主编程的突破。
此前,大多数前沿大模型能够写好函数、补全代码,是程序员的有力帮手,而如今,Qwen3.8则可以从一个空文件夹出发,自主完成一个十数天的真实项目交付,全程无需人干预。
在官方披露的实验中显示,Qwen3.8独立连续运行约16天后,最终做出一个真实可用的自进化智能体框架“oh-my-cli”,整个过程完全开源、公开保存在GitHub上供所有人检视。
16天,这已经不是几个小时能做完的评测题,而是接近真实工程师冲刺周期的工作长度。
而在办公能力上,Qwen3.8也可以胜任广泛的、真实的专业工作任务。
比如一支法务助理团队需要一周时间,才能在数百份法律文档中完成千余个相关条款的标注,Qwen3.8一小时可以做完;160小时以上的篮球比赛录像、8400多个攻防回合,模型数十分钟拆解完毕,并输出球员战术画像与教练报告。
而在长语境理解上,它能读懂200页的财报PDF、看懂超过100小时的长视频,并把自己“所学”反馈到工作全流程,进一步提升思考与执行能力。
需要说明,这些是官方团队给出的示例,真实水位还有待更多第三方使用去持续验证,但方向已经很清楚:模型的训练目标,正在从“答得对”转向“干得完”。
从Qwen3.8可以看出,当前大模型的竞争,已经从“聊天智能”悄悄切换到“交付智能”。
前者考验的是讲台上的博学,后者考验的是工位上的靠谱;前者可以靠堆参数、刷榜单来证明,后者必须让模型在真实任务的复杂、模糊与长周期里站稳。
这么看,阿里Qwen3.8的发布,本身就是行业转向的信号。
更重要的是价格,通过千问AI平台,国内每百万tokens输入12元、输出36元,隐式缓存命中仅1.5元;海外每百万tokens输入2美元、输出6美元,国际价格仅为Opus5的40%与24%。
这也就意味着,在“相近智能”的前提下,阿里把单位智能的价格打下来。这是一种典型的“以价换规模”的做法——希望用旗舰模型的高性价比,把开发者和企业客户牢牢吸在千问生态里。
整体来看,Qwen3.8真正的意义,不在于它比上一代大了多少,而在于它把从对话到交付的闭环做实了。一个能自主跑16天、能一次性消化160小时录像的模型,已经不是对话框里的文字游戏,而是开始具备数字员工的雏形。
当模型能稳定、可靠地交付生产级成果,AI才真正从“辅助思考”跨入“替代执行”时代。
阿里的AI ToB 千问办公被推到台前
而模型证明它能把活儿干好之后,下一个问题也随之而来,这份能力要通过什么载体、走哪条路,才能真正交到企业手里?
这也是当前所有巨头大厂们都在争夺的关键。字节跳动将飞书与豆包结合,推豆包企业版,腾讯主推Workbuddy,同时瞄准AI办公这条赛道,要抢的就是AI时代工作流的入口。
对阿里来说,承接这个答案的产品,是千问办公。

从底层模型能力来看,千问办公是Qwen3.8的首发落地平台,用户在千问办公中处理复杂任务时,系统会默认自动调用Qwen3.8。
这意味着,Qwen3.8的2.4T参数、百万级上下文、原生多模态等能力,第一时间通过千问办公触达真实用户,而非仅停留在API或技术演示层面。
不过,值得一提的是,千问办公虽然深度绑定Qwen3.8,但据内部确认,产品在AI接入上不限于千问自家模型,也就是说,谁家的模型好、更适配,就用谁。
这也就说明,对于阿里来说,Qwen3.8当前是默认最优解,但不是唯一解,也反向给Qwen3.8团队施加压力,即必须在真实办公场景中持续保持领先,否则可能会被自家产品换将。
千问办公也并不是阿里内部从零开始的产品,而是长达数月产品和组织整合的结果。
2026年6月,钉钉创始人陈航卸任CEO,1992年技术人陈宇森接棒。阿里随即整合内部Agent力量:桌面级QoderWork、云端MuleRun、企业级悟空三款产品合一,推出千问办公,成为业内首款同时支持桌面端、云端和企业协同Agent的产品。
可以看到,阿里的意图很明显,用旗舰模型为全新整合产品背书,同时用统一的产品入口结束内部多线赛马。
事实上,这两年AI办公产品并不稀缺,但多数产品没有跳出同一个范式:用户提问,AI回答,然后用户自己把答案搬回现实——复制粘贴、调整格式、在几个系统之间来回切换、手工录入。
AI只完成了工作的第一步,剩下的九步还是人。
千问办公则试图改变这个分工,它的能力边界,比多数“AI办公助手”要宽得多:
如传统AI对话“主要回答问题”,千问办公则能够“拆解任务并执行”;前者输出以文字为主,后者可以交付PPT、Word、Excel、网页、报告、代码、多媒体等结果;前者难沉淀复用、需要反复输入指令,后者通过技能、记忆与定时任务沉淀为可复用流程。
用一句话概括,就是千问办公已经从聊天工具,转变为真正的数字同事。
更值得注意的是它与钉钉的融合深度。
据悉,千问办公已初步打通钉钉IM,能够同步获取群聊信息、日程安排、待办事项、审批流程等企业级数据。钉钉PC端和手机端的内置入口近期开放后,用户无需切换应用即可在钉钉内直接调用千问办公的全部能力。
这一步至关重要,毕竟对于AI办公来说,其护城河从来不是模型能力,而是组织关系、审批流、日程与群聊里沉淀多年的业务上下文。钉钉背后是数以百万计的企业组织,这是阿里手里最独特的一张牌,也是别家最难复制的一段路。
换句话说,当AI从“回答问题”走向“执行任务”,它需要一个能触达组织毛细血管的载体,而钉钉正是现成的那一个。
事实上,千问办公在阿里内部的地位,也变得愈发重要。
据媒体报道称,千问办公被定义为阿里云与钉钉“唯一主推的SaaS产品”,这也就意味着阿里在AI To B赛道上正将所有筹码押向同一个方向。
当前,大模型落地AI办公赛道,竞争重心正在从“模型能力”转向“交付能力”与“沉淀能力”。
往往模型能力决定第一次使用有多惊艳,交付能力则决定用户会不会持续把真实工作交给它,沉淀能力决定组织会不会离不开它。
对于阿里来说,Qwen3.8负责打技术口碑,千问办公负责打市场份额,而钉钉的2600万企业组织则负责打生态护城河。
这也解释了为什么阿里会选择在同一天发布旗舰模型与这款产品:模型是引擎,产品是整车,只发布引擎,载不动用户。一个能交付成品、而非只给建议的Agent,才是办公场景的下半场。
字节、腾讯、阿里 AI办公的新三国杀
2026年,AI办公这条赛道骤然升温。
此次千问办公开启公测,也是阿里正式“杀”入了AI办公赛道。国盛证券研报此前对千问办公的战略意义做过一个清晰的拆解:
对内:整合了原有分散的3个AI Agent产品,有望引领阿里Agent战略走向集中攻坚;
对外:抢占AI办公入口市场,直接回应腾讯WorkBuddy、字节跳动Trae等行业AI应用竞争;
生态:深度融合钉钉生态,以千问模型为基础,打通阿里B端生态优势,有望形成从底层模型到前端应用的闭环。
这个判断其实基本可以视作市场共识。

而在AI编程之后,Work Agent已经成为企业服务里下一个被巨头集体押注的赛道。
前有腾讯凭借WorkBuddy实现6月单月访问量达2097万次,后有字节跳动AI ToB组织架构变阵,整合飞书、豆包和火山引擎,剑指AI办公赛道。
三家巨头的打法也各有侧重:
阿里把千问办公的产品归钉钉、销售归阿里云,本质上是用钉钉十余年沉淀的企业组织关系和数据资产做支点;字节把飞书的产品团队并入豆包,成立独立豆包产品团队,而销售、市场等则并入火山引擎,是让办公产品直接承接豆包模型与企业级算力。
腾讯的WorkBuddy则依托其Harness(驾驭层)优势生长,并宣布将QClaw产品中心调整至云产品六部,与WorkBuddy归入同一管理体系。
三家大厂同时押注AI办公,尽管各自路径不同,但终点一致,即谁能先让Agent在客户的实际业务里“跑起来、留下来、反复用”,谁就握住了办公AI商业化的命脉。
这场仗不会在发布会上决出胜负,而会在千千万万个工作流的日复一日里见分晓。
总的来看,AI办公赛道会在6-12个月内将迎来一场残酷洗牌,腾讯WorkBuddy、字节Trae/豆包企业版、阿里千问办公已经同台竞技。
相比大模型决赛的是单一技术参数,AI办公对产品、运营、生态的能力要求也很高。这一定程度上,决定了AI办公赛道可能是大厂之间的三国杀。大模型公司的竞争力或许会弱一些。
对企业与每一个职场人来说,真正的问题或许已经不再是“要不要用AI同事”,而是愿意把多大比例的工作交给它,又准备以怎样的机制与它分工、对它治理。
这个问题,比任何一份榜单都更值得回答。
