讯飞首发业界首个支持百万上下文端侧模型,不仅能聊天也能办事

消费级智能硬件已经成长为万亿级赛道。根据洛图科技《2026 中国 AI 硬件产业全景洞察与趋势报告》,2026 年国内不含手机、汽车的 AI 硬件市场规模将突破1.27 万亿元,预计 2030 年达到 2.56 万亿元,智能家居、服务机器人、智能座舱、可穿戴设备成为核心增长引擎。IDC 数据显示,智能眼镜、家用机器人等新兴终端出货量保持高速增长,AI 能力已经成为新品的核心卖点,硬件行业全面进入 AI 改造周期。
行业发展可以清晰划分为两个阶段:第一阶段是语音交互普及期,比拼语音识别准确率、单点指令响应,解决 “听得见、听得懂” 的基础问题;而当下正在进入第二阶段:端侧大模型落地,AI 从简单语音交互,向复杂意图理解、多步骤任务执行演进。
9月1日,科大讯飞全资子公司

繁荣背后:硬件 “能聊天”,却很难 “办成事”
过去智能硬件厂商的AI竞争集中在硬件参数、语音能力、联网云端问答;但市场已经出现明显的供需错位:硬件产品 AI 功能越来越多,但同质化严重,很多 AI 能力停留在演示效果,难以解决用户真实复杂诉求。行业共识正在形成:智能硬件的价值,不再是 “有没有 AI”,而是 AI 能不能真正帮用户完成完整任务。在真实家庭、车载、机器人场景暴露出多重共性痛点,制约用户体验升级与行业进一步破局。
从技术层面来说,AI化体验还不够好的原因只要有几点:
一是,上下文记忆能力不足,复杂长链路任务容易断裂。传统端侧模型上下文窗口有限,面对带前置条件、多轮交互、需要参考整套规则文档的任务时,只能拆分文本分段处理,极易遗忘历史条件、丢失关键信息。例如智能家居多条件联动、机器人长时序家务任务,一旦中间状态发生变化,设备就会 “断片”,只能靠用户一句一句下达简短指令,无法自主完成连贯任务。
二是,高度依赖云端,弱网、离线场景能力大幅缩水。多数智能硬件的复杂推理、决策逻辑放在云端完成。网络波动、离线环境下,设备只能执行预设简单脚本;同时数据频繁上传云端,也带来隐私泄露风险。延迟高、网络依赖性强,导致很多高级功能只能在联网演示环境生效,日常使用体验大打折扣人民日报。
三是,重交互对话、轻任务执行,缺少智能体与工具调用能力。市面上不少硬件可以流畅聊天对话,但缺少拆解目标、分步执行、调用工具的能力。用户提出复合型目标,模型只能给出文字回答,不能驱动硬件设备完成一系列操作。对话热闹,但无法落地成实际动作,造成 “AI 演示效果好,家用实用性不足” 的行业怪象。
四是,模型部署适配门槛高。终端硬件芯片体系碎片化,国产、海外多种算力平台并存;中小厂商想要接入高性能端侧模型,面临部署难、调优成本高,缺少完整开源底座,限制新技术快速规模化落地到终端产品。
可以说,今天很多智能硬件拥有 “耳朵”和“嘴巴”,却缺少一个擅长记忆、推理、动手执行的本地 “大脑”和“双手”。
星火 X2.5‑4B&1.7B 开源:端侧模型补齐短板,重新定义硬件AI
科大讯飞全资子公司词元星火开源的星火 X2.5‑4B、星火 X2.5‑1.7B 两款端侧模型,作为业界首个原生支持百万 Token 上下文的开源端侧模型,正推动智能硬件从 “听懂对话” 迈向 “办成事情”。
两款模型原生支持最长100 万 Token 上下文窗口,可以一次性完整加载控制规则、环境约束、多轮交互历史信息,不需要把文档切分片段处理。放到智能硬件场景,设备可以本地完整读取整套家庭控制规则、业务约束条件,多轮交互过程牢牢记住前置条件。 例如机器人执行多步骤家务、智能家居处理叠加多重条件的调度需求时,不会遗忘前提条件,避免信息割裂带来误判。百万上下文不是简单支持输入长文本,核心价值在于让终端拥有完整记忆能力,支撑复杂连续任务。
长上下文解决 “看得全、记得住”,智能体与工具调用能力解决 “想得清、做得到”。模型不再局限输出文字回复,能够解析用户复杂意图,拆解为多步骤执行动作,直接驱动硬件运行。 在 Domux 智能家居测试集上,星火 X2.5‑1.7B 控制指令端到端执行正确率达到90.3%,平均响应时间仅 0.85 秒,兼顾准确度与本地低时延表现。机器人场景中,模型可部署在本体或者边缘设备,支撑目标追踪、导航决策、连续操作,摆脱对云端强依赖与固定脚本限制;弱网甚至离线状态下依旧可以完成复杂任务,同时用户数据无需外传,强化隐私安全。
针对安全和适配的问题,这两款模型基于全国产算力平台完成全流程训练,支持英伟达、华为、海光、后摩等多元硬件平台,兼容 vLLM、SGLang、llama.cpp 等主流推理框架,开发者可以借助 Ollama、LM Studio 快速部署,支持 LLaMA‑Factory 开展增量微调。 模型权重、代码仓库、部署文档已同步在 GitHub、Hugging Face 开源,API 上线讯飞星辰 MaaS 平台限时免费开放。碎片化硬件环境下,大幅降低智能家居、机器人厂商接入高性能端侧大模型的开发成本,助力新技术快速向消费硬件渗透。
端侧AI能力边界打开,智能硬件下半场比拼开始
星火 X2.5‑4B&1.7B 的开源,代表端侧模型发展的重要拐点:端侧 AI 的能力边界,已经从对话交互延伸到完整任务闭环。未来智能硬件的评价标准将发生根本性迁移:不再只看语音识别准确率、对话流畅度,三大核心指标将成为产品分水岭:能不能读懂复杂模糊意图、能不能记住连续交互条件持续协同、能不能稳定跑完完整任务闭环。
万亿智能硬件赛道,增量机会不再来自 “会聊天” 的 AI 噱头,而是来源于真正解决用户现实痛点。当百万上下文、智能体、工具调用能力大规模下沉到终端本地,智能家居、机器人、车载终端等产品,将摆脱云端束缚,进化成本地化、可执行的智能助手。硬件产业的下半场比拼正式开启:比拼的不是话术有多好听,而是能不能实实在在把事情办成。
