9月1日,两款端侧大模型开源
9月1日,科大讯飞全资子公司词元星火正式推出并开源星火X2.5-4B和星火X2.5-1.7B两款端侧通用大模型。据中国日报网、南方+客户端等多家媒体报道,星火X2.5是端侧模型中首个原生支持最长100万Token上下文的模型(发布方口径),把长文本处理能力从云端搬到了手机、PC、汽车座舱和机器人等本地设备上。
这件事值得关注,不只是因为参数。过去一年,AI大模型往终端走的趋势已经很明显,但端侧模型长期被一个短板卡住:上下文窗口太小。一份几十页的产品手册、一套完整的项目文档,端侧模型处理起来往往要切成几段分别提问,结果就是忘记前情、遗漏信息、答非所问。
百万上下文解决的是"信息看不全"
混合注意力架构撑起长窗口
星火X2.5-4B和1.7B采用混合注意力架构,使用覆盖长篇文档、技术资料等场景的千亿Token级高质量数据开展训练,可以在一次任务中接收和理解更大规模的信息。以产品售后场景为例,用户可以把完整的产品售后手册导入星火X2.5-4B,模型先梳理不同场景下的售后规则并标注对应章节;当被问到"购买10天后设备故障,且使用过第三方耗材,是否符合换货要求"这类问题时,它能够关联退换货、故障处理和例外条件等跨章节规定,给出综合判断。
百万级上下文并不是单纯为了"塞下更多字"。它真正解决的是让模型基于完整信息,在连续交互中持续理解和处理复杂问题。长上下文解决的是"信息能不能看全",智能体和工具调用能力解决的,则是"看完之后能不能动手"。
全国产算力训练,部署门槛低
两款模型基于全国产算力平台完成全流程训练,使用约20万亿Token多样化数据进行预训练,并通过监督微调和强化学习提升推理、代码、智能体和指令遵循能力。部署层面,它们支持英伟达、华为、海光及后摩等硬件平台,兼容vLLM、SGLang、llama.cpp等主流推理框架,可以借助Ollama、LM Studio等工具快速部署,也支持用LLaMA-Factory开展增量训练。据发布方实测介绍,星火X2.5-4B在算法实现、代码补全等任务中可对标参数规模大2至3倍的云端模型(厂商自报口径,独立验证待时)。
端侧AI加速,企业内容要跟着改
这批开源恰逢端侧智能体密集落地的窗口期。就在同一天,搭载豆包手机助手的努比亚新机获得入网许可,多家手机厂商的端侧大模型也陆续完成备案。端侧AI的能力边界,正从"断网能聊几句"转向"本地直接完成任务"。
对企业的启示相当直接:当用户的手机、电脑上就跑着一个能一次读完几十页手册的AI助手,企业内容被AI引用的战场又多了一层。产品说明、售后规则、服务条款这些过去很少有人细看的文档,恰恰是端侧助手经常被问到的内容。如果这些信息写得含糊、结构混乱、散落在图片里,端侧模型读不懂,自然也不会把你的答案转述给用户。
河北极欧智推科技有限公司在做GEO优化(生成式引擎优化)时一直强调,官网和文档里的核心事实要写成结构清晰、可直接引用的句子——这一原则在端侧场景同样成立,甚至更苛刻,因为本地模型的参数规模更小,对内容清晰度的要求反而更高。
端侧会是AI引用的下一块阵地
往前看,端侧模型与云端模型的分工会越来越清楚:隐私敏感、高频简单的任务在本地完成,复杂推理交给云端。对企业来说,无论任务在哪一端完成,被AI正确转述的前提都是同一个——内容事实清楚、来源可核验、结构对机器友好。端侧开源模型持续增多,意味着AI搜索引用的入口正在从几个云端App,扩散到数以亿计的终端设备。早一步把内容地基按AI可读的标准理顺,在下一阶段的可见度竞争中就多一分主动。
信息来源
- 中国日报网,《端侧首个支持百万上下文模型开源 让小模型干大活》,2026-09-02,https://cn.chinadaily.com.cn/a/202609/02/WS6a97772de4b09a165c78768e.html
- 南方+客户端(今日头条转载),《端侧首个支持百万上下文模型开源:星火要让小模型干大活》,2026-09-01,https://www.toutiao.com/article/7680491445710586387/

