科大讯飞旗下词元星火于 9 月 1 日在 Hugging Face 发布两款端侧开源模型:Spark X2.5-4B 和 Spark X2.5-1.7B。模型权重、代码仓库与部署文档已同步开放至 Hugging Face、ModelScope 和 GitHub,API 已上线 MaaS 平台。
官方公布的评测结果中,4B 模型在 τ³-bench(多轮工具调用)得分 30.4,MCP-Atlas(MCP 协议真实 API 环境)得分 54.6,BrowseComp(自主网络信息检索)得分 40.9,IFBench(长指令遵循)得分 75.0。1.7B 版本在 MCP-Atlas 上得分 23.4。以上数据均为官方发布值,实际表现建议自行复测。词元星火称,两款模型在国产算力平台完成训练,部署端适配英伟达、华为、海光及后摩等硬件平台。
本地实测方面,将 4B 模型接入 Codex 后,输入两份各八千余字的商业合同并要求比对差异。模型找出了三处较隐蔽的改动:“应当”被改为“可以”(强制性义务变为任意条款)、B 版合同中“知识产权”衍生成果归属段落整段缺失,以及违约金条款不对等(乙方从万分之五降至万分之三,甲方未同步调整)。输出结果按条款列出 A 版原文、B 版原文、影响分析和风险等级,并给出应对建议。后续用另一份原始表格测试数据处理能力,模型自行生成 Python 脚本完成分析,识别出超审批上限记录 4 条、字段缺失 3 条、疑似拆单 11 条,并标记了周末报销、负数金额及日期格式异常等问题。上述测试均在断网笔记本上完成。
支撑长任务处理的关键之一是上下文长度。Spark X2.5 原生支持 100 万 token,底层注意力层拆分为两部分:一层建立全文宏观联系,另一层处理局部细节。官方称同等跑满 100 万 token 时,显存占用约为传统全局注意力模型的四分之一。另一项技术是 MOPD(Multi-Teacher Online Policy Distillation,多教师在线策略蒸馏),流程为:先用高质量数据按编程、推理、工具调用分别训练多个大模型,再由小模型在实际操作中试错,教师模型在旁逐步纠偏——读需求、选工具、填参数、处理报错,失败后换路径重试。与直接灌输标准答案的离线蒸馏不同,这种方法传递的是问题解决的动作策略。
模型体积方面,BF16 精度下 4B 权重约 8 GB,1.7B 约 3 GB;4bit 量化后体积减半,可进一步适配低配设备。4B 版本适用于笔记本和工作站,1.7B 版本可覆盖座舱与家居设备。部署框架兼容 vLLM、SGLang、llama.cpp,可通过 Ollama 与 LM Studio 快速拉起。权重采用 Apache-2.0 协议,允许免费商用,微调后不强制开源。
此次发布面向的政策背景是:国资委 79 号文要求央企国企在 2027 年底前完成信创替代;2025 年 8 月施行的《网络数据安全风险评估办法》将 AI 大模型纳入动态安全评估范围。券商测算的政企 PC 替换需求在 2025–2027 年间达千万台量级,2026–2027 年为集中交付期。本地化、国产硬件可运行的端侧模型是其中较明确的缺口。
相关链接:
- Hugging Face:https://huggingface.co/collections/XHToken/spark-x25
- GitHub:https://github.com/XHToken/Spark-X2.5
- ModelScope:https://www.modelscope.cn/collections/XHToken/Spark-X25
- MaaS 平台:https://maas.xfyun.cn/modelSquare
科大讯飞将于 9 月 7 日发布新一代旗舰通用大模型星火 X2.5,届时代码与智能体能力将有更新。