星辰Xing4.0开源:4B跑Agent

中国电信开源29B MoE模型Xing4.0-29B-A4B,每个Token仅激活4B参数,原生支持256K上下文,并打通昇腾、MindSpore与主流Agent工具链。
中国电信把新一代星辰大模型的重点从“回答问题”转向了“执行任务”。9月17日,中电信人工智能科技有限公司发布并开源 Xing4.0-29B-A4B:模型总参数量为290亿,但每个Token仅激活约40亿参数,原生上下文长度达到256K,并可扩展至512K,目标直指代码开发、数据分析、终端操作和深度研究等复杂工程Agent场景。
这款模型最值得关注的地方,并不是又多了一个29B开源模型,而是它试图同时解决Agent落地中的三个现实矛盾:模型能力要足够强,推理成本不能太高,训练与部署链路还要在国产软硬件上真正跑通。按照官方模型卡的说法,Xing4.0-29B-A4B完成了基于昇腾NPU与MindSpore框架的端到端训练,并针对主流推理框架和Agent工具做了定向适配。

先看参数:29B容量,4B计算量
**Xing4.0-29B-A4B是一款混合专家模型,即模型拥有多个并行的专家网络,但处理每个Token时只调用其中一小部分。**这种架构通常简称MoE,其意义类似于一家拥有多个专业团队的公司:公司总知识储备取决于全部团队,但每项任务只需要调动最相关的几组人,不必让所有人同时参与。
| 核心项目 | Xing4.0-29B-A4B参数 | |---|---:| | 总参数量 | 29B | | 单Token激活参数 | 4B | | Transformer层数 | 40层 | | 隐藏层维度 | 3584 | | 注意力机制 | MLA | | 路由专家数量 | 64个 | | 每Token激活路由专家 | 4个 | | 共享专家 | 1个 | | 专家中间层维度 | 1024 | | 原生上下文 | 256K | | 可扩展上下文 | 512K | | 训练平台 | 昇腾NPU、MindSpore | | 开源协议 | Apache 2.0 |
**A4B中的“4B”代表推理时参与单个Token计算的活跃参数约为40亿,而不是整个模型只有40亿参数。**模型仍然需要保存和加载290亿参数对应的权重,只是在前向计算过程中,由路由器从64个路由专家中选出4个,再配合1个共享专家完成计算。
**这种设计让Xing4.0处在“小模型速度”和“中型模型容量”之间。**与同规模的29B稠密模型相比,它不必让全部参数参与每一步推理;与真正的4B稠密模型相比,它又能把不同类型的知识和能力分散到更多专家中,在代码、规划、工具调用等任务上获得更大的模型容量。
| 部署形态 | 总权重规模 | 单Token计算规模 | 主要优势 | 主要代价 | |---|---:|---:|---|---| | 29B稠密模型 | 29B | 约29B | 参数全部参与,行为相对直接 | 推理计算量和延迟较高 | | Xing4.0-29B-A4B | 29B | 约4B | 以较低激活量获得29B级容量 | 路由、显存带宽和框架优化更复杂 | | 4B稠密模型 | 4B | 约4B | 权重小,部署最简单 | 知识容量和复杂任务上限通常较低 |
**MoE并不会自动带来与参数比例完全一致的加速。**Xing4.0的激活参数约占总参数的13.8%,但实际吞吐不会简单变成同尺寸稠密模型的7倍,因为推理过程还受到权重读取、专家调度、注意力计算、KV Cache和框架实现效率影响。对于单用户、长上下文Agent任务,显存带宽和KV Cache往往比理论浮点计算量更容易成为瓶颈。
256K上下文不是装饰,而是给工程Agent准备的工作台
**原生256K上下文意味着模型可以在一次任务中接收约25.6万个Token,并维持跨文件、跨步骤的信息关联。**对于普通聊天,256K往往明显过剩;对于需要读取整个代码仓库、日志、接口文档和历史执行结果的工程Agent,它却可能直接决定任务能否完成。
一个代码Agent要修复真实软件缺陷,通常不只是阅读一段函数。它需要先理解项目目录,再搜索调用关系,读取测试文件和构建配置,执行命令,根据报错回到源码修改,最后重新运行测试。任务持续数十甚至数百个步骤后,如果早期发现的约束从上下文中丢失,模型就容易重复搜索、修改错误文件,或者推翻自己此前的判断。
**Xing4.0采用MLA注意力机制来降低长上下文推理的缓存压力。**MLA即Multi-head Latent Attention,是一种通过潜在表示压缩注意力键值缓存的机制,其目标是在保留多头注意力表达能力的同时,减少长序列推理时不断增长的KV Cache占用。
**512K属于可扩展能力,而不是用户在所有设备上都能无成本使用的默认配置。**上下文越长,首Token延迟、显存占用和注意力计算开销越高;即使模型权重经过4-bit量化只占约15GB,超长上下文对应的KV Cache、推理框架缓冲区和系统开销仍会继续占用显存。
因此,“RTX 3090或RTX 4090可以运行”与“单卡可以舒适跑满256K甚至512K”是两回事。24GB消费级显卡确实降低了本地部署门槛,但开发者仍需结合KV Cache精度、上下文长度、并发数、CPU卸载和推理框架进行取舍,不能只根据15GB权重占用判断最终可用长度。
4-bit约15GB,让29B模型真正靠近个人工作站
**Xing4.0经过4-bit量化后,官方给出的权重显存占用约为15GB。**按照29B参数的理论体积计算,FP16权重约需要58GB空间,15GB相当于减少约43GB,降幅约74.1%,与官方所说的“约节省75%”基本一致。
| 权重精度 | 29B参数理论体积 | 单张24GB显卡可行性 | 适用方向 | |---|---:|---|---| | FP16/BF16 | 约58GB | 通常不可直接完整装入 | 多卡服务器、高精度评测 | | INT8 | 约29GB | 通常仍超出24GB | 工作站或多卡部署 | | 4-bit | 约14.5GB至15GB | 可以装入权重,并留出部分运行空间 | 本地Agent、低并发推理 |
**15GB这个数字的实际价值,是把29B MoE模型从服务器产品变成了可在个人工作站测试的工程组件。**开发者可以在RTX 3090、RTX 4090等24GB显卡上搭建私有代码助手、文档研究Agent或数据分析工具,而不必为模型权重本身准备多张高端GPU。
**量化带来的代价仍然需要通过真实任务评估。**Agent任务比短问答更容易放大误差,因为一次任务可能包含几十轮规划、工具调用和结果校验;如果量化使某一步的函数参数、文件路径或代码逻辑出现偏差,错误可能沿着执行链继续累积。相比单轮跑分,连续执行成功率、错误恢复能力和工具调用格式稳定性更值得关注。
这次开源的重点,是把模型接进现有Agent生态
**Agent模型是能够围绕目标规划步骤、调用外部工具并根据执行结果继续决策的大语言模型。**它与传统聊天模型的区别不是“更会说”,而是需要稳定输出工具参数、理解终端反馈、保存任务状态,并在失败后主动修正执行路径。
Xing4.0没有要求开发者迁移到一套完全封闭的新工具链。官方仓库列出的兼容范围覆盖训练、推理和Agent三个层级:
- 微调框架支持LLaMA-Factory、MindFormers;
- 推理框架适配SGLang、vLLM、KTransformers;
- Agent工具定向适配OpenCode、Claude Code、OpenClaw、Hermes;
- 模型权重已经同步至Hugging Face、GitHub及多个国内开源社区。
**对OpenCode、Claude Code等工具的定向适配,比单纯提供Transformers权重更有工程价值。**Agent框架通常对系统提示词、工具描述、消息角色、函数调用格式和停止条件有自己的约定,模型即使代码能力不错,只要格式对齐不到位,也可能把工具参数输出成自然语言,或者在执行结果返回后无法继续推进任务。
**Xing4.0的生态策略明显瞄准“拿来组装”,而不是让开发者从头搭建Agent运行时。**这对企业内部部署尤其重要,因为大多数团队真正缺少的并不是一个能生成代码片段的模型,而是一套能接入代码仓库、终端、数据库和办公系统,并稳定跑完任务的执行链路。
SuperCLUE拿到93.52分,但还不能只看总榜名次
**Xing4.0-29B-A4B在SuperCLUE智能体能力评测中获得93.52分,排名第三。**按照公开信息,它与榜单中两款头部Qwen模型的差距均不足1分,这说明一个每Token只激活4B参数的模型,已经可以在特定Agent评测中接近国内头部开源模型。
| 评测项目 | Xing4.0-29B-A4B表现 | |---|---:| | SuperCLUE智能体能力得分 | 93.52 | | 榜单排名 | 第3名 | | 与两款头部Qwen模型差距 | 均不足1分 |
**这组成绩说明了模型的能力密度较高,但不能直接等同于真实生产环境的任务完成率。**Agent基准往往依赖特定提示词、工具集合、采样参数和最大输出长度;同一个模型换到真实代码仓库、复杂权限环境或不稳定网络服务后,表现可能明显波动。
**工程团队更应该关注四项补充指标:连续任务成功率、工具调用参数正确率、失败恢复次数和完成任务的总Token成本。**一个模型如果单步准确率很高,却在第30步忘记初始约束,仍然无法胜任复杂工程Agent;另一个模型即使偶尔走错路径,但能识别错误并回退,实际价值反而可能更高。
“全栈国产”的含金量,在于训练链路确实跑通
**全栈国产在这里指模型从训练芯片、训练框架到推理适配均建立了国产技术路径。**根据官方模型卡,Xing4.0-29B-A4B在昇腾NPU平台上使用MindSpore完成训练,而不是先在海外GPU与框架上训练,再进行一次国产芯片推理适配。
**端到端训练与模型搬运是两个难度等级。**大规模MoE训练需要处理专家负载均衡、通信开销、并行策略、长上下文稳定性和故障恢复;如果框架与硬件协同不足,某些专家可能过载,跨设备通信也会吞掉MoE节省的计算成本。
**Xing4.0的意义不在于证明国产平台已经全面取代CUDA生态,而在于给出了一条可复现、可继续优化的29B MoE训练样本。**国内算力最缺的往往不是单点硬件参数,而是模型架构、训练框架、算子、集群通信与推理引擎之间的系统协同。一个真正开源且能被开发者部署的模型,比只公布训练规模更能检验这条链路是否成立。
它适合谁,又不适合谁
**Xing4.0最适合需要本地控制、长上下文和工具调用能力的开发者与企业团队。**典型使用方向包括私有代码仓库分析、内部文档研究、日志排障、数据处理、办公流程自动化,以及对数据出域较为敏感的Agent系统。
以下几类场景值得优先尝试:
- 需要在24GB显卡上运行中型Agent模型的个人开发者;
- 希望把代码、文档和日志留在本地环境的企业团队;
- 已经使用vLLM、SGLang、LLaMA-Factory或MindFormers的工程团队;
- 需要验证昇腾与MindSpore训练、微调和推理链路的国产化项目;
- 任务上下文显著超过32K,并需要跨文件持续执行的代码或研究Agent。
**纯聊天、短文本摘要和简单分类任务未必需要Xing4.0。**这些场景用更小的稠密模型通常更容易部署,也能获得更低延迟;MoE路由、超长上下文和Agent适配的优势,只有在复杂任务链中才会真正体现。
**高并发在线服务也不能只根据4B激活量判断成本。**29B总权重仍需占用显存和带宽,超长上下文还会扩大KV Cache;如果业务以大量短请求为主,一个总权重更小的稠密模型可能具有更好的批处理效率和更简单的容量规划。
OpenAI Hub判断:这是一款有明确工程目标的模型
**Xing4.0-29B-A4B不是为了在通用聊天榜单上制造一个更大的数字,而是试图成为能在有限硬件上执行长任务的Agent底座。**29B总参数、4B激活参数、256K原生上下文、4-bit约15GB权重占用,以及对主流Agent框架的定向适配,共同指向一个相当明确的产品定位:复杂度高于普通助手,但部署门槛低于大型稠密模型。
**它目前最大的优势是能力、上下文和本地部署成本之间的平衡。**它目前最大的未知数,则是长任务中的真实稳定性,包括跑满数十步工具调用后的指令保持、量化版本的错误累积,以及256K以上上下文的有效信息利用率。
**中国电信此次开源真正值得肯定的地方,是没有把“国产全栈”停留在适配声明上。**模型权重、架构参数和工程仓库已经公开,开发者可以直接用消费级显卡和现有框架检验它。对于开源模型而言,可下载、可部署、可复现的工程结果,最终比发布会上的定位更有说服力。
参考来源
- 中国电信开源首个全栈国产轻量级智能体大模型 Xing4.0-29B-A4B:发布信息、量化显存占用、SuperCLUE成绩及生态适配情况。
- Xing4.0-29B-A4B Hugging Face模型卡:模型架构、参数规模、专家配置和上下文长度等技术信息。
- Xing4.0-29B-A4B GitHub仓库:官方开源仓库及部署、推理与生态适配说明。



