中国电信开源 Xing4.0-29B-A4B:全栈国产化,消费级显卡也能跑长上下文

AI资讯19小时前发布 全启星小编
88 0

中国电信开源 Xing4.0-29B-A4B:全栈国产化,消费级显卡也能跑长上下文

近日,中国电信正式开源了其自研大语言模型 **Xing4.0-29B-A4B**。该模型总参数量达 290 亿,但采用了 Mixture-of-Experts(MoE)架构,每次推理仅激活约 40 亿参数(即“A4B”标识的含义),大幅降低了计算开销。更值得关注的是,它实现了从训练框架到硬件适配的“全栈国产化”,并能运行在消费级显卡上,支持长达 128K 甚至更高的上下文窗口。

全栈国产化的技术突破

“全栈国产化”意味着 Xing4.0-29B-A4B 在底层依赖于国产深度学习框架(如昇思 MindSpore 或自主研发的通信库),并适配了包括昇腾、寒武纪等国产 AI 加速卡。同时,该模型在 Hugging Face 等国际平台也提供了兼容 PyTorch 的版本,降低了社区使用门槛。这种设计兼顾了自主可控与生态开放:对于国内政企客户,可部署在信创硬件上;对于开发者,即使只有一张消费级显卡(如 RTX 4090 24GB),也能通过激活参数的稀疏性加载和推理长序列。

长上下文推理的可行性分析

消费级显卡的显存瓶颈通常在于 KV Cache。Xing4.0-29B-A4B 通过 MoE 架构将单次推理的活跃参数压缩至 4B,配合高效的位置编码(如 YaRN)和显存优化技术(如 FlashAttention),使得 24GB 显存的显卡足以处理数万 token 的上下文。实测显示,在 RTX 4090 上可流畅运行 128K 长度的对话任务,这标志着国产大模型在推理效率上已接近国际一线水平。

意义与展望

中国电信的开源举措,一方面为国产大模型生态注入了“可用、可跑、可二次开发”的优质基座,另一方面也证明了通过算法架构创新(而非单纯堆算力)同样能实现高性能。未来,随着国产算力生态的完善以及 MoE 技术的进一步成熟,类似“小显存跑大模型”的方案将加速落地,推动大模型在金融、政务、医疗等垂直场景的普惠化部署。

相关文章