全球首个!中国电信完成千卡、千亿参数模型500公里联合训练试商用

内容摘要快科技1月23日消息,据中国电信,在集团公司统一组织下,中国电信研究院、天翼云、北京电信成功了完成业内首个1024卡、千亿参数商用大模型的分布式联合训练真实用户试商用。通过天津市武清区到北京市大兴区瀛海镇之间的真实光路环回,实现了500公里

快科技1月23日消息,据中国电信,在集团公司统一组织下,中国电信研究院、天翼云、北京电信成功了完成业内首个1024卡、千亿参数商用大模型的分布式联合训练真实用户试商用。

通过天津市武清区到北京市大兴区瀛海镇之间的真实光路环回,实现了500公里长距互联分布式训练,而且训练性能达到单数据中心的97%以上。

全球首个!中国电信完成千卡、千亿参数模型500公里联合训练试商用

本次试商用基于北京现网800G广域智联无损网络,以及息壤一站式智算服务平台,在互联距离、带宽收敛比、模型参数方面,都去取得了重大突破,实现了多数据中心互联、资源整合支持商用模型分布式联合训练。

在广域智联无损网络技术方面,中国电信创新广域无损调度算法、关键帧识别技术,将带宽收敛比提升到32:1;创新WSON 50ms极速倒换技术,实现长距链路中断无感知切换。

系列技术有效解决了长距离传输中网络拥塞丢包、链路故障、建网成本等问题,确保了训练过程的稳定性和高效性。

在500公里的长距离传输下,网络传输吞吐率仍能保持在较高水平,为千卡千亿参数商用大模型的联合训练提供了坚实的网络支撑。

与此同时,息壤平台支持算力插件、跨地域算网协同、跨数据中心自动并行、断点续训等一系列关键技术能力,实现故障秒级定位、分钟级处理与恢复,保证了百川千亿参数商用模型的快速部署和稳定高效运行。

全球首个!中国电信完成千卡、千亿参数模型500公里联合训练试商用

 
举报 收藏 打赏 评论 0
24小时热闻
今日推荐
浙ICP备19001410号-1