2025年12月18日,光合组织2025人工智能创新大会(HAIC2025)于江苏昆山举办,中科曙光在本次大会现场,正式对外展出scaleX万卡超集群真机,这也是国内万卡级别AI集群第一次公开真机对外亮相,标志我国大规模国产AI算力基础设施实现重要里程碑式突破。这套系统面向万亿参数大模型训练、科学智能仿真、AI for Science等高强度计算任务打造,整套集群由16台scaleX640超节点组成,实现10240块AI加速卡协同调度,总算力突破5EFlops,也就是500亿亿次每秒,HBM总内存容量超过650TB,整体硬件规格对标国际主流高端智算集群,部分架构指标已经超越海外厂商2027年产品路线规划节点。
硬件架构层面,该集群最核心创新点为全球首创单机柜640卡超节点设计。传统AI机柜单柜一般仅能部署数十张加速卡,scaleX640超节点采用超高密度刀片架构,搭配浸没式相变液冷散热方案,单机柜算力密度达到传统机房方案的20倍,同时把整机柜PUE电能利用效率压低至1.04,逼近物理理论极限,极大缓解万卡规模集群对机房供电、散热空间的严苛要求,让万卡级算力可以在现有数据中心条件下落地部署,不再需要改造特殊定制机房。
集群配套搭载中科曙光自研scaleFabric国产原生RDMA高速网络,这套网络是整套万卡集群能够稳定运行的底座。万卡规模集群最大的技术难点不在于堆叠足够多的加速卡,而在于上万张卡协同训练时,网络延迟、拥塞会直接压低整体算力利用率。scaleFabric采用国产400G RDMA网卡与交换芯片,端到端通信延迟低于1微秒,支持无损流控,链路故障恢复时间小于1毫秒;单子网最大可支撑11.4万卡规模组网,相比传统IB网络,扩展能力提升2.33倍,网络整体建设成本下降30%,解决了国产大规模智算集群长期依赖海外高速互联硬件的痛点,真正实现计算、存储、传输三者深度协同优化。
区别于部分封闭绑定自家硬件的集群方案,scaleX万卡超集群坚持AI计算开放架构路线,可以兼容多家不同厂商的AI加速硬件,不锁定单一芯片品牌,给AI企业提供硬件选型自由度。截至发布会现场,该系统已经完成四百多款主流大模型、世界模型的适配调优,覆盖通用大语言模型、多模态大模型、具身智能世界模型等主流类型,能够同时承接大模型预训练、微调推理、地质能源勘探模拟、金融仿真推演、生物医药分子计算等多元化业务场景,有效降低国内AI企业自建万卡级超算集群的技术门槛与试错成本,大模型企业不用从零解决集群组网、网络调优、模型适配等复杂工程难题,直接调用成熟算力底座开展业务研发。
在基础设施商业落地层面,scaleX万卡超集群方案已经完成产品化定型,具备面向全国智算中心批量交付的能力。国内多地新建算力园区、国家算力枢纽节点,已经将该系统纳入采购评估名单。早在2025年2月,就已经有三套同架构万卡集群在国家超算互联网核心节点上线试运行,总卡数规模达到3万卡,承接国内多家科研机构、头部AI企业的大模型训练任务。12月发布会之后,各地的项目订单正在逐步落地,国产大规模算力集群正式从实验室原型样机阶段,走向规模化商业化交付,进一步完善国内自主可控算力基础设施版图。
中科曙光高级副总裁李斌在大会采访中提到,万卡集群的研发,最大挑战是系统工程,而不是单芯片性能。当上万块加速卡组成紧耦合计算系统,任何一个节点、网络链路的微小故障,都会被放大到整个集群,造成大规模训练任务中断。国产万卡集群的突破,代表国内产业已经跨过“单卡性能追赶”阶段,真正进入整机系统、高速互联、调度软件、液冷散热全栈一体化攻关的新阶段。过去国内算力产业更多聚焦芯片单点能力,而搭建万卡集群考验的是从硬件机柜、网络芯片、存储系统到上层调度软件的整套体系能力,这也是国内算力产业迈向成熟的关键标志。
从全球产业竞争格局看,这套开放架构万卡超集群的推出,代表中国已经具备自主设计、建造万卡级AI训练集群的完整工程能力,将和海外大型AI集群产品形成直接竞争,重塑全球智算硬件市场格局。长期以来,万卡级别大规模AI集群方案基本由海外厂商主导,整套软硬件深度绑定,客户选择空间有限。scaleX万卡超集群提供了一套开放的国产替代路线,既可以适配国产加速芯片,也兼容国际主流硬件,给国内智算建设提供了更多选择,减少关键算力基础设施对外依赖。
同时也要客观看到国产万卡集群现阶段存在的现实约束。硬件架构实现突破不等于全场景能力全面超越海外成熟产品,在算子库深度优化、大规模长周期训练稳定性、配套软件生态完善度上,仍然还有持续迭代空间。万卡集群的价值,不止是硬件机柜本身,更需要上下游芯片厂商、大模型企业、科研机构共同打磨适配,把硬件的理论算力真正转化为实际可用的有效算力。四百多款大模型适配,正是生态共建的过程,硬件只是底座,产业生态成熟度决定这套系统能释放多大价值。
放眼国内产业大环境,当前全国智算中心建设持续提速,各地算力枢纽不断上马,国产软硬件生态成熟度持续提升。过去几年,国内算力建设更多处在“堆硬件、拼规模”的阶段,而scaleX万卡超集群代表行业转向“重系统、重效率、重生态”的新阶段。大量新建智算中心不再只追求卡数规模,而是更加看重算力利用率、能耗水平、软硬件开放兼容能力,这也是国内算力产业走向高质量发展的信号。
从产业价值来看,自主可控的万卡级国产智算集群落地,有着非常重要的现实意义。数字经济时代,大规模AI算力已经成为国家关键新型基础设施,大模型创新、科学计算、工业仿真、生物医药研发都高度依赖大规模算力底座。如果关键算力基础设施高度依赖外部供应链,会给科研、产业发展带来潜在风险。国产万卡集群实现真机亮相、批量交付,代表我们掌握大规模智算系统完整建造能力,当这套系统在全国各个算力节点逐步部署落地,将为我国大模型创新、科学智能计算提供坚实的算力底座,持续助推新质生产力发展。
从长远发展来看,万卡集群只是一个新起点。行业已经开始展望十万卡级别超大规模智算系统,未来还会面临更大规模组网、更高散热压力、更强调度软件的多重挑战。以scaleX万卡超集群为基础,国内产业链可以持续沉淀超大规模集群的系统工程经验,持续打磨国产RDMA网络、液冷超节点、集群调度软件,为下一代十万卡级国产智算系统打下技术基础。
