【经管讲堂·AI经管实践】中科曙光十万卡AI集群:大模型基础设施的工程化实践

中科曙光十万卡AI集群:大模型基础设施的工程化实践

案例背景

2026年7月,中科曙光宣布其十万卡级别AI超算集群正式落成并投入运营。这是中国乃至全球范围内规模最大的AI算力基础设施之一,标志着国产AI算力在工程化能力上实现了重大跨越。所谓”十万卡”,即集群集成了超过十万张AI加速卡(包括GPU及国产AI芯片),总算力规模达到EFLOPS(每秒百亿亿次浮点运算)级别,能够支撑万亿参数大模型的训练与推理。这一集群的落成不仅是算力规模的突破,更是对国产芯片、互连网络、液冷散热、集群调度等全链条工程能力的系统性验证。

在大模型时代,算力基础设施已成为国家战略竞争的核心要素。过去两年,美国通过出口管制限制高端GPU对华出口,倒逼中国加速国产AI芯片和算力集群的自主研发。然而,从”单卡可用”到”十万卡集群可用”之间,横亘着巨大的工程鸿沟。单个AI芯片的性能可以通过制程和架构优化逐步提升,但当十万张卡组成集群时,互连带宽、通信延迟、散热效率、故障容错、任务调度等系统性挑战将呈指数级增长。国际经验表明,万卡以上集群的线性加速比(即实际算力与理论算力之比)通常仅为50%-70%,十万卡集群的工程难度更上层楼。中科曙光此次落成的集群, reportedly在典型训练场景下实现了超过65%的线性加速比,这一数据在全球范围内属于领先水平,也证明了国产算力供应链已具备支撑超大规模AI集群的工程化能力。

核心分析

一、国产芯片供应链验证:从”单点突破”到”系统集成”

十万卡集群的核心意义首先在于对国产AI芯片供应链的系统性验证。过去两年,中国AI芯片产业在单卡性能上取得了显著进步,多款国产AI加速卡在FP16/BF16算力、显存带宽等关键指标上已接近国际主流水平。但单卡性能不等于集群性能——芯片在集群环境下的表现取决于互连协议兼容性、驱动稳定性、算子库完备性等系统因素。中科曙光十万卡集群采用了多型号国产AI芯片混合部署的架构,这要求集群软件栈能够屏蔽底层硬件差异,实现异构算力的统一调度和管理。这一工程目标的实现,标志着国产AI芯片从”单点可用”迈向了”系统集成可用”的关键一步。

从供应链管理的角度分析,十万卡集群对国产芯片供应链的验证体现在三个层面。一是”量级验证”:十万张卡的部署规模意味着芯片良率、一致性、大批量交付能力均达到了实用化水平。此前国产AI芯片多在千卡级集群中验证,量级跃升十倍后,任何微小的良率或一致性问题都会被放大为系统性故障。二是”时间验证”:芯片在长时间、高负载运行中的稳定性是集群可靠性的基石,十万卡集群的持续运行数据将为国产芯片的可靠性评估提供宝贵的实战依据。三是”生态验证”:集群的成功运行依赖于芯片厂商、互连网络供应商、液冷设备厂商、集群软件开发商等多方协同,十万卡项目的落地证明了国产AI算力生态已初步形成闭环。这一生态闭环的形成,对于降低中国AI产业对单一外部供应链的依赖具有战略意义。

二、互连网络与液冷散热:超集群的工程核心

在十万卡规模下,互连网络和散热系统成为决定集群有效算力的关键工程因素。互连网络方面,当十万张卡需要协同计算时,卡间通信的带宽和延迟直接决定了集群的线性加速比。传统以太网在万卡以上规模下难以满足大模型训练的通信需求,需要采用专用高速互连技术。中科曙光在集群中部署了自研的高速互连网络,据公开信息其点对点带宽达到数百GB/s级别,端到端延迟控制在微秒级。这一性能指标的实现,意味着国产互连技术已具备支撑超大规模AI集群的能力,打破了此前在该领域对国外专有技术的依赖。

液冷散热是另一个关键工程挑战。十万张AI加速卡满载运行时的热功耗可达数十兆瓦,相当于一个小型发电站的输出功率。传统风冷散热在此功率级别下已完全不可行,必须采用液冷方案。中科曙光采用了板级液冷与浸没式液冷结合的混合散热架构,将PUE(数据中心能源效率指标)控制在1.15以下,远优于风冷数据中心的典型PUE 1.5-1.8。从工程经济学的角度分析,液冷散热虽然前期投资高于风冷,但在十万卡规模下,其带来的能效提升可每年节约电费数亿元,同时大幅降低芯片因过热降频导致的算力损失。更深远的意义在于,高效散热方案为未来百万卡级集群的可行性奠定了基础——当芯片功耗持续攀升时,散热能力将成为算力扩展的硬约束,液冷技术的成熟是突破这一约束的必要条件。这一工程实践也提示管理者,基础设施投资决策不能仅看前期CAPEX,更应基于全生命周期的TCO(总拥有成本)进行综合评估。

三、集群调度与容错:从”硬件堆叠”到”系统智能”

十万卡集群的真正难点不在于硬件堆叠,而在于软件定义的集群调度和容错能力。在大模型训练场景中,十万张卡需要协同执行同一个计算任务,任何一张卡的故障都可能导致整个训练任务中断。统计数据显示,在万卡集群中,平均每天会发生数次硬件故障;在十万卡集群中,故障频率可能达到每小时数次。如果没有高效的容错机制,训练任务将频繁中断重启,造成巨大的算力浪费。中科曙光在集群中部署了智能化的故障检测与恢复系统,能够在秒级时间内识别故障节点,自动隔离并启动检查点恢复,将故障对训练任务的影响降至最低。这种”系统智能”是十万卡集群从”可用”走向”好用”的核心能力。

从系统工程管理的角度看,十万卡集群的调度与容错体现了”涌现性”管理的思想。复杂系统理论指出,当系统规模超过一定阈值后,会涌现出小规模系统中不存在的全新特性——在AI集群中,这种涌现性表现为故障的常态化、通信的瓶颈化、负载的不均衡化等。管理这些涌现特性不能依赖线性的”堆叠思维”(即简单增加硬件),而需要系统层面的智能设计。中科曙光的实践表明,集群调度系统需要具备三个核心能力:一是全局资源视图,实时感知十万张卡的状态和负载;二是智能任务编排,根据任务特征和资源状态动态优化计算图分配;三是弹性容错,在故障发生时快速恢复而不丢失大量计算进度。这三个能力的实现,本质上是将”算力基础设施”从被动的硬件集合升级为主动的”智能系统”,这也是大模型时代算力竞争的核心壁垒。对于企业而言,理解这一趋势意味着在规划AI基础设施时,不能仅关注硬件采购清单,更应将软件栈能力、运维智能化水平作为关键评估维度。

管理启示

第一,大型基础设施项目的成功取决于供应链系统工程能力。十万卡集群的落成不仅是技术突破,更是供应链管理的胜利。管理者在推进大型技术项目时,应将供应链协同、生态闭环建设置于与技术研发同等重要的位置,避免”重技术、轻工程”的失衡。

第二,基础设施投资决策应基于全生命周期TCO视角。液冷散热等高效方案的初期投资虽高,但在大规模、长周期运营中具有显著的经级优势。管理者在评估基础设施方案时,应建立包含能耗、运维、故障损失、扩展性在内的综合TCO模型,避免因短期成本视角而做出次优决策。

第三,”系统智能”是大规模工程的核心竞争力。从硬件堆叠到系统智能的跨越,本质是从”要素驱动”到”系统驱动”的管理升级。企业应在技术项目中强化系统思维,重视软件定义能力、智能调度能力、弹性容错能力的建设,这些”看不见的能力”往往比”看得见的硬件”更具决定性。

其他思考

  1. 十万卡集群的落成验证了国产算力的工程化能力,但从”可用”到”好用”之间仍存在差距。国产算力集群在算子库完备性、开发框架易用性、生态工具链丰富度等方面与国际领先水平相比还有多远?这些”软实力”差距如何弥合?
  2. 当算力基础设施规模达到十万卡乃至百万卡级别时,其能耗、占地、水资源消耗等外部性影响将如何影响选址决策和公共政策?超大规模AI集群的环境可持续性是否应成为监管考量的维度之一?
  3. 十万卡集群的建设需要数百亿元规模的投入,这种级别的算力基础设施是否只能由国家和大型企业承担?中小AI企业如何在这一基础设施格局中找到自身定位——是租赁算力、联合共建,还是聚焦轻量化推理场景?

关键词:十万卡AI集群、国产芯片、互连网络、液冷散热、系统工程化

来源:2026年7月13日行业新闻报道——中科曙光十万卡AI超集群落成,验证国产芯片、互连网络、液冷散热供应链。

锐思,察微。
上一篇

【经管讲堂·AI经管实践】豆包、千问同步下线智能体:AI应用的合规与成本双重挑战

下一篇

【经管讲堂·AI经管实践】海外企业API账单”高过全员工资”:中国大模型出海的商业化路径

你也可能喜欢

评论已经被关闭。

插入图片
关注 关注
锐察微博
返回顶部

微信扫一扫

微信扫一扫