达卯科技与福建智算方舟达成合作,全栈式算电协同服务在闽落子
发布于 · 8月26·周三 来源 · 量子位

达卯科技与福建智算方舟达成合作,全栈式算电协同服务在闽落子

达卯科技与福建智算方舟合作,在长乐机场综保区智算中心落地全栈式算电协同服务,标志着AI算力基础设施与能源管理深度融合的新范式,为大规模GPU集群的绿色高效运营提供工程化解决方案。

核心要点速览

  • 事件要点:达卯科技与福建智算方舟合作,在长乐机场综保区智算中心落地全栈式算电协同服务,标志着AI算力基础设施与能源管理深度融合的新范式,为大规模GPU集群的绿色高效运营提供工程化解决方案。
  • 技术突破:围绕 AI算力基础设施与能源管理深度融合的新范式, GPU集群的绿色高效运营提供工程化解决方案, 达卯科技与福 等关键领域展开,推动了当前 AI 技术与工程落地的进一步深化。
  • 产业观察:信息源自 量子位,为 AI 开发者、研究人员及产业决策者提供了高价值的技术演进信号与参考。
关键词AI算力基础设施与能源管理深度融合的新范式GPU集群的绿色高效运营提供工程化解决方案达卯科技与福建智算方舟达成合作全栈式算电协同服务在闽落

【核心事件与技术概览】

达卯科技与福建智算方舟正式达成战略合作,在福州长乐机场综合保税区智算中心部署全栈式算电协同服务。该合作的核心在于将AI算力集群的电力调度、能耗管理与计算任务编排进行深度耦合,构建从电力供应端到GPU计算端的端到端智能管控体系。达卯科技作为国内算力基础设施领域的专业服务商,其技术栈涵盖算力调度平台、液冷散热系统、智能配电网络及能耗优化算法,而福建智算方舟则依托长乐综保区的区位优势和电力资源禀赋,提供规模化AI算力供给能力。

此次合作部署的智算中心定位为面向大模型训练与推理的专用算力设施,规划GPU集群规模达到数千卡级别,支持主流AI框架如PyTorch、TensorFlow及国产昇腾生态。全栈式算电协同服务的关键创新在于将传统数据中心'先供电、后计算'的串行模式转变为'算电联动、动态协同'的并行模式,通过实时感知GPU负载状态与电力供需关系,实现毫秒级电力资源再分配。该智算中心采用模块化设计,支持弹性扩容,首期部署完成后将逐步扩展至万卡集群规模,为福建省及周边区域提供区域性AI算力枢纽服务。

从合作架构来看,达卯科技负责提供全栈软件平台与硬件集成方案,包括算力调度引擎、智能配电管理系统、液冷温控系统以及能耗预测与优化模块;福建智算方舟则负责场地建设、电力接入与运营维护。双方在长乐综保区共同打造的是集'电力保障—算力供给—模型服务'于一体的垂直整合型AI基础设施,其目标客户涵盖大模型企业、科研机构、政府数字化转型项目及传统行业智能化升级需求方。该智算中心的建成将进一步完善福建省AI产业生态,形成与深圳、上海、北京等一线城市算力枢纽的差异化互补格局。

【技术原理与核心突破】

全栈式算电协同服务的核心技术架构包含三个关键层次:底层电力感知层、中间算力调度层与上层模型服务层。底层电力感知层通过部署智能电表、电流传感器和温度传感器网络,实时采集GPU服务器机柜级的电力消耗数据、电压波动及散热状态,采样频率达到毫秒级,为上层调度决策提供高保真输入。该层采用边缘计算节点进行本地数据预处理,减少回传带宽压力,同时通过联邦学习机制在多个机柜间共享能耗模型,实现全局能效优化。

中间算力调度层是整个系统的核心引擎,其算法机制基于多目标强化学习框架,同时优化计算吞吐率、单位算力能耗(PUE)和电力成本三个目标函数。调度引擎将GPU集群划分为多个异构计算池,根据任务类型(训练/推理/微调)动态分配计算资源,并结合电力实时价格信号进行任务迁移决策。当某区域电力供应紧张或电价飙升时,调度器会自动将非实时推理任务迁移至电力充裕区域,确保整体运营成本最优。该层还集成了预测性维护算法,通过分析GPU温度曲线、显存错误率等指标,提前预警硬件故障,减少训练任务的中断损失。

上层模型服务层提供标准化的API接口,支持主流大模型框架的无缝接入,包括NVIDIA CUDA生态、AMD ROCm生态以及华为昇腾CANN生态。该层实现了模型版本管理、推理请求队列调度、多租户资源隔离等功能,并通过模型量化压缩技术(如INT8/FP8量化)降低单次推理的算力与电力开销。在长上下文场景下,系统采用paged attention机制和KV Cache共享策略,减少显存占用与数据搬运能耗。整体架构的PUE目标控制在1.15以下,相比传统数据中心1.5-1.8的PUE水平具有显著优势。

【行业背景与竞争格局】

全球AI算力基础设施市场正处于快速扩张期,2024年全球AI数据中心市场规模已超过300亿美元,预计到2027年将突破600亿美元。在这一背景下,算力与电力协同管理成为行业核心竞争要素。国际对标方面,NVIDIA的DGX Cloud平台已集成基础的能耗监控功能,但尚未实现算电深度协同;微软Azure的AI超算集群采用类似的全栈方案,但其技术细节未完全开源。国内方面,华为昇腾云、阿里云PAI平台和华为云ModelArts均提供了算力调度能力,但在电力协同层面仍处于探索阶段,达卯科技的全栈方案在算电联动深度上具有先发优势。

从竞争格局来看,国内智算中心建设呈现'国家队+地方队+专业服务商'三足鼎立的态势。国家队以中国电子云、中国电信天翼云为代表,依托国资背景获取大规模电力指标;地方队如本次合作的福建智算方舟,依托地方政府政策支持和区域产业需求;专业服务商如达卯科技,以技术深度和工程经验为核心竞争力。三者在技术路线上各有侧重,但全栈式算电协同正在成为行业共识方向,因为随着GPU集群规模从百卡向万卡演进,电力成本在总运营成本中的占比已从30%上升至45%以上,算电协同的经济价值日益凸显。

从全球趋势看,AI算力基础设施正经历从'堆硬件'向'精细化运营'的范式转变。OpenAI的超算中心采用定制化液冷方案和专用电力变压器,Google DeepMind的TPU集群实现了芯片级功耗动态调节,这些前沿实践均指向同一个方向:算力与电力的深度协同是下一代AI基础设施的标配能力。达卯科技与福建智算方舟的合作,正是这一趋势在中国区域市场的典型落地案例,其技术方案的成熟度和可复制性将直接影响国内智算中心行业的整体能效水平。

【开发者与产业落地启示】

从开发者接入角度,该智算中心提供标准化的RESTful API和gRPC接口,支持通过Python SDK、CLI工具及Web控制台进行算力资源申请与任务提交。开发者无需关心底层电力调度细节,只需通过简单的YAML配置文件声明计算资源需求(GPU型号、数量、显存大小、网络带宽),系统自动完成资源分配与电力协同优化。对于已有训练流水线的团队,迁移成本较低,主要工作量集中在数据迁移和少量配置调整,预计可在1-2周内完成从原有云平台的迁移。

在硬件显存开销方面,该智算中心支持NVIDIA H100/H200、H800及华为昇腾910B等主流AI加速卡,单节点显存容量从80GB到141GB不等,支持NVLink和HCCS高速互联。对于70B参数级别大模型的分布式训练,系统自动进行张量并行和数据并行切分,配合ZeRO-3优化策略,可将单模型训练显存需求降低60%以上。推理场景下,通过vLLM或SGLang等高性能推理引擎,配合系统级的KV Cache共享和批处理优化,单卡推理吞吐率可达传统方案的2-3倍,单位token的电力成本相应降低。

商业落地价值方面,该智算中心的算电协同服务可帮助客户降低15%-25%的算力运营成本,主要来源于三个维度:一是通过电力价格信号驱动的任务调度,将高负载任务安排在电价低谷时段,直接降低电费支出;二是通过液冷系统和智能温控降低散热能耗,PUE从1.5降至1.15以下;三是通过预测性维护减少硬件故障导致的训练中断和算力浪费。对于月算力消费超过500万元的大模型企业,年度节省可达数百万至千万元级别,投资回报周期通常在6-12个月内。

【综合评述与关键要点】

达卯科技与福建智算方舟的合作标志着AI算力基础设施行业从'粗放式扩容'向'精细化运营'的关键转折。全栈式算电协同服务的核心价值在于将电力这一传统被视为'成本项'的资源转化为'可调度资产',通过算法驱动的动态优化实现算力供给与电力消耗的最优匹配。这一技术范式的成熟将深刻影响AI基础设施的经济模型,使算力成本的下降速度超越摩尔定律,为更大规模模型的训练和更广泛场景的AI推理提供经济可行性。

未来1-2年,算电协同技术将沿着三个方向演进:一是从区域级协同向跨地域协同扩展,通过构建全国性的算力电力调度网络,实现跨省域的算力资源优化配置;二是与可再生能源深度融合,利用风光电的间歇性特征与AI训练任务的弹性需求进行匹配,推动AI算力向零碳目标迈进;三是与新型电力系统(如虚拟电厂、储能系统)深度集成,使智算中心从单纯的电力消费者转变为电力系统的柔性调节节点。这些演进方向将共同塑造下一代AI基础设施的形态,而达卯科技与福建智算方舟的先行实践将为行业提供重要的技术验证与工程参考。

本站展示内容为基于公开信息的资讯解读与整理,不代表原文转载。如需核实细节或获取完整报道,请通过下方链接访问原始来源。

深度背景与行业观察

随着人工智能技术的快速演化,围绕 AI算力基础设施与能源管理深度融合的新范式、GPU集群的绿色高效运营提供工程化解决方案、达卯科技与福、建智算方舟达 的技术探索正从单纯的算法突破转向系统化、场景化的实际落地。

在开源生态与商业化闭源模型的双重驱动下,算力调度、数据飞轮与智能体(Agent)工作流的结合愈发紧密。本条动态不仅反映了当前领域内的研发热点,也为下一阶段的工具化、工程化实践提供了重要风向标。