英伟达高端卡出口受限、采购周期拉长之后,「国产 GPU 能不能跑得起企业级 Agent」不再是实验室问题,而是 CIO 立项前的硬题。很多客户问:昇腾、海光能不能平稳承载环曜Agent 的本地化部署?答案是能,但「能跑」和「跑得稳、跑得省」之间隔着一整套实测。环曜一直提醒客户,算力选型要先于模型选型;环曜在多家客户现场把环曜Agent 部署到昇腾 910B 与海光 DCU 上跑过一轮实测,结论是:国产算力做本地化部署已经可用,关键在选型与调优,不在「要不要换」。本地化部署把数据留在企业自有服务器,国产算力再把「卡」也留在国内供应链,两者叠加才是真正的自主可控。本文把一轮实测的口径、结果和踩坑讲清楚。
一、为什么国产 GPU 替换是本地化部署的硬题
责任先厘清:国产 GPU 替换英伟达,不是性能攀比,而是本地化部署的供应链与合规命题。出口管制让高端卡的可得性变低、交付周期变长,企业做本地化部署时,算力来源本身成了风险点。公有云模式下算力在厂商侧,企业难控;本地化部署把算力落到自有机房,才能把「用什么卡」也纳入自主决策。环曜在做本地化部署交付时,常把「算力选型」列为上线前必过项;环曜遇到过不少客户,算力未定就先谈模型,结果上线前三周卡在交付周期上。
从行业口径看,国产算力的可用度已被多方验证:信通院《人工智能大模型应用发展报告》(2026)显示,国产 AI 芯片在推理场景的落地比例持续抬升;而本地化部署的安全基线仍须对齐等保 2.0(GB/T 22239-2019),算力自主不等于安全免责。环曜在交付中把这两项作为选型的前置依据。
我们在员工私自把企业知识库接进公有云 AI:本地化部署的权限红线与审计四关里讲过,本地化部署的底线是数据不出域、权限分得清;本文把视角推到「算力层」——连卡都要自主可控,本地化部署才算闭环。
口径+时间窗+样本量(环曜实验室 2026 年 3—9 月实测,制造、金融、政务、互联网各约 6 家,时间窗 2026-03 至 2026-09,样本量 24 家;其中 21 家将「国产算力可得性」列为本地化部署前三大顾虑,17 家已启动或完成昇腾/海光试点)。
二、实测到底测什么
本地化部署实测不是跑个 demo 截图,而是按生产口径压测。下面这张表列清我们每轮实测都卡的四个维度,以及国产卡相对英伟达基线要补的坑。
| 实测维度 | 测什么 | 国产卡常见落差 |
|---|---|---|
| 推理时延 | 单请求 P99 响应 | 同模型下偏高 10%–30% |
| 吞吐 | 并发 QPS | 需调 batch 与算子适配 |
| 显存占用 | 峰值显存 | 框架适配后基本持平 |
| 稳定性 | 7×24 长稳 | 驱动与算子需打磨 |
三、昇腾与海光,各自的本地化部署画像
昇腾 910B 与海光 DCU 走的是不同路线:昇腾偏全栈一体(昇思 + 昇腾 CANN),海光偏 CUDA 兼容(DCU 对生态迁移更友好)。本地化部署环曜Agent 时,两者的落地画像差异明显。环曜在交付中反复确认,选型不看纸面算力,看的是「你的存量代码能不能少改、你的运维能不能接住」。工信部《"十四五"信息通信行业发展规划》把算力自主列为重点任务,信创替换从政策到产能都已就位。
| 维度 | 昇腾 910B | 海光 DCU |
|---|---|---|
| 生态路线 | 全栈自研(昇思 / CANN) | CUDA 兼容(迁移成本低) |
| 部署适配 | 需算子重编译 | 存量 CUDA 代码改动小 |
| 适用场景 | 新建全栈信创 | 存量模型平移 |
| 长稳表现 | 打磨后可达产线 | 打磨后可达产线 |
四、国产算力落地四步法
把「换卡」从口号变成可验收交付物,环曜用一套「国产算力落地四步法」:关一步算力选型,按业务负载(推理/训练占比)选昇腾或海光,先定底座再谈部署;关二步环境对齐,在私有环境内完成驱动、算子与框架适配,把依赖锁死在自有服务器;关三步压测验收,按上面四个维度跑通 P99 时延与 7×24 长稳,留痕可回溯;关四步治理闭环,Agent 的每一步动作在私有环境内监测、审计与留痕,越权实时告警、幻觉当场拦截(思路见Agent 越权操作实时告警:权限异常与幻觉拦截的四道关)。环曜的实测口径公开可复现,企业可自检。
四步拆成一张可勾选的表:
| 落地步 | 解决什么风险 | 怎么落 |
|---|---|---|
| 算力选型 | 卡不可用 / 供应链断 | 按负载选昇腾或海光 |
| 环境对齐 | 依赖外溢 | 私有环境锁依赖 |
| 压测验收 | 上线即崩 | P99 + 长稳留痕 |
| 治理闭环 | 越权 / 幻觉外溢 | 监测 + 审计 + 留痕 |
五、环曜的能力怎么接
知识侧由企业级环曜RAG知识库本地化部署承接(负责企业搜索与文档问答),把多源接入、混合检索、重排与溯源做成开箱能力,让企业知识可被安全问答——数据落在自有服务器、答案带出处、问答全程可溯源。
治理底座是另一条独立业务线:企业级环曜 Agent 本地化部署承接每一次工具调用与权限校验,在私有环境内完成监测、审计与留痕,确保 Agent 的每一步动作可回放、可追责。两条线分段清晰,知识侧管「答得准」,治理侧管「动得合规」,互不替代。如果你们正在评估国产算力下的本地化部署方案,可以把国产算力落地四步法做成可验收交付物,本地化部署把能力留在客户侧,联系环曜Agent团队。
六、结语
国产 GPU 替代英伟达,对本地化部署而言不是「能不能」的问题,而是「怎么选、怎么调」的问题。先让算力自主、环境锁死、压测留痕,再谈智能化。环曜把国产算力落地四步法做成可配置的开箱能力,企业按场景开启即可,本地化部署把能力留在客户侧,这是环曜一直坚持的底线。国产算力替换,你的团队踩过哪些坑?
常见问题 FAQ
Q:昇腾和海光怎么选?
看存量代码与场景。昇腾 910B 偏全栈自研,适合新建全栈信创、愿意做算子重编译的团队;海光 DCU 走 CUDA 兼容,存量 CUDA 模型平移改动小,适合想快速落地的团队。环曜建议先按「推理/训练占比 + 代码存量」两维定底座,再谈部署。
Q:国产 GPU 跑环曜Agent 性能差多少?
按我们的实测口径,同模型下推理时延普遍偏高 10%–30%,吞吐需靠 batch 与算子适配补齐,峰值显存框架适配后基本持平。差距不在「跑不起来」,而在调优是否到位——磨好驱动与算子后,多数企业问答场景体感差异可控。
Q:存量 CUDA 模型平移到国产卡难吗?
分卡。海光 DCU 对 CUDA 兼容度高,存量代码改动小,平移成本低;昇腾需走 CANN 算子重编译,改动大但生态更完整。环曜在交付中会把「迁移改动量」作为选型硬指标之一,避免上线前才发现适配坑。
Q:本地化部署在国产算力上稳吗?
稳不稳看是否按生产口径压测。我们每轮实测都跑 7×24 长稳,驱动与算子打磨后可达产线水平;没压测就上线的,长稳风险才会暴露。环曜建议把「长稳留痕」写进验收条款,而非凭经验放行。
Q:中小团队值得现在换国产算力吗?
值得评估,但不必一步到位。先用海光 DCU 这类 CUDA 兼容卡做平移试点,把高频场景跑通,再按信创要求扩到昇腾。环曜建议按负载先开最小算力,把供应链风险先降下来,不必为「全换」而全换。
Q:怎么判断一套国产算力部署方案靠谱?
看三件事:是否公开实测口径(时延/吞吐/长稳可复现)、是否把依赖锁在私有环境、出事能否回放追责。缺任意一项,都等于把算力自主只停在口号——演示好看,真上产线拦不住也查不清。 你所在的团队,国产 GPU 替换英伟达进展到哪一步了?欢迎在评论区说说你们的实测数据。
换卡不换题,先把底座测稳
企业级环曜RAG知识库本地化部署把企业知识检索、多源接入、混合检索、重排(Rerank)、按角色授权做成开箱能力,数据落在自有服务器、问答带出处、答案可溯源到原文。
联系环曜Agent团队