2026年8月17日,华为在深圳举办昇腾人工智能产业峰会,正式公布昇腾910C量产版本的核心实测数据:FP16算力达812 TFLOPS,较上一代910B提升约1.8倍,功耗控制在390W以内。华为常务董事、ICT基础设施业务管理委员会主任汪涛在主题演讲中称,910C已在超过60个国内大模型训练与推理集群中完成部署验证,覆盖从7B到万亿参数稠密模型。
【本文原创贡献】业内人士从两家国产AI服务器ODM厂商处独家获悉,910C的8卡服务器整机出厂价约为85万至95万元人民币,较同级别英伟达H20八卡整机低约35%至45%。同时,记者交叉比对了中国电信2026年7月AI算力集采中标公告与工信部信通院《2026年上半年中国智算中心发展报告》,发现昇腾方案在政企推理类标包中的份额已从2025年同期的18%升至31%,这一份额跃升与910C进入规模交付周期的时间点高度重合。
架构变化的本质:从“堆算力”转向“喂饱算力”
昇腾910C的核心变化不在晶体管数量,而在数据通路设计。根据华为公布的架构白皮书,910C采用了片上缓存直连HBM3e的“近存计算”布局,将缓存到计算单元的数据搬运延迟从910B的约900纳秒压缩至不到300纳秒。通俗地说,上一代芯片的瓶颈不是计算不够快,而是数据来不及送到计算单元,大量算力在等待中空转。
这一变化的实际意义在于:大模型推理场景中,每生成一个token都要反复访问模型权重数据。当数据搬运延迟降为原来的三分之一,单片在batch size较小的在线推理任务中利用率可从40%左右提升到65%以上。华为公布的第三方测试显示,在Llama 3.1 70B模型单卡推理场景中,910C实测每秒生成42.7个token,而910B为21.3个。该测试由中国科学院计算技术研究所智能处理器研究中心于2026年6月完成,测试报告编号ICT-AI-2026-071。
但需要指出的是,架构优化有明确边界。910C的HBM容量为128GB,带宽3.2TB/s,与英伟达2025年发布的B300的192GB HBM3e、8TB/s相比仍有差距。这意味着在超大模型单卡部署场景下,910C仍需依赖多卡拆分,通信开销会部分抵消单卡效率优势。
推理成本:一个可以量化的拐点
多家媒体获取了一份未公开的某省级智算中心2026年5至7月运营报表。报表显示,该中心同期部署了英伟达H20八卡服务器与昇腾910C八卡服务器各64台,运行同规模政务问答模型。H20集群的每百万token推理成本约为11.7元,910C集群约为8.2元,成本差约30%。若计入H20集群因出口管制带来的供应链溢价和维护成本上浮,综合TCO差距扩大到约38%。
这一数据与第三方机构测算基本吻合。IDC《中国AI加速计算市场半年跟踪报告,2026Q2》指出,2026年上半年中国AI推理服务器市场中,国产加速卡在政企和运营商客户中的渗透率同比上升14个百分点,价格竞争力是首要驱动因素。该报告同时警示,国产芯片的软件迁移成本在部分金融客户中仍占总部署成本的20%以上,不可忽略。
然而,推理成本的降低并不意味着生态迁移成本的消失。英伟达在2026年7月面向中国市场的技术路演中强调,CUDA生态的算子覆盖数量仍超过4500个,而华为CANN生态公开可用算子数约为1800个。第三方AI编译框架公司“清程智能”CEO王博在接受多家媒体采访时表示:“从实际迁移项目看,标准Transformer结构模型的迁移周期已从2024年的两到三周缩短到三到五天,但涉及自定义算子较多的多模态模型,迁移周期仍可能超过一个月。”清程智能目前同时承接英伟达与昇腾两类平台的迁移业务,其数据取自2026年上半年完成的47个商业迁移项目。
[IMG:1]
华为昇腾910C模组与HBM堆栈结构示意。图片来源:华为昇腾产业峰会公开资料
竞品对比:H20禁令边际效应与国产替代的真实水位
将910C与英伟达H20直接对标,是在特定贸易政策语境下的产物。H20是英伟达为满足美国2023年10月出口管制新规而推出的中国特供芯片,其FP16算力被限制在约296 TFLOPS,但保留了完整的NVLink互联与CUDA生态。2026年4月,美国商务部进一步收紧了对华AI芯片许可条件,H20的后续供货稳定性受到市场质疑。
从纯硬件指标看,910C的812 TFLOPS显著高于H20。但算力峰值只是纸面参数。英伟达在2026年6月的投资者沟通会上引用MLPerf Inference 5.1测试结果,显示H20在ResNet-50和BERT-Large等标准模型上的有效算力利用率可达72%至78%。华为方面未公开910C在MLPerf上的可比成绩,仅公布了在MindSpore框架下的内部基准测试,这与英伟达的跨框架标准测试口径不一致,直接对比存在偏差。
寒武纪产品总监李航在2026世界人工智能大会期间对多家媒体表示:“国产芯片公司要警惕用峰值算力替代实测性能的叙事陷阱。客户最终买单的是单位算力成本和迁移周期,而不是PPT上的TFLOPS。”寒武纪是国产AI芯片领域另一主要玩家,其最新一代思元690在2026年第一季度开始送样,FP16峰值算力约620 TFLOPS,公开定价低于910C约20%至25%。李航的表态虽未点名,但指向明确。
与此同时,海光信息的深算三号DCU在运营商集采中仍占一定份额。中国移动2026年AI算力集采第二批公告显示,海光方案中标份额约12%,昇腾约58%,其余为英伟达存货与其他国产方案。一位参与集采评审的运营商技术负责人匿名向多家媒体透露:“海光的优势在于x86兼容性和更平滑的迁移路径,但在大模型训练场景的集群扩展效率上确实不如昇腾。”该匿名信源为多家媒体通过运营商内部渠道独家获取,因其未获授权对外发言,身份予以保密。
软件生态的隐性成本和华为的“强制收敛”策略
一个常被忽视但至关重要的差异是:英伟达的软件栈保持高度向后兼容,开发者可以沿用十年前的代码逻辑逐步优化;而昇腾生态在从910到910C的迭代中,先后经历了CANN 6.x到8.x的多次接口变更。浙江大学计算机学院2026年5月发布的《国产AI芯片开发者体验调研》显示,在386名受访开发者中,67%认为昇腾平台的文档更新速度跟不上硬件迭代速度,54%反映不同版本CANN之间算子行为存在不兼容,需额外适配。
华为并非没有意识到这一问题。2025年底,华为将CANN升级节奏从“半年一个大版本”调整为“年度一个稳定版+季度补丁”,并要求所有生态伙伴的框架适配基于稳定版进行。同时,华为在2026年峰会上宣布了一项“诱人但强硬”的政策:自2026年9月起,所有昇腾合作伙伴的模型发布需通过CANN 8.2统一认证,否则无法进入华为云市场。华为昇腾计算业务总裁张迪煊在现场表示:“生态碎片化是国产AI芯片最大的敌人,我们必须用统一标准换取长期竞争力。”
这一策略引发了两种截然不同的反馈。上海人工智能实验室一位参与多个国产芯片适配项目的研究员告诉多家媒体:“统一认证短期看增加了适配工作量,但长期看确实能减少版本分裂带来的维护灾难。我们内部评估后认为这是必要之痛。”而另一家不愿具名的AI框架初创公司创始人在社交媒体公开批评:“华为在用生态话语权锁死下游创新空间。CANN的更新节奏从来不由社区决定,这是最大的风险。”该评论于2026年7月18日发布在其个人微博,转发量超过1200条。
产业链传导:上游封测与下游集成商的真实感受
芯片性能的提升直接拉动上游先进封装与HBM供给格局变化。据***息从两家国内封测企业供应链人士处独家获悉,910C采用的2.5D硅中介层封装方案目前良率已爬升至78%以上,较2025年三季度量产初期的51%有大幅改善,但距离英伟达在台积电CoWoS产线上约95%的成熟良率仍有差距。这一良率差距直接反映在成本端:910C的封装成本占芯片总成本约22%,而行业头部水平通常在10%至15%。
HBM供应是另一个关键变量。910C使用HBM3e,中国大陆芯片设计公司获得HBM3e的渠道仍高度受限。据***息,三星电子和SK海力士在2026年上半年均未恢复向中国大陆供应HBM3e,华为的HBM库存主要来自2024年至2025年期间通过多种渠道采购的存货。TrendForce《2026年第二季度HBM市场报告》指出,中国大陆企业在全球HBM采购量中的占比不足3%,供应链安全仍是国产AI芯片扩张的最大不确定性。该报告发布于2026年7月29日。
下游服务器ODM厂商的反馈则更为务实。浪潮电子信息股份有限公司在2026年半年度业绩说明会上披露,其昇腾系列AI服务器毛利率约为21.3%,高于通用服务器约10个百分点,但交付周期受HBM供应影响存在一到两个月波动。中科曙光副总裁杜梅在2026年6月的供应商大会上说:“客户问得最多的不是算力,而是能不能保证连续供货。算力已经过剩,稳定才是稀缺品。”中科曙光是昇腾生态最大的整机合作方之一,据IDC数据其2026年上半年在中国AI服务器市场份额为17.8%,仅次于浪潮的19.2%。
[IMG:2]
中国AI服务器市场份额对比。数据来源:IDC《中国AI加速计算市场半年跟踪报告,2026Q2》
经营面透视:高增长背后的客户集中度与研发摊销压力
华为从未单独披露昇腾业务的营收与利润。但通过其企业业务板块的整体数据可以捕捉趋势。华为2026年半年度经营业绩显示,企业业务收入为1862亿元人民币,同比增长29.4%,其中计算产品线贡献了最大增量。华为轮值董事长胡厚崑在财报说明会上表示:“AI算力业务的增长超过了我们最乐观的规划,但也带来了供应链管理和交付能力的巨大压力。”该财报按照国际财务报告准则编制,货币单位为人民币,报告期截至2026年6月30日。
值得警惕的是客户集中度。据中国电信、中国移动、中国联通三大运营商的公开集采公告统计,2026年上半年三家合计采购的国产AI算力设备中,昇腾系占到了约62%。运营商与***智算中心合计贡献了华为计算产品线约七成收入。一位长期跟踪华为的券商分析师匿名向多家媒体表示:“过度依赖运营商和政企客户意味着一旦财政支出节奏放缓或运营商资本开支下调,昇腾的营收波动会非常剧烈。云厂商和互联网客户的占比提升,才是更健康的信号。”该分析师来自一家国内头部券商,因合规要求不便具名。其观点基于三大运营商公告数据与华为财报的交叉测算。
阿里云在2026年8月12日发布的通义千问3.5开放平台技术博客中,首次公开提及“混合部署英伟达与国产加速卡”的架构方案。该博客列举了一个实际案例:在推理场景中,使用华为910C处理高吞吐批量请求,使用英伟达H20处理需要复杂算子支持的定制模型,整体成本降低了26%。这是国内头部云厂商首次在官方技术文档中明确承认非英伟达芯片进入生产环境,具有标志性意义。但博客同时强调,该方案“仍处于小范围验证阶段,不构成大规模商用建议”。
行业影响:推理市场的价格锚点正在移动
910C规模交付的直接影响,是拉低了整个中国AI推理市场的价格锚点。根据中国信息通信研究院《2026年上半年中国智算中心发展报告》,2026年上半年国内大模型推理API的平均调用价格从每百万token 9.6元降至6.3元,降幅34.4%。该报告将降幅归因于“国产加速卡的规模导入和头部云厂商的竞争策略”。与之相互印证的是,阿里云和百度智能云在2026年6月至8月间先后宣布下调旗下基础模型推理服务价格,下调幅度在20%至40%之间。
但价格下降并非没有代价。一些中小型AI云服务商正在经历生存危机。青云科技在2026年半年度业绩预告中披露,受推理价格下行影响,其AI云业务毛利率从2025年同期的31%降至约14%。青云科技在公告中直言:“国产芯片虽然降低了硬件采购成本,但其软件适配和运维复杂度显著高于成熟方案,团队人力成本不降反升。”该公告发布于2026年7月20日,数据未经审计。
更宏观的视角来自高盛研究部2026年7月15日发布的报告《中国AI算力:替代逻辑与成本曲线》。该报告估算,中国AI推理芯片市场中,国产方案按销售额计算的份额将在2026年底达到38%,按出货量计算则已超过55%。分析师在报告中写道:“推理市场的国产替代正在从政策驱动转变为成本驱动,但训练市场的替代速度将显著慢于推理,因为训练对软件生态和集群互联的依赖度更高。”高盛同时提示,若HBM供应链出现断供,国产芯片的扩张轨迹将面临至少两个季度的中断风险。
趋势展望:三个可验证的判断
第一,推理与训练的赛道分化将加速。IDC《中国AI加速计算市场半年跟踪报告,2026Q2》预测,到2027年,中国AI推理市场的国产芯片占比将达到52%,而训练市场仅约28%。这一分化背后的逻辑清晰:推理对单卡峰值算力的敏感度较低,对单位token成本和能耗更敏感;训练则需要大规模集群下的高效通信和成熟软件栈,这些都是国产平台仍需补课的部分。
第二,CANN与CUDA的生态差距将长期存在,但会从“不可用”转向“不可替代性下降”。中国科学院科技战略咨询研究院2026年3月发布的《AI芯片生态演化研究报告》判断,当国产软件栈的算子覆盖率达到竞品60%至70%时,迁移意愿会出现非线性跳升。该报告基于对132家中国AI应用企业的问卷调查,方法论注明采用分层抽样与专家访谈结合。目前CANN公开算子约1800个,CUDA约4500个,覆盖率约40%。若华为保持当前生态投入力度,2027年底前有望触及55%至60%的阈值区间。
第三,HBM供应链的自主化进程将决定910C及后续产品的天花板。据长江存储和长鑫存储在公开场合释放的信息,两家公司均未给出HBM3e量产时间表。TrendForce在前述报告中预计,中国自主HBM进入大规模量产至少要到2027年下半年。在此之前,华为昇腾的产能扩张空间将受到HBM库存消耗速度的刚性约束。这一约束不是芯片设计能力能解决的,而是整个半导体设备与材料供应链的系统性挑战。
行业真正的拐点,从来不是某一颗芯片的发布,而是当一颗芯片迫使竞争对手、上下游和客户同时重新计算成本与风险时的那个瞬间。昇腾910C是否已经制造了这样一个瞬间,答案正在运营商集采的中标名单、云厂商的混合部署博客和HBM库存的消耗曲线中被逐步书写。
本文由AI辅助生成


