Bitget App
交易“智”变
快捷买币行情交易合约理财广场更多
英伟达开源战略升级:从"支持者"到"构建者",计划亲自打造全球顶尖开源AI模型

英伟达开源战略升级:从"支持者"到"构建者",计划亲自打造全球顶尖开源AI模型

华尔街见闻华尔街见闻2026/08/12 01:58
作者:华尔街见闻

英伟达斥数十亿美元训练万亿参数开放大模型Nemotron 4,表面"不务正业",实则暗藏商业逻辑:模型免费,算力收费。通过免费模型吸引企业、政府和开发者部署AI,推动GPU、网络、软件全栈消费。此举还有助于分散客户集中风险,对抗大客户自研芯片威胁。同时,亲自训练前沿模型可提前发现硬件瓶颈,反哺下一代芯片设计。

英伟达正悄然完成一次战略身份转变,从开源AI生态的"支持者"升级为亲身下场的"构建者"。

华尔街见闻提及,8月11日,据The Information报道,英伟达希望下一代Nemotron 4跻身全球最强开放模型之列。

参与项目的员工预计,最大版本至少拥有1万亿个总参数,约为6月发布的Nemotron 3 Ultra的两倍。

模型的预训练数据和架构已有初步决定,但最终规格、发布时间尚未确定,最关键的一轮训练也还没有开始。所谓“万亿参数Nemotron 4”,目前仍是一项研发计划,不能当作已经发布的产品。

这场投入很容易被理解成英伟达也想成为OpenAI或者Anthropic,但实际上英伟达无须靠Nemotron的API收费收回成本。

只要免费模型让更多企业、政府和创业公司开始训练、微调和部署AI,英伟达便能在GPU、NVLink网络、整机系统、CUDA以及企业软件上逐层收费。

Nemotron 4更像一台算力需求发生器:模型免费,使用模型所需的计算并不免费。

英伟达需要把买家从少数巨头扩散到整个市场

眼下的GPU繁荣异常集中。

英伟达截至4月26日的10-Q显示,三个直接客户分别贡献当季收入的21%、17%和16%,合计54%;公司还披露,一家AI研究与部署企业通过云服务间接贡献了“有意义的收入”。

这类直接客户可能是整机商、分销商或云厂,不能简单等同于三家最终用户,但客户集中风险已经写在账面上。

更麻烦的是,大客户同时在造英伟达的替代品:

  • 亚马逊AWS用Trainium承接Anthropic的训练和推理,官方称已有接近100万颗Trainium 2服务Claude;
  • 谷歌的Ironwood TPU面向大规模训练和推理;
  • AMD也用MI350和ROCm争夺开放模型负载。

闭源模型把需求集中在几家实验室和云平台,它们规模巨大、议价能力强,还有动力把成熟而稳定的工作负载迁往自研芯片。

对英伟达而言,最安全的市场形态并非某一家模型公司统治AI,而是成千上万个互不相同的模型和应用同时生长。需求越分散,客户越难用一款定制ASIC覆盖所有架构;工作负载变化越快,通用GPU和CUDA成熟的软件生态越占便宜。

这也解释了英伟达为什么不能只在口头上支持开放生态。一个远落后于闭源模型的开放模型,只能吸引研究试验,很难让银行、制造商、政府部门为生产集群开预算。

模型必须足够强,强到企业愿意用自己的数据继续训练,强到客户愿意把高频工作流交给它,开放模型才会从开发者下载量变成机房里的GPU利用率。

万亿参数的作用在这里。它不是一枚证明智能水平的奖章,而是英伟达争取跨过企业可用门槛的一种手段。

现有Nemotron 3 Ultra拥有5500亿个总参数、每个token激活550亿参数,支持最长100万token上下文。

英伟达公布的测试显示,它在部分任务上接近其他头部开放模型,推理吞吐量则明显更高。但The Information援引第三方榜单称,它仍落后于最强的中国开放模型,在全球综合模型中也远非第一梯队。

所以,参数规模只能说明野心,不能代替成绩。

稀疏MoE架构中,总参数与每次推理实际调用的参数相差很大,数据质量、训练token、后训练、工具调用能力和推理系统共同决定最终效果。

Nemotron 4若只有“1万亿”这个好看的数字,却没有进入真实任务的第一梯队,它很难改变任何采购决定。

一款免费模型,可以卖出一整座AI工厂

英伟达已经把转化路径铺好:

  1. 开放的Nemotron提供模型权重、数据和训练配方;
  2. 企业用NeMo做继续预训练、微调、强化学习和评测;
  3. 部署时再接入NIM推理微服务、TensorRT-LLM和CUDA;
  4. 规模扩大后,算力落到DGX Cloud、公有云GPU或者企业自建的HGX/DGX集群。
  5. GPU之外,NVLink、InfiniBand或Spectrum-X网络、CPU、DPU和NVIDIA AI Enterprise订阅也进入账单。

这条路径已经出现早期样板。Palantir把Nemotron带入美国政府的隔离网络,客户可以在本地基础设施上训练、保留模型权重并持续迭代,生产部署由NVIDIA AI Enterprise支持。

日本市场则更接近“主权AI”模板:研究机构和企业用Nemotron数据及NeMo训练日语模型,HGX B300承担私有基础设施,Jetson负责边缘部署。

闭源API进不了隔离网络,也很难满足数据驻留、模型所有权和本地审计要求。开放模型把这些原本不会发生在公共云API上的负载带进政府机房、企业数据中心、区域AI云和边缘设备。

对模型公司来说,这是一个较分散、较难收费的市场;对出售基础设施的英伟达来说,每多一个部署地点,就多了一处硬件和软件收入入口。

模型路由让这盘生意更大。The Information报道英伟达在推出Nemotron 3.5 Lightning的同时,发布了免费的模型路由软件。路由器会把简单任务交给便宜的小模型,把少数困难任务交给大模型。

表面看,它在帮助客户少用昂贵算力;实际的赌注是,当单次任务成本降下来,企业会启动更多常驻智能体,让一次问答变成包含规划、搜索、工具调用、验证和返工的连续流程。

Gartner预计,到2030年,万亿参数模型的推理成本会比2025年下降90%以上,但智能体每项任务消耗的token可能是普通聊天机器人的5至30倍;如果token用量增长快于单价下降,推理总支出仍会上升。

英伟达押注的并非“大模型越昂贵,GPU卖得越多”,而是“智能越便宜,使用量扩张得越快”。Nemotron同时覆盖轻量模型、旗舰模型和路由工具,正是在主动制造这种价格下降后的需求弹性。

做模型也是为了把下一代芯片提前做对

Nemotron还有一层不直接体现在模型收入里的价值:它是英伟达自己的全栈压力测试。

芯片公司若只等客户模型定型,再去适配新的注意力机制、MoE路由、长上下文和低精度格式,硬件迭代会永远慢半拍。

亲自训练前沿模型,工程团队能更早看到算力、显存、互联、数据吞吐和推理调度的瓶颈,再把这些发现写进下一代GPU、NVLink和软件库。

Nemotron 3 Ultra已经带有很强的“硬件共设计”痕迹:模型使用混合Mamba-Attention与MoE架构,预训练采用为Blackwell设计的NVFP4格式,并通过多token预测提升生成速度。

英伟达称,量化后的版本可以在4张B200上部署。这样的模型既是产品,也是Blackwell低精度能力、显存体系和推理软件的演示负载。

开放之后,外部开发者又会替英伟达继续优化这套负载。

新的模型架构先在CUDA、PyTorch、vLLM、SGLang和TensorRT-LLM上跑通,优化回流到英伟达平台,后来者面对的就不再是一颗GPU的性能差距,而是一套已经被数千个项目打磨过的生产环境。

英伟达今年展示的案例中,Blackwell运行DeepSeek V4的每token成本在一个月内最多下降到原来的五分之一;多项软件优化叠加,吞吐量最高可提升20倍。

0
0

免责声明:文章中的所有内容仅代表作者的观点,与本平台无关。用户不应以本文作为投资决策的参考。

你已了解市场,是时候开始交易了!
Bitget支持一站式交易加密货币、股票和黄金等。
立即交易!

你也可能喜欢

美银:今夜CPI“下行意外”影响更大,若核心CPI意外走低或将排除9月加息

美银在CPI前瞻报告中指出,市场对通胀“下行意外”的反应将显著大于“上行意外”。若核心CPI环比录得0.1%低于预期,9月加息将基本出局,并对美债利率和美元形成双重压力;而0.3%的超预期虽将9月加息重新纳入视野,但因沃什态度存疑及8月数据尚待验证,并不能锁定结果。

华尔街见闻2026/08/12 03:20