新闻

DeepSeek整顿AI圈,GPU增长焦虑如何解?

by 2025-02-17 11:00:09

价格亲民的DeepSeek-V3及R1分别在2024年12月和2025年1月上线,随之而来,全球最大数据中心GPU供应商英伟达的股价和市值应声下挫。根据Stock Analysis数据,以月为单位,英伟达市值在2024年12月和2025年1月分别下降2.86%和10.59%。当地时间1月27日,英伟达股价较上一个交易日(1月24日)下跌近17%,市值蒸发5920亿美元。

尽管2月英伟达市值回调,其股市际遇仍值得警醒。2024年(nián)以(yǐ)来(lái),资(zī)本(běn)市(shì)场(chǎng)对(duì)英(yīng)伟(wěi)达(dá)信(xìn)心(xīn)满(mǎn)满(mǎn),上(shàng)一(yī)次(cì)市(shì)值(zhí)跌(diē)去(qù)双(shuāng)位(wèi)数(shù),还(hái)是(shì)2023年(nián)9月(yuè)。去(qù)年(nián)11月(yuè),英(yīng)伟(wěi)达(dá)一(yī)度(dù)取(qǔ)代(dài)苹(píng)果(guǒ)成(chéng)为(wèi)全球(qiú)市(shì)值(zhí)第(dì)一(yī)的(de)上(shàng)市(shì)公(gōng)司(sī)。这(zhè)份(fèn)信(xìn)心(xīn),为(wèi)何(hé)出(chū)现(xiàn)了(le)动(dòng)摇(yáo)?

在OpenAI推出的ChatGPT卷起AIGC浪潮之初,大模型的参数规模与GPU的集群规模深度绑定。Omdia分析称,微软在2024年购买了48.5万块英伟达Hopper GPU,OpenAI o1大模型就是在微软Azure的AI基础设施训练。Meta在2022年构建了16000块英伟达A100组成的算力集群,以支持Llama和Llama2大模型的发展,又在2024年3月宣布建设两个由24576块英伟达H100 GPU组成的集群,以训练Llama3。

如此高昂的训练成本,对于大模型厂商的ROI(投资回报(bào)率(lǜ))是(shì)一(yī)个(gè)巨(jù)大(dà)的(de)考(kǎo)验(yàn)。有(yǒu)报(bào)道(dào)称(chēng),OpenAI预(yù)计(jì)2024年(nián)营(yíng)收(shōu)37亿(yì)美(měi)元(yuán),亏(kuī)损(sǔn)50亿(yì)美(měi)元(yuán)。红(hóng)杉(shān)资(zī)本(běn)投(tóu)资(zī)人(rén)曾(céng)估(gū)计(jì),2023年(nián)人(rén)工(gōng)智(zhì)能(néng)行(xíng)业(yè)在(zài)用(yòng)于(yú)训(xun)练(liàn)先(xiān)进(jìn)人(rén)工(gōng)智(zhì)能(néng)模(mó)型(xíng)的(de)英(yīng)伟(wěi)达芯片上花费了500亿美元,但仅带来30亿美元的收入。因而,对于大模型开发商来说,除了拓展服务场景以提升盈利能力,如何降低大模型的训练和部署成本同样关键。

这也是为什么DeepSeek-V3一经推出,就备受市场青睐——它让业界看到了大模型训练从“GPU堆料”走向“精耕细作”的可能性。

具体来看,6710亿参数的DeepSeek-V3在配备2048块英伟达H800 GPU的集群上训练,整个训练流程用时278.8万个H800 GPU小时,总成本为557.6万美元(按照每GPU小时2美元的租用价格计算)。在GPU用量、训练用时、算力成本上,较同等性能的闭源模型大幅缩减。

之所以能用如此少量的计算资源完成大规模参数量的训练,得益于DeepSeek团队对算法、训练框架和硬件的优化协同。

从架构来看,DeepSeek-V3沿用了在DeepSeek-V2进行验证的多头潜在注意力(MLA)和DeepSeek MoE进行具有成本效益的训练。多头潜在注意力机制通过将键值(KV)缓存压缩为潜在向量,显著降低了计算成本,加快了推理速度并提高了吞吐量。同时,专家混合(MoE)架构通过稀疏计算实现高效推理。

在训练精度上,Deepseek-V3支持FP8计算和存储,在加快训练速度的同时,减少了对GPU内存的使用。

在训练框架上,Deepseek-V3团队打造了HAI-LLM框架,并进行了细致的工程优化。首先是设计了DualPipe(双管道)算法以(yǐ)实(shí)现(xiàn)高(gāo)效(xiào)的(de)管(guǎn)道(dào)并(bìng)行(xíng),并(bìng)实(shí)现(xiàn)了(le)计(jì)算(suàn)和(hé)通(tōng)信(xìn)重(zhòng)叠(dié)(而(ér)不(bù)是(shì)按(àn)照(zhào)串(chuàn)行(xíng)模(mó)式(shì),完(wán)成(chéng)计(jì)算(suàn)再(zài)进(jìn)行(xíng)通(tōng)信(xìn)),从(cóng)而(ér)解(jiě)决(jué)了(le)跨(kuà)节(jié)点(diǎn)专(zhuān)家(jiā)并(bìng)行(xíng)带(dài)来(lái)的(de)巨(jù)大(dà)通(tōng)信(xìn)开(kāi)销(xiāo)问(wèn)题(tí)。其(qí)次(cì)是(shì)开发了跨节点全对(duì)全通(tōng)信(xìn)内(nèi)核(hé),使(shǐ)InfiniBand(IB)和(hé)NVLink的(de)通(tōng)信(xìn)充(chōng)分(fēn)重(zhòng)叠(dié),仅(jǐn)需(xū)20个(gè)流(liú)式(shì)多(duō)处(chù)理(lǐ)器(qì)就(jiù)能(néng)充(chōng)分(fēn)利(lì)用(yòng)IB和(hé)NVLink的(de)带(dài)宽(kuān)。其(qí)三(sān)是(shì)优(yōu)化了内存占用,在不使用成本高昂的张量并行的情况下,也能够训练DeepSeek-V3。

训练成本的压缩,使DeepSeek能够提供远低于其对标的闭源模型(DeepSeek-V3性能比肩GPT-4o, DeepSeek-R1性能对标OpenAI o1)的API服务价格。

记者计算得知,DeepSeek-V3的每百万输入tokens价格约为GPT-4o的5.5%(缓存命中)/11%(缓存未命中),每百万输出tokens价格约为GPT-4o的11%。DeepSeek-R1的每百万输入tokens价格约为OpenAI o1的1.8%(缓存命中)/3.7%(缓存未命中),每百万输出tokens价格约为OpenAI o1的3.7%。

DeepSeek与对标的OpenAI模型API价格对比

640 - 2025-02-17T104339.214.png

来源:中国电子报根据DeepSeek、OpenAI官网报价整理,以2月14日汇率为准

GPU规格和用量降下来了,大模型价格也便宜了,这对于产业界来说是一个好消息,对于尖端GPU厂商来说,则带有一些不确定性。

首先,云厂商和数据中心厂商在过去两年“买爆”英伟达,很大程度上是为大模型的训练、部署和运行提供基础设施,可一旦MoE、小模型等更具成本效益的模型流行开来,头部买家能否持续现有的GPU采购量,要打一个问号。

其次,大模型训练使用的GPU向来由英伟达独占鳌头,但若算力投入不再高企,其他厂商也有了分一杯羹的机会。目前,龙芯中科、昆仑芯、燧原科技、华为昇腾、海光信息、天数智芯、奕斯伟等多家国产芯片企业宣布与DeepSeek适配。

再次,降低训练开销的可能性,也让广大GPU买家开始将目光转向(xiàng)其(qí)他(tā)架(jià)构(gòu)——尤(yóu)其(qí)是(shì)自(zì)家(jiā)研(yán)发(fā)的(de)ASIC芯(xīn)片(piàn),以(yǐ)增(zēng)加(jiā)硬(yìng)件(jiàn)收(shōu)入(rù)、增(zēng)强(qiáng)云(yún)服(fú)务(wu)的(de)整(zhěng)体(tǐ)性(xìng)并(bìng)提(tí)升(shēng)客(kè)户(hù)粘(zhān)性(xìng)。

以全球最大的云服务厂商亚马逊AWS为例,2月12日,亚马逊AWS宣布已于1月上线DeepSeek系列大模型,用户可以使用亚马逊云科技自研芯片Trainium和Inferentia通过Amazon EC2或者Amazon SageMaker部署DeepSeek-R1蒸馏模型,规模从15亿参数的Qwen蒸馏模型到706亿参数的Llama蒸馏模型不等。亚马逊自研芯片的一个重要目标就是降低训练成本,与基于GPU的同类实例相比,Trainium芯片支持的Amazon EC2Trn1实例,可节省50%的训练成本。

OpenAI也在近期再传自研芯片的消息。据悉,OpenAI将在年内完成首款自研芯片设计,计划采用台积电3nm工艺制造。

此外,LPU(语言处理器)受到市场关注,采用RISC-V指令集的AI SoC也实现了与DeepSeek的适配。

当然,也有观点认为,DeepSeek对算力产业是长期利好。

比如,在英伟达市值蒸发5920亿美元的那个交易日,微软CEO萨提亚·纳(nà)德(dé)拉(lā)(Satya Nadella)在(zài)社(shè)交(jiāo)媒(méi)体(tǐ)平(píng)台(tái)表(biǎo)示(shì):“杰(jié)文斯(sī)悖(bèi)论(lùn)再(zài)次(cì)应(yīng)验(yàn)!随(suí)着(zhe)人(rén)工(gōng)智(zhì)能(néng)变(biàn)得(de)更(gèng)高(gāo)效(xiào)、更(gèng)易(yì)用(yòng),我(wǒ)们(men)会(huì)看(kàn)到(dào)其(qí)使(shǐ)用(yòng)量(liàng)急(jí)剧(jù)飙(biāo)升(shēng),它(tā)会(huì)变(biàn)成(chéng)一(yī)种(zhǒng)我(wǒ)们(men)怎(zěn)么都用不够的大众资源。”

杰文斯悖论是一种经济学理论,主张当技术进步提高了资源使用的效率,即减少资源使用的数量,但成本降低导致需求增加,令资源消(xiāo)耗(hào)的(de)速(sù)度(dù)不(bù)减(jiǎn)反(fǎn)增(zēng)。

这(zhè)套(tào)逻(luó)辑(ji),当(dāng)然(rán)也(yě)适(shì)用(yòng)于(yú)算(suàn)力(lì)。既(jì)然(rán)DeepSeek等(děng)MoE模(mó)型(xíng)降(jiàng)低(dī)了(le)单(dān)个(gè)大(dà)模(mó)型(xíng)训(xun)练(liàn)所(suǒ)需(xū)的(de)算(suàn)力(lì)开(kāi)销(xiāo),使(shǐ)大(dà)模(mó)型(xíng)更(gèng)具(jù)性(xìng)价(jià)比(bǐ),就(jiù)会(huì)加速大模型的落地开花。如果各行各业部署大模型的积极性提升,从长远来看,对算力的整体需求就有较为充足的上升空间,自然利(lì)好(hǎo)GPU等(děng)算(suàn)力(lì)芯(xīn)片(piàn)的(de)发(fā)展(zhǎn)。

只(zhǐ)是(shì)这(zhè)杯(bēi)羹(gēng),不(bù)一(yī)定(dìng)再(zài)由(yóu)英(yīng)伟(wěi)达(dá)的(de)尖(jiān)端(duān)GPU独(dú)占(zhàn),算(suàn)力(lì)需(xū)求(qiú)带来的利润洪流,也未必再被CUDA这道大坝截留。

在DeepSeek-V3的技术报告中,DeepSeek团队向人工智能硬件供应商提出了芯片设计建议,包括提高张量核心中FP8通用矩阵乘法的累加精度、支持分块和块级量化等。对于芯片企业来说,除了持续提升芯片性能,能够与大模型开发团队进行紧密协作、将工程化做好做精,会更有机会在“效率至上”的训练竞赛中站到前排。