翻页 夜间
首页 > 荡寇风云 > 中国房价称霸全球

致命魔术

撕掉 “不烧钱” 标签,DeepSeek被传最快年底IPO,大模型效率神话终抵不过资本军备赛?_我的网站

魔女的条件

A |     DeepSeek正试图撕掉自己最鲜明的标签。    想想美国的顶尖人工智能开发者吧。

B |          过去一年,在全球AI产业陷入算力军备竞赛之际,OpenAI、谷歌、Anthropic等海外巨头持续投入数十亿美元建设基础设施,而DeepSeek却凭借算法优化、模型架构创新和训练效率提升,以相对有限的资源推出R1模型,在全球范围内引发关注。         这也让DeepSeek成为AI行业中的特殊样本,它证明大模型竞争并非只能依靠巨额资本投入。他们将心血、汗水和巨额资金倾注到每一个前沿模型的新版本中。然而,他们几乎来不及喘口气,竞争对手就已经追了上来。

C | 如果只是收费的竞争对手紧追不舍,情况已经够糟了。但像Anthropic和OpenAI这样的公司还必须全力冲刺,才能勉强领先那些免费提供模型的实验室几步。         随着近期MiniMax M3、Kimi K3相继发布,DeepSeek V4也即将到来,其发展逻辑却发生变化。

D |          7月16日,中国初创公司月之暗面(Moonshot AI)发布了Kimi K3——一个仅比Anthropic和OpenAI的最新作品Fable和Sol分别略逊一筹的模型。         日前,据彭博社报道,DeepSeek已开始筹备首次公开募股(IPO),计划登陆中国内地资本市场,最快可能于2026年提交上市申请,并争取在2027年正式挂牌。         《凤凰WEEKLY财经》就相关问题询问DeepSeek,截至发稿前暂未收到回复。其参数(或称“权重”)将在本月晚些时候免费公开,这意味着它可以被下载并在任何能够运行的服务器上使用。7月19日,中国互联网巨头阿里巴巴(Alibaba)也发布了其通义千问(Qwen)模型系列新成员的预览版,该公司称其性能仅次于Fable。         “做大模型不烧钱、不依赖资本是不可能的。         根据研究公司Epoch AI的分析,最强大的开源权重模型(通常来自中国)落后于技术前沿仅几个月(见图表)。这些系统的采用正在迅速扩大。”汇生国际资本总裁黄立冲认为,DeepSeek早期所谓“不烧钱”,更多是通过技术效率降低对外部资本的依赖,并不意味着大模型本身不需要资金。5月,在热门模型市场OpenRouter上,客户使用美国顶尖实验室提供的系统量与使用中国顶尖实验室的系统量大致相当——以tokens(行业首选输出单位)消耗量计算。到了6月,美国模型的使用量增加了三分之二——但中国模型增加了两倍。

E | R1时代主要比算法效率,V4时代开始比整个资产负债表和产业链组织能力,模型越接近基础设施,企业对资本的需求就越难完全回避。         这不仅引起美国领先模型制造商的警觉,也引起美国政府的担忧,他们担心国家在AI领域失去领先地位并为黑客攻击创造新机会。         靠“省钱”已无法运营现有生态          DeepSeek曾经的崛起,本质上是一场针对AI行业高投入模式的效率探索。

F |          2025年1月,DeepSeek发布推理模型R1,在全球范围内引发关注。据说特朗普(Trump)政府内部一些人正在推动各种措施来减缓中国模型的传播,例如将其制造商加入贸易黑名单或警告美国公司不要使用它们。         据DeepSeek公开技术报告披露,其V3模型训练阶段累计使用约278.8万H800 GPU小时,按照公开GPU租赁价格估算,训练成本约560万美元。

G | 然而,美国政府在授予Fable和Sol等先进模型访问权方面的不可预测做法,也在刺激人们采用中国的开源权重替代方案。         甚至在K3发布之前,中国的开源权重模型就已引起全球关注。随后,DeepSeek在V3基础上推出推理模型R1,通过强化学习等技术进一步提升模型推理能力,其后训练成本约29.4万美元。         而此前,OpenAI、谷歌等公司训练前沿模型通常需要投入数千万美元甚至更大规模资金,资本投入长期被视为AI能力竞争的重要基础。         图1:DeepSeek-R1-0528在各项评测集上评分。GLM-5.2是另一家中国实验室Z.ai于6月推出的模型,在执行所谓的智能体任务(agentic tasks,如创建软件)方面,比美国另一家顶级模型制造商Google目前提供的任何产品都要出色。         在技术能力接近头部模型、训练成本却大幅降低的情况下,DeepSeek也并没有第一时间选择通过融资快速扩张,这一点与同期大模型创业公司形成明显差异。来自另两家中国实验室DeepSeek和MiniMax的模型也很受欢迎。

H | 根据Firefox浏览器制造商Mozilla的报告,开源权重模型在推理和复杂智能体工作方面仍落后于前沿,但现在被普遍认为对许多任务“足够好”(good enough)。         它们的成本也低得多——在公司应对AI不断上升的成本时,这是一个重要优势。         在接受媒体采访时,DeepSeek创始人梁文锋曾表示,DeepSeek更看重长期技术探索,而不是短期商业回报。他曾提到,公司“不是为了赚钱”,而是希望探索通用人工智能的技术路径;对于融资,他也曾表示,DeepSeek没有融资需求,不希望受到投资人的约束。另一家研究公司Artificial Analysis追踪选定模型在其一系列测试中执行每项任务的成本。         另外,相比大量依靠融资扩张的大模型企业,DeepSeek保持了相对精简的团队规模,也避免了资本对研发路线的影响。公开报道显示,截至2025年3月,DeepSeek团队仅约160人。同期,OpenAI约4500人,Anthropic约2500人。DeepSeek提供的最强系统平均每个任务花费0.04美元。         但扩招、融资、上市……梁文锋和DeepSeek近期的一系列选择,却与此前强调的“小团队、高效率”路线形成明显反差。尚未开源的K3平均每个任务花费0.95美元。         在黄立冲看来,DeepSeek早期能够保持与资本距离,核心原因在于其并不需要通过外部融资解决生存问题。Fable的用户预计需要支付2.75美元。         部分成本差异来自几乎任何云提供商都可以出售对开源权重模型的访问权,从而压低利润率。例如,DeepSeek以每百万tokens 0.28美元的价格提供其v4 flash模型的访问权,而最便宜的第三方提供商则提供每百万0.18美元的价格。

I | 一方面,梁文锋和幻方量化体系能够提供早期资金支持;另一方面,DeepSeek当时更偏研究导向,并不需要同步建设大规模销售、交付和商业体系。         但从R1走向V4后,竞争环境已经发生变化。         “现在还要建设数据中心、保障高并发推理、采购和适配芯片、扩充研发团队、做企业服务、建立全球开发者生态,并承担安全、合规和持续运维成本。

J |          更重要的是,许多开源权重模型的训练特别注重运行效率,部分原因是中国实验室因美国对先进芯片的限制而在获取计算能力方面面临挑战。像“专家混合”(mixture of experts)模型这样的创新——仅激活AI系统中与查询相关的部分——已被开源权重开发者广泛采用,DeepSeek和阿里巴巴等实验室在这一技术上取得了重大进展。         然而,开源权重模型的吸引力更深层次。由于美国政府仓促试图将Fable模型仅限美国公民使用,导致该模型在全球范围内三周无法使用,这促使许多公司审视自己对单一实验室的依赖。”黄立冲表示,DeepSeek此前解决的是技术从“0到1”的问题,而下一阶段面对的是从“1到100”的系统工程问题。         520亿美元估值也有“水分”?          从资本市场的角度来看,外界对DeepSeek都抱有较高的期待值。         2026年5月底,其完成首轮外部融资,募资规模约70亿美元,投后估值约520亿美元,投资方包括腾讯、京东、网易、宁德时代及多家投资机构,创始人梁文锋也参与投入约30亿美元。         7月15日,安徽开润发布公告称,其全资子公司宁波浦润收到砺思星灵普通合伙人天津砺思明棠企业管理咨询合伙企业(有限合伙)的通知,砺思星灵已将全部29亿元实缴资金,间接投资于杭州深度求索人工智能基础技术研究有限公司(即DeepSeek),砺思星灵间接占比0.8265%。按照29亿元出资额和0.8265%的持股占比倒推,DeepSeek的估值大致为3508.77亿元。

K | 这鼓励他们尝试可以通过多个提供商访问、甚至可能在内部服务器上运行的开源权重替代方案。         图2:7月15日,安徽开润发布公告截图。         而近日,又有外媒报道,DeepSeek已与潜在投资者展开初步接触,新一轮融资可能按照约710亿美元投前估值推进,较上一轮估值上涨约37%。Mozilla首席技术官Raffi Krikorian指出,这一事件起到了“警示射击”(shot across the bow)的作用。         不过,对于这一估值,黄立冲认为,这并不是按照传统盈利能力进行定价,而是市场对于未来价值的提前下注。         (注:本文编译自《经济学人》7月22日文章,原链接:https://www.economist.com/business/2026/07/21/americas-ai-labs-are-under-threat-from-cheap-chinese-rivals)。         “这个估值实际上支付了三部分溢价:第一,中国顶级独立基础模型平台的稀缺性;第二,DeepSeek在开源生态和全球开发者中的品牌影响力;第三,未来进入企业服务、Agent平台、算力基础设施和资本市场的期权价值。”黄立冲指出,如果未来模型能力逐渐趋同,单纯依靠排行榜领先并不能形成长期护城河。         而想要建立属于自己的护城河,或许单单在大模型层面“卷”还不够。         此前DeepSeek通过算法优化降低模型训练成本,未来如果希望扩大模型规模、提升服务能力,算力成本将成为无法回避的问题。

L |          今年7月,路透社援引三位知情人士报道称,DeepSeek已经秘密启动自研AI芯片项目,相关工作已经推进近一年。         “DeepSeek自研芯片并不意味着进入芯片制造领域,更现实的路径是设计针对自身模型和推理负载优化的芯片,再与制造、封装、存储和服务器厂商合作。”黄立冲认为,DeepSeek过去是用更好的算法节省芯片,下一阶段可能是用更适合自己的芯片放大算法优势。         晶捷品牌咨询创始人陈晶晶也认为,DeepSeek布局AI芯片,折射出大模型企业对算力成本和计算效率的关注。随着AI应用规模化发展,算力成本将成为影响商业模式的重要因素,通过软硬件协同优化降低推理成本,将直接影响企业竞争力。         “自研芯片并非目的,提升算力利用效率才是核心。

M | ”陈晶晶说。

N |          估值不再单看模型能力          DeepSeek加速资本化,并非孤立事件,今年以来,中国大模型企业正在集中进入资本市场。

o |          除了DeepSeek被曝推进IPO,智谱、MiniMax也都相继释放回归A股信号,前者科创板IPO辅导已进入验收阶段,后者完成辅导备案并公告筹划回A;另一边,月之暗面持续获得资本加码,同步启动VIE及红筹架构拆除工作,为赴港IPO扫清障碍。         大模型企业为何纷纷选择同一时间排队上市?          陈晶晶道,大模型企业集中进入资本市场,反映出行业正在从技术验证阶段进入商业化和产业化阶段。企业需要持续投入算力基础设施、产品落地和生态建设,资本市场成为获取长期资金、支撑规模化发展的重要渠道。

p |          但与此同时,企业选择此时上市,也存在估值窗口因素。         “资金需求是底层原因,估值窗口是时间选择。”黄立冲表示,2025年前后,大模型公司获得高估值,很大程度上来自“模型能力稀缺性”。当时,拥有领先基础模型能力,本身就是一种稀缺资产,资本愿意给予大模型企业较高估值。但随着越来越多模型出现,大模型能力差距逐渐缩小,投资逻辑正在从“谁拥有更强模型”,转向“谁掌握AI商业化链条中的关键环节”。         在黄立冲看来,AI需求真正增长以后,产业瓶颈逐渐转向芯片、先进封装、高带宽存储、网络互联、电力、数据中心和推理效率。这些环节具有更强的资产稀缺性、更长的扩产周期和更明确的收入兑现路径,因此资本市场开始给予基础设施更高的确定性溢价。

q |          “这并不意味着大模型公司的价值下降,而是市场对AI企业的估值逻辑正在发生变化。

r | ”黄立冲强调,未来市场关注的重点将不再只是“模型跑分有多高”,而是企业能否形成持续收入、降低单位推理成本、建立客户和开发者生态,以及掌握关键基础设施和供应链能力。         据黄立冲判断,未来估值最高的企业未必是单一模型能力最强的公司,而可能是能够将模型、算力、工具和应用整合,并形成持续现金流的平台型企业。“模型能力仍然重要,但模型正在从估值终点变成估值起点。

Current article:http://6oo.nenyaogecebenliexi.shop/list_nd1xgl/x70w334.html

Published on:07:40:06