就在昨天,彭博社报道:

放在别的公司身上,这只是又一条融资快讯。放在
从"不要钱"到"钱多到超募",
01
前传:DeepSeek的"天使轮",是一家量化基金(2015–2023)
•2015年:梁文锋创立幻方量化,这家量化私募后来管理规模一度破千亿。
•2016年10月:幻方第一个AI模型上线,深度学习生成的交易仓位开始用GPU计算;2018年把AI定为公司主方向。
•2019–2020年:成立幻方AI,自研训练平台"萤火一号",总投资近2亿元,搭载约1100块GPU。
•2021年:投入10亿元建"萤火二号",约1万张英伟达A100。当时国内持有万卡的企业不超过5家,一家量化基金就在其中。
•2023年4月:幻方公告成立独立研究组织,探索AGI,命名"深度求索"。
•2023年7月17日:杭州深度求索人工智能基础技术研究有限公司注册成立。

怪哥划重点:在ChatGPT引爆大模型之前,幻方已经提前两年囤好了万卡。别人2023年满世界找卡,
02
出道:开源、MoE和价格屠夫(2023–2024)
•2023年11月2日:成立半年后发布第一个模型
•2024年1月:开源
•2024年5月:
•2024年12月:
这一阶段
03
R1时刻:一个开源模型,让英伟达一天蒸发5888亿美元(2025)
2025年1月20日,
一周后的1月27日,美股给出了反应:英伟达单日收跌16.86%,市值蒸发5888.62亿美元,创下美股单只个股最大单日蒸发纪录。华尔街第一次认真问自己:巨头们砸进AI基建的几千亿美元,是不是有一部分白花了?
用户侧同样炸裂:
这一年还有一个容易被忽略的节点:2025年9月17日,R1论文登上《自然》封面,成为首个通过权威期刊同行评审的主流大模型。补充材料首次披露R1的强化学习训练成本只有29.4万美元,加上V3基座约600万美元,依然远低于硅谷同行。
怪哥划重点:R1之后,
04
"不融资"的两年:辟谣、拒绝和错过
R1爆火后,想投

那段时间
梁文锋拒绝的理由,归纳起来有两条:
1. 外部投资者会干预公司决策。
2. 很多VC对做研究有顾虑,他们有退出需求,希望尽快商业化。
怪哥划重点:注意这两条理由。后来
05
2026首轮融资:从"至少3亿美元"到500亿元
2026年6月,
为什么突然要钱?据报道,最初的动机很朴素:给员工期权定一个估值,留住研究员——此前几个月,
估值是怎么被抢上去的:
•4月17日:The Information首次报道,
•4月22日:腾讯、阿里被曝洽谈入局,目标估值抬到200亿美元以上,参照物是同期融资的
•5月6日前后:英国《金融时报》报道国家集成电路产业投资基金(大基金)洽谈领投,估值约450亿美元。
•5月8日:估值升至500亿美元以上,梁文锋个人拟出资约29亿美元。
•5月22日:宁德时代被曝参投。
•6月3日:路透社报道融资约500亿元,投后估值3500亿–4000亿元。
•6月中旬:交割落定(《金融时报》称5月末完成,国内媒体多称6月交割)。
最终的投资人名单(金额为媒体报道,

交易结构才是这轮最值得看的地方:多数投资人的钱不直接进
认购有多火?意向资金超过1000亿元,最后只进来一半,至少500亿元在排队。融资后,梁文锋持股从约90%降到约78%,但身家从167亿美元涨到约360亿美元。
估值还有一个侧面印证:上市公司开润股份披露,4000万元间接持有0.0114%股份,倒推估值约3508亿元;汤臣倍健1.3亿元持有0.04%,倒推约3250亿元。《财经》则提到,算上增发5%的员工期权池,实际投前估值约3675亿元。
06
第二轮:启动、暂停、重启、超募
首轮交割才六周,第二轮就开了,而且过程比首轮更有戏剧性。
•7月14日:《金融时报》报道,
•7月22日:梁文锋在首轮融资期间与投资人的一场4小时闭门会,3.4万字实录在网上刷屏。
•7月25日:彭博报道
•8月5日:《财经》报道融资重启,计划募资500亿元,投前估值约5000亿元,希望低调推进。
•8月10日前后:据IPO早知道,首批签约在杭州进行,单家最低投资额50亿元;资金路径分两条,部分直接进入深度求索主体,部分进入梁文锋控制的有限合伙。
•8月27日:《华尔街日报》报道本轮拟募74亿美元,投前估值740亿美元;宁德时代、砺思资本、拾象科技等老股东加码,并有地方政府背景基金参与。同时披露
•10月6日:彭博报道本轮即将敲定,规模至少800亿元,可能逼近1000亿元,宁德时代和腾讯出资最多;
估值口径混杂了目标、投前和投后,但方向很清楚:首轮还没交割,估值就被抢高了五倍。
那份外流的实录里,梁文锋反复讲"克制":不追求利润最大化,只赚合理利润;不做3D生成、视频生成和世界模型;最强的模型大概率继续开源;当下最重要的方向是Coding Agent。对投资人说这些话,本质上是在提前声明:钱可以进来,路线不会改。
怪哥注:10月6日这条报道没有明说就是"第二轮",但从时间线、投资人和估值目标看,它应当就是7月启动的那一轮,只是认购太热,规模从500亿元一路被抬到800亿元以上。最终数字以交割为准。
07
技术底牌:V4到V4.1 Flash,估值是用模型撑起来的
两轮融资的估值曲线,几乎和模型发布节奏同步。投资人买单的,是
V4:迟到三个月的百万上下文。V4原定2026年春节发布,一路推迟到4月24日才正式开源,分两个版本:

两个关键词:一是上下文从128K扩到1M,KV Cache大幅压缩;二是华为昇腾超节点全系首发适配,模型发布和国产算力适配同步推进。作为参照,同期GPT-5.5的价格是输入5美元、输出30美元。
V4-Flash正式版:小模型干翻大模型。7月底上线的V4-Flash-0731参数没变,靠重新后训练,在九项代码和智能体测试上全部超过V4-Pro预览版,DeepSWE得分从7.3跃到54.4。Artificial Analysis估算它完成一项基准任务平均只要约0.03美元。8月31日又开源了视觉版V4-Flash-Vision-Exp。
V4.1 Flash:新架构先在小模型落地。9月10日发布,552B参数MoE,采用全新的因果编码器-解码器(Causal Encoder-Decoder)结构,输入激活8B、输出激活16B,原生支持图像理解。官方测试显示它在性能、费用、速度上全面超过V4-Pro,于是从9月14日起,V4-Pro的请求全部被路由到V4.1 Flash,按Flash价格计费,直到V4.1 Pro发布。腾讯的
商业化数据也开始浮出水面:据TechCrunch援引Vercel数据,6月
08
钱往哪花:乌兰察布、16万颗昇腾和一场IPO
两轮融资加起来,
自建数据中心。2026年4月,
押注华为。9月4日彭博报道,
• 这批芯片目前计划用于推理,不用于训练;训练端
• 华为产能是瓶颈。受高端存储等零部件短缺影响,950DT今年产量只有几十万颗量级,
10月的报道还提到,
IPO。按彭博和The Information的报道,
09
怪哥观点:DeepSeek融资史里的四个反常识
1.
2. 这是一次"拿钱不交权"的融资。创始人自掏200亿元,外部资金走有限合伙、无投票权、锁定五年。梁文锋当年拒绝融资的两条理由——怕干预、怕催着退出——在交易结构里被逐条堵上了。唯一的例外是国家人工智能产业投资基金,这本身也是一个信号。
3. 投资人名单里几乎没有美元VC,全是产业资本和国家队。腾讯要的是模型能力整合进自家产品,
4. 估值涨得快,但按收入算并不便宜。四个月里报道估值从100亿美元涨到700多亿美元。但如果按5000亿元估值和5亿美元ARR粗算,市销率大约在150倍。它比OpenAI、Anthropic便宜得多,可它的定价策略又在主动压缩自己的利润空间——"只赚合理利润"和上市公司的增长叙事,迟早要正面碰一次。
10
附:DeepSeek大事年表
按时间倒序,融资相关事件多为媒体援引知情人士报道,DeepSeek官方未逐一确认。



11
数据/信息来源
• IT之家:消息称DeepSeek接近完成至少800亿元融资
• The Decoder:DeepSeek takes outside money for the first time
• 华尔街见闻/《财经》:DeepSeek重启融资,投前估值5000亿元
• TechCrunch:DeepSeek reportedly in talks to raise $1.5B, then IPO
• 凤凰网科技:DeepSeek将采购16万颗华为AI芯片

