

这是顾煜贤, 清华大学2025年研究生特等奖学金获得者, Google Scholar引用近5000的AI研究者, 苹果AI学者奖学金的得主。
他刚从清华园搬来, 正式加入了DeepSeek。
事情的端倪, 出现在一份论文作者名单里。
DeepSeek V4的论文预印本在几个月前悄悄上线。有眼尖的研究者在作者列表里扫到了一个名字, Yuxian Gu, affiliation那一栏写着Tsinghua University。
那时候没人多想。学术合作嘛, 太正常了。
但7月初, 国内科技媒体机器之心放出消息, 说顾煜贤已经正式入职DeepSeek。不是访问, 不是实习, 是全职。
消息像一颗小石子扔进湖里, 涟漪慢慢荡开。

先别急着下结论, 我们来看看顾煜贤是谁。
清华计算机系2021级博士生, 导师是黄民烈教授。在清华交互式人工智能课题组待了五年, 研究方向听起来很拗口, 语言模型的高效训练和模型压缩。
翻译成人话就是, 让大模型跑得更快, 更省资源, 更便宜。
这恰恰是DeepSeek最在意的事情。
顾煜贤的代表作叫MiniLLM。简单来说, 他找到一种方法, 把大模型的知识蒸馏到小模型里, 让小模型也能达到接近大模型的效果。谷歌, 阿里, 英伟达后来都用上了这套方法。
另一项工作Jet-Nemotron更猛。他设计了一种混合架构, 在H100 GPU上把生成速度提升了53.6倍。不是5%, 是53倍。
这篇论文的引用量早就破了千。
他还拿了一个很少人听过的奖, 2025年度苹果AI学者奖学金。全球每年只选十几个博士生, 清华那年就他一个。
所以这不是一个普通应届生找工作。这是一个在学术圈已经打出名堂的人, 主动选择了一家中国AI公司。

这里有个细节值得玩味。
顾煜贤完全可以去硅谷。OpenAI, Anthropic, Google DeepMind, 这些地方的offer对苹果学者获得者来说几乎是标配。
他也可以留在清华做博士后, 或者去北大, 中科院。国内的顶尖实验室都在抢人。
但他选了DeepSeek, 一家成立刚满三年的杭州公司。
为什么。
看看DeepSeek最近在干什么就明白了。
V4正式版要在7月中旬上线, 从preview版本来看, 这是一套MoE架构的语言模型, 支持百万token的超长上下文。国外技术博客DeepWiki评价说, V4在效率和成本上的优化让西方同行感到意外。
更重要的是, DeepSeek正在疯狂招人。算法, 研发, 产品, 运维, 数据工程师, 几乎所有核心部门都在扩编。
梁文峰去年说过一句话, 他们招人看能力不看资历, 核心岗位很多都是应届生或者只有一两年经验的年轻人。
但这话只说了一半。
另一半是, DeepSeek对顶尖人才的吸引力正在超过传统大厂。根据猎头公司Suntzu Recruit的分析, DeepSeek的团队构成有一个明显特征, 清华北大的毕业生密度极高, 而且忠诚度远超行业平均水平。

把时间拉长一点看, 顾煜贤的选择不是一个孤立事件。
斯坦福大学和胡佛研究所今年年初联合发布了一份报告, 专门研究全球AI人才的流动趋势。里面有个数字很有意思, 全球顶尖AI研究者里, 48%来自中国, 18%来自美国。
但过去五年, 这些人才的流向正在发生变化。
以前是从中国流向美国。现在是, 越来越多在海外读书或者工作的华人研究者选择回国, 或者干脆就没出去。
DeepSeek成了这个现象的最大受益者之一。
他们的核心团队里, 邵智宏是清华博士, 郭志斌是清华硕士, 还有一大批从清华, 北大, 浙大, 北航毕业的年轻人。
国外论坛Reddit的MachineLearning板块里, 关于DeepSeek的讨论帖越来越多。有人算了一笔账, DeepSeek-V3的训练成本大约560万美元, 而OpenAI的同级别模型要高出几十倍。
底下最高赞的评论是, 这帮人用最少的钱做出了最狠的模型, 现在他们要把这帮人凑到一块搞更大的事情。
这个更大的事情, 就是V4, 以及V4之后的下一代模型。
顾煜贤出现在V4论文的作者列表里, 说明他至少在几个月前就已经深度参与了项目。

但事情没那么简单。
DeepSeek最近传出了融资的消息。一些工商信息平台显示, 他们的估值已经达到数百亿美元级别, 投资方包括腾讯, 宁德时代等国内巨头。
如果这个消息属实, 意味着DeepSeek已经从一家自筹资金的研究型机构, 正式进入了资本驱动的扩张轨道。
融这么多钱, 意味着什么。
意味着扩张压力。意味着产品要更快迭代。意味着招人不是选择题, 是必答题。
一位在硅谷做AI招聘的朋友告诉我, 现在中国AI公司挖人的手已经伸到湾区了。DeepSeek, 字节, 阿里, 开出的package很多时候比OpenAI还高, 而且给的是实打实的现金加股权。
但顾煜贤这样的人, 钱恐怕不是第一考量。
他自己说过一句话, 硬件资源受限时, 算法创新就成为突破计算瓶颈的关键。
这话的潜台词是, 他想去一个真正重视算法创新的地方, 而不是堆卡, 堆算力, 堆数据的军备竞赛。
从这点看, DeepSeek确实是一个合理的选择。他们的核心叙事一直是效率至上, 用更聪明的架构替代更暴力的训练。
但这枚硬币还有另一面。
DeepSeek的V4 preview在4月份发布之后, 国外社区的评价褒贬不一。有人觉得它在长上下文处理上确实突破了, 也有人质疑它的安全对齐做得不够。加上中美科技博弈的大背景, 选择DeepSeek在某种程度上也意味着选择了一个立场。
顾煜贤当然清楚这些。他在学术圈混了五年, 不可能不知道。

再多说几句清华特奖。
很多人不知道这个奖意味着什么。清华特等奖学金设立于1989年, 是清华授予在校学生的最高荣誉, 每年本科生和研究生加起来也就十来个名额。
评选过程极其残酷。院系推荐, 材料函评, 现场答辩, 学校公示, 层层筛选。能走到最后的, 基本上是在学术, 竞赛, 社会实践几个维度都没有短板的人。
顾煜贤是2025年研究生特奖获得者。同期入选的还有电子系的徐卓等人。
这个奖的含金量在于, 它代表了清华对一个学生综合能力的最高认可。而获得特奖的人, 毕业后的选择往往会被放大观察。
去大厂, 留校, 出国, 创业, 每一种选择背后都有一套叙事。
顾煜贤选了加入一家成立三年的创业公司。
这在特奖获得者里不算常见, 但也算不上罕见。真正值得关注的是, 他选的这家公司正在成为中美AI竞赛中的一个关键变量。

把顾煜贤的个人选择和更大的时代背景放在一起看, 会看到一些有趣的东西。
2025年到2026年, 全球AI人才市场正在经历一场静默的重构。
OpenAI在过去一年流失了超过25%的核心研究人员, 很多人去了Anthropic, xAI, 或者自己创业。Google DeepMind虽然还在吸纳人才, 但内部的文化冲突和项目裁撤让一些人开始观望。
与此同时, 中国的AI公司正在以另一种方式崛起。DeepSeek的效率路线, 字节的流量打法, 阿里的开源策略, 各家找到了不同的切口。
在这个格局里, DeepSeek的定位最特殊。它既没有字节那样的海量用户, 也没有阿里那样的云基础设施, 它有的只是一群非常年轻, 非常能打的研究者, 以及梁文峰从量化基金带来的那一套方法论。
顾煜贤的加入, 某种程度上是这种吸引力的一个注脚。
但故事到这里还没完。
DeepSeek V4正式版将在7月中旬发布。如果V4能达到preview版本展示出的潜力, DeepSeek将正式跻身全球顶尖大模型公司的第一梯队。而如果顾煜贤的算法优化能力能在V4及后续版本中持续释放, 他个人的学术声誉和产业影响力都会再上一个台阶。
这是一场双向的赌注。
写到这里, 我想回到开头那个场景。
7月的杭州, 顾煜贤拖着行李箱走进DeepSeek的办公楼。空调开得很足, 电梯往上走, 他可能在想接下来要写的第一行代码, 也可能什么都没想。
这个画面之所以重要, 不是因为一个清华特奖获得者加入了哪家公司。
而是因为它提醒我们, 在AI这个赛道上, 真正的竞争从来都不是公司之间的竞争, 而是人跟人之间的竞争。是那些深夜还在改论文的博士生, 是那些盯着训练曲线不敢睡觉的工程师, 是那些在每个交叉口做出选择的年轻人。
顾煜贤做了一个选择。这个选择对不对, 三年后再看。
但无论如何, DeepSeek的下一版模型里, 会留下他的名字。
这就够了。