清华博士顾煜贤加入 DeepSeek,研究聚焦大模型高效训练、蒸馏与架构优化

清华特奖博士顾煜贤加入 DeepSeek,研究聚焦大模型效率、蒸馏与新架构。

原文标题:清华特奖获得者顾煜贤,加入DeepSeek

原文作者:机器之心

冷月清谈:

机器之心报道称,清华大学计算机系博士生、2025 年研究生特等奖学金获得者顾煜贤已正式加入 DeepSeek,并出现在此前 DeepSeek V4 论文作者列表中。顾煜贤本科和博士均就读于清华,师从黄民烈教授,研究方向围绕大语言模型全生命周期的效率提升,包括预训练数据筛选、模型压缩中的知识蒸馏,以及高效模型架构设计。他曾在 NeurIPS、ICLR、ACL 等顶会发表多篇论文,Google Scholar 引用量接近 5000。文章重点介绍了其代表性工作 MiniLLM 与 Jet-Nemotron:前者通过改进知识蒸馏目标提升小模型生成质量,后者探索混合架构和线性注意力,在长上下文推理中实现显著效率提升。此次加入也被视为 DeepSeek 持续扩充算法与研究团队的一个信号。

怜星夜思:

1、DeepSeek 这类模型公司现在疯狂招人,最缺的到底是“顶尖研究员”还是“工程落地型人才”?
2、顾煜贤关注的“高效大模型”方向,会不会比单纯堆参数更重要?
3、MiniLLM、Jet-Nemotron 这类工作,对普通开发者有什么实际意义?
4、顶尖高校博士加入头部 AI 公司,是学术研究的流失,还是更快推动成果转化?

原文内容

图片
机器之心编辑部

最近,DeepSeek 开启了疯狂招人,岗位涉及算法、研发、产品、运维、数据工程师以及职能等多个部门。


与此同时,DeepSeek V4 正式版将于本月中旬上线。在此前的 DeepSeek V4 论文作者列表中,我们发现了清华大学 2021 级博士生、2025 年研究生特等奖学金获得者顾煜贤(Yuxian Gu)的名字



就我们所知,顾煜贤已经正式加入了 DeepSeek


顾煜贤还曾获得 以及蚂蚁 In-Tech 奖学金。


「硬件资源受限时,算法创新就成为突破计算瓶颈的关键。」清华人顾煜贤表示。他是清华大学计算机系毕业年级博士生,本科同样毕业于清华大学。


个人主页显示,顾煜贤在清华大学交互式人工智能课题组(Conversational AI, CoAI)学习,师从黄民烈教授。


个人主页地址:https://t1101675.github.io/


他的研究主要关注如何在大语言模型的全生命周期中提升效率,覆盖预训练、下游适配和推理等关键阶段,最近主要从三个方向展开相关研究:


  • 预训练数据筛选:致力于构建理论和算法,优化大语言模型训练中的数据选择过程,从而训练出更强大、更高效的模型。代表性工作包括 PDS、Instruction Pre-training 和 Learning Law。

  • 模型压缩中的知识蒸馏:设计新的方法,将大模型的知识有效迁移到更小、更易部署的模型中。该方向的代表性成果包括 MiniLLM 和 MiniPLM。

  • 高效模型架构:探索并设计新的模型架构,在降低计算成本的同时提升模型性能,相关工作包括 Jet-Nemotron。


在 Google Scholar 主页,顾煜贤的论文引用量已近 5000,超过 1000 的论文有两篇,分别是《Pre-trained models: Past, present and future》和《MiniLLM: Knowledge distillation of large language models》。



顾煜贤作为一作,多次在 NeurIPS、ICLR、ACL 等国际 AI 学术顶会上发表论文。



机器之心在去年报道过「」,一种全新的混合架构语言模型新系列,在达到 SOTA 全注意力模型精度的同时,还具备卓越的效率。


Jet-Nemotron 的核心创新主要体现在以下两点:


  • 后神经架构搜索 (Post Neural Architecture Search,PostNAS):一种高效的后训练架构探索与自适应 pipeline,可适用于任意预训练的 Transformer 模型。

  • JetBlock:一种新型的线性注意力模块,其性能显著优于 Mamba2 等先前的设计。



论文地址:https://arxiv.org/pdf/2508.15884


当时,2B 版本的 Jet-Nemotron 性能就能赶超 Qwen3、Qwen2.5、Gemma3 和 Llama3.2 等最 SOTA 开源全注意力语言模型,同时实现了显著的效率提升。在 H100 GPU 上,其生成吞吐量实现了高达 53.6 倍的加速(上下文长度为 256K,最大 batch size)。


在 MMLU 和 MMLU-Pro 基准上,Jet-Nemotron 的准确率也超过了一些 MoE 全注意力模型,如 DeepSeek-V3-Small 和 Moonlight,尽管这些模型的参数规模更大。


在更早的 2024 年,顾煜贤及其合作者提出了一种将大语言模型蒸馏为更小语言模型的知识蒸馏方法,首先利用反向 Kullback-Leibler 散度(KLD)替代标准知识蒸馏方法中的正向 KLD 目标,随后推导出一种有效的优化方法来学习这一目标。


他们将得到的学生模型命名为 「MiniLLM」。在指令跟随场景下的大量实验表明,相比基线方法,MiniLLM 能生成更精准的回答,整体质量更高,同时具有更低的曝光偏差、更好的校准能力,以及更强的长文本生成性能。


谷歌、阿里、英伟达等领先的开源社区和产业平台已采用这一方法。



论文地址:https://arxiv.org/pdf/2306.08543


我们也期待顾煜贤在人生的下一段「DeepSeek」中,带来更多新的成果。


【ICML 2026首尔 · 云帆AI Talent Meetup】最后报名中


7月9日晚,首尔ICML会场旁,上海人工智能实验室、上海科技大学、上海创智学院、阶跃星辰、Sharpa Robotics等20余家上海顶尖AI单位现场设展,开放100+岗位。专场招聘、学术分享、圆桌交流、自由Networking一站式搞定。


扫码即刻报名。



© THE END

转载请联系本公众号获得授权

投稿或寻求报道:liyazhou@jiqizhixin.com

也不能说堆参数不重要。规模定律仍然有效,大模型很多能力确实来自规模。但在资源受限环境下,数据筛选、蒸馏、架构优化能把同等算力的收益放大,这也是为什么高效训练和推理会成为竞争焦点。

2 个赞

回应“这些高效模型工作对开发者有什么意义”:最直接就是部署门槛降低。以前可能得上很贵的 GPU,现在如果小模型蒸馏得足够好,中小团队也能做客服、文档问答、代码助手这类应用。

3 个赞

我会更谨慎一点。产业界确实能加速成果落地,但也可能让研究方向被商业目标牵引。高校的价值在于保留更自由、更长期的问题探索。理想状态是人才在高校和产业之间流动,而不是单向虹吸。

1 个赞