【清华特奖得主顾煜贤加入DeepSeek,曾主导大模型蒸馏与50倍长文本提速】

07-06
【清华特奖得主顾煜贤加入DeepSeek,曾主导大模型蒸馏与50倍长文本提速】报道,7月6日消息,清华大学计算机系博士毕业生、2025 年研究生特等奖学金获得者顾煜贤已正式加入 DeepSeek,名字已出现在 DeepSeek V4 论文作者列表中。 顾煜贤的研究主要聚焦大模型在预训练、模型压缩和推理阶段的效率优化,谷歌学术总引用量已近 5000 次。顾煜贤此前的代表作包括大模型知识蒸馏方法 MiniLLM(已被谷歌、阿里、英伟达等平台采用),以及混合架构模型 Jet-Nemotron。Jet-Nemotron 在 H100 显卡处理 256K 超长上下文时,生成吞吐量比传统全注意力模型提速达 53.6 倍,并在多项基准测试中超越了参数规模更大的混合专家模型。
免责声明:
内容来源金色财经、欧意交易所、gate.io交易平台以及Binance交易所官网
本站不对其做任何背书,也不代表赞成作者观点,如有失察或对您造成影响,可联系我们删除

发表评论

快捷回复: 表情:
AddoilApplauseBadlaughBombCoffeeFabulousFacepalmFecesFrownHeyhaInsidiousKeepFightingNoProbPigHeadShockedSinistersmileSlapSocialSweatTolaughWatermelonWittyWowYeahYellowdog
验证码
评论列表 (暂无评论,94人围观)

还没有评论,来说两句吧...