gpt-oss-120b模型短暂上线Hugging Face,疑为OpenAI开源泄露

GPT-OSS-120B模型短暂现身Hugging Face,OpenAI开源信号?

原文标题:刚刚,OpenAI开源模型泄露了?gpt-oss-120b?

原文作者:机器之心

冷月清谈:

近日,Hugging Face社区惊现一个名为“gpt-oss-120b”的模型,由于其命名带有OpenAI的“gpt”、代表开源的“oss”以及高达1200亿的参数量“120b”,引发了其可能是OpenAI即将发布的开源版GPT模型的猜测。然而,该模型在上传后极短时间内就被迅速删除或隐藏。

尽管模型本体未被公开,但从截图中的ddtypes.json文件可窥见其可能采用了FP4、BF16、UE8等混合精度量化方式,这暗示了模型在追求高性能与部署效率方面的激进策略。

深入调查发现,上传该模型的社区成员背景不凡:其中一位据传为上传者的李卓翰(Zhuohan Li)是vLLM等知名项目的主要作者,另一位则是Meta员工,而最后一位Dominik Kundel更是OpenAI的在职员工。这些扑朔迷离的线索,使得外界猜测这究竟是一次有意的“提前测试”,还是vLLM团队在技术合作中不慎泄露了OpenAI内部的秘密模型?文章最后抛出了对此事件的疑问,引发人们对OpenAI未来开源策略和内部管理的好奇。

怜星夜思:

1、OpenAI作为一个商业公司,如果真的发布120B参数的开源GPT模型,这对它的商业模式和行业地位会有什么影响?这步棋是好是坏?
2、文章里提到模型可能采用FP4、BF16、UE8等混合精度量化方式,这些技术在大型AI模型部署中具体有什么优势?(比如对硬件要求、运行速度、资源消耗方面)
3、这件事涉及到OpenAI员工、顶尖推理框架vLLM的作者,还有Meta的员工,你觉得这究竟是一次精心策划的“泄露测试”,还是说就是一次团队内部的意外操作?你更倾向于哪种解释?为什么?

原文内容

左右滑动查看更多图片

刚刚,X 网友 @secemp9 发现,Hugging Face 用户 zhuohan123 在一个名叫 yofo-happy-panda 的社区上传了一个名为 gpt-oss-120b 的模型。

光看名字就足够炸裂:gpt 是 OpenAI 的标杆,oss 通常是「开源软件」(open-source software)的缩写,而 120b 则意味着 1200 亿参数。这几乎与 OpenAI 此前频繁提及、但始终未发布的「开源版 GPT」一一对应。

然而,非常遗憾,上传者的动作很快,在大多数人还没看到这个模型的时候,他们就已经删除或隐藏了这个模型。

不过我们可以从截图中 dtypes.json 文件获得更多一点信息:模型可能采用 FP4、BF16、UE8 等混合精度量化方式,暗示它在追求性能与部署效率方面颇为激进。

更进一步挖掘,我们发现 yofo-happy-panda 社区共有三位成员:

- 其中据传上传该模型的 Zhuohan Li(李卓翰)目前正在伯克利 RISE 实验室从事研究工作,同时也是著名模型推理框架 vLLM 的主要作者和领导者之一,他还参与开发了 Vicuna、AlpaServe、Alpa 等项目,谷歌学术记录的引用量已经超过 1.5 万。
- 另一位成员 Casey Dvorak 就职于 Meta。
- 最后的 Dominik Kundel 则是正经的 OpenAI 公司员工,不过也才刚入职 7 个月。

种种线索引发猜测:这是一次「提前测试」?还是 vLLM 团队手滑泄露了 OpenAI 内部的 gpt-oss?

对此,你怎么看?

针对“文章里提到模型可能采用FP4、BF16、UE8等混合精度量化方式,这些技术在大型AI模型部署中具体有什么优势?(比如对硬件要求、运行速度、资源消耗方面)”的疑问,简单来说,这些低精度量化技术是给模型“减肥增肌”的。在硬件要求上,它们能显著降低模型对显存的需求,这意味着你不再需要顶配的H100,一些中、低端的GPU甚至边缘设备也有机会跑动大模型,降低了准入门槛。在运行速度方面,由于存储和传输的数据量减少,加上现代AI芯片对低精度计算的支持,模型的推理速度会大幅提升。资源消耗上,能耗自然也随之降低,这对于动辄上百亿参数的模型来说,是巨大的成本节约,也是绿色AI趋势的体现。当然,缺点是会牺牲一定的精度,但通过混合精度等巧妙设计,可以有效平衡性能和精度。

关于“文章里提到模型可能采用FP4、BF16、UE8等混合精度量化方式,这些技术在大型AI模型部署中具体有什么优势?(比如对硬件要求、运行速度、资源消耗方面)”这个技术问题,其核心优势在于优化资源效率。对大型AI模型而言,模型大小和计算量是部署瓶颈。FP4 (4-bit floating point)、BF16 (Brain Floating Point)和UE8 (某种8-bit unsigend integer)等量化技术,通过用更少的比特表示模型参数和中间激活值,能将模型尺寸大幅缩小,从而显著降低显存占用量。这不仅使得模型更容易在硬件条件受限的设备上部署(例如更少的GPU或消费级硬件),也减少了数据传输的带宽需求。在运行速度上,由于数据量减少,且现代AI加速器(如GPU的Tensor Core)对低精度计算有特定优化,推理速度能得到显著提升。资源消耗方面,更小的模型尺寸和更快的计算速度直接转化为更低的能源消耗,这对于数据中心大规模部署AI服务而言,意味着巨大的运营成本节约和更强的环保性。平衡精度损失和性能提升是其关键挑战,但成熟的量化方案已能将损失控制在可接受范围。

哎呀,问到心坎里了!“这件事涉及到OpenAI员工、顶尖推理框架vLLM的作者,还有Meta的员工,你觉得这究竟是一次精心策划的‘泄露测试’,还是说就是一次团队内部的意外操作?你更倾向于哪种解释?为什么?”说实话,我其实更倾向于相信……是意外操作。倒不是说OpenAI没有策划的可能性,而是像vLLM这种高速迭代的明星开源项目,开发和测试周期非常紧张,团队成员又都是技术大佬,在某个开发分支或者测试环节,不小心传错,或者为了测试某个部署流程而临时上传,然后发现不妥赶紧撤回,这种‘乌龙’的概率也是很大的。天才也可能犯低级错误嘛!当然,背后如果有更深远的战略考量,那就细思极恐了。

回答一下关于“OpenAI作为一个商业公司,如果真的发布120B参数的开源GPT模型,这对它的商业模式和行业地位会有什么影响?这步棋是好是坏?”这个讨论。从战略角度分析,此举可能代表着OpenAI对AI发展路径的深层思考。开源一个如此规模的模型,一方面可以激发社区的创新潜力,聚合全球智慧共同推动AI进步,形成强大的技术影响力,这对于提升其在AI领域的‘话语权’至关重要。另一方面,它可能在为未来更高级的AI范式铺路,例如通过开源基础模型来推广新的AI交互模式或应用平台,从而在更上层的服务或生态中实现商业价值的闭环。传统API业务短期内或受冲击,但长期来看有助于其在AI时代占据更核心的战略制高点。这是一个复杂的多维博弈,没有简单的‘好’与‘坏’,只有‘更适合未来’的权衡。

关于“OpenAI作为一个商业公司,如果真的发布120B参数的开源GPT模型,这对它的商业模式和行业地位会有什么影响?这步棋是好是坏?”这个问题,我觉得这无疑是把双刃剑。从积极面看,开源一个巨型模型能极大提升其生态系统影响力和用户黏性,吸引更多开发者基于其技术创新,也许能形成类似Linux或Android的生态护城河。但这也会直接冲击其API收费模式,毕竟大家都可以免费部署了。最终可能还是会走服务增值、专业定制或者与硬件结合的路线。要说好坏,得看他们怎么玩转开源社区和商业服务之间的平衡艺术了,这可比做模型复杂多了!

针对“这件事涉及到OpenAI员工、顶尖推理框架vLLM的作者,还有Meta的员工,你觉得这究竟是一次精心策划的‘泄露测试’,还是说就是一次团队内部的意外操作?你更倾向于哪种解释?为什么?”这个讨论,我个人更倾向于是’意外操作’与’非故意泄露’的结合,而非刻意的’测试’。主要原因在于,如果是有意测试,这种方式过于粗糙和高风险。像OpenAI这样的大公司,进行市场测试会有更精密的公关和法律风险评估。然而,考虑到 involved Persons’ professional backgrounds (vLLM lead, OpenAI employee, Meta employee)以及他们可能在合作进行某个联合研究或技术验证,比如用vLLM对某个内部或合作模型进行高效部署测试,在过程中因疏忽(例如代码分支管理混乱、测试环境与生产环境混淆)导致短时间模型文件被公开,而后迅速被发现并撤回。这种解释更符合大型科技公司内部协作流程中可能出现的常见但严重的失误。当然,这并不能排除其引发的后续战略影响,但初始行动的动机可能并非“主动测试市场”。

关于“这件事涉及到OpenAI员工、顶尖推理框架vLLM的作者,还有Meta的员工,你觉得这究竟是一次精心策划的‘泄露测试’,还是说就是一次团队内部的意外操作?你更倾向于哪种解释?为什么?”这个问题,哈哈,我个人觉得,像OpenAI这种级别的公司,任何‘意外’都可能不是真正的意外。我更倾向于这是一次‘探水温’式的测试。你想啊,一个OpenAI的员工,一个顶尖开源项目的核心人物,还有一个Meta的,这团队配置多豪华?如果真是手滑,这手也太滑了。他们可能就是想看看市场反应,舆论走向,以及竞品动向,同时给自己留了个‘手滑了,对不起’的退路。毕竟,这种先放风再撤回,比直接官宣可操作空间大多了。

这个问题问到点子上了!“OpenAI作为一个商业公司,如果真的发布120B参数的开源GPT模型,这对它的商业模式和行业地位会有什么影响?这步棋是好是坏?” 我觉得这绝对是‘高风险高回报’的一步棋。好的地方在于,可以迅速扩大市场渗透率,让更多人接触到GPT技术,也能在某种程度上‘洗白’之前被诟病不够开放的形象。坏的地方嘛,那可多了,竞争对手可以直接拿去优化,甚至‘套壳’盈利,OpenAI自己要怎么收割这波红利呢?会不会变成‘赔本赚吆喝’?我猜他们内部肯定也是经过了无数次头脑风暴,才敢尝试这么刺激的策略吧!

关于“文章里提到模型可能采用FP4、BF16、UE8等混合精度量化方式,这些技术在大型AI模型部署中具体有什么优势?(比如对硬件要求、运行速度、资源消耗方面)”这个问题,最大的优势就是能让模型变得“瘦身”且“跑得快”!比如FP4、BF16这种低精度格式,它们占用的显存更少,传输数据更快,计算时也能利用更高效的专用硬件指令(比如Nvidia Tensor Cores),自然就大幅加速了推理速度。对于大型模型来说,这意味着你可以在更便宜、更少的GPU上运行同一个模型,或者在相同的硬件上跑更大的模型,极大地降低了部署成本和能耗,同时提高了响应速度。简直是模型部署的“神仙操作”!