刚刚,DeepSeek公布了推理引擎开源路径,OpenAI也将开始连续一周发布


刚刚,DeepSeek公布了推理引擎开源路径,OpenAI也将开始连续一周发布

仅用于站内搜索,没有排版格式,具体信息请跳转上方微信公众号内链接

机器之心报道
编辑:Panda
今天下午,DeepSeek默默地在自己的open-infra-index库中发布了一份题为「开源DeepSeek推理引擎的路径」的文档,宣布将开源自己的内部推理引擎(internalinferenceengine)并与开源社区建立更广泛的合作。有意思的是,该文档发布之后不久就经历了两次修改,对一些措辞和表述进行了更加中立和宽泛的处理。
在其中一次修改中,DeepSeek提到了与SGLang和vLLM项目的合作关系,但这两个具体的项目名称在新版本中被替换成了「现有的开源项目」。修改原因是为了强调「未来的开源合作是面向整个开源社区的,不局限于具体某些项目。」因此,DeepSeek与SGLang和vLLM这两大开源项目的合作关系应该是已经确定了。
不得不说,DeepSeek非常GOAT(GreatestofAllTime)!
而就在不久前,SamAltman才宣布OpenAI将开始一轮发布周。犹记得上一次,在OpenAI一连12个工作日的连续发布中,o1满血版、Sora、强化微调技术、Canvas更新、o3-mini等产品和服务纷纷问世。不知道,这一次,OpenAI又将发布什么东西?
事实上,各路网友已经开始根据各种草蛇灰线的线索开始猜测这一周将会发布的东西了。说实在的,有一些颇具说服力,而且还有证据。
下面我们首先将介绍「开源DeepSeek推理引擎的路径」,然后将简单盘点一番网友对OpenAI这周发布内容的预测。
开源DeepSeek推理引擎的路径

以下为DeepSeek发布的文档的原文译本:
几周前,在开源周期间,我们开源了多个库。社区的反响非常积极——激发了鼓舞人心的合作、富有成效的讨论以及宝贵的错误修复。受此鼓舞,我们决定更进一步:将我们的内部推理引擎回馈给开源社区。
我们非常感谢开源生态系统,没有它,我们不可能在通用人工智能(AGI)方面取得进展。我们的训练框架依赖于PyTorch,我们的推理引擎基于vLLM,这两者都对加速DeepSeek模型的训练和部署起到了重要作用。
鉴于部署DeepSeek-V3和DeepSeek-R1等模型的需求日益增长,我们希望尽己所能回馈社区。在我们起初考虑将完整的内部推理引擎开源时,我们发现了一些挑战:
代码库差异:我们的引擎基于vLLM一年多前的一个早期分支。虽然结构相似,但我们针对DeepSeek模型对其进行了大量定制化处理,因此难以扩展到更广泛的用例。
基础设施依赖:该引擎与我们的内部基础设施(包括集群管理工具)紧密耦合,如果不进行重大修改,就无法进行公开部署。
维护带宽有限:作为一个专注于开发更优质模型的小型研究团队,我们缺乏维护大型开源项目的带宽。
考虑到这些挑战,我们决定采用一种更可持续的替代方案:与现有的开源项目合作。
展望未来,我们将在以下方面与现有的开源项目紧密合作:
提取出分立的功能:将可复用的组件模块化并作为独立的软件库贡献出来。
共享优化:直接贡献设计改进和实现细节。
我们衷心感谢开源运动——从操作系统和编程语言到机器学习框架和推理引擎。能够为这个蓬勃发展的生态系统做出贡献,并看到我们的模型和代码受到社区的广泛欢迎,我们深感荣幸。让我们携手突破通用人工智能(AGI)的界限,并确保其造福全人类。
注:需要说明,本文仅概述了我们开源DeepSeek-Inference-Engine代码库的路径。对于未来的模型发布,我们将对开源社区和硬件合作伙伴保持开放和协作的态度。我们承诺在新模型发布之前主动同步与推理(inference)相关的工程工作,目标是使社区能够从第一天起就获得SOTA级支持。我们的最终目标是建立一个同步的生态系统,使尖端的AI功能能够在模型正式发布后无缝地应用于各种硬件。
OpenAI将发布什么?
看了DeepSeek振奋人心的开源路径,再来看看OpenAI是否有可能给我们带来类似的震撼。
o3、o4-mini、GPT-4.1系列模型
对于OpenAI这次发布周,目前最可信的信息还是来自OpenAI自己,其已经在自家的CDN(内容分发网络)上发布了一些图标,几乎明示了即将发布的一系列模型。从目前网友们收集到的数据看,OpenAI这一次一共公布了至少5个图标:
但从这些图标看,OpenAI有可能在今晚开始的发布周中发布至少5个模型,包括o3满血版与o4-mini两个推理模型以及GPT-4.1系列模型(包括满血版、mini以及nano)版。
开源模型
此外,还有人猜测OpenAI可能会开源一个可与DeepSeek-R1比肩的开源模型,而且这个模型很可能就是已经在OpenRouter上线且可免费使用的OptimusAlpha。该模型支持100万上下文长度,网友实测其编程性能非常好。
地址:https ://openrouter.ai/openrouter/optimus-alpha
理由之一是如果用户让OptimusAlpha介绍自己,他会自称是来自OpenAI并且基于GPT-4架构。
机器之心的测试
智能体软件工程师
OpenAICFOSarahFriar近日在高盛举办的一次活动上透露,该公司正在开发一款名叫AgenticSoftwareEngineer(A-SWE)的产品,即智能体软件工程师/自主式软件工程师。不同于编程助手(Copilot),A-SWE可以自己完成构建应用、处理拉取请求、进行质量保证、修复错误和编写文档等任务。
视频由𝕏用户@slow_developer剪辑
在此之前,OpenAI已经发布了Operator和DeepResearch这两款智能体,分别面向计算机控制和深度研究两个应用方向,而A-SWE很显然会是一个面向编程任务的智能体。
除了以上传言,还有网友猜测OpenAI可能还会发布一个新的图像生成模型,并且其性能可能胜过因吉卜力风格生成而大火的GPT-4o。不过关于此传言的切实信息并不多。
你期待在OpenAI这次发布周上看到什么呢?
参考链接
https ://github.com/deepseek-ai/open-infra-index/tree/main
https ://x.com/sama/status/1911490401221120284
https ://cdn.openai.com/API/docs/images/model-page/model-icons/gpt-4.1-mini
https ://x.com/ImperialistsL/status/1911677033404612659
©THEEND
转载请联系本公众号获得授权
投稿或寻求报道:liyazhou@jiqizhixin.com


文章作者: ZejunCao
版权声明: 本博客所有文章除特別声明外,均采用 CC BY 4.0 许可协议。转载请注明来源 ZejunCao !
  目录