CWM:一个用于世界模型代码生成研究的开源权重大语言模型

arxiv.org 2026-07-04T19:25:22.245186

论文信息

论文信息

摘要

我们发布了代码世界模型(CWM),一个拥有320亿参数的开源权重大语言模型(LLM),旨在推进基于世界模型的代码生成研究。为了提升对代码的理解,超越仅从静态代码训练中学习的能力,我们对CWM进行了中间训练,使用了来自Python解释器和智能体Docker环境的大量观测-动作轨迹,并在可验证的编程、数学以及多轮软件工程环境中执行了广泛的多任务推理强化学习。通过CWM,我们为研究者提供了一个强大的试验平台,以探索世界建模在计算环境中通过推理和规划改进代码生成的潜力。我们展示了世界模型如何赋能智能体编码、支持Python代码执行的逐步模拟,并提供了关于推理如何从中受益的初步结果。CWM是一个密集的、仅解码器的LLM,训练上下文大小高达131k tokens。独立于其世界建模能力之外,CWM在通用编程和数学任务上表现出色:在SWE-bench Verified(含测试时缩放)上达到65.8%的pass@1得分,在LiveCodeBench上达到68.6%,在Math-500上达到96.6%,在AIME 2024上达到76.0%。为了支持关于代码世界建模的进一步研究,我们发布了中间训练、监督微调(SFT)和强化学习(RL)后的模型检查点。

查看原文