AfterVibe: 对话结束后剩下的东西

arXiv cs.SE 2026-07-14T05:51:46.608546

论文信息

论文信息

摘要

我们提出 AfterVibe,一个从氛围编程(vibe coding)会话中恢复自然语言规格说明的框架。给定一个代码产物及产生它的对话轨迹,AfterVibe 使用大语言模型(LLM)提取一份抽象的自然语言规格说明,以捕捉开发者的意图,并通过一个再生测试进行验证:一个独立的、盲法的 AI 代理仅根据该规格说明重新实现代码产物,生成的代码再通过一个多层验证流水线与原代码进行比对评分。规格说明的质量由此衡量:若代理能生成通过验证的代码,则认为该规格说明是强的;否则迭代优化。我们在来自一家公司内部编程会话的 72 个真实世界氛围编程项目上评估 AfterVibe,发现其恢复的规格说明在设计上是抽象的——捕捉行为意图而不规定实现方式——但却是强的。多次独立再生获得了平均 5.06(满分 6.0)的高再生评分,同时细节上保持多样性,证实了该规格说明约束了“做什么”而没有过度规定“怎么做”。除了超越现有的人工撰写的描述外,这些规格说明还能通过迭代进一步强化至 5.74 分。一个实际意义是:当 AI 生成的代码已超越常规代码评审的速度时,规格说明——而非代码——可能成为人工审查的主要产物和记录来源。

查看原文