Gemini与DeepSeek在后端软件工程中大语言模型生成代码质量与架构鲁棒性的比较评估

www.semanticscholar.org 2026-07-13T06:07:07.441609

论文信息

论文信息

Gemini与DeepSeek在后端软件工程中大语言模型生成代码质量与架构鲁棒性的比较评估

摘要

随着大语言模型(LLM)在软件工程工作流中的集成日益增加,这种被称为"vibe-coding"的实践亟需对其代码生成能力进行系统的实证评估,尤其是在复杂后端开发与架构决策的背景下。本研究比较了主流基础模型Google Gemini 3 Pro与DeepSeek-V3.1,在遵循典型vibe-coding流程的结构化提示链协议下,为Java/Spring Boot后端应用程序开发所生成的解决方案。我们采用多个定量与定性标准进行评估,包括纠正性提示次数、所需手动代码干预程度、功能正确性、架构鲁棒性、与可维护性相关的设计选择、延迟以及测试质量。结果显示两个模型之间存在显著差异。DeepSeek所需的纠正性自然语言提示次数是Gemini的两倍,但两个模型在生成代码中所需的手动干预次数相似:DeepSeek为23次,Gemini为20次。最显著的差异在于架构推理能力。Gemini自主引入了数据传输对象(DTO)设计模式,实现了解耦架构,尽管带来了轻微的性能问题。相比之下,DeepSeek在样板代码开发方面表现更优,但通过应用程序接口暴露了原始JPA实体,导致紧耦合等问题。Gemini的解决方案满足了90.25%的评估需求,而DeepSeek仅为68.08%。此外,Gemini生成的测试具有更高的成功率和更广的代码覆盖率:测试执行成功率达95.7%,代码覆盖率达55.9%;而DeepSeek分别为74.1%和45.6%。结果表明,在vibe-coding范式下,即使是当前最佳的基础LLM,仍可能需要人类专家的监督,尤其在生成代码需满足生产级后端系统特定要求时。

查看原文