[2606.26103] 探究LLM的问题解决能力——基于静力学题目的研究
[2606.26103] 探究LLM的问题解决能力——基于静力学题目的研究
作者: Tanner Culleton, Hung-Fu Chang
提交日期: 2026年4月30日
大语言模型(LLMs)凭借其在广泛学科中完成作业和考试的能力,已迅速影响了社会的诸多方面,尤其是教育领域。尽管已有研究探讨了LLM的教育影响,但现有工作大多依赖于公开或开放的问题数据集,且缺乏针对特定主题的分析。在工程教育中,尤其是机械工程领域,关于LLM在特定问题类型上表现的系统性研究仍然有限。不同于传统方法直接向LLM工具提问教科书上的问题,我们的研究采用模型蒸馏(model distillation)过程来评估LLM解决静力学问题的能力。通过蒸馏ChatGPT,我们提取了25个纯文本静力学问题,并进一步通过添加图表和修改数值构建了另外两个数据集。实验结果表明,虽然LLM在纯文本静力学问题上表现良好,但当引入图表且问题需要多步推理时,其准确性会下降。进一步分析表明,这种性能下降的主要原因并非图像识别能力的局限,而是多步推理的困难以及在连续求解阶段中一致性地应用提取的视觉信息方面存在不足。