GitHub上MCP实现的大规模数据集

arXiv cs.SE 2026-07-14T05:51:46.616442

论文信息

论文信息

摘要

模型上下文协议(Model Context Protocol, MCP)的迅速出现,为将大语言模型连接到外部工具和服务引入了新标准。尽管该协议在开源开发中已被广泛采用,但目前对于MCP如何实现、结构化及维护的系统性理解仍然有限。本研究提出了首个基于大规模真实世界证据的MCP实现数据集,该数据集直接从GitHub采集。通过采用整合了GitHub REST和GraphQL API以及自定义Python验证脚本的混合管道,我们发现了3,238个候选仓库,并通过多阶段证据检查进行了筛选和验证。每个经过验证的项目按照操作角色(如客户端、服务器、网关)进行分类,并以可复现的JSONL模式导出。对代表性子集的人工审查确认,在95%的置信水平下整体精确率达到83%,并且还发现了一组主要作为教育样本、教程或演示模板的仓库。随后应用了针对性的排除规则来移除这些非操作性仓库,最终得到包含2,297个已验证MCP项目的数据集。分析表明,Python和TypeScript主导了MCP开发,混合架构成为最常见的设计模式。通过强调透明的验证策略、结构化的证据标记以及可复现的数据组织,本工作为研究真实世界MCP生态系统建立了基础基准,并支持未来在更广泛开发者社区中关于集成、连接性和兼容性的研究。

查看原文