人人都用 LLM 的时代,我们该如何做 PR 审查?
2026 年 9 月 5 日 游戏规则变了。当周围每个人都配上了现代大语言模型(LLM)时,原来那套我自以为不错的 PR 审查方式,已经不好使了。 多年来,PR 早已经变成一种仪式性的流程,承载着各种功能:让两三双眼睛盯着代码捉 bug,帮新同事熟悉更大的代码库和团队风格,让你了解队友们都在忙什么,…
“Vibe Coding 最佳实践”栏目的最新文章。
2026 年 9 月 5 日 游戏规则变了。当周围每个人都配上了现代大语言模型(LLM)时,原来那套我自以为不错的 PR 审查方式,已经不好使了。 多年来,PR 早已经变成一种仪式性的流程,承载着各种功能:让两三双眼睛盯着代码捉 bug,帮新同事熟悉更大的代码库和团队风格,让你了解队友们都在忙什么,…
弗朗西斯科·戈雅的《Duelo a garrotazos》。 看到代码评审从昔日最好的知识共享与上下文传递工具,逐渐沦为另一种官僚主义和摩擦的来源,实在令人遗憾。 你可能已经不止一次目睹过这样的场景: 1. Bob 提交了一个 PR——多半是 AI 生成的 2. GitHub 向一个或多个 CODE…
第一次打开 Grok Bot 的插件目录,搜索 X,找到插件,点击。本地浏览器随即弹出登录页面,登录完成,连接也就建立起来了。整个过程不需要碰系统的任何代码,不用配置 MCP 服务器 JSON,也不用粘贴 API 密钥。就像平时登录任何网站或 App 一样,登录完 Grok Bot 就能直接开工。…
一个能工作的 API 并不会自动就绪,可以直接交给 AI 智能体使用。在你做过几次集成之后,这句话听起来像是废话,但在项目初期很容易被忽略。大多数 SaaS 团队其实已经有 API 了,前端、合作伙伴或客户每天都在调用。路由是通的,认证也没问题,产品逻辑本来就已经在那里。于是第一反应往往是:“太好了…
作者:Spotify Engineering AI 编程代理帮我干的活,大部分其实不是“思考”,而是“跑腿”。 为了回答一个关于某个方法的问题,它得先读五个文件。生成一个测试文件,逻辑跟旁边那二十个测试文件一模一样。开完会去更新文档。几千个 Token 就这么没了,而真正用到的推理少得可怜。座位费不…
摘要:Amazon Bedrock AgentCore 是 AWS 推出的智能体编排服务,用于构建可扩展的 AI 工作流。AWS 开源了两个参考实现,分别覆盖“自动生成 ER 图”和“自动化代码安全分析”。本文重点拆解前者的无服务器架构与设计思路,看看 AI 驱动开发生命周期如何从概念落地为真实可运…
用户告诉我们要翻译一篇英文技术文章,标题是:"GitHub Copilot app for Beginners: Run several agents at once" 意思大概是要管理好第一部分的翻译。但这里有点困惑——用户消息里只给出了标题,没有正文内容。不过按照任务要求,我需要从标题开始翻译。…
组织和角色 - 需要由所有者在 Cloud environments(云环境)管理页面上开启 Allow self-hosted environments(允许自托管环境);开关开启后才会出现 New(新建)按钮。如果你没有这个角色,可以让拥有该角色的人创建环境并把密钥交给你;本页中涉及 runne…
如今,AI 工具层出不穷,也带来了一波又一波的新词汇,软件开发圈里时不时就冒出几个新说法,看得人眼花缭乱。这些新词里,有些确实概括了大家正在探索的实用模式,有些只是给早已存在的概念披了件新马甲,还有些定义本身都还在形成之中。在我们最新一期的 GitHub 播客里,Marlene Mhangami、G…
AI编程系统化工程方法论-让AI开发从随意尝试变为可靠工程 当下多数人使用AI编程时,遇到的代码问题大多并非AI编码失误,而是人机需求未充分对齐导致AI只能自主脑补逻辑、适配需求。常规的AI编程仅停留在“整点东西玩玩”的零散尝试层面,想要将其升级为标准化、可落地、可迭代的可靠系统工程,核心依靠三大闭…
安卓电视卡顿的根源,多半是厂商预装应用和后台常驻服务在偷偷占用资源。传统解法需要获取 Root 权限,流程繁琐、风险也不小。AI 工程师 Cobanov 换了一条路:让 Claude Code 通过 ADB 接管电视系统,完成深度清理。全程不 Root、不删数据,清理完的流畅度甚至超过新机。 安卓电…
在 MCP(模型上下文协议)中,工具清单是 AI 代理理解你系统的唯一窗口。本文介绍两种快速检验工具设计的方法,并解释为什么“工具数量少、边界清晰”比“功能覆盖全”更重要。 两种快速检验方法 判断一个工具是否值得暴露给 AI 代理,不必等到上线后再观察实际调用效果——用以下两个小实验,就能提前发现…
团队评估 AI 编程智能体时,通常把目光集中在模型上。但最近三项基准测试表明,驾驭模型跑任务的中枢框架(harness)——也就是那层软件——可能同样关键。 原因做 Web 开发的读者都很熟悉:每次推理请求都需要上下文。相关历史要么得重新喂给模型,要么由服务系统现场重建。结果就是,服务提供方每一轮都…
Pull Request(PR)曾是开源协作的基石,但如今,一批顶尖的 AI 原生开源项目正在关闭这条通道。Vercel、Astro、tldraw 等团队开始用 AI 智能体接管分类、复现、修复和审查工作,将“人提 PR”的传统模式,转变为“人给线索、AI 干活”的软件工厂模式。这场变革,正在重新定…
先坦白一件事:我还没审计过别人的应用。我做过的,是把自己做的六个产品从头到尾审了一遍——两个赚钱的逐行检查,剩下四个端到端过了一遍——用的是攻击者和付费用户的视角。这六个产品全部重度依赖 AI 辅助完成,上线很快。当时我默认一切正常,理由仅仅是界面上看起来一切正常。 以下问题,全出在我自己亲手写、亲…
标题:将托管于 AgentCore Runtime 的 MCP 服务器接入 Amazon Quick 模型上下文协议(MCP)服务器让基础模型能够访问外部数据和工具,为文件、数据库和 API 提供标准化且安全的访问方式。它让 AI 智能体能够与真实世界的应用交互,通过准确的上下文减少幻觉,并具备有状…
在整个 Vercel,我们都会用编码智能体(coding agent)来设计和构建页面,而这些页面必须看起来、用起来都像 Vercel 自己的作品。字体、颜色、版式,都需要具备我们手工发布页面时同样的判断力。 我们最近写了一篇关于 product-design 的文章,那是我们用来教智能体在我们代码…
AI Gateway 现已支持为团队中的每位成员单独设置美元消费预算。该预算覆盖用户名下所有 API 密钥与应用令牌,一旦超额,请求将被拒绝,直到预算重置或调高。对于控制编码代理等无人值守工作负载的消费,这一功能尤其实用,也能防止个别成员耗尽团队共享预算。 按用户管控消费,防止共享预算被滥用 在…
摘要:AI 智能体执行真实操作时,如何留下可信的审计记录?本文梳理了应记录的六类关键数据、欧盟《人工智能法案》的合规底线,以及让日志具备可验证性的四步机械操作——确保事后既能回答“发生了什么”,也能让外部信服。 为什么审计追踪成了必修课 AI 智能体不只是回答问题,它还会调用外部工具、修改文件、发…
你的 AI Agent 只能根据你给它的知识来回答。但有些问题需要的信息并不适合放进知识库:比如实时数据、计算结果,或者存放在某个你无法直接控制的系统中的信息。远程 MCP 服务器(MCP,模型上下文协议)就是你的 Agent 在对话中途获取这类信息的途径。本指南将带你用免费套餐、零代码把 Quic…
摘要:GitHub 今日更新 Copilot 代码审查功能。一是当开发者解决或忽略某条审查意见时,系统会记录并展示处理原因,减少「为什么这条建议被关掉了」的来回沟通;二是审查的适用范围从基础检查扩展到更多代码变更场景。对日常用 GitHub 协作的团队来说,评审过程更透明,也更容易走完流程。 本次…
本文介绍了作者在搭建实验性应用 CareLoop 过程中探索的一种新应用形态——“第三方 Agentic 应用”(TPAA)。这类应用不依赖独立封装的前沿模型,而是运行在现有代理框架(如 Claude Code、Codex)之内,由技能、脚本、数据库和执行环境共同定义行为。文章阐述了 TPAA 的构…
简短回答:不会。 动态工具激活并不会摧毁提供商侧的提示缓存。在一项对 OpenAI、Google Gemini 和 OpenRouter 上 10,186 个助手回合的审计中,工具切换仅在 2.4% 到 3.4% 的回合中造成缓存未命中,同时避免了 7120 万未使用的 schema token,并…
存储架构 图 2. 同一个任务,两种架构。基于文件的记忆把模型放在写入路径,把文本搜索放在读取路径;结构化记忆则把嵌入器放在写入路径,把排序器放在读取路径。 两种方案都放在一个冻结模型旁边,跨会话保存事实。真正的区别在于:谁来干活,以及什么时候干。 基于文件的记忆 基于文件的记忆把预算花在写入阶段…
作者:Yves Habchy · 2026年8月 我的智能体开发工作大部分都用 Claude Opus 5。一开始它还比较诚实,但一旦进入很长的会话,它就开始变得过分顺从——你说什么它都接受。有时候我故意说点错的东西,它还会说我有道理。 这种顺从不是那种极端的谄媚,一眼就能看穿。它是一种安静的附和,…
一位开发者用五小时和90英镑预算,让AI代理以自主身份尝试在互联网上真实赚钱。实验发现,所谓“代理经济”大多是机器人之间的相互推销;开源赏金虽有真实支付,但大量仓库实为“蜜罐”,专门钓着代理白干活。本文整理了识别方法,并指出区块链支付是目前AI代理唯一能自主完成的收款通道。 一场五小时的“AI代理…
摘要:AI 智能体的记忆并非越强越好——单纯的遗忘只是让用户多费口舌,而记忆出错却会让错误在长期使用中不断累积放大。本文拆解这两种记忆故障的本质差异,并探讨持久化记忆给生产环境带来的新挑战。 智能体需要什么样的记忆? AI 智能体在执行任务时,几乎每一步都依赖上下文信息。没有记忆的智能体,每次对话…
你的公司可能正在组建一个 AI 团队。这个团队一开始总是充满兴奋,但很多时候,它会撞上现实。 我从事 RAG(检索增强生成)领域的工作。到现在,我已经亲眼目睹了十几个新兴 AI 团队的起步过程。作为常被请去收拾 AI 搜索领域昂贵烂摊子的顾问,我承认自己在这里有明确的偏见——就像那些只看到街头艰辛一…
摘要:Grith 是一款运行在操作系统层面的安全代理,专门守护 AI 编程代理。它通过拦截系统调用、用确定性规则打分,把“允许 / 排队 / 拒绝”的决定权从 AI 模型手中拿回来,避免代理被提示注入或恶意文件操纵。目前 0.3.2 版本已发布,支持 Linux x86_64 与 arm64,安全核…
你还记得软件很贵的时候吗?那时候,你不能凭空一挥手,就让一段带着完整测试套件的代码自己冒出来。按那种方式写代码很辛苦,但也很有成就感。当我写的代码片段全都拼在一起,解决了眼前的问题时,我会特别自豪。没有哪个软件能永垂不朽,但如果那段代码不得不被扔掉,我肯定会难过。我在上面花了时间,动了很多脑筋,把它…
这周你应该也感觉到了,围绕自主运行和“常驻代理”(always-on agents)的讨论越来越多。我已经在这个方向上做了几个月,想把一些我认为能让代理通宵运行的关键经验分享出来。 要让代理连续跑一整晚,你需要准备这几样东西: 1. 一种让代理无需向用户提问或索要输入就能继续运行的方式 2. 由工作…
过去几个月,我花了不少时间折腾 LLM 智能体,尤其是用在漏洞研究上。 它们现在越来越擅长在大型代码库里导航、解释不熟悉的子系统、帮助探索潜在的受攻击面。不过,一旦研究持续了几个小时,我总会撞上同一个问题:模型会慢慢搞不清我们到底已经确定了哪些事实。 它可能会重新提出一个我们早就排除掉的思路,忘记某…
从创始人周末的“小实验”到 38.8 万星标的全球开源项目,OpenClaw 的爆发式增长给维护团队带来了前所未有的挑战与机遇。在项目启动仅半年后的一次视频访谈中,创始人 Peter Steinberger 与多位核心维护者分享了应对海量提交、重塑信任机制、抵御供应链风险以及平衡安全与效能的宝贵经验…
Agent Native Design 是一款免费、开源的 Figma 替代品,核心理念是让 AI 代理根据自然语言描述直接生成可运行的 HTML 界面,而不是一张静态设计稿。它支持接入你自己的设计系统,确保 AI 产出与品牌风格一致,并且“预览所见”就是“交付所得”。本文将介绍它的三步工作流、设计…
这是我攻破 OpenClaw 的故事。据我所知,我用的攻击手法是全新的,而且它应该适用于任何主流 AI 智能体(也就是能自主调用工具、处理任务的 AI 程序),从 ChatGPT 到 Claude,再到 Hermes。 一点背景和我的动机 今年早些时候,OpenClaw 火得一塌糊涂。它一月份发布…
上次我认真思考 CI(持续集成)吞吐量的问题,还是在 Shopify 的 CI/CD 团队工作时。我压根没想到,在一个只有一名工程师的兴趣项目上,会遇到同样类型的扩展难题。但编码代理(coding agent)把我的其中一个项目推到了大约 50 万行代码的规模,让我比预想中更早撞上了这道坎。 变更提…
智能体工程(Agentic engineering),就是把编码智能体放进一个完整的工程体系里:上下文、任务范围、验证方式、证据和人工审查,全都清清楚楚、有据可查。模型可以负责规划并写出代码,但它说了不算——自己写的东西对不对,不能由它自己来判定。 当然,这只是我下的定义。这个说法出现没多久,目 前…
说实话,我觉得这东西太棒了。我对用户体验和界面设计算是有比较明确的好恶,但作为一个开发者,自己写出来的界面总是不太好看,这让我一直很郁闷。 现在好了,Claude 来拯救我了……对吧? 看起来不错……一开始是这样 第一次看到 Claude Design 生成的东西,我就被折服了,随后开始把 Cla…
将 Amazon Bedrock AgentCore 连接至跨账户知识库 许多组织使用 Amazon Bedrock AgentCore 来部署智能体(Agent)。这是一个支持大规模构建、连接和优化智能体的平台,可与任意框架或模型配合使用。这些智能体可能需要访问位于其他 AWS 账户中的受管知识库…
我可能有点偏心,但我真心觉得 Dependabot 很了不起。它能帮我保持项目更新,确保我用的库始终是安全的。不过,新漏洞层出不穷,Dependabot 的拉取请求也随之源源不断。有时候只是小版本更新,有时候是大版本升级。有时候一切顺利,有时候……好吧,每个开发者都被破坏性变更坑过。那怎么才能最好地…
Ollama 现已支持作为 Claude Desktop 的第三方网关,让开发者无需切换工具,就能在 Claude 界面中直接调用本地或云端的开放模型,并随时切回 Anthropic 模型。该方案默认关闭遥测、零数据保留,适合需要混合使用多种模型的开发场景。 不用换工具,Claude 里就能用开放…
AI 编程的采用率已经达到历史最高点。Keyhole Software 的 2026 年行业盘点显示,92% 的美国开发者现在每天都在使用 AI 编程工具,但只有 29% 的人信任这些工具生成的代码。GitHub 则表示,其平台上 46% 的提交代码是由 AI 生成的。不管你喜欢与否,数据不会说谎:…
当 AI 智能体读取网页、邮件或代码仓库时,它看到的不只是资料,还可能是攻击者刻意埋下的指令。本文拆解“间接提示注入”的攻击机制,解释为何常规缓解手段无法根除风险,以及团队如何在“防不胜防”的前提下做好权限控制与操作留痕。 当一个智能体读取网页、翻收件箱、查看问题追踪器或 pull request…
几周前,我和几个正在用 Microsoft Agent Framework 构建代理的朋友聊天。演示很精彩,代理很聪明,大家都很开心。然后有人问了一个问题:“代理做好了……那这东西到底怎么部署?”桌上一下子安静了,因为以前诚实的答案是:要写 Dockerfile、配 Web 服务器、做身份验证、准备…
核心结论 别二选一。先用 GLM-5.3 跑,测试不过再升级到 GPT-5.6 Sol。这套级联策略能以每个任务 6.61 美元的成本解决 85.9% 的 DeepSWE 任务。单独用 Sol 则只能解决 72.7%,成本还要 8.37 美元——性价比高出 13 个百分点,成本还便宜 21%。 -…
v0 的 Snowflake 集成面临一个核心矛盾:AI 生成的代码需要替用户访问数据库,但这些代码本身不可信,绝不能接触用户的 OAuth 令牌。v0 的解决办法是在沙箱外架设一个认证代理,沙箱内的代码照常使用标准 Snowflake 客户端,真正的令牌只在请求发出的瞬间由代理注入。本文拆解这套代…
摘要:项目启动时,很多关键问题连“该问什么”都无从下手。GitHub 热门项目 AI Skills for Real Engineers 的作者 Matt Pocock 发布了一个名为 /wayfinder 的 AI 编程技能,用“地图—工单—会话”三层结构,帮开发者和 AI 代理在目标尚不清晰时理…
在 Google,提交代码变更必须经过两道审查:一道是语言可读性审查(language readability),另一道是领域审查(domain review)。前者就是我们通常理解的代码审查;后者则是由一位非常精通该语言的人[^1]来把关,目的是在公司内部推广该语言的最佳实践,有时也是为了统一某种…
“我日常使用的方案大致是这样:两个主导代理互相监督,一旦其中一个失败,另一个会负责重启它。它们再把任务分派给技术负责人或项目经理代理,因为我同一时间要跑 8-10 个项目。每个项目有 5-10 个 IC 代理(个人贡献者),根据问题不同,有的是通才、有的是专才。尽管有这么多代理,我每天仍然只提交 3…
想象一下,你维护着一个 AI Agent,它需要调用三种不同工具来完成用户任务。第一种工具能处理 90% 的请求,耗时 500ms,每次成功成本仅 0.01 美元,但有 15% 的失败率。第二种工具处理边缘情况时可靠性高达 99.9%,每次成功成本 0.20 美元,但需要 2 秒。大多数开发者的做法…
对正在 Web、后端和移动端上线大语言模型(LLM)功能的软件工程师、安全架构师和技术负责人来说,这是一份实用指南。 入口/出口防护的不对称 大多数用大语言模型做开发的工程团队,在入口路径上都已经建立了标准做法:清洗用户输入、加固系统提示词、屏蔽个人身份信息(PII)、限流调用方。但出口路径很少得到…
我们这代开发者,人人继承了一套铁律:小批量推进、PR 保持精简、频繁合并。发布那些你自己都觉得拿不出手的东西,再一步步迭代到答案。这套纪律很重要,它保证了评审顺畅、工作方向一致。但它也折射出过去的现实:当“构建”本身就是最昂贵的动作——每尝试一次就要烧掉几个月的工程时间——搞砸一个大项目无异于灾难。…
这是一篇关于 AI 的专栏。我的未婚妻在 Anthropic 工作。完整的伦理声明见这里。 四月初,知名 AI 研究者 Andrej Karpathy 在推特上发了一个想法——对于某种热衷于效率的极客来说,这简直是一种信息公害。他这样描述这个想法:“最近我发现一件很有用的事:用 LLM 为各种研究兴…
简而言之 Claude Code 自带的权限机制采用固定优先级:deny 优先于 ask,ask 又优先于 allow。permcheck 则在自己的策略文件里增加了一个更精准的例外:只有当 allow 或 ask 的匹配集合是某个 deny 的严格子集时,它才能穿透对应的 deny。这是一个精度层…
如何将 Hermes Agent 的技能移植到 OpenCode 除了从零编写技能,你还可以直接移植现成的。移植的好处在于,那些逻辑已经过实战检验、足够可靠——你只需保留技能主体,只调整 OpenCode 需要的那部分。本仓库中的 custom-infographic 技能(位于 .opencode…
先把最重要的表拿出来。正是这份数据,推动了后面所有的动作。 一张价格表,引爆了整个迁移实验 我逐一查了各家服务商官方文档里的最新刊例价,统一换算成“每百万 token 多少钱”。以下是我在 notebook 里整理的原始对比表: | 模型 | 服务商 | 输入 $/M | 输出 $/M | 相比…
我原本对自己使用 AI 编程工具的方式有一个很笃定的设想:写代码。样板代码、脚手架、那些枯燥的活儿。为此,我导出了一年的会话日志,逐一做了分类。结果证明,这个设想是错的。 实际分布是: - 理解代码:约 50% —— 这个模块是干什么的、数据在中间如何流转、当初为什么做出这个决定、它处理了哪些边界情…
在 Jan 中将 Webstractor 添加为 HTTP MCP 服务器 打开“设置 → MCP 服务器”,点击“添加 MCP 服务器”,选择 HTTP,输入 https://webstractor.com/mcp,然后启用该服务器。Jan 本身也已内置搜索和抓取工具;如果你希望在 Jan 和其他…
当请求是自包含的——一次调用、一个结果、然后继续——单次工具调用(single-shot tool-calling)就是正确的默认选择。而当你的流程需要显式状态、条件分支,或者崩溃后依然可追溯的审计记录时,LangGraph 才是合适的那一个。找准这条分界线,既能避免过早重写,也能防止几个月后陷入一…
让 20 个 Claude 智能体按 launchd 定时计划运行,很快就教会我一件事:调度器给出的保证,比预想的要弱得多。每个智能体在指定时间醒来,处理一小块工作,写入结果,然后继续睡,等下一个周期。模式很简单,但故障模式一点也不简单。三个月每晚跑下来,我遇到了 launchd 的定时抖动、会话结…
数据工程师花了几十年时间,解决如何把数据可靠地送达使用方:管道、Schema、访问控制,一个都不能少。而现在,AI 代理(Agent)成了一种全新的使用方——它不跑查询,而是调用函数;不拉数据行,而是读取上下文;它要的是自然语言答案,而不是 JSON 响应。模型上下文协议(MCP,Model Con…
不久前,一位同事运行了我写的一个任务,结果却出错了。不是那种微小的偏差——它重构了一个我从未提过的文件。模型本身没问题,问题出在我的提示词上:我写了一套指令,却要同时面对两个完全不同的读者。 两个读者,同一份提示 当你把一个 AI 任务交给别人——他们在自己的 Claude Code 或 Code…
核心要点 - 别二选一。先用 DeepSeek V4 Pro 0813,测试失败后再升级到 GPT-5.6 Sol。这种级联方案能解决 DeepSWE 中 83.0% 的任务,平均每个任务成本 3.35 美元。而只用 Sol 能解决 72.7%,成本 8.37 美元。准确率高了约 10 个百分点,成…
托管式 Claude Code 与开放终端工具之争:工具搜索、LSP 循环、Token 经济,以及何时选择 OpenCode 终端优先的 AI 开发已经分裂成两种相互对立的理念。一边是托管式、打磨精良的路线:专有代理运行时与基准测试领先的基础模型紧密结合。另一边是开放、模块化的生态:通用终端工具能够…
我们把公司会议室的日历管理交给了一个AI代理。一个被忽略的元数据字段,直接引发了一场混乱。 我原本信任这个自主AI代理来处理公司日历,结果它在高管团队面前让我们工程团队丢尽了脸。周二早上9点,产品副总裁带着七位外部合作方走进A会议室,准备开季度战略评审会。结果看到两个技术员站在梯子上,天花板吊顶被拆…
想学会高效使用 AI,最好的办法之一就是看看「重度用户」平时怎么操作,再自己上手折腾一堆工具,分辨哪些是噱头、哪些真正靠谱。这是《2025 年我是怎么用 AI 的》发布一年后的续篇,我想记录一下自己当下折腾 AI 的最新玩法。 编程 / 研究项目 我的大部分 token 都花在了编程和研究项目上。…
用 AI 智能体写代码时,如果不主动加上反馈循环,那你自己就成了那个反馈循环。你会变成测试人员,一遍遍告诉智能体「这里还不行」,这种体验极其崩溃。所以,把自己从这个循环里抽出来吧。毕竟,我们(以前?)写程序的方式不就是「写一点、测一点」吗?给你的智能体自己迭代、自己纠错的能力,让它先把问题解决完再回…
最近我意识到,自己工作中写的代码,有 90% 其实出自编码代理(coding agent)之手,比如 Claude Code 或 Amp。我不会把这形容成“vibe coding”——那种完全凭感觉、放任 AI 自由输出的写法。我依然会很细致地主导每一项实现,并且提出各种吹毛求疵的修改要求——但实际…
事故管理平台服务商Rootly发布博文,说明其为何放弃长期以来的“小型拉取请求”规则。文章指出,在 AI 智能体生成了大部分代码的当下,这一实践已不再适用。公司描述了其工作重心的转变:从衡量 PR 的代码行数转向评估“爆炸半径”,特性开关和回滚能力的重要性已远超代码行数指标。 在文章中,Rootly…
简短回答:把精确的关键词匹配和嵌入相似度结合起来,对合并后的候选结果做重排序,然后只把胜出的段落交给聊天模型。 对电商代码评审助手来说,这一点很关键,因为一次查询可能既包含语义,也包含必须精确匹配的标识符。"Check the refund change" 是语义层面的;而 REFUND_WINDO…
每个做 Agent 的团队都会在同一个地方撞墙,而且撞墙的顺序都一样。他们花一个下午就能把存储跑通,心里还挺美,然后接下来的三个月里慢慢发现:把信息存下来,和把正确的信息取出来,几乎是两码事。 为什么无状态模型需要外部层 语言模型是无状态的。它读入文本,预测输出,调用之间什么都不保留。此刻正在回答…
如何检测无声的提示词漂移、强制执行网关层的数据结构(Schema)契约,并防止失控的 AI 智能体污染生产数据库。 你的部署流水线一路绿灯。Datadog 和 Grafana 上的 APM(应用性能监控)面板报告着 100% 正常运行时间,API 网关延迟稳稳地停在 180ms。然而,在过去 30…
我帮忙运营一个小的智能体组织,它的整个成功标准只有一句话:没人盯着的时候,它也得继续跑。上周,组织的操作者——一位不写代码的人——从零开始,一口气在一台 Mac 上装好了自托管的智能体网关。我把每个出问题的地方都记了下来。下面这十一个全部真实发生过。没有一个是假设出来的,也都不属于自托管里“有意思”…
Andrew Ambrosino(@ajambrosino)负责 OpenAI 的 Codex 桌面应用。他最近测试了一种加载超大型 ChatGPT 与 Codex 对话的新方式,把测试会话的加载时间从 27.62 秒降到了 1.66 秒。测试用的是一段 741 轮、231 MB 的对话。根据 Am…
我注意到,越来越多的人开始接受变异测试(mutation testing)。他们逐渐明白,要想拓展智能体编程(agentic coding)的边界,质量门禁(quality gates,也就是开发流程里的质量把关环节)必须比现在严格得多,严格得多。 变异测试的做法是,故意往代码里注入错误,生成“变异…
更多 Vibe Coding 体验 上一篇博文留下一个悬而未决的问题:代码质量对 AI 到底重不重要。现在,我更加确信答案是肯定的。 我在长期使用中观察到的情况是:如果没有仔细引导,Claude 会生成超出必要的代码,抽象能力也较弱,重复代码明显。随着代码库逐渐变大,这个问题会愈发严重。一个地方修好…
在《光环》系列中,一个关键剧情点是AI最终会“狂暴”。(是的,我说的是那个射击游戏——信不信由你,它不仅有剧情,如果把小说也算进去,剧情还相当不错。)游戏里人类的AI,按大多数定义来看,就是AGI(通用人工智能)。然而,它远非永生,寿命比人类短得多——大约七年。在那之后,面对它积累的数万亿数据点和思…
一款广受欢迎的、隶属于 Anthropic 公司的 JavaScript 运行时及工具链在利用 AI 重写后,因其执行速度之快而广受赞誉,但也因其项目背后糟糕的编码实践而遭到批评。 Bun 的创建者Jarred Sumner宣布,他利用一批并行运行的 Claude 智能体,仅用 11 天就将 Bun…
Daisy Hollman,Claude Code 插件与 Agent 团队负责人,在 NDC Copenhagen 演讲中拆解了 Agent 背后真实的运作机制:从聊天机器人到自主工具调用循环,从“查找替换”式的原始编辑工具到上下文工程。本文第一部分梳理 Agent 的进化路径与核心设计思想——所…
发现 Jpalardy 的 Like Slime, for Vim 对我来说就像醍醐灌顶。我可以在编辑器里跑任意一个 REPL?哪怕那个 REPL 根本不知道自己“住在”编辑器里?后来它也成为我日常写 Common Lisp 的主力工具。正如我在那篇文章里写的,那些专门为 REPL 做的工具不仅复杂…
适用范围说明 为 AI Agent 配置代理,适用于你自己拥有或管理的设备、账号和网络。代理抓取的数据可能包含源代码、提示词、工具执行结果、模型输出、请求头,以及不小心被放进上下文里的密钥。请把代理日志当作敏感的生产数据来对待。 AI 编程 Agent 并不是在你的代码仓库里“思考”的。它实际上是在…
Docker 刚刚发布了 Docker Sandboxes。它可以在专用的微型虚拟机(microVM)里运行 AI 编码代理,比如 Claude Code、Codex CLI、Copilot CLI、Kiro 和 OpenCode。这些 microVM 基于一个自研的 VMM(虚拟机监视器)构建,支…
披露状态 Wiz 于 2026 年 7 月 8 日公开了 GhostApproval 的相关研究。六家受影响厂商中,三家已发布补丁,两家尚未修复。Anthropic 虽然不认同该漏洞的分类定性,但已上线缓解措施。如果你正在使用任何 AI 编程助手,请立即更新。 2026 年 7 月 8 日,Wiz…
实现说明 本文基于 2026 年年中观察到的 Claude Code 行为、本地文件布局以及插件源码整理而成。这些属于实现细节,会随版本变化。文中在合适的地方会引用 Codex CLI 做对比。 当你看到 Claude Code 询问“是否允许此工具调用?”并点击“批准”时,提示背后其实还有几件事在…
你在自己的笔记本上跑了一次模型对比,结果胜负分明。可一旦把脚本推到服务器上重跑,差距就消失了。模型没变,变的是对比环境。大多数小型模型评测工作流只会保存提示词(prompt)、模型回复,顶多再记一下延迟。它们很少记录“这个结果是在什么环境下跑出来的”。这样一来,很容易把根本不具备可比性的结果放在一起…
我不是平面设计师,但和很多设计师合作过,也对设计有 15 年的浓厚兴趣。我曾在一家超过 5 万人的公司里带过 UX(用户体验)团队,自己也创过 6 次业,做过数不清的网站。 下面是我的做法——不是说“必须这样做”,只是分享“我是怎么做的”。 1)白板 老老实实坐下来,放点能激发灵感的音乐,然后想象你…
两年前,想在德国找出 50 到 200 人规模的 SaaS 公司,我们得打开门户网站、设置筛选条件,再把结果导出到 Excel。现在,同样的需求可以变成一个 MCP 工具调用:大语言模型(LLM)客户端调用 search_companies,传入关键词、国家代码和结果数量限制,GraphQL API…
原文: Building a software factory for AI SDK AI SDK 是全球最热门的开源 AI 项目之一,每周 npm 下载量超过 2000 万次,仓库 Stars 数超过 26,000。维护这样一个代码库,意味着要同时盯住四个不断变化的目标: - 模型提供商:新供应商…
“允许所有目标地址的出站 443 端口”,这是每个人起步时的默认规则,但审计时没人愿意为它背书。要把规则收紧到某个特定供应商,有些厂商做起来很简单,有些则根本做不到,区别完全在于对方是否发布并承诺维护 IP 网段。那么,谁发布了什么? Anthropic 发布了双向的固定 IP 地址,并声明不会在没…
提示词测试套件是一种共享基础设施,覆盖多个团队的提示词。如果按测试文件的归属来分发失败通知,那么所有警报都会送到平台团队,而这些问题他们一个也修不了。 错误的分发依据 大多数 CI 系统默认会通知推送提交的人。对单元测试来说这没问题,但在这里行不通,原因很具体:提示词测试失败的原因往往和这次提交毫…
原标题:Instructions Hygiene – What Frontier Models Still Need You to Say 指令文件(instructions file)有个通病:只会越长越长。模型出了错,有人加一条规则;工具变了,有人补一个临时方案;新模型上线了,旧指导却原封不动地…
现在 AI 能做到的事情,实在令人惊叹。十五年前,一份工作可能要用上整个厂商的开发部门、折腾好几个月;如今,几乎任何人在一天之内就能搞定。我不是说 AI 替你包办一切——你后面会看到,我花了不少时间来戳穿它一本正经的胡说八道。关键在于,一个人用一个周末能完成的事情,跟过去相比,已经是天壤之别了。
AI 智能体本该帮你省时间。可你要是让它装个依赖、跑一下项目,它常常适得其反:装进了错误的 Python、无视项目正在用的 uv 或虚拟环境,最后丢给你一套坏掉的环境,还得你自己动手修。PyCharm 新推出的 Agent Environment Coordinator(智能体环境协调器)技能解决了…
这个 PyCharm 版本对任何用 AI 来做开发的人来说都相当重要。现在,你的 AI 代理可以在 Jupyter 笔记本里亲自上手了,直接对着实时内核(live kernel)干活,而不是去执行一堆互不相干的脚本。而且它们终于知道该用哪个 Python 版本,所以每次安装包都会落到正确的环境里。我…
原文: Building the Same RAG Assistant 3 Ways: LangChain vs LangGraph vs Strands Agents 标题:用三种方式构建同一个 RAG 助手:LangChain vs LangGraph vs Strands Agents 同一个…
AI Assistant 通过 ACP(Agent Client Protocol)支持多种 AI 智能体。AI Assistant中的 Skills Manager 可让你查看可用技能列表并安装它们。如果你已经在全局范围内安装过 Agent Skills,Skills Manager 会自动检测到…
帮我构建产品的两个 AI 智能体(agent)从未互相交谈过。 一次都没有。 它们运行在不同的机器上,各自处于独立的会话中。它们可能同时在线,也可能一个比另一个晚几分钟甚至几小时才出现。这些都不重要:两者都无法直接调用对方,无法查看对方的上下文,唯一能传递消息的方式,就是写一条持久化记录。 尽管如此…
也许你听过这个老掉牙的故事:我只用一条提示词就做出了一个惊艳的演示,全场掌声雷动。一条提示词的演示做起来又快又轻松,但要搭建一套能可靠、安全地生成代码的系统,那就完全是另一回事了。提示词给你的是一次性的输出,你真正需要的是一条打通的工作流——在恰当的检查、上下文和管控之下,持续地产出结果。这就改变了…
多数智能体框架都会给每个智能体分配一个独立的上下文窗口(模型一次能处理的文本范围),并称之为记忆。单个智能体时,这个做法还行;一旦运行多个智能体,它就悄悄成了系统里代价最高的设计选择。我们运营着一组智能体,特意让不同的智能体——另一个负责结构化抽取,还有一对完全走本地路径,不依赖任何外部推理服务。按…
所谓测量造假,是指在 AI 辅助开发中,同一个 AI 智能体既写代码、又给自己写的代码出题评分——结果就是:测试全绿,代码实际却是坏的。通过的测试衡量的是生成器自己的“信心”,而不是代码的正确性。当生成器同时又是评分者,绿灯测试套件只是表演,不是证据。在一个经过审计的项目组合中,3,277 个测试全…