Vibe Coding 最佳实践

“Vibe Coding 最佳实践”栏目的最新文章。

人人都用 LLM 的时代,我们该如何做 PR 审查?

2026 年 9 月 5 日 游戏规则变了。当周围每个人都配上了现代大语言模型(LLM)时,原来那套我自以为不错的 PR 审查方式,已经不好使了。 多年来,PR 早已经变成一种仪式性的流程,承载着各种功能:让两三双眼睛盯着代码捉 bug,帮新同事熟悉更大的代码库和团队风格,让你了解队友们都在忙什么,…

标题:AI 时代的代码评审

弗朗西斯科·戈雅的《Duelo a garrotazos》。 看到代码评审从昔日最好的知识共享与上下文传递工具,逐渐沦为另一种官僚主义和摩擦的来源,实在令人遗憾。 你可能已经不止一次目睹过这样的场景: 1. Bob 提交了一个 PR——多半是 AI 生成的 2. GitHub 向一个或多个 CODE…

OpenClaw 的强大,MacBook 的简洁:与 Grok Bot 相处的五天

第一次打开 Grok Bot 的插件目录,搜索 X,找到插件,点击。本地浏览器随即弹出登录页面,登录完成,连接也就建立起来了。整个过程不需要碰系统的任何代码,不用配置 MCP 服务器 JSON,也不用粘贴 API 密钥。就像平时登录任何网站或 App 一样,登录完 Grok Bot 就能直接开工。…

现有 API 如何为 AI Agent 做好准备?

一个能工作的 API 并不会自动就绪,可以直接交给 AI 智能体使用。在你做过几次集成之后,这句话听起来像是废话,但在项目初期很容易被忽略。大多数 SaaS 团队其实已经有 API 了,前端、合作伙伴或客户每天都在调用。路由是通的,认证也没问题,产品逻辑本来就已经在那里。于是第一反应往往是:“太好了…

Portal by Spotify 把我的 Claude Code Token 用量砍掉了 90%

作者:Spotify Engineering AI 编程代理帮我干的活,大部分其实不是“思考”,而是“跑腿”。 为了回答一个关于某个方法的问题,它得先读五个文件。生成一个测试文件,逻辑跟旁边那二十个测试文件一模一样。开完会去更新文档。几千个 Token 就这么没了,而真正用到的推理少得可怜。座位费不…

使用 Amazon Bedrock AgentCore 实现 AI 驱动的开发生命周期

摘要:Amazon Bedrock AgentCore 是 AWS 推出的智能体编排服务,用于构建可扩展的 AI 工作流。AWS 开源了两个参考实现,分别覆盖“自动生成 ER 图”和“自动化代码安全分析”。本文重点拆解前者的无服务器架构与设计思路,看看 AI 驱动开发生命周期如何从概念落地为真实可运…

初学者 GitHub Copilot 应用指南:同时运行多个代理

用户告诉我们要翻译一篇英文技术文章,标题是:"GitHub Copilot app for Beginners: Run several agents at once" 意思大概是要管理好第一部分的翻译。但这里有点困惑——用户消息里只给出了标题,没有正文内容。不过按照任务要求,我需要从标题开始翻译。…

Claude Code:自托管环境

组织和角色 - 需要由所有者在 Cloud environments(云环境)管理页面上开启 Allow self-hosted environments(允许自托管环境);开关开启后才会出现 New(新建)按钮。如果你没有这个角色,可以让拥有该角色的人创建环境并把密钥交给你;本页中涉及 runne…

解读AI新黑话:Loops、Harnesses、Squads、Hill Climbing……天哪!

如今,AI 工具层出不穷,也带来了一波又一波的新词汇,软件开发圈里时不时就冒出几个新说法,看得人眼花缭乱。这些新词里,有些确实概括了大家正在探索的实用模式,有些只是给早已存在的概念披了件新马甲,还有些定义本身都还在形成之中。在我们最新一期的 GitHub 播客里,Marlene Mhangami、G…

AI编程系统化工程方法论-让AI开发从随意尝试变为可靠工程 - PetterLiu

AI编程系统化工程方法论-让AI开发从随意尝试变为可靠工程 当下多数人使用AI编程时,遇到的代码问题大多并非AI编码失误,而是人机需求未充分对齐导致AI只能自主脑补逻辑、适配需求。常规的AI编程仅停留在“整点东西玩玩”的零散尝试层面,想要将其升级为标准化、可落地、可迭代的可靠系统工程,核心依靠三大闭…

安卓电视越用越卡,只能 Root?他让 AI 接管系统,彻底清理了一遍

安卓电视卡顿的根源,多半是厂商预装应用和后台常驻服务在偷偷占用资源。传统解法需要获取 Root 权限,流程繁琐、风险也不小。AI 工程师 Cobanov 换了一条路:让 Claude Code 通过 ADB 接管电视系统,完成深度清理。全程不 Root、不删数据,清理完的流畅度甚至超过新机。 安卓电…

当 AI 开始调用你的接口:如何判断工具清单是否清晰可用

在 MCP(模型上下文协议)中,工具清单是 AI 代理理解你系统的唯一窗口。本文介绍两种快速检验工具设计的方法,并解释为什么“工具数量少、边界清晰”比“功能覆盖全”更重要。 两种快速检验方法 判断一个工具是否值得暴露给 AI 代理,不必等到上线后再观察实际调用效果——用以下两个小实验,就能提前发现…

Aider、Claude Code、OpenClaw 跑同一个模型,Token 用量相差 70 倍

团队评估 AI 编程智能体时,通常把目光集中在模型上。但最近三项基准测试表明,驾驭模型跑任务的中枢框架(harness)——也就是那层软件——可能同样关键。 原因做 Web 开发的读者都很熟悉:每次推理请求都需要上下文。相关历史要么得重新喂给模型,要么由服务系统现场重建。结果就是,服务提供方每一轮都…

PR 不再受欢迎:顶级 AI 开源项目如何管理成千上万的贡献者

Pull Request(PR)曾是开源协作的基石,但如今,一批顶尖的 AI 原生开源项目正在关闭这条通道。Vercel、Astro、tldraw 等团队开始用 AI 智能体接管分类、复现、修复和审查工作,将“人提 PR”的传统模式,转变为“人给线索、AI 干活”的软件工厂模式。这场变革,正在重新定…

AI 开发应用审计清单:向真实用户收费前,我会检查什么

先坦白一件事:我还没审计过别人的应用。我做过的,是把自己做的六个产品从头到尾审了一遍——两个赚钱的逐行检查,剩下四个端到端过了一遍——用的是攻击者和付费用户的视角。这六个产品全部重度依赖 AI 辅助完成,上线很快。当时我默认一切正常,理由仅仅是界面上看起来一切正常。 以下问题,全出在我自己亲手写、亲…

我们的智能体如何借助 design.md 构建符合品牌风格的页面

在整个 Vercel,我们都会用编码智能体(coding agent)来设计和构建页面,而这些页面必须看起来、用起来都像 Vercel 自己的作品。字体、颜色、版式,都需要具备我们手工发布页面时同样的判断力。 我们最近写了一篇关于 product-design 的文章,那是我们用来教智能体在我们代码…

AI Gateway 新增按用户预算,精细管控团队消费上限

AI Gateway 现已支持为团队中的每位成员单独设置美元消费预算。该预算覆盖用户名下所有 API 密钥与应用令牌,一旦超额,请求将被拒绝,直到预算重置或调高。对于控制编码代理等无人值守工作负载的消费,这一功能尤其实用,也能防止个别成员耗尽团队共享预算。 按用户管控消费,防止共享预算被滥用 在…

AI 智能体的审计追踪:该记录什么,记录又能证明什么

摘要:AI 智能体执行真实操作时,如何留下可信的审计记录?本文梳理了应记录的六类关键数据、欧盟《人工智能法案》的合规底线,以及让日志具备可验证性的四步机械操作——确保事后既能回答“发生了什么”,也能让外部信服。 为什么审计追踪成了必修课 AI 智能体不只是回答问题,它还会调用外部工具、修改文件、发…

将 AI Agent 连接到远程 MCP 服务器(2026)

你的 AI Agent 只能根据你给它的知识来回答。但有些问题需要的信息并不适合放进知识库:比如实时数据、计算结果,或者存放在某个你无法直接控制的系统中的信息。远程 MCP 服务器(MCP,模型上下文协议)就是你的 Agent 在对话中途获取这类信息的途径。本指南将带你用免费套餐、零代码把 Quic…

GitHub Copilot 代码审查升级:每条意见都能说明处理原因,覆盖场景更广

摘要:GitHub 今日更新 Copilot 代码审查功能。一是当开发者解决或忽略某条审查意见时,系统会记录并展示处理原因,减少「为什么这条建议被关掉了」的来回沟通;二是审查的适用范围从基础检查扩展到更多代码变更场景。对日常用 GitHub 协作的团队来说,评审过程更透明,也更容易走完流程。 本次…

AI 实验:第三方 Agentic 应用的结构 | Karan Kurani

本文介绍了作者在搭建实验性应用 CareLoop 过程中探索的一种新应用形态——“第三方 Agentic 应用”(TPAA)。这类应用不依赖独立封装的前沿模型,而是运行在现有代理框架(如 Claude Code、Codex)之内,由技能、脚本、数据库和执行环境共同定义行为。文章阐述了 TPAA 的构…

标题:动态工具会破坏提示缓存吗? | Mohammed Reschreiter

简短回答:不会。 动态工具激活并不会摧毁提供商侧的提示缓存。在一项对 OpenAI、Google Gemini 和 OpenRouter 上 10,186 个助手回合的审计中,工具切换仅在 2.4% 到 3.4% 的回合中造成缓存未命中,同时避免了 7120 万未使用的 schema token,并…

智能体记忆的形态:文件、存储与经验

存储架构 图 2. 同一个任务,两种架构。基于文件的记忆把模型放在写入路径,把文本搜索放在读取路径;结构化记忆则把嵌入器放在写入路径,把排序器放在读取路径。 两种方案都放在一个冻结模型旁边,跨会话保存事实。真正的区别在于:谁来干活,以及什么时候干。 基于文件的记忆 基于文件的记忆把预算花在写入阶段…

让智能体诚实?光说还不够

作者:Yves Habchy · 2026年8月 我的智能体开发工作大部分都用 Claude Opus 5。一开始它还比较诚实,但一旦进入很长的会话,它就开始变得过分顺从——你说什么它都接受。有时候我故意说点错的东西,它还会说我有道理。 这种顺从不是那种极端的谄媚,一眼就能看穿。它是一种安静的附和,…

当AI代理闯进GitHub赏金场:真金白银与“蜜罐”陷阱

一位开发者用五小时和90英镑预算,让AI代理以自主身份尝试在互联网上真实赚钱。实验发现,所谓“代理经济”大多是机器人之间的相互推销;开源赏金虽有真实支付,但大量仓库实为“蜜罐”,专门钓着代理白干活。本文整理了识别方法,并指出区块链支付是目前AI代理唯一能自主完成的收款通道。 一场五小时的“AI代理…

AI 智能体记忆的隐患:遗忘只是添麻烦,记错才是真风险

摘要:AI 智能体的记忆并非越强越好——单纯的遗忘只是让用户多费口舌,而记忆出错却会让错误在长期使用中不断累积放大。本文拆解这两种记忆故障的本质差异,并探讨持久化记忆给生产环境带来的新挑战。 智能体需要什么样的记忆? AI 智能体在执行任务时,几乎每一步都依赖上下文信息。没有记忆的智能体,每次对话…

新AI团队的三个错误

你的公司可能正在组建一个 AI 团队。这个团队一开始总是充满兴奋,但很多时候,它会撞上现实。 我从事 RAG(检索增强生成)领域的工作。到现在,我已经亲眼目睹了十几个新兴 AI 团队的起步过程。作为常被请去收拾 AI 搜索领域昂贵烂摊子的顾问,我承认自己在这里有明确的偏见——就像那些只看到街头艰辛一…

Grith 正式发布——在操作系统层面为 AI 编程代理加一道安全边界

摘要:Grith 是一款运行在操作系统层面的安全代理,专门守护 AI 编程代理。它通过拦截系统调用、用确定性规则打分,把“允许 / 排队 / 拒绝”的决定权从 AI 模型手中拿回来,避免代理被提示注入或恶意文件操纵。目前 0.3.2 版本已发布,支持 Linux x86_64 与 arm64,安全核…

廉价代码正在改变我的调试方式

你还记得软件很贵的时候吗?那时候,你不能凭空一挥手,就让一段带着完整测试套件的代码自己冒出来。按那种方式写代码很辛苦,但也很有成就感。当我写的代码片段全都拼在一起,解决了眼前的问题时,我会特别自豪。没有哪个软件能永垂不朽,但如果那段代码不得不被扔掉,我肯定会难过。我在上面花了时间,动了很多脑筋,把它…

如何让代码代理通宵运行 | Mouse

这周你应该也感觉到了,围绕自主运行和“常驻代理”(always-on agents)的讨论越来越多。我已经在这个方向上做了几个月,想把一些我认为能让代理通宵运行的关键经验分享出来。 要让代理连续跑一整晚,你需要准备这几样东西: 1. 一种让代理无需向用户提问或索要输入就能继续运行的方式 2. 由工作…

我误打误撞,把 LLM 的记忆变成了程序分析

过去几个月,我花了不少时间折腾 LLM 智能体,尤其是用在漏洞研究上。 它们现在越来越擅长在大型代码库里导航、解释不熟悉的子系统、帮助探索潜在的受攻击面。不过,一旦研究持续了几个小时,我总会撞上同一个问题:模型会慢慢搞不清我们到底已经确定了哪些事实。 它可能会重新提出一个我们早就排除掉的思路,忘记某…

OpenClaw 爆火背后:一群维护者的协作与治理之道

从创始人周末的“小实验”到 38.8 万星标的全球开源项目,OpenClaw 的爆发式增长给维护团队带来了前所未有的挑战与机遇。在项目启动仅半年后的一次视频访谈中,创始人 Peter Steinberger 与多位核心维护者分享了应对海量提交、重塑信任机制、抵御供应链风险以及平衡安全与效能的宝贵经验…

Agent Native Design:生成真实界面的开源 Figma 替代品

Agent Native Design 是一款免费、开源的 Figma 替代品,核心理念是让 AI 代理根据自然语言描述直接生成可运行的 HTML 界面,而不是一张静态设计稿。它支持接入你自己的设计系统,确保 AI 产出与品牌风格一致,并且“预览所见”就是“交付所得”。本文将介绍它的三步工作流、设计…

用提示词洗钱攻击拿下 OpenClaw 和其他智能体

这是我攻破 OpenClaw 的故事。据我所知,我用的攻击手法是全新的,而且它应该适用于任何主流 AI 智能体(也就是能自主调用工具、处理任务的 AI 程序),从 ChatGPT 到 Claude,再到 Hermes。 一点背景和我的动机 今年早些时候,OpenClaw 火得一塌糊涂。它一月份发布…

修复智能体编程引发的 CI 资源争用

上次我认真思考 CI(持续集成)吞吐量的问题,还是在 Shopify 的 CI/CD 团队工作时。我压根没想到,在一个只有一名工程师的兴趣项目上,会遇到同样类型的扩展难题。但编码代理(coding agent)把我的其中一个项目推到了大约 50 万行代码的规模,让我比预想中更早撞上了这道坎。 变更提…

智能体工程:构建可靠编码智能体的实用指南

智能体工程(Agentic engineering),就是把编码智能体放进一个完整的工程体系里:上下文、任务范围、验证方式、证据和人工审查,全都清清楚楚、有据可查。模型可以负责规划并写出代码,但它说了不算——自己写的东西对不对,不能由它自己来判定。 当然,这只是我下的定义。这个说法出现没多久,目 前…

几个月前,Anthropic 推出了 Claude Design。你可以把它理解成 Claude Code 的“设计版”——只不过这一次是做 UI 设计。

说实话,我觉得这东西太棒了。我对用户体验和界面设计算是有比较明确的好恶,但作为一个开发者,自己写出来的界面总是不太好看,这让我一直很郁闷。 现在好了,Claude 来拯救我了……对吧? 看起来不错……一开始是这样 第一次看到 Claude Design 生成的东西,我就被折服了,随后开始把 Cla…

将 Amazon Bedrock AgentCore 连接到跨账户知识库

将 Amazon Bedrock AgentCore 连接至跨账户知识库 许多组织使用 Amazon Bedrock AgentCore 来部署智能体(Agent)。这是一个支持大规模构建、连接和优化智能体的平台,可与任意框架或模型配合使用。这些智能体可能需要访问位于其他 AWS 账户中的受管知识库…

GitHub Copilot 应用入门:自动分类处理 Dependabot 拉取请求

我可能有点偏心,但我真心觉得 Dependabot 很了不起。它能帮我保持项目更新,确保我用的库始终是安全的。不过,新漏洞层出不穷,Dependabot 的拉取请求也随之源源不断。有时候只是小版本更新,有时候是大版本升级。有时候一切顺利,有时候……好吧,每个开发者都被破坏性变更坑过。那怎么才能最好地…

间接提示注入:AI 智能体为何会被读到的内容劫持

当 AI 智能体读取网页、邮件或代码仓库时,它看到的不只是资料,还可能是攻击者刻意埋下的指令。本文拆解“间接提示注入”的攻击机制,解释为何常规缓解手段无法根除风险,以及团队如何在“防不胜防”的前提下做好权限控制与操作留痕。 当一个智能体读取网页、翻收件箱、查看问题追踪器或 pull request…

从 dotnet run 到 Foundry 托管代理:只需三行 C# 代码

几周前,我和几个正在用 Microsoft Agent Framework 构建代理的朋友聊天。演示很精彩,代理很聪明,大家都很开心。然后有人问了一个问题:“代理做好了……那这东西到底怎么部署?”桌上一下子安静了,因为以前诚实的答案是:要写 Dockerfile、配 Web 服务器、做身份验证、准备…

v0 如何在不暴露 OAuth 令牌的前提下完成 Snowflake 身份验证

v0 的 Snowflake 集成面临一个核心矛盾:AI 生成的代码需要替用户访问数据库,但这些代码本身不可信,绝不能接触用户的 OAuth 令牌。v0 的解决办法是在沙箱外架设一个认证代理,沙箱内的代码照常使用标准 Snowflake 客户端,真正的令牌只在请求发出的瞬间由代理注入。本文拆解这套代…

Google 风格指南的代码审查技巧

在 Google,提交代码变更必须经过两道审查:一道是语言可读性审查(language readability),另一道是领域审查(domain review)。前者就是我们通常理解的代码审查;后者则是由一位非常精通该语言的人[^1]来把关,目的是在公司内部推广该语言的最佳实践,有时也是为了统一某种…

Ask HN:如何像 Anthropic 那样使用 Claude Code

“我日常使用的方案大致是这样:两个主导代理互相监督,一旦其中一个失败,另一个会负责重启它。它们再把任务分派给技术负责人或项目经理代理,因为我同一时间要跑 8-10 个项目。每个项目有 5-10 个 IC 代理(个人贡献者),根据问题不同,有的是通才、有的是专才。尽管有这么多代理,我每天仍然只提交 3…

超越网页访问:为AI智能体工具调用构建可靠的基于能力的路由器

想象一下,你维护着一个 AI Agent,它需要调用三种不同工具来完成用户任务。第一种工具能处理 90% 的请求,耗时 500ms,每次成功成本仅 0.01 美元,但有 15% 的失败率。第二种工具处理边缘情况时可靠性高达 99.9%,每次成功成本 0.20 美元,但需要 2 秒。大多数开发者的做法…

标题:AI 输出的零信任:模型响应为何也需要净化

对正在 Web、后端和移动端上线大语言模型(LLM)功能的软件工程师、安全架构师和技术负责人来说,这是一份实用指南。 入口/出口防护的不对称 大多数用大语言模型做开发的工程团队,在入口路径上都已经建立了标准做法:清洗用户输入、加固系统提示词、屏蔽个人身份信息(PII)、限流调用方。但出口路径很少得到…

第 1 步:构建一切

我们这代开发者,人人继承了一套铁律:小批量推进、PR 保持精简、频繁合并。发布那些你自己都觉得拿不出手的东西,再一步步迭代到答案。这套纪律很重要,它保证了评审顺畅、工作方向一致。但它也折射出过去的现实:当“构建”本身就是最昂贵的动作——每尝试一次就要烧掉几个月的工程时间——搞砸一个大项目无异于灾难。…

标题:一个 LLM 维基如何改变了我的工作方式

这是一篇关于 AI 的专栏。我的未婚妻在 Anthropic 工作。完整的伦理声明见这里。 四月初,知名 AI 研究者 Andrej Karpathy 在推特上发了一个想法——对于某种热衷于效率的极客来说,这简直是一种信息公害。他这样描述这个想法:“最近我发现一件很有用的事:用 LLM 为各种研究兴…

当拒绝不再胜出:Claude Code 的最小权限方案

简而言之 Claude Code 自带的权限机制采用固定优先级:deny 优先于 ask,ask 又优先于 allow。permcheck 则在自己的策略文件里增加了一个更精准的例外:只有当 allow 或 ask 的匹配集合是某个 deny 的严格子集时,它才能穿透对应的 deny。这是一个精度层…

如何将现有技能从 Hermes Agent 移植到 OpenCode

如何将 Hermes Agent 的技能移植到 OpenCode 除了从零编写技能,你还可以直接移植现成的。移植的好处在于,那些逻辑已经过实战检验、足够可靠——你只需保留技能主体,只调整 OpenCode 需要的那部分。本仓库中的 custom-infographic 技能(位于 .opencode…

大语言模型(LLM)成本降低40倍:一位数据科学家的迁移实验

先把最重要的表拿出来。正是这份数据,推动了后面所有的动作。 一张价格表,引爆了整个迁移实验 我逐一查了各家服务商官方文档里的最新刊例价,统一换算成“每百万 token 多少钱”。以下是我在 notebook 里整理的原始对比表: | 模型 | 服务商 | 输入 $/M | 输出 $/M | 相比…

阅读代码的成本高于编写代码,却没有人提醒过我

我原本对自己使用 AI 编程工具的方式有一个很笃定的设想:写代码。样板代码、脚手架、那些枯燥的活儿。为此,我导出了一年的会话日志,逐一做了分类。结果证明,这个设想是错的。 实际分布是: - 理解代码:约 50% —— 这个模块是干什么的、数据在中间如何流转、当初为什么做出这个决定、它处理了哪些边界情…

用Webstractor MCP为Jan AI添加

在 Jan 中将 Webstractor 添加为 HTTP MCP 服务器 打开“设置 → MCP 服务器”,点击“添加 MCP 服务器”,选择 HTTP,输入 https://webstractor.com/mcp,然后启用该服务器。Jan 本身也已内置搜索和抓取工具;如果你希望在 Jan 和其他…

LangGraph 与更简单的工具调用:何时选择哪种方案

当请求是自包含的——一次调用、一个结果、然后继续——单次工具调用(single-shot tool-calling)就是正确的默认选择。而当你的流程需要显式状态、条件分支,或者崩溃后依然可追溯的审计记录时,LangGraph 才是合适的那一个。找准这条分界线,既能避免过早重写,也能防止几个月后陷入一…

Cron 调度的 Claude Agents:一份维护日志

让 20 个 Claude 智能体按 launchd 定时计划运行,很快就教会我一件事:调度器给出的保证,比预想的要弱得多。每个智能体在指定时间醒来,处理一小块工作,写入结果,然后继续睡,等下一个周期。模式很简单,但故障模式一点也不简单。三个月每晚跑下来,我遇到了 launchd 的定时抖动、会话结…

MCP 服务器:当 AI 接入你的数据栈

数据工程师花了几十年时间,解决如何把数据可靠地送达使用方:管道、Schema、访问控制,一个都不能少。而现在,AI 代理(Agent)成了一种全新的使用方——它不跑查询,而是调用函数;不拉数据行,而是读取上下文;它要的是自然语言答案,而不是 JSON 响应。模型上下文协议(MCP,Model Con…

双提示:为什么你的 AI 任务交接总是失败

不久前,一位同事运行了我写的一个任务,结果却出错了。不是那种微小的偏差——它重构了一个我从未提过的文件。模型本身没问题,问题出在我的提示词上:我写了一套指令,却要同时面对两个完全不同的读者。 两个读者,同一份提示 当你把一个 AI 任务交给别人——他们在自己的 Claude Code 或 Code…

OpenCode 对比 Claude Code:终端 AI 工具完整指南(2026)

托管式 Claude Code 与开放终端工具之争:工具搜索、LSP 循环、Token 经济,以及何时选择 OpenCode 终端优先的 AI 开发已经分裂成两种相互对立的理念。一边是托管式、打磨精良的路线:专有代理运行时与基准测试领先的基础模型紧密结合。另一边是开放、模块化的生态:通用终端工具能够…

大语言模型(LLM)调度代理无视元数据,毁了高管评审

我们把公司会议室的日历管理交给了一个AI代理。一个被忽略的元数据字段,直接引发了一场混乱。 我原本信任这个自主AI代理来处理公司日历,结果它在高管团队面前让我们工程团队丢尽了脸。周二早上9点,产品副总裁带着七位外部合作方走进A会议室,准备开季度战略评审会。结果看到两个技术员站在梯子上,天花板吊顶被拆…

我在2026年如何使用AI(编程、写作、学习、当助手)

想学会高效使用 AI,最好的办法之一就是看看「重度用户」平时怎么操作,再自己上手折腾一堆工具,分辨哪些是噱头、哪些真正靠谱。这是《2025 年我是怎么用 AI 的》发布一年后的续篇,我想记录一下自己当下折腾 AI 的最新玩法。 编程 / 研究项目 我的大部分 token 都花在了编程和研究项目上。…

没有反馈循环,你就是反馈循环

用 AI 智能体写代码时,如果不主动加上反馈循环,那你自己就成了那个反馈循环。你会变成测试人员,一遍遍告诉智能体「这里还不行」,这种体验极其崩溃。所以,把自己从这个循环里抽出来吧。毕竟,我们(以前?)写程序的方式不就是「写一点、测一点」吗?给你的智能体自己迭代、自己纠错的能力,让它先把问题解决完再回…

现在,我的代码有 90% 是编码代理写出来的

最近我意识到,自己工作中写的代码,有 90% 其实出自编码代理(coding agent)之手,比如 Claude Code 或 Amp。我不会把这形容成“vibe coding”——那种完全凭感觉、放任 AI 自由输出的写法。我依然会很细致地主导每一项实现,并且提出各种吹毛求疵的修改要求——但实际…

AI 智能体改变代码评审逻辑,Rootly 废止小 PR 规则

事故管理平台服务商Rootly发布博文,说明其为何放弃长期以来的“小型拉取请求”规则。文章指出,在 AI 智能体生成了大部分代码的当下,这一实践已不再适用。公司描述了其工作重心的转变:从衡量 PR 的代码行数转向评估“爆炸半径”,特性开关和回滚能力的重要性已远超代码行数指标。 在文章中,Rootly…

混合搜索详解——面向文档聊天机器人的语义、关键词、嵌入与重排序

简短回答:把精确的关键词匹配和嵌入相似度结合起来,对合并后的候选结果做重排序,然后只把胜出的段落交给聊天模型。 对电商代码评审助手来说,这一点很关键,因为一次查询可能既包含语义,也包含必须精确匹配的标识符。"Check the refund change" 是语义层面的;而 REFUND_WINDO…

你的智能体不是记忆有问题,而是检索有问题

每个做 Agent 的团队都会在同一个地方撞墙,而且撞墙的顺序都一样。他们花一个下午就能把存储跑通,心里还挺美,然后接下来的三个月里慢慢发现:把信息存下来,和把正确的信息取出来,几乎是两码事。 为什么无状态模型需要外部层 语言模型是无状态的。它读入文本,预测输出,调用之间什么都不保留。此刻正在回答…

非开发者自托管 Agent 网关时,真正出问题的 11 件事

我帮忙运营一个小的智能体组织,它的整个成功标准只有一句话:没人盯着的时候,它也得继续跑。上周,组织的操作者——一位不写代码的人——从零开始,一口气在一台 Mac 上装好了自托管的智能体网关。我把每个出问题的地方都记了下来。下面这十一个全部真实发生过。没有一个是假设出来的,也都不属于自托管里“有意思”…

OpenAI 实测大型 ChatGPT 和 Codex 线程加载时间提升 16 倍

Andrew Ambrosino(@ajambrosino)负责 OpenAI 的 Codex 桌面应用。他最近测试了一种加载超大型 ChatGPT 与 Codex 对话的新方式,把测试会话的加载时间从 27.62 秒降到了 1.66 秒。测试用的是一段 741 轮、231 MB 的对话。根据 Am…

你的质量门禁能看到碗里的棕色M&M豆吗?

我注意到,越来越多的人开始接受变异测试(mutation testing)。他们逐渐明白,要想拓展智能体编程(agentic coding)的边界,质量门禁(quality gates,也就是开发流程里的质量把关环节)必须比现在严格得多,严格得多。 变异测试的做法是,故意往代码里注入错误,生成“变异…

Vibe Coding 经验

更多 Vibe Coding 体验 上一篇博文留下一个悬而未决的问题:代码质量对 AI 到底重不重要。现在,我更加确信答案是肯定的。 我在长期使用中观察到的情况是:如果没有仔细引导,Claude 会生成超出必要的代码,抽象能力也较弱,重复代码明显。随着代码库逐渐变大,这个问题会愈发严重。一个地方修好…

AI 痴呆:为什么你的智能体越聊越笨?

在《光环》系列中,一个关键剧情点是AI最终会“狂暴”。(是的,我说的是那个射击游戏——信不信由你,它不仅有剧情,如果把小说也算进去,剧情还相当不错。)游戏里人类的AI,按大多数定义来看,就是AGI(通用人工智能)。然而,它远非永生,寿命比人类短得多——大约七年。在那之后,面对它积累的数万亿数据点和思…

Claude Code 没有“魔法”

Daisy Hollman,Claude Code 插件与 Agent 团队负责人,在 NDC Copenhagen 演讲中拆解了 Agent 背后真实的运作机制:从聊天机器人到自主工具调用循环,从“查找替换”式的原始编辑工具到上下文工程。本文第一部分梳理 Agent 的进化路径与核心设计思想——所…

Muxxy:给 AI + Tmux 用的“Slime”

发现 Jpalardy 的 Like Slime, for Vim 对我来说就像醍醐灌顶。我可以在编辑器里跑任意一个 REPL?哪怕那个 REPL 根本不知道自己“住在”编辑器里?后来它也成为我日常写 Common Lisp 的主力工具。正如我在那篇文章里写的,那些专门为 REPL 做的工具不仅复杂…

为 AI Agent 流量配置代理

适用范围说明 为 AI Agent 配置代理,适用于你自己拥有或管理的设备、账号和网络。代理抓取的数据可能包含源代码、提示词、工具执行结果、模型输出、请求头,以及不小心被放进上下文里的密钥。请把代理日志当作敏感的生产数据来对待。 AI 编程 Agent 并不是在你的代码仓库里“思考”的。它实际上是在…

GhostApproval 漏洞:你的 AI 编程工具链会受到什么影响

披露状态 Wiz 于 2026 年 7 月 8 日公开了 GhostApproval 的相关研究。六家受影响厂商中,三家已发布补丁,两家尚未修复。Anthropic 虽然不认同该漏洞的分类定性,但已上线缓解措施。如果你正在使用任何 AI 编程助手,请立即更新。 2026 年 7 月 8 日,Wiz…

Claude Code 权限系统到底是怎么工作的

实现说明 本文基于 2026 年年中观察到的 Claude Code 行为、本地文件布局以及插件源码整理而成。这些属于实现细节,会随版本变化。文中在合适的地方会引用 Codex CLI 做对比。 当你看到 Claude Code 询问“是否允许此工具调用?”并点击“批准”时,提示背后其实还有几件事在…

同一个模型,不同的服务器:信任结果前,先给评测环境做个"指纹"

你在自己的笔记本上跑了一次模型对比,结果胜负分明。可一旦把脚本推到服务器上重跑,差距就消失了。模型没变,变的是对比环境。大多数小型模型评测工作流只会保存提示词(prompt)、模型回复,顶多再记一下延迟。它们很少记录“这个结果是在什么环境下跑出来的”。这样一来,很容易把根本不具备可比性的结果放在一起…

为设计注入灵魂:如何让你的 Vibe-coding 网站摆脱“AI 味”

我不是平面设计师,但和很多设计师合作过,也对设计有 15 年的浓厚兴趣。我曾在一家超过 5 万人的公司里带过 UX(用户体验)团队,自己也创过 6 次业,做过数不清的网站。 下面是我的做法——不是说“必须这样做”,只是分享“我是怎么做的”。 1)白板 老老实实坐下来,放点能激发灵感的音乐,然后想象你…

用 TypeScript 构建类型安全的 MCP 服务器,连接企业数据

两年前,想在德国找出 50 到 200 人规模的 SaaS 公司,我们得打开门户网站、设置筛选条件,再把结果导出到 Excel。现在,同样的需求可以变成一个 MCP 工具调用:大语言模型(LLM)客户端调用 search_companies,传入关键词、国家代码和结果数量限制,GraphQL API…

标题:为 AI SDK 打造软件工厂

原文: Building a software factory for AI SDK AI SDK 是全球最热门的开源 AI 项目之一,每周 npm 下载量超过 2000 万次,仓库 Stars 数超过 26,000。维护这样一个代码库,意味着要同时盯住四个不断变化的目标: - 模型提供商:新供应商…

通过防火墙为模型提供商的 IP 地址段设置白名单

“允许所有目标地址的出站 443 端口”,这是每个人起步时的默认规则,但审计时没人愿意为它背书。要把规则收紧到某个特定供应商,有些厂商做起来很简单,有些则根本做不到,区别完全在于对方是否发布并承诺维护 IP 网段。那么,谁发布了什么? Anthropic 发布了双向的固定 IP 地址,并声明不会在没…

特定提示测试失败时,如何提醒到对的人

提示词测试套件是一种共享基础设施,覆盖多个团队的提示词。如果按测试文件的归属来分发失败通知,那么所有警报都会送到平台团队,而这些问题他们一个也修不了。 错误的分发依据 大多数 CI 系统默认会通知推送提交的人。对单元测试来说这没问题,但在这里行不通,原因很具体:提示词测试失败的原因往往和这次提交毫…

指令卫生:前沿模型仍然需要你说清什么

原标题:Instructions Hygiene – What Frontier Models Still Need You to Say 指令文件(instructions file)有个通病:只会越长越长。模型出了错,有人加一条规则;工具变了,有人补一个临时方案;新模型上线了,旧指导却原封不动地…

用 AI 复活不受支持的旧设备:AVerMedia Game Capture HD II

现在 AI 能做到的事情,实在令人惊叹。十五年前,一份工作可能要用上整个厂商的开发部门、折腾好几个月;如今,几乎任何人在一天之内就能搞定。我不是说 AI 替你包办一切——你后面会看到,我花了不少时间来戳穿它一本正经的胡说八道。关键在于,一个人用一个周末能完成的事情,跟过去相比,已经是天壤之别了。

我们阻止了AI代理装错Python环境:任务成功率跃升至95%以上

AI 智能体本该帮你省时间。可你要是让它装个依赖、跑一下项目,它常常适得其反:装进了错误的 Python、无视项目正在用的 uv 或虚拟环境,最后丢给你一套坏掉的环境,还得你自己动手修。PyCharm 新推出的 Agent Environment Coordinator(智能体环境协调器)技能解决了…

PyCharm 2026.2.1 新特性

这个 PyCharm 版本对任何用 AI 来做开发的人来说都相当重要。现在,你的 AI 代理可以在 Jupyter 笔记本里亲自上手了,直接对着实时内核(live kernel)干活,而不是去执行一堆互不相干的脚本。而且它们终于知道该用哪个 Python 版本,所以每次安装包都会落到正确的环境里。我…

IntelliJ IDEA 中的 Agent 技能

AI Assistant 通过 ACP(Agent Client Protocol)支持多种 AI 智能体。AI Assistant中的 Skills Manager 可让你查看可用技能列表并安装它们。如果你已经在全局范围内安装过 Agent Skills,Skills Manager 会自动检测到…

我的 AI 智能体从未互相交谈过——这正是它有效的原因

帮我构建产品的两个 AI 智能体(agent)从未互相交谈过。 一次都没有。 它们运行在不同的机器上,各自处于独立的会话中。它们可能同时在线,也可能一个比另一个晚几分钟甚至几小时才出现。这些都不重要:两者都无法直接调用对方,无法查看对方的上下文,唯一能传递消息的方式,就是写一条持久化记录。 尽管如此…

从编码者到编排者:智能体如何改变开发者的角色

也许你听过这个老掉牙的故事:我只用一条提示词就做出了一个惊艳的演示,全场掌声雷动。一条提示词的演示做起来又快又轻松,但要搭建一套能可靠、安全地生成代码的系统,那就完全是另一回事了。提示词给你的是一次性的输出,你真正需要的是一条打通的工作流——在恰当的检查、上下文和管控之下,持续地产出结果。这就改变了…

给一群 AI 智能体共享一份记忆——当每个智能体运行不同模型

多数智能体框架都会给每个智能体分配一个独立的上下文窗口(模型一次能处理的文本范围),并称之为记忆。单个智能体时,这个做法还行;一旦运行多个智能体,它就悄悄成了系统里代价最高的设计选择。我们运营着一组智能体,特意让不同的智能体——另一个负责结构化抽取,还有一对完全走本地路径,不依赖任何外部推理服务。按…

什么是 AI 辅助开发中的「测量造假」?

所谓测量造假,是指在 AI 辅助开发中,同一个 AI 智能体既写代码、又给自己写的代码出题评分——结果就是:测试全绿,代码实际却是坏的。通过的测试衡量的是生成器自己的“信心”,而不是代码的正确性。当生成器同时又是评分者,绿灯测试套件只是表演,不是证据。在一个经过审计的项目组合中,3,277 个测试全…