值得长期关注的 Agent 技术博客
/ 23 min read
Table of Contents
下面按阅读优先级分成两档。每个条目都固定为“博客入口 + 代表文章 + 文章内容”:说明针对文章本身,不用“主要关注 Agent Infra、评测或安全”这类博客定位代替文章介绍。
第一梯队
Anthropic Engineering
代表文章:
- Building Effective Agents:区分预先编排的 workflow 和由模型自主决策的 agent,并依次解释 prompt chaining、routing、parallelization、orchestrator-workers、evaluator-optimizer 等模式分别适合什么任务。文章最后把 Agent 简化为“模型使用工具并根据环境反馈不断迭代”,也强调工具接口往往比复杂框架更重要。
- Effective Context Engineering for AI Agents:把上下文视作有限的注意力预算,讨论 system prompt、工具定义、示例、消息历史和外部数据应该如何取舍。文章重点介绍 just-in-time retrieval、progressive disclosure、compaction、结构化笔记和 multi-agent 等长任务上下文管理方法。
- Effective Harnesses for Long-running Agents:用跨多个 context window 构建 Web 应用的实验,说明初始化 Agent 和后续 coding Agent 如何通过进度文件、Git commit、测试结果和明确的下一步交接状态。核心问题是怎样避免新一轮 Agent 不知道此前做了什么,或者过早宣布任务已经完成。
- Demystifying Evals for AI Agents:从任务、trial、grader、transcript 和 outcome 等基本对象开始搭建 Agent eval。文章解释为什么不能只评最终答案,还需要检查工具轨迹、环境状态、grader 设计、重复运行、人工校准以及 eval 中的 reward hacking。
OpenAI
代表文章:
- Harness Engineering: Leveraging Codex in an Agent-first World:复盘一个全部代码都由 Codex 生成的内部产品。重点不是模型提示词,而是如何让仓库、文档、浏览器、日志、指标、架构约束和 CI 对 Agent 可见,并把人的 review 意见沉淀为可持续执行的规则。
- An Open-source Spec for Codex Orchestration: Symphony:把 Linear 等任务看板变成 Agent 的 control plane,每个开放任务对应独立 workspace 和持续运行的 Agent。文章具体讨论任务状态机、失败重启、并发限制、workspace 生命周期和人类只在交付物层面审核的工作方式。
- Inside OpenAI’s In-house Data Agent:介绍内部数据 Agent 如何寻找数据源、生成和执行查询、分析结果并回答业务问题。文章尤其关注权限继承、语义层、查询验证、用户反馈和如何让数据 Agent 在真实企业数据环境中保持可信。
- Running Codex Safely at OpenAI:解释 coding agent 获得终端、代码和网络访问后带来的风险,以及如何用 sandbox、网络策略、凭据隔离、审批和审计缩小攻击面。它适合与各种“让 Agent 更自主”的文章一起阅读,了解自主权对应的安全成本。
Cursor Blog
代表文章:
- Continually Improving Our Agent Harness:讲 Cursor 如何同时使用离线 benchmark、线上 A/B test、代码 keep rate、用户后续反馈和工具错误率来迭代 harness。还给出了按模型定制编辑工具、处理上下文退化、模型中途切换以及自动发现生产回归的具体做法。
- Dynamic Context Discovery:展示如何把长工具输出、旧对话、Agent Skills、MCP 工具和终端 session 都转换成可搜索的文件或引用,让 Agent 在需要时自己加载。重点是减少启动时静态塞入的内容,避免上下文被无关信息和完整工具 schema 占满。
- Implementing a Secure Sandbox for Local Agents:讨论本地 coding agent 的 shell 命令为什么既需要足够权限又需要隔离,并介绍 macOS Seatbelt 与 Linux Landlock 等系统级限制。文章还涉及文件、网络、子进程和用户审批应该如何形成分层边界。
Ramp Builders
代表文章:
- Why We Built Our Own Background Agent:公开内部 coding agent Inspect 的设计。每个任务运行在带完整开发栈的 sandbox 中,并连接 GitHub、CI、Sentry、Datadog 和 feature flag,让 Agent 不只写代码,还能运行测试、读取遥测、验证前端并提交可审核的 PR。
- How To Build Agents Users Can Trust:以自动审批企业支出的 Agent 为例,讨论在高风险业务动作中怎样设计权限、证据展示、用户确认、失败回退和可解释的执行记录。文章关注的不是“回答是否自然”,而是用户为什么敢让 Agent 真正执行动作。
- Building Ramp’s MCP Server:记录 Ramp 怎样把 REST API 数据转换到本地 SQLite,再让模型用 SQL 查询数万条交易。文章展示了直接把大量 JSON 塞进上下文为何会失败,以及 server-side computation、OAuth scope、audit log 和只读/写入工具边界如何改善可扩展性与安全性。
Thinking Machines Lab:Connectionism
代表文章:
- Interaction Models:提出原生处理实时互动的模型,而不是在普通语言模型外面拼接语音、视频、打断和并发组件。文章介绍 multi-stream、micro-turn 训练和评测方式,讨论如何让模型一边接收连续输入、一边思考和响应。
- Defeating Nondeterminism in LLM Inference:追踪温度为零时推理结果仍然变化的真正来源。结论指向随服务器负载变化的 batch size 与缺乏 batch invariance,并逐层分析 RMSNorm、矩阵乘法和 attention kernel 如何实现可复现推理。
- On-Policy Distillation:比较 RL、离线蒸馏和 on-policy distillation。方法让 student 从自身 rollout 中采样,但使用 teacher 的逐 token 概率提供密集监督;文章用数学推理和持续学习实验说明它如何兼顾 on-policy 稳定性与蒸馏的训练效率。
Lilian Weng:Lil’Log
代表文章:
- LLM Powered Autonomous Agents:系统整理 planning、memory、self-reflection、tool use 和 multi-agent 等早期 LLM Agent 组件,并串联 ReAct、Reflexion、Tree of Thoughts、Generative Agents 等代表工作。适合用来建立术语和论文地图。
- Harness Engineering for Self-Improvement:把 harness 定义为模型外围的工作流、上下文、工具、权限、持久状态和评测系统,整理文件系统记忆、sub-agent、后台任务和 coding agent 等模式。后半部分讨论如何让 Agent 通过 propose-evaluate-accept 循环修改自己的 harness,以及如何限制 reward hacking。
Hamel Husain
代表文章:
- LLM Evals: Everything You Need to Know:以 FAQ 形式覆盖 trace、最小可行评测、抽样、error analysis、synthetic data、LLM-as-a-judge 和人工标注。主线是先查看真实失败并建立 failure taxonomy,再决定哪些错误值得自动化评测,而不是一开始套用通用分数。
- How Do I Evaluate Agentic Workflows?:建议先以黑盒方式判断端到端任务是否成功,再对工具选择、参数提取、错误恢复、上下文保留和关键里程碑做 step-level diagnosis。文章还用 transition failure matrix 定位工作流最常断在哪个状态转换。
- Evals Skills for Coding Agents:把 error analysis、生成测试数据、编写 judge、校准 evaluator、评测 RAG 和制作 review UI 封装成 Agent Skills。文章的重点是工具平台只能提供 traces 和实验能力,还需要把正确的评测方法教给 coding agent。
Simon Willison’s Weblog
代表文章:
- Agentic Engineering Patterns:一份持续更新的 coding agent 实践手册,覆盖 Agent 的工作原理、Git、sub-agent、red/green TDD、手工验证、代码理解和实际 prompt。它关注专业工程师如何利用 Agent 提高产出,而不是不看代码的 vibe coding。
- Designing Agentic Loops:把 coding agent 看作能够围绕明确目标反复执行、测试和修正的搜索工具。文章说明任务目标、可验证反馈和工具环境如何共同决定循环能否收敛,而不仅是给模型一句更长的提示词。
- The Lethal Trifecta for AI Agents:把 Agent 安全中最危险的组合归纳为私有数据、外部通信能力和不可信内容。当三者同时存在时,prompt injection 可以从“模型说错话”升级为真实的数据外泄,因此工具组合本身就是安全边界。
Can Bölük / Stencil
代表文章:
- The Harness Problem:在模型权重不变的情况下替换 coding agent 的编辑工具和 harness,并测试多个模型的编码表现。文章重点比较
apply_patch、字符串替换等编辑协议如何影响成功率、token 消耗和错误恢复,说明 benchmark 分数不能脱离运行模型的 harness 来解释。
第二梯队
NVIDIA Developer Blog / NVIDIA ADLR
代表文章:
- How to Build Custom AI Agents with NVIDIA NeMo Agent Toolkit:用开源 NeMo Agent Toolkit 组合不同框架、模型、数据源和工具,并构建一个可以访问多个 RAG 数据源的 Agent。它更像入门实现,展示 toolkit 的配置、FastAPI 服务入口和可复用 integration。
- Full-Stack Optimizations for Agentic Inference with NVIDIA Dynamo:从 coding agent 的多轮请求特征出发,分析 system prompt 和对话 prefix 的 KV cache 复用。文章解释 harness 如何把优先级、预期输出长度和缓存提示传给 Dynamo,再由 router 与多层 KV cache 改善延迟和吞吐。
- Nemotron-CORTEXA:ADLR 项目页中的软件工程 Agent,重点是改进 issue localization 和生成多样化候选解,再用 SWE-bench Verified 衡量成本与解决率。它适合观察 NVIDIA 除了 GPU serving 之外,在 coding agent 模型与搜索策略上的研究。
Cloudflare Blog:Agents
代表文章:
- Code Mode: The Better Way to Use MCP:把 MCP tools 转成带类型的 TypeScript API,让模型编写一小段程序组合多个 API 调用,只把最终结果送回上下文。文章比较直接 tool calling 与 code execution,解释为什么这种方式能减少中间数据、token 和多轮调用。
- Sandboxing AI Agents, 100x Faster:说明 Code Mode 生成的代码如何在 Dynamic Workers 中隔离执行。重点包括 Worker isolate 的启动成本、网络和 binding 限制、每次执行后销毁,以及它与传统容器 sandbox 在短时工具调用场景中的差异。
Modal Blog
代表文章:
- Modal Sandboxes Are Generally Available:介绍为不可信代码和 Agent 生成代码提供的隔离环境,包括动态依赖、进程执行、文件、端口、网络限制和 GPU。文章还给出 SWE-bench、代码重构和 Agent 自动化等实际使用场景。
- Building with Modal and the OpenAI Agents SDK:从最小 coding agent loop 开始,为它加入有状态 sandbox、shell capability、GPU 和异步并行 worker,最后组成一个可并行运行研究实验的 harness。适合直接看 Agent SDK 与远程执行环境怎样衔接。
AWS Machine Learning Blog
代表文章:
- Get to Your First Working Agent in Minutes:介绍 AgentCore 如何把 harness、runtime、filesystem、memory、identity、tool gateway、browser 和 observability 组合成可部署 Agent。它还解释何时使用配置式 Agent,何时切换到基于 Strands 的代码编排。
- Build and Deploy Scalable AI Agents with NVIDIA NeMo, AgentCore, and Strands:给出跨 NVIDIA 与 AWS 组件的完整生产链路,从 Agent 构建、评测和 profiling 到安全运行、身份、memory、浏览器、code interpreter 与监控。
GitHub Blog:AI & ML
代表文章:
- Onboarding Your AI Peer Programmer:逐步拆解 Copilot coding agent 从 issue、branch、Actions 环境、代码探索到 PR 的后台工作流,并说明 repository instructions、环境初始化和 MCP 如何影响最终结果。
- GitHub Copilot CLI Is Now Generally Available:列出终端 Agent 的 plan、autopilot、并行 sub-agent、后台 delegation、Skills、plugins、hooks、MCP 和 repository memory。适合用来了解 GitHub 对完整 coding agent 产品形态的拆分。
Meta Engineering
代表文章:
- How Meta Used AI to Map Tribal Knowledge in Large-Scale Data Pipelines:用五十多个专项 Agent 阅读跨四个仓库的四千多个文件,生成短小的模块导航、隐性约束和依赖图,再通过 critic 与定期刷新防止文档腐化。文章提供了大型私有代码库 context engineering 的具体做法。
- Ranking Engineer Agent:介绍一个可以跨数天或数周运行 ML 实验的 Agent,包含 hypothesis generator、planner、executor、hibernate-and-wake、实验知识库和人工决策点。它展示了异步训练任务如何超出普通聊天 session 的生命周期。
- Capacity Efficiency at Meta:把性能诊断工具封装为 MCP tools,把资深工程师的分析方式封装为 Skills,让同一组底层工具同时支持发现优化机会和修复性能回归。文章给出了从生产指标到 ready-to-review PR 的闭环。
Replit Blog
代表文章:
- Enabling Agent 3 to Self-Test at Scale with REPL-Based Verification:组合浏览器自动化和 REPL,让 Agent 在不知道页面 selector 的情况下逐步探索自己构建的应用。文章重点解决“界面看起来存在、实际功能没有接通”的 Potemkin interface,并让 Agent 能持续自测数小时。
- Closing the Loop: Evaluating and Improving Replit Agent at Scale:把 ViBench 离线评测、线上 A/B、生产 trace 聚类系统 Telescope 和自改进 Agent 接成一条循环。文章说明 benchmark 负责发布前回归、A/B 判断真实用户影响、trace cluster 解释失败原因,最后再由 Agent 提出 patch 和测试。
Databricks Blog 与文档
代表文章:
- Mosaic AI Agent Evaluation Tutorial:用 notebook 展示怎样把生产 traces 变成评测数据集、运行内置或自定义 LLM judges、做 root-cause analysis,并邀请领域专家标注。它适合观察数据平台怎样把离线评测和线上日志接起来。
- MLflow Tracing for GenAI:说明 MLflow 如何记录 Agent 的输入、输出、中间步骤、工具调用和元数据,再用于调试、成本分析、线上监控、评测与合规审计。内容偏平台文档,但把生产 Agent observability 的对象定义得很清楚。
Google Research / Google Developers Blog
代表文章:
- Agent Development Kit: Making It Easy to Build Multi-agent Applications:介绍 ADK 的 agent hierarchy、Sequential/Parallel/Loop workflow、LLM 动态 delegation、工具、session state、双向流媒体、trajectory evaluation 和部署方式。
- Towards a Science of Scaling Agent Systems:在多种模型和一百八十种 Agent 配置上比较 single、independent、centralized、decentralized 和 hybrid 架构。结果显示并行可分任务可能获益,强顺序依赖任务反而退化,并量化了独立 Agent 的错误放大与中心 orchestrator 的抑制作用。
Microsoft Research
代表文章:
- Magentic-One:由 Orchestrator 协调 WebSurfer、FileSurfer、Coder 和 ComputerTerminal 等专用 Agent,负责计划、记录进度和失败后重规划。文章同时发布 AutoGenBench,用重复运行和隔离环境评测有副作用的 Agent 任务。
- Magentic-UI:在 Magentic-One 基础上加入人与 Agent 的 co-planning、实时观察、行动审批和中途干预。它更关注浏览器 Agent 的交互设计:何时请求用户判断,以及如何让用户看懂并控制一个多 Agent 团队。
LangChain Blog
代表文章:
- Introducing Open SWE:拆解一个云端异步 coding agent 的 Manager、Planner、Programmer 和 Reviewer,展示 GitHub issue 触发、sandbox、human-in-the-loop plan、运行中追加消息、自审和自动创建 PR。
- Evaluating Deep Agents: Our Learnings:把 Agent eval 分成 single-step、full-turn 和 multi-turn 三种粒度,分别检查下一步决策、完整 trajectory、最终回复和产生的文件。文章强调每个 case 可能有独立成功条件,而且每次评测必须获得干净、可复现的环境。
Hugging Face Blog
代表文章:
- Introducing smolagents:用很小的代码量实现基础 Agent loop,并把 CodeAgent 与生成 JSON tool call 的 ToolCallingAgent 做对比。文章解释模型为什么可以用 Python 代码组合多步行动,以及开放模型、任意模型 provider、共享工具和 sandbox 如何接入。
Vercel Blog
代表文章:
- AI SDK 7:围绕 TypeScript Agent 提供 model/tool loop、Skills、MCP Apps、tool approval、sandbox、telemetry 和 provider abstraction。新增的 WorkflowAgent 可以在进程重启、部署和等待人工批准后继续执行。
- A New Programming Model for Durable Execution:解释为什么长任务只增加 timeout 不够,以及 workflow checkpoint、retry、state、sleep、hook 和 durable stream 如何让 Agent 从最后一个成功步骤恢复,而不是失败后重跑全部模型调用。
Berkeley AI Research Blog
代表文章:
- The Shift from Models to Compound AI Systems:论证高价值 AI 应用不会只是单次调用一个更大的模型,而会组合 retrieval、tools、多个模型调用、程序和 verifier。文章用成本与质量的例子说明,改进系统结构有时比等待下一个模型更快。
- TinyAgent: Function Calling at the Edge:训练 1B/7B 小模型在本地调用 macOS 工具,并用专门的 Tool RAG 只加载完成当前请求所需的函数。文章展示 tool retrieval 不能简单等同于普通语义 RAG,以及如何同时降低 prompt 长度并保持工具召回率。
Stripe Engineering
代表文章:
- Can AI Agents Build Real Stripe Integrations?:构造包含完整代码库、数据库、脚本、浏览器和测试 API key 的真实集成环境,再用 grader 检查 Agent 是否能完成跨前后端的长任务。文章也记录 Agent 对模糊要求、测试数据和浏览器验证的典型失败。
- Stripe Projects Adds New Agent Integrations:讨论 coding agent 从写代码进一步走向创建云资源时,需要怎样的短期凭据、provider spending limit 和开发/生产环境隔离。文章把基础设施 provisioning 视为 Agent 软件开发链路的一部分。
Chip Huyen
代表文章:
- Agents:从任务规划、工具、memory 和失败恢复搭建 Agent 框架,并讨论 Agent 特有的失败模式与评测难题。它与 Anthropic 的 Building Effective Agents 接近,但更像教材章节,包含更完整的概念推导和示例。
Interconnects
代表文章:
- What Comes Next with Reinforcement Learning:讨论 RLVR 在可验证任务上继续扩展之后,会遇到 sparse reward、更难环境、持续学习和训练基础设施等瓶颈。它解释为什么 coding、research 等 Agent 能力与模型 post-training 的进展紧密相关。
- My Bets on Open Models, Mid-2026:分析开放模型与闭源模型在训练资源、distillation、真实用户反馈和 Agent 工具使用上的能力差距,并判断本地 Agent 与重复自动化任务会怎样推动开放模型采用。