AWS 旗下 Strands Agents 团队的开源 Agent Harness 正成为 AI 工程化领域的关注焦点。该项目采用 Apache-2.0 许可,自 2025 年 5 月开源以来在 GitHub 已收获逾 7300 Star。Harness——为智能体构建工程化运行框架的思路,此前已被 HashiCorp 联合创始人 Mitchell Hashimoto 等人反复强调。最新实测中,基于 Strands 构建的智能体在 ARC-AGI-3 上取得 99.95% 的 RHAE 成绩,而裸模型仅为 30.16%。
strands-agents/harness-sdk,这个由 AWS Strands Agents 团队维护的 GitHub 仓库,目前积累了约 7324 个 Star 和 1151 个 Fork。项目采用 Python 与 TypeScript 双语言编写,基于 Apache-2.0 许可证完整开源。按照 AWS 官方博客的描述,Strands Agents 是 AWS 面向多智能体编排推出的模型驱动开发套件,可接入 Bedrock、Anthropic、OpenAI、Google 等多家模型服务,并内置 MCP(模型上下文协议)、Guardrails 与多 agent 协作机制。Strands Harness,正是该团队在整套 SDK 中提出的核心抽象——一个负责承载、调度和约束智能体行为的工程化运行框架。
Harness:AI 工程圈的新关键词
「Harness」在 2026 年已经成为 AI 工程界的高频词。这一概念由 HashiCorp 联合创始人 Mitchell Hashimoto 以「Engineer the Harness」的说法明确提出,随后在 OpenAI 的技术报告、Martin Fowler 的博客以及 LangChain 的工程实践中被反复讨论和跟进。
与 LangChain 这类直接提供现成 agent 组件的框架不同,harness 更强调为智能体搭建一套可控的工程化运行环境——从上下文管理、工具调用到安全边界,都被纳入可配置、可观测的系统范畴。分析认为,这一概念之所以在 2026 年集中爆发,根本原因在于 agent 应用正从「单次调用演示」走向「长时运行的生产系统」。模型本身的能力差距在缩小,决定应用上限的,越来越多地取决于外围这套工程系统是否可靠。
AWS 的 Strands Agents 正是这一思路在云厂商生态中的典型落地。它不是一个单独的模型或 API,而是一整套让 agent 在真实业务环境中稳定工作的「后台系统」。在 AWS 的 agent 产品序列中,Strands Agents 承担着与 LangChain 等第三方框架直接竞争的角色,但其差异点在于:与 AWS 自家 Bedrock 模型服务、Guardrails 安全机制以及多 agent 协作能力的深度绑定。
从 30.16% 到 99.95%:一次硬核验证
Harness 的价值,在 2026 年 8 月 31 日 AWS 工程师于 DEV Community 发布的一篇技术博客中得到了直观展现。该团队使用 Claude Opus 5 配合 Strands Agents SDK 构建的 agent,在 ARC-AGI-3 基准测试中取得了 99.95% 的 RHAE 成绩,而此前裸模型仅有 30.16%。
这是一个极具冲击力的对比。值得注意的细节是,这次实验所使用的模型并非 AWS 自研,而是 Anthropic 的 Claude Opus 5——这恰好印证了 Strands Agents SDK 的模型无关性:harness 的增益来自工程系统本身,而非特定模型的智力水平。30.16% 到 99.95% 的跨越,很大程度上可以归因于 harness 对外部工具调用、推理路径规划和自我纠错机制的有效编排。
Strands 团队的迭代步伐并未停歇。2026 年 9 月初的 AWS 官方博客对 8 月发布内容进行了盘点:Strands 新增 Robots 功能,支持 14 天长时运行的 agent 任务。这些更新显示,该团队正在将重心从「能否跑通」转向「能否长期稳定运行」。与此同时,Strands Agents 已经被 AWS 内部团队及合作伙伴(如聚云立方 DecisionAI)用于企业场景,这为开源项目提供了来自真实生产环境的反馈闭环。
分析:开源路线的下一步想象
从
AWS机器学习 产品矩阵的整体视角来看,Strands Agents 只是其中的一环,但它选择的 Apache-2.0 开源路线,使其具备了超出 AWS 生态边界的影响力。分析认为,AWS 将这一底层框架彻底开源,意在 agent 开发工具链的早期阶段建立事实标准——当大量开发者基于 Strands Harness 构建应用时,AWS 的模型服务和云基础设施就成为了最自然的承载层。
对于外界关心的成本问题,围绕 harness 降低 token 消耗的讨论在 2026 年持续升温,社区中存在多种关于降本幅度的说法,但 AWS 官方始终未给出统一数据口径。可以确认的是,Strands Agents 团队的开发节奏保持活跃——GitHub 仓库的更新频率、官方博客的发布密度,以及 DEV Community 上的技术分享,共同勾勒出一个仍在快速演进的项目面貌。
可以推断,Harness 概念正在从 Mitchell Hashimoto 口中的一句口号,变成 AWS 开源仓库里一行行具体的代码。对于 AI 工程师而言,衡量一个 agent 框架的价值,或许正从「模型有多强」转向「harness 有多稳」。Strands Agents 用 ARC-AGI-3 上的成绩证明了这条路线的可行性,而接下来,更值得关注的是这套开源工具链能在多大程度上改变企业构建 AI 应用的方式。
参考资料
- Category: Announcements - Amazon Web Services (AWS)
- 提价后开发者Token成本激增,Harness工程如何实现效率跃升?|AI Agent|Qwen|模型|上下文|缓存_手机新浪网 - 新浪新闻
- Amazon 出品的 Agent SDK,凭什么让近千人 fork?-腾讯云开发者社区-腾讯云 - 腾讯云
- 基于Strands SDK 构建的企业智能问数解决方案实践 | 亚马逊AWS官方博客 - Amazon Web Services (AWS)
- python - 2026-09-18 GitHub 热点项目精选 - 个人文章 - SegmentFault 思否 - SegmentFault 思否
- Building intelligent physical AI: From edge to cloud with Strands Agents, Bedrock AgentCore, Claude 4.5, NVIDIA GR00T, and Hugging Face LeRobot - Amazon Web Services (AWS)
- AWS Open-Sources Strands Agents SDK to Simplify AI Agent Development - daily.dev
- Strands Agents SDK Python v0.1.9 版本深度解析 - GitCode
- 《Harness不是万能药:假绿、审计死穴,以及为什么换模型救不了你》-CSDN博客 - CSDN博客
- Agent harness 复现率 28%:5 基座 harness 屠夫榜_人工智能_神奇霸王龙-DeepSeek技术社区 - DeepSeek技术社区
- How a Strands agent took Claude Opus 5 from 30% to 99.95% on ARC-AGI-3 - DEV Community - DEV Community
- Artificial Intelligence - Amazon Web Services (AWS)
本文基于公开信息分析整理,仅供参考。更多AI工具动态与行业解读,请持续关注本站更新。