skyming/awesome-ai-agent

AI Agent 资源汇总,不限于基础概念、Harness 实践、RAG、测评基准、感知记忆、开源项目推荐、核心论文、开源项目等

289

137 commits

updated Sep 21, 2026

See the code

README

awesome-ai-agent

ai-agent-arch

概念篇

框架&工程

  • 📖 框架深度评测与对比分析
    简介:全面评测主流 Agent 框架,覆盖六大类别:通用开发(LangChain/LangGraph/OpenAI Agents SDK)、多Agent协作(AutoGen/CrewAI/MetaGPT/AgentScope/Camel-Owl)、自主Agent(AutoGPT/BabyAGI/gpt-engineer)、数据与RAG(LlamaIndex/MemGPT)、平台级工具(Dify/Flowise/Spring AI Alibaba)、领域专用(TradingAgents/GPT-Researcher)。从架构设计、核心能力、适用场景等维度深度对比,提供选型决策矩阵,助你快速定位最佳技术方案。

  • 📖 LangGraph 官方文档
    简介:LangChain 团队推出的状态图式 Agent 编排框架,支持循环、分支、持久化与人工干预,提供细粒度控制流与记忆管理,适合构建复杂多步骤 Agent 工作流。

  • 📄 AutoGen: Enabling Next-Gen LLM Application via Multi-Agent Conversation
    简介:微软研究院提出的多 Agent 对话框架,支持 Agent 间自主对话协作、人机协同、代码执行与工具调用,可构建研究助手、编码团队等复杂应用场景。

  • 📖 如何设计一个AI Agent系统
    简介:大淘宝 SRE 团队出品,从工程实践出发,系统讲解如何以LLM为认知核心,围绕规划、记忆、工具与执行框架构建可控可用的Agent系统,并结合研发流程、设计范式、知识管理与资损分析案例,给出工业落地方法论与实践体会。

  • 📖 Running a Software Factory Efficiently at Uber Scale
    简介:Uber 已将 AI 智能体全面融入软件开发全流程,实现超 70% 的合并请求(PR)由智能体驱动,使用规模大幅增长。本文介绍了 Uber“软件工厂”的架构体系,并分享了其在推动 AI 广泛应用的同时,通过智能调度与优化显著降低 AI 成本的实践经验。

Harness 实践

  • 📖 Effective harnesses for long-running agents
    简介:Harness 设计是 Agentic Coding 前沿性能的关键。本文介绍 Anthropic 如何在前端设计与长时自主软件工程任务中进一步释放 Claude 的能力。

  • 📖 Harness design for long-running application development
    简介:Harness 设计是 Agentic Coding 前沿性能的关键。本文分享 Anthropic 如何在前端设计与长时自主软件工程任务中进一步推动 Claude 的能力边界。

  • 📖 Effective context engineering for AI agents
    简介:Context 是 AI Agent 的关键且有限资源。本文系统讨论如何高效策划、组织与管理上下文,以提升智能体在复杂任务中的稳定性与产出质量。

  • 📖 OpenAI — Harness Engineering: Harnessing Codex in an Agent-First World
    简介:OpenAI 分享在 Agent-First 时代如何通过 Harness Engineering 驱动 Codex 的稳定产出,重点覆盖上下文组织、工具调用编排、执行反馈闭环与工程可控性。

  • 📖 Agent Harness 解析:智能体架构深度拆解
    简介:系统拆解 Agent Harness 的核心定义与工程边界,覆盖编排循环、工具调用、记忆体系、上下文管理、状态持久化、错误恢复与安全护栏等关键组件,并对 Anthropic、OpenAI、LangChain 等主流框架的落地模式进行对比,帮助从“模型能力”转向“基础设施能力”理解生产级智能体。

  • 📖 用第一性原理拆解 Agentic Coding:从理论到实操
    简介:从第一性原理出发,系统拆解 Agentic Coding 的底层机制与工程实践:涵盖 LLM 自回归与 Attention 约束、Agent Loop 与工具调用原理、上下文管理与短对话策略、项目规则与复利工程(Compounding Engineering)等关键方法,帮助开发者从“会用 AI”走向“驾驭 AI 协作”的实战能力升级。

  • 📖 逆向深扒Claude Code源码,我发现了什么!?
    简介:基于 Claude Code v2.1.88 泄露源码的逆向工程分析,系统拆解其最小 Agent Loop 如何通过 12 层渐进式 Harness 升级为工业级编码代理,重点覆盖工具系统、权限与安全、上下文压缩、子代理协同、Skills 按需注入、会话持久化与编译时特性门控等核心设计。

  • 📖 深度解析 Hermes Agent 如何实现“自进化”及其 Prompt / Context / Harness 的设计实践
    简介:聚焦 Hermes 从“自主执行”迈向“自进化”的关键机制,系统拆解动态 Skill 沉淀与 RL 训练闭环两条演进路径,并从 Prompt、Context、Harness 三个工程维度分析其在异构模型兼容、长上下文压缩、记忆管理、错误自愈与安全约束上的设计取舍与落地实践。

  • 📖 拆完Hermes源码,我发现Agent的"自我进化"根本不需要训练模型
    简介:基于 Hermes Agent 源码逆向分析,重点拆解其通过“四维记忆 + 技能自动生成 + 后台审查(KEPA)”实现的自进化机制,说明 Agent 能力提升可通过 Prompt Engineering 与文件持久化闭环达成,而不必依赖模型微调,并与 OpenClaw 的学习范式做了工程化对比。

  • 📖 QQ音乐Harness Engineering实践
    简介:结合 QQ 音乐在 Monorepo Microservices 场景的落地案例,系统阐述如何以“代码产出 = AI 能力 × 上下文质量”为核心,通过五阶段四门禁、三层知识体系、三仓联动、Skill/Agent/Command 协同与 Self-Refinement 闭环,将 AI 协作从对话式编码升级为可控、可审计、可复用的工程流程。

  • 📖 淘宝主播Agent的Harness工程实战
    简介:本文介绍了淘宝主播Agent的Harness工程实战,旨在通过构建模型外层的工程化“骨架”解决大模型在高风险、高并发直播场景中不可控、易漂移的问题。

  • 📖 Claude Code Harness 工程:数仓侧落地方案|得物技术
    简介:围绕数仓场景中 AI Coding 的上下文失忆、规范不稳与 context 膨胀问题,提出以 CLAUDE.md 持久化、Auto Memory、hooks 强校验、subagents 隔离与 SKILL 改造为核心的五层 Harness 防御体系,并给出可直接落地的 8 步工作流与工程化实施路径。

  • 📖 横向拆解Claude Code、Codex等六大Agent上下文压缩策略后,我们做了第 7 个
    简介:横向对比 Claude Code、Codex、OpenCode、Cline、Cursor、Amp 与 MemGPT/Letta 的上下文压缩策略,提炼分层渐进、成本递增、增量摘要、用户消息保护与单调边界等共识,并面向云端多用户 Agent 落地四级水位线(Snip / Prune / Summarize)方案,补充存储分离、跨轮缓存与多用户隔离等工程实践。

  • 📖 Training Agents to Evolve with Their Harness: TaoLive Digital Avatar Agent Technical Report
    简介:淘天直播数字人 Agent 技术报告,介绍可独立更新的 Skills、Tools、Prompts 与 Hooks,以及通过 Harness-State Augmentation 改善模型对运行时变化的适应能力。

感知记忆

  • 📖 从架构到代码:深入理解 OpenClaw 的双源记忆系统
    简介:围绕 OpenClaw 的“动态会话日志(JSONL)+ 静态长期记忆(Markdown)”双源记忆架构,深入拆解记忆生成、分块索引、向量与关键词混合检索(sqlite-vec + FTS5)以及 Agent 调用链路,并分析其在上下文容量、信息保真与 token 成本之间的工程权衡。

  • 📖 深度拆解 Hermes Agent 记忆系统:它修正了 OpenClaw 的哪层误区?
    简介:大淘宝技术出品,系统梳理了Agent长期记忆能力的评测全景,涵盖基准数据集、评估框架与记忆系统三大核心维度。

  • 📖 Agent-Memory 评测全景:基准、评估与记忆系统(理论篇)
    简介:围绕 OpenClaw 的“动态会话日志(JSONL)+ 静态长期记忆(Markdown)”双源记忆架构,深入拆解记忆生成、分块索引、向量与关键词混合检索(sqlite-vec + FTS5)以及 Agent 调用链路,并分析其在上下文容量、信息保真与 token 成本之间的工程权衡。

  • 📄 MemGPT: Towards LLMs as Operating Systems
    简介:借鉴操作系统内存分页机制,将有限上下文窗口视为"主存",外部存储视为"磁盘",通过自主管理的内存分页与检索策略突破上下文瓶颈,支持长期对话与多会话持久化。

  • 📄 Let All Context Be Memorized: A Memory Bank Design for LLMs
    简介:提出记忆银行架构,将历史信息按重要性分层存储,通过计算记忆的"存取频率"与"时间衰减"实现动态召回,有效缓解长对话中的信息遗忘问题。

RAG 实践

评估观测

  • 📊 Bringing Observability to Claude Code: OpenTelemetry in Action
    简介:SigNoz 官方出品的深度实践指南,从零搭建 OpenTelemetry 监控体系。深入剖析 Token 用量分析、成本核算、响应延迟控制等生产级场景,适合需要完整可观测性方案的团队落地实施。

  • 🔧 @devtheops/opencode-plugin-otel · npm
    简介:功能完善的开源 OTel 插件,完整呈现 Claude Code 到 OpenTelemetry 的数据链路。通过研读源码可深入理解如何为 AI 应用构建生产级可观测性数据模型,是学习和定制监控方案的绝佳参考实现。

  • 📖 Agent Tracing 技术方案对比:LangSmith vs Langfuse vs Phoenix
    简介:横向对比 LangSmith、Langfuse、Phoenix 三款 Agent Tracing 方案,覆盖产品定位、追踪/评测/数据集/监控、框架集成、部署方式与定价,并指出 LangSmith 不支持私有化部署,补充 Langfuse 与 Phoenix 作为可自部署替代选型。

  • 📖 AI 评测还在看准确率?数据科学早就用因果推断做归因分析了
    简介:大淘宝技术出品,本文旨在解决传统AI评测仅关注相关性而忽略因果性的局限,引入数据科学中的因果推断与博弈论方法进行归因分析,以精准量化LLM及Agent系统中各组件对结果的真实贡献度。

  • 📊 agenttrace
    简介:本地优先的AI编码智能体会话观测工具,可读取Claude Code、Codex CLI、Gemini CLI、Qwen Code、Aider、Cursor、OpenCode、OpenClaw等日志,帮助开发者查看成本、Token、耗时、工具失败和慢任务原因。

  • 📊 flameox
    简介:面向智能体的性能分析与优化工具包:协调 PyTorch Profiler、Nsight Systems 等工具,保留原生追踪证据并比较实验,帮助定位应用、原生服务、GPU 内核和推理负载的瓶颈。

  • 🚀 NVIDIA AgentIQ
    简介:企业级智能体观测与优化工具包,提供运行时性能分析、执行流程追踪、超参数/提示词优化器,支持 MCP/A2A 协议。

工具生态

  • 📖 如何让你的 Agent 更准确:MCP 工具设计技巧
    简介:围绕“工具是 Agent 的用户界面”这一核心理念,系统讲解 MCP 工具在命名、描述、参数 schema、输出与错误处理上的设计方法,结合工具粒度控制、上下文与 token 成本、Skills 与 MCP 互补等实践,帮助提升 Agent 的工具选择准确率与调用稳定性。

  • 📖 一文读懂 Agent Tools,拒绝复杂化、碎片化、黑盒化
    简介:从 Agent 工具全生命周期出发,系统梳理类型安全、LLM 友好接口、自我修复与人机确认等关键设计原则,并结合 AgentKit Gateway 在工具转化、调用治理、技能化管理与身份鉴权上的企业级实践,给出破解 Tools 碎片化、复杂化、黑盒化的落地路径。

  • 📖 Code execution with MCP: Building more efficient agents
    简介:传统直接工具调用会为每个定义与中间结果持续消耗上下文。本文说明为何让 Agent 通过编写代码来调用工具更易扩展,并详细介绍在 MCP 中的实现方式。

  • 📖 Writing effective tools for agents — with agents
    简介:Agent 的效果高度依赖可用工具质量。本文分享如何编写高质量工具与评测流程,并说明如何借助 Claude 反向优化其自身工具以进一步提升性能。

  • 🔗 Open Agent Relay
    简介:开源、本地优先的 Agent 能力中继 CLI,可将 Claude Code、Codex 等本机 Agent 或自动化任务通过受信局域网暴露给其他 Agent 调用,同时让提示词、依赖、工作目录与凭据留在发布者设备上。

  • 🔬 OrcaReplay · npm
    简介:在进程与 socket 层记录 coding agent 的整场运行——模型请求、shell 命令的退出码、每轮文件变更、MCP 调用落在同一条时间线上。与只做观测的方案不同,它能把这次运行重新跑一遍:断网重放逐字节复现,或从任一检查点分叉到另一个模型,让两个模型面对完全相同的上下文与文件状态。Apache-2.0。

评测基准

  • 📊 AI Agent评测基准大揭秘:智能体的「体检标准」
    简介:深度解析主流Agent评估体系,系统性梳理 GAIA、AgentBench、PaperBench、WAA等七大主流评测基准,覆盖通用能力、安全鲁棒性、中文场景及科研复现等多维度评估体系。

  • 📊 XBench
    简介:红杉中国推出的双轨测评体系:AGI Tracking测试技术上限,Profession-Aligned量化商业场景效用价值(如招聘/营销)。

  • 🔍 ClawBench
    简介:面向真实生产网页的AI浏览器Agent评测基准,153个日常任务、144个真实网站、15个类别;通过提交拦截层(Chrome扩展+CDP)保证真实环境下的端到端评测不产生副作用。paper

  • 📊 VBench
    简介:全面评估视频生成模型的基准测试套件。它通过多维度的分层评估体系,将“视频生成质量”拆解为多个细粒度指标,提供客观、精细化的评测方法,并与人类视觉偏好高度对齐(CVPR 2024 Highlight)。

  • 📊 VBench-2.0
    简介:新一代视频生成模型评测基准,核心聚焦于模型的“内在真实性(Intrinsic Faithfulness)”。它将评估维度从早期的基础技术质量(如像素保真度、简单的提示词依从性),扩展到了常识推理、物理规律真实性、人类运动姿态及创意组合等更复杂的高阶能力评测。

自我进化

  • 📄 翁荔博客-通过Harness工程实现AI自我提升
    简介:翁荔在文中系统梳理了从 ACE、Meta Context Engineering 到 Self-Harness、Darwin Gödel Machine 等一系列围绕「Harness 自我优化」展开的研究工作,并试图回答:递归式自我提升(RSI)究竟会先发生在模型权重层面,还是先发生在这层「脚手架」上

  • 📄 翁荔长文谈Harness自进化:Agent越用越强,评测难点怎么破?
    简介:现有 Agent benchmark 大多仍然面向静态系统无法回答 harness evolution 中更关键的问题:一次更新到底改进了什么?提升是否能迁移到未见任务?是否只是过拟合近期反馈?是否遗忘了旧能力?是否引入了更高成本或运行时不稳定?

  • 📄 Self-Refine: Iterative Refinement with Self-Feedback
    简介:Aman Madaan et al. (CMU, Google, Allen AI),单一 LLM 同时作为生成器、反馈提供者和优化者,通过迭代式自我反馈改进输出,无需额外训练数据或强化学习。在 7 个任务上平均提升 20%。

  • 📄 OPRO: Large Language Models as Optimizers
    简介:Chengrun Yang et al. (Google DeepMind) 提出的方法,将 LLM 作为通用优化器,用自然语言描述优化任务,以历史解和评分为上下文迭代生成新候选解。GSM8K 提升 8%,Big-Bench Hard 提升 50%。

  • 📄 TextGrad: Automatic Differentiation via Text
    简介:Mert Yuksekgonul et al. (Stanford) 提出的框架,借鉴神经网络反向传播思想,通过 LLM 提供的文本反馈"反向传播"优化复合 AI 系统各组件。采用 PyTorch 风格 API,GPT-4o 准确率从 51% 提升至 55%。[GitHub]

  • 📄 DSPy: Compiling Declarative Language Model Calls
    简介:Omar Khattab et al. (Stanford) 提出的声明式 LM 编程框架,将 LM 管道抽象为计算图,编译器自动优化提示词、微调策略与推理流程。GPT-3.5 提升 >25%,llama2-13b-chat 提升 >65%。[文档]

  • 📄 ADAS: Automated Design of Agentic Systems
    简介: Shengran Hu, Cong Lu, Jeff Clune 提出"元智能体搜索"(Meta Agent Search)框架,让智能体通过编程自动发现新智能体架构,构建不断增长的发现档案。发明的智能体超越手工设计 SOTA,且跨领域迁移鲁棒。

  • 📄 STOP: Self-Teaching Optimization Program
    简介:递归自改进框架,LLM 通过生成自教学样本、反思自身解法、蒸馏推理能力来实现无外部数据的持续优化。核心是代码层面的递归改进循环。

安全实践

开源项目

  • 🤖 openclaw
    简介:跨平台开源个人 Agent(“龙虾”),强调真能动手执行任务。2026 年 2.0(v2026.8.1)完成史上最大重构:降低安装门槛、重做 Web UI,并补齐记忆、云端会话与多人协作,从个人助理走向可协作的 Agent 工作台。同年它引爆大厂“诸神大战”——字节 ArkClaw、腾讯 WorkBuddy、阿里 CoPaw 等纷纷跟进,成为观察 Agent 入口与生态卡位的关键开源底座。

  • 🤖 Claude Code
    简介:Anthropic Claude Code 泄露源码的可构建、可调试复现版。可对照研读其 Agent Loop、工具系统、权限与安全、上下文压缩、子代理协同、Skills 按需注入与会话持久化等工业级 Harness 设计。

  • 🤖 OpenAI Codex
    简介:OpenAI 开源的终端编码 Agent(Codex CLI)。可在本地执行读写代码、跑命令与工具调用,覆盖沙箱权限、MCP、Skills 与会话工作流,是研读 OpenAI 侧 coding harness 的一手参考实现。

  • 🤖 DeepSeek-Harness
    简介:DeepSeek出品,DeepSeek Harness(dsh)是由 DeepSeek AI 开发的开源 agent harness(智能体框架),它采用一切皆插件的架构,并由 Cordis 驱动。

  • 🤖 grok-bot-0.18-reconstructed
    简介:与 Claude Code / Codex(单厂商终端 Agent)和 DeepSeek-Harness(通用插件化 harness)不同,本项目重建的是桌面端 Grok Bot 产品形态:Electron GUI + Host/Coordinator 控制面,把 Cursor / Claude Code / Codex / OpenRouter 当作可切换推理后端,并配套本地用量统计与可选 Docker 沙箱。价值在于对照「桌面 Agent 壳 + 多后端路由」如何落地,而非再提供一套 CLI coding agent。

  • 🤖 prime-agent
    简介:Prime Intellect 开源的自改进编码 / 研究 Agent harness。以 RLM(持久 Python REPL + 递归子代理)与 Continual Harness(可沉淀的提示、记忆、Skills、子代理规格)为核心,支持 /refine 基于轨迹做小步证据化更新,面向长时自主任务与后台持续运行。

  • 🦌 DeerFlow
    简介:字节跳动推出的深度研究框架,集成多智能体协作与端到端研究自动化。核心特点:多智能体分工(基于LangGraph实现模块化架构)、工具深度集成(支持Tavily/DuckDuckGo搜索、Python代 码执行、学术资源抓取)、人机协同创作(提供类Notion的交互式编辑界面)、MCP无缝扩展。

  • 🦌 HKUDS-VideoAgent
    简介:VideoAgent: 一站式智能体框架,用于视频理解、编辑与再创作

  • 🦌 HKUDS-DeepTutor
    简介:DeepTutor 是一个智能体原生的学习工作区,在一个可扩展的系统中集成了辅导、解题、出题、研究、可视化及掌握度练习等多种功能。

  • 🌐 Suna
    简介:Kortix AI推出的通用型智能体,专注于跨平台任务自动化执行。核心特点:浏览器自动化引擎(基于Playwright实现网页导航、数据抓取及表单操作)、安全沙箱环境(通过Docker容器隔离任务执行)、多工具链协同、企业级部署。

  • Jev Social 简介:开源、本地优先的社交媒体研究 Agent。Jev 为每一步浏览器调研操作提供类型化路由,socai CLI 在用户已登录的 Chrome 中搜索 Instagram、TikTok 和 LinkedIn,并将帖子、评论、媒体与来源链接流式汇入可复核的研究报告。提供轻量级单页 Web 演示和免克隆 npx 启动方式。

  • 🛠️ NotFair
    简介:面向营销场景的开源 Claude Code Skills 套件(约2.9k stars,MIT开源)。覆盖 SEO 站点分析、关键词研究、内容写作、Google Ads 审计与出价管理、Meta Ads(Facebook + Instagram)广告效果分析,通过 Google Ads MCP、Meta Ads MCP、Google Search Console MCP 和 Google Analytics(GA4)MCP 接入实时数据,是目前开源生态中覆盖付费广告+自然搜索最完整的 Agent Skills 实现。

  • 🖥️ Orkas
    简介:开源、本地优先的多智能体桌面客户端,由 Commander 协调专业智能体并行或串行完成复杂任务,支持 macOS、Windows 与 Linux。

  • 🤖 SandBase Harness 简介:本地优先的 TypeScript Agent Runtime,提供持久化会话、沙箱工具执行、MCP 集成、记忆、凭据、审计日志与执行回放,支持 Local、Docker、Kubernetes 和自托管部署。

资源中心

  • 📚 awesome-foundation-agents
    简介:系统性整理基础智能体研究路径的论文精选集,聚焦核心概念定义与技术演进脉络,提供领域研究全景导航。

  • 🔍 Awesome Generative AI Guide
    简介:全面的生成式AI资源中心,整合研究论文、面试题库、免费课程与开发笔记。

  • 🎓 Awesome-Agent-Papers
    简介:智能体领域前沿论文聚合仓库,覆盖大语言模型智能体、多智能体协作、人-智能体交互三大方向,持续追踪学术界突破性成果。

  • 📈 awesome-openclaw-skills
    简介:OpenClaw技能资源汇总。

  • 📈 showcase
    简介:OpenClaw展示案例。

  • 📈 awesome-openclaw-usecases
    简介:OpenClaw用例资源汇总。

  • 📚 awesome-ai-agents
    简介:AI Agent资源汇总。

  • 📚 awesome-llm-apps
    简介:精选的LLM应用集合,基于RAG和AI agents构建,支持OpenAI、Anthropic、Google以及DeepSeek、Qwen、Llama等开源模型,可本地运行。

Contributors

skyming

126 commits

IRONICBo

1 commits

luoyuctl

1 commits

masutaka

1 commits

skyming/awesome-ai-agent

AI Agent 资源汇总,不限于基础概念、Harness 实践、RAG、测评基准、感知记忆、开源项目推荐、核心论文、开源项目等

289

137 commits

updated Sep 21, 2026

See the code

README

awesome-ai-agent

ai-agent-arch

概念篇

框架&工程

  • 📖 框架深度评测与对比分析
    简介:全面评测主流 Agent 框架,覆盖六大类别:通用开发(LangChain/LangGraph/OpenAI Agents SDK)、多Agent协作(AutoGen/CrewAI/MetaGPT/AgentScope/Camel-Owl)、自主Agent(AutoGPT/BabyAGI/gpt-engineer)、数据与RAG(LlamaIndex/MemGPT)、平台级工具(Dify/Flowise/Spring AI Alibaba)、领域专用(TradingAgents/GPT-Researcher)。从架构设计、核心能力、适用场景等维度深度对比,提供选型决策矩阵,助你快速定位最佳技术方案。

  • 📖 LangGraph 官方文档
    简介:LangChain 团队推出的状态图式 Agent 编排框架,支持循环、分支、持久化与人工干预,提供细粒度控制流与记忆管理,适合构建复杂多步骤 Agent 工作流。

  • 📄 AutoGen: Enabling Next-Gen LLM Application via Multi-Agent Conversation
    简介:微软研究院提出的多 Agent 对话框架,支持 Agent 间自主对话协作、人机协同、代码执行与工具调用,可构建研究助手、编码团队等复杂应用场景。

  • 📖 如何设计一个AI Agent系统
    简介:大淘宝 SRE 团队出品,从工程实践出发,系统讲解如何以LLM为认知核心,围绕规划、记忆、工具与执行框架构建可控可用的Agent系统,并结合研发流程、设计范式、知识管理与资损分析案例,给出工业落地方法论与实践体会。

  • 📖 Running a Software Factory Efficiently at Uber Scale
    简介:Uber 已将 AI 智能体全面融入软件开发全流程,实现超 70% 的合并请求(PR)由智能体驱动,使用规模大幅增长。本文介绍了 Uber“软件工厂”的架构体系,并分享了其在推动 AI 广泛应用的同时,通过智能调度与优化显著降低 AI 成本的实践经验。

Harness 实践

  • 📖 Effective harnesses for long-running agents
    简介:Harness 设计是 Agentic Coding 前沿性能的关键。本文介绍 Anthropic 如何在前端设计与长时自主软件工程任务中进一步释放 Claude 的能力。

  • 📖 Harness design for long-running application development
    简介:Harness 设计是 Agentic Coding 前沿性能的关键。本文分享 Anthropic 如何在前端设计与长时自主软件工程任务中进一步推动 Claude 的能力边界。

  • 📖 Effective context engineering for AI agents
    简介:Context 是 AI Agent 的关键且有限资源。本文系统讨论如何高效策划、组织与管理上下文,以提升智能体在复杂任务中的稳定性与产出质量。

  • 📖 OpenAI — Harness Engineering: Harnessing Codex in an Agent-First World
    简介:OpenAI 分享在 Agent-First 时代如何通过 Harness Engineering 驱动 Codex 的稳定产出,重点覆盖上下文组织、工具调用编排、执行反馈闭环与工程可控性。

  • 📖 Agent Harness 解析:智能体架构深度拆解
    简介:系统拆解 Agent Harness 的核心定义与工程边界,覆盖编排循环、工具调用、记忆体系、上下文管理、状态持久化、错误恢复与安全护栏等关键组件,并对 Anthropic、OpenAI、LangChain 等主流框架的落地模式进行对比,帮助从“模型能力”转向“基础设施能力”理解生产级智能体。

  • 📖 用第一性原理拆解 Agentic Coding:从理论到实操
    简介:从第一性原理出发,系统拆解 Agentic Coding 的底层机制与工程实践:涵盖 LLM 自回归与 Attention 约束、Agent Loop 与工具调用原理、上下文管理与短对话策略、项目规则与复利工程(Compounding Engineering)等关键方法,帮助开发者从“会用 AI”走向“驾驭 AI 协作”的实战能力升级。

  • 📖 逆向深扒Claude Code源码,我发现了什么!?
    简介:基于 Claude Code v2.1.88 泄露源码的逆向工程分析,系统拆解其最小 Agent Loop 如何通过 12 层渐进式 Harness 升级为工业级编码代理,重点覆盖工具系统、权限与安全、上下文压缩、子代理协同、Skills 按需注入、会话持久化与编译时特性门控等核心设计。

  • 📖 深度解析 Hermes Agent 如何实现“自进化”及其 Prompt / Context / Harness 的设计实践
    简介:聚焦 Hermes 从“自主执行”迈向“自进化”的关键机制,系统拆解动态 Skill 沉淀与 RL 训练闭环两条演进路径,并从 Prompt、Context、Harness 三个工程维度分析其在异构模型兼容、长上下文压缩、记忆管理、错误自愈与安全约束上的设计取舍与落地实践。

  • 📖 拆完Hermes源码,我发现Agent的"自我进化"根本不需要训练模型
    简介:基于 Hermes Agent 源码逆向分析,重点拆解其通过“四维记忆 + 技能自动生成 + 后台审查(KEPA)”实现的自进化机制,说明 Agent 能力提升可通过 Prompt Engineering 与文件持久化闭环达成,而不必依赖模型微调,并与 OpenClaw 的学习范式做了工程化对比。

  • 📖 QQ音乐Harness Engineering实践
    简介:结合 QQ 音乐在 Monorepo Microservices 场景的落地案例,系统阐述如何以“代码产出 = AI 能力 × 上下文质量”为核心,通过五阶段四门禁、三层知识体系、三仓联动、Skill/Agent/Command 协同与 Self-Refinement 闭环,将 AI 协作从对话式编码升级为可控、可审计、可复用的工程流程。

  • 📖 淘宝主播Agent的Harness工程实战
    简介:本文介绍了淘宝主播Agent的Harness工程实战,旨在通过构建模型外层的工程化“骨架”解决大模型在高风险、高并发直播场景中不可控、易漂移的问题。

  • 📖 Claude Code Harness 工程:数仓侧落地方案|得物技术
    简介:围绕数仓场景中 AI Coding 的上下文失忆、规范不稳与 context 膨胀问题,提出以 CLAUDE.md 持久化、Auto Memory、hooks 强校验、subagents 隔离与 SKILL 改造为核心的五层 Harness 防御体系,并给出可直接落地的 8 步工作流与工程化实施路径。

  • 📖 横向拆解Claude Code、Codex等六大Agent上下文压缩策略后,我们做了第 7 个
    简介:横向对比 Claude Code、Codex、OpenCode、Cline、Cursor、Amp 与 MemGPT/Letta 的上下文压缩策略,提炼分层渐进、成本递增、增量摘要、用户消息保护与单调边界等共识,并面向云端多用户 Agent 落地四级水位线(Snip / Prune / Summarize)方案,补充存储分离、跨轮缓存与多用户隔离等工程实践。

  • 📖 Training Agents to Evolve with Their Harness: TaoLive Digital Avatar Agent Technical Report
    简介:淘天直播数字人 Agent 技术报告,介绍可独立更新的 Skills、Tools、Prompts 与 Hooks,以及通过 Harness-State Augmentation 改善模型对运行时变化的适应能力。

感知记忆

  • 📖 从架构到代码:深入理解 OpenClaw 的双源记忆系统
    简介:围绕 OpenClaw 的“动态会话日志(JSONL)+ 静态长期记忆(Markdown)”双源记忆架构,深入拆解记忆生成、分块索引、向量与关键词混合检索(sqlite-vec + FTS5)以及 Agent 调用链路,并分析其在上下文容量、信息保真与 token 成本之间的工程权衡。

  • 📖 深度拆解 Hermes Agent 记忆系统:它修正了 OpenClaw 的哪层误区?
    简介:大淘宝技术出品,系统梳理了Agent长期记忆能力的评测全景,涵盖基准数据集、评估框架与记忆系统三大核心维度。

  • 📖 Agent-Memory 评测全景:基准、评估与记忆系统(理论篇)
    简介:围绕 OpenClaw 的“动态会话日志(JSONL)+ 静态长期记忆(Markdown)”双源记忆架构,深入拆解记忆生成、分块索引、向量与关键词混合检索(sqlite-vec + FTS5)以及 Agent 调用链路,并分析其在上下文容量、信息保真与 token 成本之间的工程权衡。

  • 📄 MemGPT: Towards LLMs as Operating Systems
    简介:借鉴操作系统内存分页机制,将有限上下文窗口视为"主存",外部存储视为"磁盘",通过自主管理的内存分页与检索策略突破上下文瓶颈,支持长期对话与多会话持久化。

  • 📄 Let All Context Be Memorized: A Memory Bank Design for LLMs
    简介:提出记忆银行架构,将历史信息按重要性分层存储,通过计算记忆的"存取频率"与"时间衰减"实现动态召回,有效缓解长对话中的信息遗忘问题。

RAG 实践

评估观测

  • 📊 Bringing Observability to Claude Code: OpenTelemetry in Action
    简介:SigNoz 官方出品的深度实践指南,从零搭建 OpenTelemetry 监控体系。深入剖析 Token 用量分析、成本核算、响应延迟控制等生产级场景,适合需要完整可观测性方案的团队落地实施。

  • 🔧 @devtheops/opencode-plugin-otel · npm
    简介:功能完善的开源 OTel 插件,完整呈现 Claude Code 到 OpenTelemetry 的数据链路。通过研读源码可深入理解如何为 AI 应用构建生产级可观测性数据模型,是学习和定制监控方案的绝佳参考实现。

  • 📖 Agent Tracing 技术方案对比:LangSmith vs Langfuse vs Phoenix
    简介:横向对比 LangSmith、Langfuse、Phoenix 三款 Agent Tracing 方案,覆盖产品定位、追踪/评测/数据集/监控、框架集成、部署方式与定价,并指出 LangSmith 不支持私有化部署,补充 Langfuse 与 Phoenix 作为可自部署替代选型。

  • 📖 AI 评测还在看准确率?数据科学早就用因果推断做归因分析了
    简介:大淘宝技术出品,本文旨在解决传统AI评测仅关注相关性而忽略因果性的局限,引入数据科学中的因果推断与博弈论方法进行归因分析,以精准量化LLM及Agent系统中各组件对结果的真实贡献度。

  • 📊 agenttrace
    简介:本地优先的AI编码智能体会话观测工具,可读取Claude Code、Codex CLI、Gemini CLI、Qwen Code、Aider、Cursor、OpenCode、OpenClaw等日志,帮助开发者查看成本、Token、耗时、工具失败和慢任务原因。

  • 📊 flameox
    简介:面向智能体的性能分析与优化工具包:协调 PyTorch Profiler、Nsight Systems 等工具,保留原生追踪证据并比较实验,帮助定位应用、原生服务、GPU 内核和推理负载的瓶颈。

  • 🚀 NVIDIA AgentIQ
    简介:企业级智能体观测与优化工具包,提供运行时性能分析、执行流程追踪、超参数/提示词优化器,支持 MCP/A2A 协议。

工具生态

  • 📖 如何让你的 Agent 更准确:MCP 工具设计技巧
    简介:围绕“工具是 Agent 的用户界面”这一核心理念,系统讲解 MCP 工具在命名、描述、参数 schema、输出与错误处理上的设计方法,结合工具粒度控制、上下文与 token 成本、Skills 与 MCP 互补等实践,帮助提升 Agent 的工具选择准确率与调用稳定性。

  • 📖 一文读懂 Agent Tools,拒绝复杂化、碎片化、黑盒化
    简介:从 Agent 工具全生命周期出发,系统梳理类型安全、LLM 友好接口、自我修复与人机确认等关键设计原则,并结合 AgentKit Gateway 在工具转化、调用治理、技能化管理与身份鉴权上的企业级实践,给出破解 Tools 碎片化、复杂化、黑盒化的落地路径。

  • 📖 Code execution with MCP: Building more efficient agents
    简介:传统直接工具调用会为每个定义与中间结果持续消耗上下文。本文说明为何让 Agent 通过编写代码来调用工具更易扩展,并详细介绍在 MCP 中的实现方式。

  • 📖 Writing effective tools for agents — with agents
    简介:Agent 的效果高度依赖可用工具质量。本文分享如何编写高质量工具与评测流程,并说明如何借助 Claude 反向优化其自身工具以进一步提升性能。

  • 🔗 Open Agent Relay
    简介:开源、本地优先的 Agent 能力中继 CLI,可将 Claude Code、Codex 等本机 Agent 或自动化任务通过受信局域网暴露给其他 Agent 调用,同时让提示词、依赖、工作目录与凭据留在发布者设备上。

  • 🔬 OrcaReplay · npm
    简介:在进程与 socket 层记录 coding agent 的整场运行——模型请求、shell 命令的退出码、每轮文件变更、MCP 调用落在同一条时间线上。与只做观测的方案不同,它能把这次运行重新跑一遍:断网重放逐字节复现,或从任一检查点分叉到另一个模型,让两个模型面对完全相同的上下文与文件状态。Apache-2.0。

评测基准

  • 📊 AI Agent评测基准大揭秘:智能体的「体检标准」
    简介:深度解析主流Agent评估体系,系统性梳理 GAIA、AgentBench、PaperBench、WAA等七大主流评测基准,覆盖通用能力、安全鲁棒性、中文场景及科研复现等多维度评估体系。

  • 📊 XBench
    简介:红杉中国推出的双轨测评体系:AGI Tracking测试技术上限,Profession-Aligned量化商业场景效用价值(如招聘/营销)。

  • 🔍 ClawBench
    简介:面向真实生产网页的AI浏览器Agent评测基准,153个日常任务、144个真实网站、15个类别;通过提交拦截层(Chrome扩展+CDP)保证真实环境下的端到端评测不产生副作用。paper

  • 📊 VBench
    简介:全面评估视频生成模型的基准测试套件。它通过多维度的分层评估体系,将“视频生成质量”拆解为多个细粒度指标,提供客观、精细化的评测方法,并与人类视觉偏好高度对齐(CVPR 2024 Highlight)。

  • 📊 VBench-2.0
    简介:新一代视频生成模型评测基准,核心聚焦于模型的“内在真实性(Intrinsic Faithfulness)”。它将评估维度从早期的基础技术质量(如像素保真度、简单的提示词依从性),扩展到了常识推理、物理规律真实性、人类运动姿态及创意组合等更复杂的高阶能力评测。

自我进化

  • 📄 翁荔博客-通过Harness工程实现AI自我提升
    简介:翁荔在文中系统梳理了从 ACE、Meta Context Engineering 到 Self-Harness、Darwin Gödel Machine 等一系列围绕「Harness 自我优化」展开的研究工作,并试图回答:递归式自我提升(RSI)究竟会先发生在模型权重层面,还是先发生在这层「脚手架」上

  • 📄 翁荔长文谈Harness自进化:Agent越用越强,评测难点怎么破?
    简介:现有 Agent benchmark 大多仍然面向静态系统无法回答 harness evolution 中更关键的问题:一次更新到底改进了什么?提升是否能迁移到未见任务?是否只是过拟合近期反馈?是否遗忘了旧能力?是否引入了更高成本或运行时不稳定?

  • 📄 Self-Refine: Iterative Refinement with Self-Feedback
    简介:Aman Madaan et al. (CMU, Google, Allen AI),单一 LLM 同时作为生成器、反馈提供者和优化者,通过迭代式自我反馈改进输出,无需额外训练数据或强化学习。在 7 个任务上平均提升 20%。

  • 📄 OPRO: Large Language Models as Optimizers
    简介:Chengrun Yang et al. (Google DeepMind) 提出的方法,将 LLM 作为通用优化器,用自然语言描述优化任务,以历史解和评分为上下文迭代生成新候选解。GSM8K 提升 8%,Big-Bench Hard 提升 50%。

  • 📄 TextGrad: Automatic Differentiation via Text
    简介:Mert Yuksekgonul et al. (Stanford) 提出的框架,借鉴神经网络反向传播思想,通过 LLM 提供的文本反馈"反向传播"优化复合 AI 系统各组件。采用 PyTorch 风格 API,GPT-4o 准确率从 51% 提升至 55%。[GitHub]

  • 📄 DSPy: Compiling Declarative Language Model Calls
    简介:Omar Khattab et al. (Stanford) 提出的声明式 LM 编程框架,将 LM 管道抽象为计算图,编译器自动优化提示词、微调策略与推理流程。GPT-3.5 提升 >25%,llama2-13b-chat 提升 >65%。[文档]

  • 📄 ADAS: Automated Design of Agentic Systems
    简介: Shengran Hu, Cong Lu, Jeff Clune 提出"元智能体搜索"(Meta Agent Search)框架,让智能体通过编程自动发现新智能体架构,构建不断增长的发现档案。发明的智能体超越手工设计 SOTA,且跨领域迁移鲁棒。

  • 📄 STOP: Self-Teaching Optimization Program
    简介:递归自改进框架,LLM 通过生成自教学样本、反思自身解法、蒸馏推理能力来实现无外部数据的持续优化。核心是代码层面的递归改进循环。

安全实践

开源项目

  • 🤖 openclaw
    简介:跨平台开源个人 Agent(“龙虾”),强调真能动手执行任务。2026 年 2.0(v2026.8.1)完成史上最大重构:降低安装门槛、重做 Web UI,并补齐记忆、云端会话与多人协作,从个人助理走向可协作的 Agent 工作台。同年它引爆大厂“诸神大战”——字节 ArkClaw、腾讯 WorkBuddy、阿里 CoPaw 等纷纷跟进,成为观察 Agent 入口与生态卡位的关键开源底座。

  • 🤖 Claude Code
    简介:Anthropic Claude Code 泄露源码的可构建、可调试复现版。可对照研读其 Agent Loop、工具系统、权限与安全、上下文压缩、子代理协同、Skills 按需注入与会话持久化等工业级 Harness 设计。

  • 🤖 OpenAI Codex
    简介:OpenAI 开源的终端编码 Agent(Codex CLI)。可在本地执行读写代码、跑命令与工具调用,覆盖沙箱权限、MCP、Skills 与会话工作流,是研读 OpenAI 侧 coding harness 的一手参考实现。

  • 🤖 DeepSeek-Harness
    简介:DeepSeek出品,DeepSeek Harness(dsh)是由 DeepSeek AI 开发的开源 agent harness(智能体框架),它采用一切皆插件的架构,并由 Cordis 驱动。

  • 🤖 grok-bot-0.18-reconstructed
    简介:与 Claude Code / Codex(单厂商终端 Agent)和 DeepSeek-Harness(通用插件化 harness)不同,本项目重建的是桌面端 Grok Bot 产品形态:Electron GUI + Host/Coordinator 控制面,把 Cursor / Claude Code / Codex / OpenRouter 当作可切换推理后端,并配套本地用量统计与可选 Docker 沙箱。价值在于对照「桌面 Agent 壳 + 多后端路由」如何落地,而非再提供一套 CLI coding agent。

  • 🤖 prime-agent
    简介:Prime Intellect 开源的自改进编码 / 研究 Agent harness。以 RLM(持久 Python REPL + 递归子代理)与 Continual Harness(可沉淀的提示、记忆、Skills、子代理规格)为核心,支持 /refine 基于轨迹做小步证据化更新,面向长时自主任务与后台持续运行。

  • 🦌 DeerFlow
    简介:字节跳动推出的深度研究框架,集成多智能体协作与端到端研究自动化。核心特点:多智能体分工(基于LangGraph实现模块化架构)、工具深度集成(支持Tavily/DuckDuckGo搜索、Python代 码执行、学术资源抓取)、人机协同创作(提供类Notion的交互式编辑界面)、MCP无缝扩展。

  • 🦌 HKUDS-VideoAgent
    简介:VideoAgent: 一站式智能体框架,用于视频理解、编辑与再创作

  • 🦌 HKUDS-DeepTutor
    简介:DeepTutor 是一个智能体原生的学习工作区,在一个可扩展的系统中集成了辅导、解题、出题、研究、可视化及掌握度练习等多种功能。

  • 🌐 Suna
    简介:Kortix AI推出的通用型智能体,专注于跨平台任务自动化执行。核心特点:浏览器自动化引擎(基于Playwright实现网页导航、数据抓取及表单操作)、安全沙箱环境(通过Docker容器隔离任务执行)、多工具链协同、企业级部署。

  • Jev Social 简介:开源、本地优先的社交媒体研究 Agent。Jev 为每一步浏览器调研操作提供类型化路由,socai CLI 在用户已登录的 Chrome 中搜索 Instagram、TikTok 和 LinkedIn,并将帖子、评论、媒体与来源链接流式汇入可复核的研究报告。提供轻量级单页 Web 演示和免克隆 npx 启动方式。

  • 🛠️ NotFair
    简介:面向营销场景的开源 Claude Code Skills 套件(约2.9k stars,MIT开源)。覆盖 SEO 站点分析、关键词研究、内容写作、Google Ads 审计与出价管理、Meta Ads(Facebook + Instagram)广告效果分析,通过 Google Ads MCP、Meta Ads MCP、Google Search Console MCP 和 Google Analytics(GA4)MCP 接入实时数据,是目前开源生态中覆盖付费广告+自然搜索最完整的 Agent Skills 实现。

  • 🖥️ Orkas
    简介:开源、本地优先的多智能体桌面客户端,由 Commander 协调专业智能体并行或串行完成复杂任务,支持 macOS、Windows 与 Linux。

  • 🤖 SandBase Harness 简介:本地优先的 TypeScript Agent Runtime,提供持久化会话、沙箱工具执行、MCP 集成、记忆、凭据、审计日志与执行回放,支持 Local、Docker、Kubernetes 和自托管部署。

资源中心

  • 📚 awesome-foundation-agents
    简介:系统性整理基础智能体研究路径的论文精选集,聚焦核心概念定义与技术演进脉络,提供领域研究全景导航。

  • 🔍 Awesome Generative AI Guide
    简介:全面的生成式AI资源中心,整合研究论文、面试题库、免费课程与开发笔记。

  • 🎓 Awesome-Agent-Papers
    简介:智能体领域前沿论文聚合仓库,覆盖大语言模型智能体、多智能体协作、人-智能体交互三大方向,持续追踪学术界突破性成果。

  • 📈 awesome-openclaw-skills
    简介:OpenClaw技能资源汇总。

  • 📈 showcase
    简介:OpenClaw展示案例。

  • 📈 awesome-openclaw-usecases
    简介:OpenClaw用例资源汇总。

  • 📚 awesome-ai-agents
    简介:AI Agent资源汇总。

  • 📚 awesome-llm-apps
    简介:精选的LLM应用集合,基于RAG和AI agents构建,支持OpenAI、Anthropic、Google以及DeepSeek、Qwen、Llama等开源模型,可本地运行。

Contributors

skyming

126 commits

IRONICBo

1 commits

luoyuctl

1 commits

masutaka

1 commits