IT技术博客大学习 共学习 共进步
全部 移动开发 后端 数据库 AI 算法 安全 DevOps 前端 设计 开发者

标签:AI Agent

共 18 篇相关文章

IT 累计浏览 14

SmartPerfetto 2026.06.04-07.17 六周更新复盘:从 v1.0.28 到 v1.1.1

SmartPerfetto 在六周内从 v1.0.28 升级至 v1.1.1,聚焦于 AI 辅助性能分析工具的架构统一与功能增强。核心更新包括双 Trace 分析工作台,支持当前 trace 与参考 trace 的实时对比,通过原子交换窗口身份和运行身份保护确保分析上下文不中断。Quick Mode 实现证据直答,对事实性问题如帧率、前台应用等零模型对话返回,附逐句数据引用和分析回执,显著优化 token 消耗。私有分析上下文集成本机源码与 Android Internals 知识库,采用双重同意模型保护隐私,模型仅访问元数据而非源码原文。Agent 运行时架构完成统一,四条运行时(Claude、OpenAI、Pi Agent Core、OpenCode)收敛到同一套运行规格,消除行为不一致,并引入取消语义和断点续传。Token 成本优化通过策略拆分为 core/detail 两层、SQL 结果自动摘要和工具描述压缩实现。场景覆盖扩展至 Camera、Heap 和 GPU 分析,遵循证据优先原则。此外,RFC-0025 定义了八个 AI 工作流表面,如分析回执、UI 导航建议和批量 trace 生命周期,增强可审计性与协作。工程化方面,实施每周审查制度、端到端验证于 DeepSeek 真实 API,并构建 Android 性能生态,连接插桩、采集、分析等八个仓库形成完整路径。

IT 累计浏览 232

Matt Pocock 的 Skills 系统:真正的工程,不是氛围编程

Matt Pocock的Skills系统是一个针对AI编码工具的工程化框架,旨在通过定义原子能力单元提升代码质量。系统基于四个设计原则:小而可组合,每个Skill专注单一功能;模型无关,可在不同Agent平台运行;可改造,用户可自由修改;通用性优先于平台绑定。它解决了AI Agent开发中的四个常见失败模式:需求不清、输出冗余、代码不可靠和架构混乱。针对这些问题,Skills提供了具体修复工具,如/grill-me用于结构化需求澄清,避免Agent误解;CONTEXT.md建立项目共享语言,减少冗余并固化领域术语;/tdd和/diagnose技能强化测试驱动开发和调试流程,确保代码可靠性,强调垂直切片而非水平切片;/zoom-out和架构分析工具如/improve-codebase-architecture持续维护设计质量,防止熵增。安装通过npx命令快速完成,将Markdown技能文件复制到Agent配置目录,并配置项目上下文。Pocock的Skills仓库获得近10万GitHub Stars,反映了开发者对AI编码质量控制的迫切需求。它将经典软件工程原则如测试驱动开发、领域驱动设计和调试流程重新编码到AI协作中,强调工程师对流程的控制权,而非依赖黑箱自动化方法,为AI时代的软件开发提供了实用且可扩展的解决方案。

IT 累计浏览 195

Ralph Loop:自主循环开发

Ralph Loop 是一种自主循环控制结构,旨在让 AI Agent 通过自指涉迭代完成任务。其核心理念源于 Geoffrey Huntley 对 AI 编码 Agent 行为的观察,这些 Agent 缺乏元认知但执着于尝试,类似《辛普森一家》中的 Ralph Wiggum。技术上,它基于 Bash while 循环,将固定 prompt 反复输入 AI,但每次迭代中 AI 读取自己上一轮修改的文件系统,形成自指涉反馈,从而持续改进代码。Anthropic 的 ralph-wiggum 插件实现了优雅的会话内循环,利用 Claude Code 的 Stop Hook 机制在 Agent 试图退出时拦截,并注入相同 prompt 继续迭代。循环状态仅由一个 Markdown 文件管理,包含迭代次数、最大迭代和完成承诺。退出条件分为两类:Completion Promise,通过语义匹配任务完成信号;以及 Max-Iterations,作为安全上限防止无限循环。相比外部进程循环,会话内设计保持了上下文连续性,支持实时人工干预。Ralph Loop 将 AI Agent 从一次性助手转变为循环迭代的初级工程师,提高了开发效率,但需谨慎设置参数以避免资源浪费。

IT 累计浏览 181

superpowers 技能框架:Agent 能力增强

superpowers是一个AI Agent技能框架,通过14种Skill增强Agent的自主开发能力。框架采用自动触发机制,Agent在任务前根据Skill描述匹配场景并自动激活相关技能,如brainstorming强制需求澄清。硬门控使用HARD-GATE标签在prompt中嵌入约束,确保质量门控。技能分组包括规划、开发、审查和元技能,强调测试驱动开发、系统化调试和子Agent驱动开发。子Agent模式通过为每个任务派生新Agent避免上下文膨胀,提高决策质量。文章对比了superpowers与gstack等方法论,突出其工具信任而非流程控制的理念。实战部分以贪吃蛇游戏为例,展示Agent自动完成设计、计划和子Agent实现。中文本地化版本superpowers-zh扩展了本土工具支持,增加六个原创Skill。框架体现了AI软件工程中自主性和工具化趋势,对开发者有较高参考价值。

IT 累计浏览 86

Harness Engineering:AI Agent 的工程实践

Harness Engineering 是 AI Agent 开发中的关键实践,专注于构建模型推理能力之外的控制基础设施,以确保 Agent 的安全性和可靠性。以 Anthropic 的 Claude Code 为例,其 Harness 系统通过 hooks 机制、权限模型和 Bash 沙箱,将大语言模型安全集成为可交付产品。系统包含 31 个生命周期事件、5 种 hook 类型(如 Command、HTTP、MCP Tool)和 4 层配置继承(Managed、User、Project、Local)。核心组件包括编排循环(控制 Agent 何时停止)、工具系统(管理工具调用权限)、安全护栏(权限模型和沙箱提供隔离)、上下文管理(通过 SessionStart hook 注入上下文)、配置管理(settings.json 多层继承)等。这些组件协同工作,覆盖从错误处理到子 Agent 编排的全方位工程需求。相比之下,OpenAI 的 Codex CLI 采用 Rust 内核设计,将安全约束编译进二进制文件,体现了不同技术路径。Harness Engineering 使 AI Agent 从对话模型转变为可靠产品,为开发生产级 Agent 提供了系统框架,涵盖安全、编排和可观测性等维度。

IT 累计浏览 90

Kanban:用看板编排 AI Agent 项目

AI Agent项目的瓶颈已从代码编写转向多Agent并行管理。Kanban方法通过可视化工作流、限制WIP和拉式流动,精准匹配Agent场景。本文介绍三个专用工具:kanbots采用本地SQLite存储,每张卡片对应一个Agent运行实例,通过git worktree隔离代码变更,支持MCP集成和Autopilot模式;Vibe Kanban作为Web协作平台,引入Workspace抽象,提供Plan-Run-Review-Preview-Ship全流程,但已宣布逐步关闭并开源;kanban-code则侧重个人开发者驾驶舱,自动关联Claude会话、tmux终端和GitHub PR,实现卡片基于真实信号横移。工具差异体现在本地优先与云协作、人机协同与自主循环。核心设计围绕Agent隔离、权限边界和状态同步,为AI时代开发范式提供实践参考。

IT 累计浏览 73

GSD Core:对抗上下文腐化的阶段循环引擎

GSD Core 是一套轻量级的元提示、上下文工程与规格驱动开发系统,旨在解决 AI Agent 在大型项目中因上下文腐化导致输出质量下降的问题。上下文腐化指随着对话轮次增加,AI 模型输出质量退化,表现为忘记早期决策、混淆文件或重复无效方案。GSD Core 通过三根支柱应对:阶段循环、子智能体和持久化工件。系统将工作组织为里程碑,每个里程碑包含多个阶段,每阶段强制执行五步循环:Discuss 捕获实现决策,Plan 使用子智能体研究和分解任务并确保计划可装入单个上下文窗口,Execute 按依赖波次并行运行执行器,每个执行器从干净上下文起步,Verify 验证工作并生成修复计划,Ship 创建 PR 并归档工件。采用瘦编排者模式,主会话仅负责协调,重活下放给专门子智能体,每个子智能体在独立的 200k token 上下文中工作,避免污染。所有状态通过 STATE.md、CONTEXT.md 等文件持久化在 .planning/ 目录,实现会话间共享记忆。系统跨运行时支持 Claude Code、OpenCode 等,通过 npm 安装,并提供模型档位以优化成本和性能。整体上,GSD Core 将 AI 编程从提示工程提升为循环工程,增强了 Agent 的可靠性和可审计性。

IT 累计浏览 66

improve:用强模型审计、让弱模型执行的"计划即产品"工作流

shadcn/improve 是一个开源的 AI 代理技能,通过模型分工优化代码审计和执行成本。其核心理念“计划即产品”强调强模型(如 Opus/GPT-4)专注于智能密集任务,包括理解代码库、识别问题和制定详细计划;弱模型(如 Haiku/GPT-4o-mini)则负责按计划执行编码和测试。这种分离基于任务智能密度,智能密集型工作交给昂贵模型,执行密集型工作交给廉价模型,以降低成本并维持质量。improve 的工作流包含五个阶段:Recon 阶段绘制仓库地图,理解技术栈和结构;Audit 阶段并行扫描九类问题(如正确性、安全、性能);Vet 阶段独立验证发现,剔除误报;Prioritize 阶段按杠杆率排序问题;Plan 阶段生成自包含的可执行计划。该工具通过计划提供上下文,弥补弱模型不足,确保执行质量。它支持多种命令,如全面审计、安全审计和快速扫描,并集成到主流 AI 编程工具中。这种工作流不仅降低 API 成本,还提高代码质量,为 AI 辅助开发提供了经济高效的解决方案,体现了从决策到执行的自动化范式。

IT 累计浏览 90

agent-skills:用生产级工程纪律武装 AI Agent

agent-skills是由Addy Osmani开发的开源框架,旨在为AI编码代理提供生产级工程纪律。它针对AI Agent常跳过规格编写、测试、代码审查等关键步骤的问题,通过结构化工作流强制执行流程。框架定义了七阶段开发生命周期:从/spec(需求规格)到/ship(安全部署),每个阶段配备专项技能,如interview-me进行需求访谈、test-driven-development强制红-绿-重构循环。核心创新是反合理化表,针对Agent可能提出的借口(如“太简单不需要spec”)预设反驳,制度性地阻止自我欺骗。agent-skills将Google工程文化原则如Hyrum's Law、Beyoncé Rule等编码为不可绕过的流程,确保代码质量、安全性和可维护性。通过Markdown格式工作流,它兼容Claude Code、Cursor等主流AI工具,使Agent从“能跑就行”转向遵循工程纪律,提升软件工程的整体效率和质量。

IT 累计浏览 83

Anthropic 官方插件:AI Agent 的领域知识插件

Anthropic 为 Claude Code 开发的 13 个官方插件,通过将静态领域知识动态化来增强 AI Agent 的能力。插件系统基于 hooks、agents 和 skills 三层基础设施,实现从代码审查到安全监控的全流程自动化。code-review 插件利用 4 个并行 Agent 进行本地 diff 审查,支持信心评分过滤噪音;feature-dev 插件将功能开发分为 7 个阶段,通过专门 Agent 探索代码库、澄清需求和设计架构;security-guidance 插件通过 PreToolUse hook 静默监控 9 类安全风险。其他插件如 pr-review-toolkit 提供多维度细粒度审查,commit-commands 自动化 Git 工作流。设计模式强调专用 Agent 并行协作、结构化阶段门控和 hook 驱动自动触发,体现了全书方法论如 Skills 系统、Ralph Loop 和 Harness Engineering。插件组合使用可定制开发工作流,提升 AI Agent 的可靠性和效率,适应复杂工程场景。

IT 累计浏览 108

Understand-Anything:代码知识图谱

本文介绍了开源项目Understand-Anything,旨在解决当前AI编程助手(如Claude Code)在理解大型代码库时面临的效率低下和记忆缺失问题。其核心方案是构建代码知识图谱:使用Tree-sitter进行确定性结构解析,提取文件、函数、类之间的调用与依赖关系作为图骨架;再利用LLM生成语义摘要、标签和架构层分类作为血肉,从而将整个代码库转化为一个可查询、可分析的图结构。文章详细阐述了其安装配置方法(支持15个AI Agent平台)、由五个专门Agent组成的分析流水线(扫描、文件分析、架构分析、导览构建、验证)以及知识图谱的七大用途,包括交互式浏览、语义搜索、影响分析、新人导览、业务域提取等。项目还支持增量更新、知识图谱的Git版本控制共享,并通过实战案例展示了其应用。整体而言,该工具通过将AI的代码理解能力从实时低效搜索转变为预计算的知识查询,显著提升了AI Agent的代码协作效率。

IT 累计浏览 123

重构:AI 时代的代码进化

在AI辅助开发时代,代码重构成为应对技术债的关键手段。重构旨在不改变外部行为的前提下优化代码内部结构,提升可读性和可维护性。技术债源于业务压力、缺测试等因素,AI加速代码生成可能迅速累积债务。Fowler的重构理论包括识别代码坏味道如过长方法、重复代码,以及应用手法如Extract Method。重构时机遵循三次法则:首次直接做,第二次忍耐,第三次开始重构;加功能、修bug或代码评审时也是自然时机。正确重构需确保代码变干净、不混入新功能、测试全通过。AI工具如goal workflow套件中的/refactor Skill,将Fowler的目录封装为AI Agent可调用能力,支持22种坏味道和40+种重构手法。它通过五阶段安全协议强制执行重构纪律,包括特征测试、小步提交和验证,将依赖自觉转为机器强制。/smell Skill提供更广泛的诊断,覆盖8大类50+坏味道,帮助优先处理问题。针对Java、TypeScript、Python等语言有特化指南,优化重构实践。AI时代,重构自动化不仅提高效率,还确保一致性,降低人为错误,促进代码库健康。

IT 累计浏览 92

理解 Skill —— 读《图解 Skill》

文章基于《图解 Skill》一书,系统解析了AI Agent中Skill的核心设计与实践方法。Skill作为功能模块,以文件夹形式存在,包含SKILL.md文件,其YAML头定义名称与描述,正文遵循角色定位、核心要点、禁止清单、参考资料的框架,并限制在5000 token以内。description需精炼功能与触发场景,直接影响模型调用时机。对比测试是验证Skill效果的关键,通过加载与不加载的对照实验,结合客观验收标准(如结构完整性、语气符合度)和盲评方法减少评估偏见。Anthropic的skill-creator工具实现了自动化测试,能生成测试用例、运行对比评估和基准测试,优化描述触发。实用技巧包括单一职责确保Skill专注、按需加载优化上下文占用、配置外置增强灵活性。文章涵盖Skill的编写、测试到迭代全流程,为AI Agent开发者提供了入门指导和优化思路。

IT 累计浏览 202

00 卷首语:当 Karpathy 说他半年没写一行代码

Andrej Karpathy宣布半年未亲手写代码,转而使用AI Agent驱动开发,标志软件工程进入新纪元。他提出软件3.0概念:LLM作为新型计算机,编程通过提示实现,产生‘参差不齐的智能’。行业趋势显示AI编程工具从Copilot到Claude Code快速进化,效率提升数百倍。然而,AI放大工程缺陷,Vibe Coding可能导致技术债务,而Agentic Engineering强调人类在架构、验证和责任感上的核心作用。方法论如Matt Pocock的Skills系统、Spec-Driven Development、Ralph Loop的自主循环和Garry Tan的gstack虚拟团队,共同应对验证差距。Harness Engineering聚焦Agent运行环境,确保可靠性。文章指出,当开发速度不稀缺,工程化成为壁垒,人类需提升品味、判断力和系统审美。作为卷首语,它引出本书对AI时代软件工程方法论的系统探讨。

IT 累计浏览 107

套壳不丢人!我用Go+AI搓了一个Agent统一编排框架,ClaudeCode-Codex-Pi全被我包了

作者在智能体开发中,从langchain转向套壳Claude Code、Codex、Pi等现有AI Agent,认为套壳是高效利用现成工具的合理方式。这些Agent已发展为通用智能体,不仅能处理代码任务,还可用于多种场景。面对多个Agent各自为政、胶水代码繁杂的问题,作者用Go语言开发了agent-wrapper框架,提供统一编排层。通过简单API,一行代码即可注册和切换不同Agent,如Claude Code、Codex、Pi等。框架核心功能包括三道安全闸门:审批拦截允许自定义工具调用权限,如只读操作而拒绝写入;预算监控在Token消耗超阈值时自动中断,防止成本失控;上下文压缩和自动重试处理上下文超限,通过滑动窗口和摘要策略提升稳定性。此外,支持会话恢复,通过SessionID跨会话保持上下文连续性,便于跨进程或跨天持续任务。框架既支持命令行测试,也可作为Go库嵌入项目,实现零额外进程和协议开销。作者通过在故障分析产品中的实际应用,展示了如何专注于业务逻辑而非基础设施。最终,agent-wrapper解决了Agent集成的安全性、预算管理和跨平台问题,将实验性套壳转化为生产就绪的解决方案。

IT 累计浏览 99

从 Next.js 迁移到 React Router Framework Mode:AI Agent 视角的完整记录

本文详细记录了将一个中型博客项目从Next.js迁移至React Router框架模式的完整过程与思考。迁移并非技术栈的简单替换,而是源于对Next.js生态逐渐封闭、捆绑部署与服务器组件过度依赖的不满,转而追求更轻量、更开放且完全可控的技术栈。核心挑战集中在数据获取、路由结构适配与服务器组件逻辑重写上。作者通过采用React Router v6.4+引入的数据路由(Data Router)模式,结合服务端渲染与流式渲染,成功实现了静态生成与动态数据的混合获取,同时将构建输出优化为独立的、可部署于任意Node.js环境的标准应用,显著提升了启动速度并降低了部署成本。文章特别指出,此迁移并非适用所有场景,其最终成果在于获得了对构建流程、部署架构与依赖关系的完全掌控,是基于项目长期维护与成本考量下的技术取舍,而非对Next.js的全盘否定。

IT 累计浏览 193

SmartPerfetto 架构文章 Q&A:8 个深度技术问答

文章深入解析了SmartPerfetto架构的核心设计哲学,重点阐述了其在确定性约束与Agent自主性之间的平衡策略。关键机制在于三层配合:Strategy文件以声明式规则定义分析必须完成的步骤与硬性约束,Planning Gate强制Agent在执行前提交计划以确保规划纪律,而Verifier则在事后对关键分析动作进行多维度检查与纠错。这使得系统对核心分析路径(如滑动卡顿的根因深钻)施加强约束,而在探索性环节保留灵活度。 文章澄清了Agent与Workflow的本质区别,指出决策权分配应因环节而异。SmartPerfetto在数据收集阶段采用类似SOP的确定性策略(Workflow),而在需要因果推理和归纳的归因阶段充分信任LLM的自主能力(Agent)。其最终架构选择基于Claude Agent SDK,并叠加了场景分类、策略注入、验证纠错等自建约束层,而非固定控制流的ReAct或LangGraph。这一选择源于性能分析路径的不可预测性,使LLM能根据运行时数据自主选择分析路径,同时通过约束框架确保分析深度与完整性,定义了由观测能力、约束框架与反馈质量共同决定的Agent能力边界。

IT 累计浏览 112

别再傻等了,给 Claude Code 装个通知铃铛

这篇讲的是作者在使用Claude Code这类AI Agent时发现的一个痛点:任务跑在后台,总忍不住去查看状态,或者错过了需要授权的交互提示,导致效率低下。 他先是试了让LLM在任务完成时播放提示音,但发现这个“软提示”方案极不靠谱——LLM不会100%遵循指令,长对话还会压缩丢掉提示词,什么算“任务完成”也没个准谱。 于是他转向了确定性的“硬触发”方案:利用各平台的Hook机制,开发了`agent-notifier`这个SKILL。它能统一监听Claude Code、Copilot CLI、Cursor等多个平台的事件(如任务空闲、需要授权),然后并发地将通知发送到声音、系统通知、Telegram、邮件等多种渠道。 整个设计很巧妙,纯用Python标准库实现零依赖,拿过来就能用。核心是统一事件模型加并发分发,单个渠道失败也不影响其他。本质上是把通知这个“该确定的事”从不靠谱的LLM手里,交给了确定的Agent脚本去执行,最终实现了可靠的自动提醒。