Agent 不是 Demo:20 条 Gold Case 如何搭建可自动运行的评测框架
作者:Agent Dev 实践笔记 | 发布日期:2026-09-21 | 标签:Agent, 评测, Gold Case, 自动化测试, 质量保障
我的个人网站
作者:Agent Dev 实践笔记 | 发布日期:2026-09-21 | 标签:Agent, 评测, Gold Case, 自动化测试, 质量保障
作者:Agent Dev 实践笔记 | 发布日期:2026-09-21 | 标签:Agent, 评测, Gold Case, 自动化测试, 质量保障
作者:Agent Dev 实践笔记 | 发布日期:2026-09-21 | 标签:Agent, 安全, AST, Human-in-the-loop, Tool Policy
作者:Agent Dev 实践笔记 | 发布日期:2026-09-21 | 标签:Agent, 安全, AST, Human-in-the-loop, Tool Policy
作者:Agent Dev 实践笔记 | 发布日期:2026-09-21 | 标签:Agent, Skill, Markdown, 低代码, Routing
作者:Agent Dev 实践笔记 | 发布日期:2026-09-21 | 标签:Agent, Skill, Markdown, 低代码, Routing
作者:Agent Dev 实践笔记 | 发布日期:2026-09-21 | 标签:Agent, 架构设计, Prompt Engineering, 软件工程
作者:Agent Dev 实践笔记 | 发布日期:2026-09-21 | 标签:Agent, 架构设计, Prompt Engineering, 软件工程
作者:Agent Dev 实践笔记 | 发布日期:2026-09-21 | 标签:Agent, Function Calling, Python, LM Studio
作者:Agent Dev 实践笔记 | 发布日期:2026-09-21 | 标签:Agent, Function Calling, Python, LM Studio
通用 Agent 让”做”这件事快速贬值,于是价值整体迁移到了”做之前”和”做之后”——决定让它干什么,以及判断它干得对不对。中间那段”动手”,才是正在被商品化的部分。
现在流行的一种说法是:通用 Agent = Coding Agent + 文件系统。
这个范式解决的是动作空间的通用:它能调 API、能爬网页、能改表格、能跑脚本,看起来什么都能干。但它没解决的是另外三件事:
这三件事,一件都没有被自动化。 继续阅读“通用 Agent 时代,价值迁移到了哪里”
流程工业判断 Agent 必要性,逻辑与互联网场景根本不同:Agent 不是主战场,而是确定性自动化层覆盖不到的残差区。本文给出时间尺度切分、五层否决漏斗与三个可立即执行的诊断动作。
互联网场景问的是”这个业务值不值得用 AI 重做一遍”;流程工业必须先问另一个问题:
“这个场景是不是已经被确定性层覆盖了?”
因为流程工业是极少数已经拥有成熟确定性自动化栈的行业:SIS 管安全联锁、DCS/PLC 管回路、APC/MPC 管多变量优化、MES/ERP 管执行与计划。这套栈是几十年工程积累、可认证、可追责的。Agent 引入的却是概率性——而来自过程系统工程研究的结论很冷酷:目前不存在将 LLM 认证为 SIL 1 及以上安全功能组成部分的路径。
所以,Agent 在流程工业的战场不是主战场,而是确定性层覆盖不到的残差区。必要性判断的全部功夫,就在于准确圈出这个残差。 继续阅读“工业流程企业,如何准确判断智能体应用的必要性?”
这个仅用500行核心代码构建的AI代码Agent框架,展示了如何让自然语言指令直接转化为可执行的Python代码。它不只是简单的“输入-生成-输出”,而是具备安全沙盒执行和自动纠错能力——当LLM生成的代码出现bug时,系统会自动将错误信息反馈给模型进行修复,最多尝试3次,全程无需人工干预。通过四个抽象接口(LLM、执行器、工具、历史管理)和一个核心编排引擎,实现了“生成→执行→改进”的智能循环。…
从零开始实现和了解一个极简但功能完整的 AI 代码 Agent 框架——code-agent-demo。不到 500 行核心代码,却涵盖了 LLM 调用、安全沙盒、自动改进循环、历史管理、CLI 交互等所有关键环节。