Featured image of post 那个“爱马仕”,想拯救“智障”小龙虾

那个“爱马仕”,想拯救“智障”小龙虾

联系方式 & 交流群\nQQ: 826215906 微信: plus6566 进微信群请联系博主,各位觉得文章对你有帮助的话可否打赏一些呀~\n原文摘要 文|Lambda 编辑|晓静 4月初,Hermes Agent 火了。这个名字直接让人联想到奢侈品牌爱马仕,所以也被戏称为“爱马仕Agent”。 它由 Nous Research 在 2 月发布,定位是「The agent that grows with you」。核心卖点是一个闭环学习系统:Agent 完成复杂任务后,自动把经验固化成 Skill,下次遇到类似任务直接复用,还能在使用过程中持续改进。Skill 自动生成、越用越强——这是 Agent 领域目前最有吸引力的叙事之一。 但这个叙事遮蔽了一个更基本的问题:Skill 真的是当前 Agent 落地的主要瓶颈吗?\n图片由AI生成 01 Skill 很性感,但它可能不是最重要的问题 一个容易被忽略的事实是:目前公认体验最好的编程 Agent 产品之一——Claude Code,它好用的基石并不是 Skill 的自动进化,而是背后大量扎实的 CLI 工具支撑。 用 GlobTool 找候选文件,用 GrepTool 定位相关代码片段,用 FileReadTool 查看实现细节,用 LSPTool 做代码符号跳转和引用分析。每一个都是确定性的、零 token 消耗的原子操作。 但人们很少为这些工具写故事。只要一提到 Agent 能自动生成 Skill、还能持续进化,整个行业立刻就兴奋起来。 这个反差说明了一件事:CLI\u00a0(命令行界面)不性感,不好讲故事,但它才是 Agent 能力的真正地基。 地基不牢,Skill 再会长,也只是长在沙地上。 02 龙虾最被人诟病的地方,Skill 自主进化解决不了 这件事放到 OpenClaw(俗称‘龙虾”)\u00a0身上会看得更清楚。 OpenClaw 最被人诟病的两点,一是 token 消耗大、账单吃不消,二是长时间工作稳定性差、经常失联。乍一看是两个问题;往下拆,会发现它们经常来自同一个源头:Agent 在用劣质工具——比如脆弱的浏览器自动化——去完成本该由确定性工具完成的任务。 这类成本在社区里并非抽象的抱怨,而有大量具体案例。 Reddit 上有 OpenClaw 用户提到,自己只是想自动化 X 账号发帖,三次尝试就花掉了 10 美元,任务还没真正跑通。还有人在 r/automation 里直言,现在很多所谓的 AI Agent 浏览器控制,本质上只是「披着智能外衣的脆弱自动化」——问题不在模型有多笨,而在底层工具本身就不可靠。页面一变、DOM 一改、按钮状态一抖,Agent 就只能一遍遍观察、一遍遍重试、一遍遍重新规划。 而这些「失败但不致命」的试错过程,并不会因为任务没完成就免费——每一次观察页面、分析状态、决定下一步,都在继续消耗 token。 于是,稳定性问题和成本问题,其实是同一个问题的两面:工具越脆弱,试错越多;试错越多,token 烧得越快;任务链越长,失联和中断的概率也越高。 从这个角度看,Skill 自主进化解决的是「怎么更聪明地使用一个工具」,但并没有解决「好工具本身稀缺」的问题。Skill 可以让 Agent 更熟练地驾驭一匹跛脚马,但并不能把跛脚马变成千里马。 这才是今天很多 Agent 系统真正卡住的地方:不是 Skill 不够强,而是底下能调度的高质量原子工具太少。 03 Skill 是对模型能力的补丁 Hermes 做的事情,本质上是把 Skill 的生成和优化自动化——让 Agent 从经验中蒸馏知识,不再需要人手写。这确实解决了一个真实痛点。 但 Skill 本身有一个更深层的问题:它是自然语言驱动的,本质上是模型能力的延伸,或者说,是一种对模型能力的借贷。 现状是,大量 Agent 在用 Skill 加上自主解题能力,完成本该由 CLI 完成的事情——比如以效率低下的浏览器自动化方案查一个股票价格、下载一张图片、提交一个表单。代价很清楚:贵、慢、不稳定、调试难。 这里还有一个常见的认知误区,可以叫做「Skill 可迁移幻觉」:很多人以为,用强模型写出来的 Skill,可以无缝迁移给弱模型用。实际上不能。Skill 是自然语言指令,它对模型能力有隐性依赖;模型一换,行为就可能变。CLI 则不同——它是代码:同样的输入,永远给你同样的输出,不管底下跑的是什么模型。 二者的区别非常鲜明: Skill 调试难,CLI 调试容易; Skill 烧 token,CLI 近乎零消耗; Skill 吃模型版本,CLI 不吃; Skill 是语义层资产,CLI 是执行层资产。 如果把 Skill 当成核心积累方向,本质上是把赌注压在模型能力的稳定性上。至少在当前阶段,更值得积累的是高质量 CLI。 04 当工具和上下文足够好时,Skill 的优先级会自然下降 上面的分析也能从 Anthropic 自己的产品经验里得到印证。 Anthropic 的设计负责人、Cowork 产品的设计主导者 Jenny Wen 在近期访谈中提到一个细节:她个人其实不怎么用 Cowork 的 Skills 功能。原因不是她否定 Skill,而是她在 Cowork 里挂载了一个文件夹,里面有自己长期积累的个人笔记、一对一会议记录、随手想法和工作观察。对她来说,Cowork 从这些材料里已经学到了足够的信息,以至于她对 Skill 和 Memory 的需求都被显著削弱了。 这并不是说 Skill 没有价值,而是说:当上下文管理足够好、底层工具足够强时,Skill 的优先级会自然下降。 换言之,Hermes 所强调的 Skill 自主进化并不是错,而是它解决的问题很可能没有想象中那么基础。 05 有一件事正在悄悄发生:CLI 的使用者,从人变成了 Agent 如果说 Skill 解决的是应用层的编排问题,那么更底层的变化发生在 CLI 上。 过去,CLI 是为人设计的。给人用的 CLI 可以有交互提示,可以容忍模糊输出,也可以在文档不全的时候靠用户自己猜——因为人会停下来,会理解歧义,会重试,会去查文档。 Agent 不一样。 Agent 不睡觉,不容忍歧义,会并发,会在没有预料到的时机无限重试。一个对人类来说「勉强能用」的 CLI,对 Agent 来说可能就是高频事故源。 给 Agent 用的 CLI 必须满足一组完全不同的要求: 一条命令只产出一个明确结果; 输出是结构化的 JSON; 错误信息不仅告诉你哪里错了,还要告诉 Agent 下一步该怎么办; 长任务必须支持异步,不能让 Agent 傻等; 接口天然支持幂等、重试和并发。 背后只有一句话:以前的软件默认使用者要睡觉、会分心、有耐心;现在 Agent 不满足这些前提。 一旦使用者从人变成 Agent,CLI 的设计哲学就需要从头重写。Agent 真正在乎的是 token 消耗、缓存命中率、幻觉控制、长程稳定性,而不是「这个命令看起来是否优雅」。 06 浏览器里能看到的,都值得被 CLI 化 有一个实验很能说明问题:把 Cha\n

逍遥微信二维码

联系逍遥

扫码添加微信,或点击下方按钮复制联系方式。

进微信群请联系博主,各位觉得文章对你有帮助的话可否打赏一些呀~



原文摘要

文|Lambda 编辑|晓静 4月初,Hermes Agent 火了。这个名字直接让人联想到奢侈品牌爱马仕,所以也被戏称为“爱马仕Agent”。 它由 Nous Research 在 2 月发布,定位是「The agent that grows with you」。核心卖点是一个闭环学习系统:Agent 完成复杂任务后,自动把经验固化成 Skill,下次遇到类似任务直接复用,还能在使用过程中持续改进。Skill 自动生成、越用越强——这是 Agent 领域目前最有吸引力的叙事之一。 但这个叙事遮蔽了一个更基本的问题:Skill 真的是当前 Agent 落地的主要瓶颈吗?

图片由AI生成 01 Skill 很性感,但它可能不是最重要的问题 一个容易被忽略的事实是:目前公认体验最好的编程 Agent 产品之一——Claude Code,它好用的基石并不是 Skill 的自动进化,而是背后大量扎实的 CLI 工具支撑。 用 GlobTool 找候选文件,用 GrepTool 定位相关代码片段,用 FileReadTool 查看实现细节,用 LSPTool 做代码符号跳转和引用分析。每一个都是确定性的、零 token 消耗的原子操作。 但人们很少为这些工具写故事。只要一提到 Agent 能自动生成 Skill、还能持续进化,整个行业立刻就兴奋起来。 这个反差说明了一件事:CLI (命令行界面)不性感,不好讲故事,但它才是 Agent 能力的真正地基。 地基不牢,Skill 再会长,也只是长在沙地上。 02 龙虾最被人诟病的地方,Skill 自主进化解决不了 这件事放到 OpenClaw(俗称‘龙虾”) 身上会看得更清楚。 OpenClaw 最被人诟病的两点,一是 token 消耗大、账单吃不消,二是长时间工作稳定性差、经常失联。乍一看是两个问题;往下拆,会发现它们经常来自同一个源头:Agent 在用劣质工具——比如脆弱的浏览器自动化——去完成本该由确定性工具完成的任务。 这类成本在社区里并非抽象的抱怨,而有大量具体案例。 Reddit 上有 OpenClaw 用户提到,自己只是想自动化 X 账号发帖,三次尝试就花掉了 10 美元,任务还没真正跑通。还有人在 r/automation 里直言,现在很多所谓的 AI Agent 浏览器控制,本质上只是「披着智能外衣的脆弱自动化」——问题不在模型有多笨,而在底层工具本身就不可靠。页面一变、DOM 一改、按钮状态一抖,Agent 就只能一遍遍观察、一遍遍重试、一遍遍重新规划。 而这些「失败但不致命」的试错过程,并不会因为任务没完成就免费——每一次观察页面、分析状态、决定下一步,都在继续消耗 token。 于是,稳定性问题和成本问题,其实是同一个问题的两面:工具越脆弱,试错越多;试错越多,token 烧得越快;任务链越长,失联和中断的概率也越高。 从这个角度看,Skill 自主进化解决的是「怎么更聪明地使用一个工具」,但并没有解决「好工具本身稀缺」的问题。Skill 可以让 Agent 更熟练地驾驭一匹跛脚马,但并不能把跛脚马变成千里马。 这才是今天很多 Agent 系统真正卡住的地方:不是 Skill 不够强,而是底下能调度的高质量原子工具太少。 03 Skill 是对模型能力的补丁 Hermes 做的事情,本质上是把 Skill 的生成和优化自动化——让 Agent 从经验中蒸馏知识,不再需要人手写。这确实解决了一个真实痛点。 但 Skill 本身有一个更深层的问题:它是自然语言驱动的,本质上是模型能力的延伸,或者说,是一种对模型能力的借贷。 现状是,大量 Agent 在用 Skill 加上自主解题能力,完成本该由 CLI 完成的事情——比如以效率低下的浏览器自动化方案查一个股票价格、下载一张图片、提交一个表单。代价很清楚:贵、慢、不稳定、调试难。 这里还有一个常见的认知误区,可以叫做「Skill 可迁移幻觉」:很多人以为,用强模型写出来的 Skill,可以无缝迁移给弱模型用。实际上不能。Skill 是自然语言指令,它对模型能力有隐性依赖;模型一换,行为就可能变。CLI 则不同——它是代码:同样的输入,永远给你同样的输出,不管底下跑的是什么模型。 二者的区别非常鲜明: Skill 调试难,CLI 调试容易; Skill 烧 token,CLI 近乎零消耗; Skill 吃模型版本,CLI 不吃; Skill 是语义层资产,CLI 是执行层资产。 如果把 Skill 当成核心积累方向,本质上是把赌注压在模型能力的稳定性上。至少在当前阶段,更值得积累的是高质量 CLI。 04 当工具和上下文足够好时,Skill 的优先级会自然下降 上面的分析也能从 Anthropic 自己的产品经验里得到印证。 Anthropic 的设计负责人、Cowork 产品的设计主导者 Jenny Wen 在近期访谈中提到一个细节:她个人其实不怎么用 Cowork 的 Skills 功能。原因不是她否定 Skill,而是她在 Cowork 里挂载了一个文件夹,里面有自己长期积累的个人笔记、一对一会议记录、随手想法和工作观察。对她来说,Cowork 从这些材料里已经学到了足够的信息,以至于她对 Skill 和 Memory 的需求都被显著削弱了。 这并不是说 Skill 没有价值,而是说:当上下文管理足够好、底层工具足够强时,Skill 的优先级会自然下降。 换言之,Hermes 所强调的 Skill 自主进化并不是错,而是它解决的问题很可能没有想象中那么基础。 05 有一件事正在悄悄发生:CLI 的使用者,从人变成了 Agent 如果说 Skill 解决的是应用层的编排问题,那么更底层的变化发生在 CLI 上。 过去,CLI 是为人设计的。给人用的 CLI 可以有交互提示,可以容忍模糊输出,也可以在文档不全的时候靠用户自己猜——因为人会停下来,会理解歧义,会重试,会去查文档。 Agent 不一样。 Agent 不睡觉,不容忍歧义,会并发,会在没有预料到的时机无限重试。一个对人类来说「勉强能用」的 CLI,对 Agent 来说可能就是高频事故源。 给 Agent 用的 CLI 必须满足一组完全不同的要求: 一条命令只产出一个明确结果; 输出是结构化的 JSON; 错误信息不仅告诉你哪里错了,还要告诉 Agent 下一步该怎么办; 长任务必须支持异步,不能让 Agent 傻等; 接口天然支持幂等、重试和并发。 背后只有一句话:以前的软件默认使用者要睡觉、会分心、有耐心;现在 Agent 不满足这些前提。 一旦使用者从人变成 Agent,CLI 的设计哲学就需要从头重写。Agent 真正在乎的是 token 消耗、缓存命中率、幻觉控制、长程稳定性,而不是「这个命令看起来是否优雅」。 06 浏览器里能看到的,都值得被 CLI 化 有一个实验很能说明问题:把 Cha

文章来源

核心内容

文|Lambda 编辑|晓静 4月初,Hermes Agent 火了。这个名字直接让人联想到奢侈品牌爱马仕,所以也被戏称为“爱马仕Agent”。 它由 Nous Research 在 2 月发布,定位是「The agent that grows with you」。核心卖点是一个闭环学习系统:Agent 完成复杂任务后,自动把经验固化成 Skill,下次遇到类似任务直接复用,还能在使用过程中持续改进。Skill 自动生成、越用越强——这是 Agent 领域目前最有吸引力的叙事之一。 但这个叙事遮蔽了一个更基本的问题:Skill 真的是当前 Agent 落地的主要瓶颈吗?

图片由AI生成 01 Skill 很性感,但它可能不是最重要的问题 一个容易被忽略的事实是:目前公认体验最好的编程 Agent 产品之一——Claude Code,它好用的基石并不是 Skill 的自动进化,而是背后大量扎实的 CLI 工具支撑。 用 GlobTool 找候选文件,用 GrepTool 定位相关代码片段,用 FileReadTool 查看实现细节,用 LSPTool 做代码符号跳转和引用分析。每一个都是确定性的、零 token 消耗的原子操作。 但人们很少为这些工具写故事。只要一提到 Agent 能自动生成 Skill、还能持续进化,整个行业立刻就兴奋起来。 这个反差说明了一件事:CLI (命令行界面)不性感,不好讲故事,但它才是 Agent 能力的真正地基。 地基不牢,Skill 再会长,也只是长在沙地上。 02 龙虾最被人诟病的地方,Skill 自主进化解决不了 这件事放到 OpenClaw(俗称‘龙虾”) 身上会看得更清楚。 OpenClaw 最被人诟病的两点,一是 token 消耗大、账单吃不消,二是长时间工作稳定性差、经常失联。乍一看是两个问题;往下拆,会发现它们经常来自同一个源头:Agent 在用劣质工具——比如脆弱的浏览器自动化——去完成本该由确定性工具完成的任务。 这类成本在社区里并非抽象的抱怨,而有大量具体案例。 Reddit 上有 OpenClaw 用户提到,自己只是想自动化 X 账号发帖,三次尝试就花掉了 10 美元,任务还没真正跑通。还有人在 r/automation 里直言,现在很多所谓的 AI Agent 浏览器控制,本质上只是「披着智能外衣的脆弱自动化」——问题不在模型有多笨,而在底层工具本身就不可靠。页面一变、DOM 一改、按钮状态一抖,Agent 就只能一遍遍观察、一遍遍重试、一遍遍重新规划。 而这些「失败但不致命」的试错过程,并不会因为任务没完成就免费——每一次观察页面、分析状态、决定下一步,都在继续消耗 token。 于是,稳定性问题和成本问题,其实是同一个问题的两面:工具越脆弱,试错越多;试错越多,token 烧得越快;任务链越长,失联和中断的概率也越高。 从这个角度看,Skill 自主进化解决的是「怎么更聪明地使用一个工具」,但并没有解决「好工具本身稀缺」的问题。Skill 可以让 Agent 更熟练地驾驭一匹跛脚马,但并不能把跛脚马变成千里马。 这才是今天很多 Agent 系统真正卡住的地方:不是 Skill 不够强,而是底下能调度的高质量原子工具太少。 03 Skill 是对模型能力的补丁 Hermes 做的事情,本质上是把 Skill 的生成和优化自动化——让 Agent 从经验中蒸馏知识,不再需要人手写。这确实解决了一个真实痛点。 但 Skill 本身有一个更深层的问题:它是自然语言驱动的,本质上是模型能力的延伸,或者说,是一种对模型能力的借贷。 现状是,大量 Agent 在用 Skill 加上自主解题能力,完成本该由 CLI 完成的事情——比如以效率低下的浏览器自动化方案查一个股票价格、下载一张图片、提交一个表单。代价很清楚:贵、慢、不稳定、调试难。 这里还有一个常见的认知误区,可以叫做「Skill 可迁移幻觉」:很多人以为,用强模型写出来的 Skill,可以无缝迁移给弱模型用。实际上不能。Skill 是自然语言指令,它对模型能力有隐性依赖;模型一换,行为就可能变。CLI 则不同——它是代码:同样的输入,永远给你同样的输出,不管底下跑的是什么模型。 二者的区别非常鲜明: Skill 调试难,CLI 调试容易; Skill 烧 token,CLI 近乎零消耗; Skill 吃模型版本,CLI 不吃; Skill 是语义层资产,CLI 是执行层资产。 如果把 Skill 当成核心积累方向,本质上是把赌注压在模型能力的稳定性上。至少在当前阶段,更值得积累的是高质量 CLI。 04 当工具和上下文足够好时,Skill 的优先级会自然下降 上面的分析也能从 Anthropic 自己的产品经验里得到印证。 Anthropic 的设计负责人、Cowork 产品的设计主导者 Jenny Wen 在近期访谈中提到一个细节:她个人其实不怎么用 Cowork 的 Skills 功能。原因不是她否定 Skill,而是她在 Cowork 里挂载了一个文件夹,里面有自己长期积累的个人笔记、一对一会议记录、随手想法和工作观察。对她来说,Cowork 从这些材料里已经学到了足够的信息,以至于她对 Skill 和 Memory 的需求都被显著削弱了。 这并不是说 Skill 没有价值,而是说:当上下文管理足够好、底层工具足够强时,Skill 的优先级会自然下降。 换言之,Hermes 所强调的 Skill 自主进化并不是错,而是它解决的问题很可能没有想象中那么基础。 05 有一件事正在悄悄发生:CLI 的使用者,从人变成了 Agent 如果说 Skill 解决的是应用层的编排问题,那么更底层的变化发生在 CLI 上。 过去,CLI 是为人设计的。给人用的 CLI 可以有交互提示,可以容忍模糊输出,也可以在文档不全的时候靠用户自己猜——因为人会停下来,会理解歧义,会重试,会去查文档。 Agent 不一样。 Agent 不睡觉,不容忍歧义,会并发,会在没有预料到的时机无限重试。一个对人类来说「勉强能用」的 CLI,对 Agent 来说可能就是高频事故源。 给 Agent 用的 CLI 必须满足一组完全不同的要求: 一条命令只产出一个明确结果; 输出是结构化的 JSON; 错误信息不仅告诉你哪里错了,还要告诉 Agent 下一步该怎么办; 长任务必须支持异步,不能让 Agent 傻等; 接口天然支持幂等、重试和并发。 背后只有一句话:以前的软件默认使用者要睡觉、会分心、有耐心;现在 Agent 不满足这些前提。 一旦使用者从人变成 Agent,CLI 的设计哲学就需要从头重写。Agent 真正在乎的是 token 消耗、缓存命中率、幻觉控制、长程稳定性,而不是「这个命令看起来是否优雅」。 06 浏览器里能看到的,都值得被 CLI 化 有一个实验很能说明问题:把 Cha


内容来源:ai 原文链接:https://36kr.com/p/3761883183530502?f=rss

市场背景

  • BTC 价格:$0.00
  • 24h 涨跌:+0.00%

AI Agent 加工:AI Agent(技术分析) 生成时间:2026-04-11T06:00:35.231637

站长推荐
Hello World | 开启技术博客之旅
从这里开始阅读本站的网络安全、AI 与技术实践内容。
查看文章 →
订阅更新
通过 RSS 阅读本站
不依赖平台算法,第一时间获取新文章。
订阅 RSS →
站长推荐
Hello World | 开启技术博客之旅
从这里开始阅读本站的网络安全、AI 与技术实践内容。
查看文章 →
订阅更新
通过 RSS 阅读本站
不依赖平台算法,第一时间获取新文章。
订阅 RSS →