三个月后AI已经不一样了
3 个月前,我做完小程序之后 vibe coding 就停了,公司那边也没什么活,所以很长一段时间我都没有重度用 AI 写过代码。失业之后,我又重新开始了 vibe coding。
结果发现仅仅过了 3 个月,使用体验上面就发生了很大的变化。
为什么还是 Claude Code
我用的还是一直在用的 Claude Code。为什么在茫茫多的 AI 产品里我选择了它,之前我也提到过,因为它现在是生态最全的:无论是插件系统、远程连接、Claude Design 这些外围能力,还是它自身的模型能力,都让我觉得够用。
但是它也有一个很大的缺点,那就是它没有生图模型。Anthropic 到现在都没有推出过原生的图像生成能力,官方帮助中心里写得很直白,Claude 可以用 HTML 和 SVG 画图表和可视化,但没法像图像模型那样生成照片或插画。
这就导致生图要使用其它的模型。其实写代码时用到生图的场景,比生成视频、生成语音要常见得多,因为项目中难免有时候会使用一两个图片。
体感最大的变化:harness 把上下文管住了
体感最大的是更加完善的 harness。现在模型拥有极强的分发能力,会将大部分工作分发给 subagent 去做,而主线仅仅处理一些重要的事情,这就直接大幅度地节省了主线程的上下文,不会出现频繁压缩的情况,即使在读大型项目也拥有非常良好的效果。
这套做法 Anthropic 自己在上下文工程的文章里讲得很清楚:专门的子代理各自维护干净的上下文窗口,做完之后只把一份压缩过的结论交回来,通常只有一两千个 token,详细的检索过程整个隔离在主线之外。
到今年 8 月,Claude Code 已经内置了多种 subagent 类型,还支持子代理再开子代理,最多嵌套五层;2.1.232 版本更是把 subagent forking 默认打开了,fork 出来的子代理会直接继承完整的对话历史和 prompt 缓存。
少给模型加限制
其次是模型考虑问题的边界更加清晰了,而且对于 prompt 的理解更强。
我是从来没有用过 Superpowers 这种库的,我之前使用了一下,发现它限制了模型原本的能力,我直接就给卸载了。现在我的建议是尽量少地限制模型,因为现在的模型已经十分优秀了。
正如 Anthropic 的文章中所写,最好先拿手头最强的模型跑一个最小提示词,看它在你的任务上表现如何,再根据初期测试暴露出来的失败情况,一条条补上明确的指令和示例。同一篇文章里还提到一个叫”合适的高度”的说法:提示词写得太死,就变成了又脆又硬的硬编码逻辑;写得太虚,又只剩下空泛的口号;要的是既能有效引导行为、又留给模型足够启发空间的那个度。
不要给模型太大的限制。
复杂问题一次到位,长任务能自己跑
而随着模型能力的增加,很多复杂的问题都能一次实现到位,而且 Claude Code 原生就引入了 /goal 命令,这也直接导致它可以自主运行一些长任务。
/goal 是 5 月 12 日随 2.1.139 版本上线的,用法是给一个完成条件,然后模型自己跨多轮往下推进:读文件、改代码、跑测试、看结果、继续改,直到达成目标,或者确实卡到需要人介入为止。它在交互模式、-p 和 Remote Control 里都能用,运行过程中会记录耗时、轮次和 token 消耗。
新功能还在往外冒
而且 Anthropic 还在持续推出新的功能,比如最新的 /design 命令,可以直接在项目中创建 canvas,一次生成好几版画板,然后用户自己选择方式往下做。它跑在 Artifacts 运行时上,画板可以直接在画布上手动改,目前还是 research preview 阶段。
Cowork 现在对于 mobile 用户也开放了。7 月 7 日 Anthropic 把 Cowork 搬出了桌面端,浏览器里的 claude.ai 和 iOS、安卓上的 Claude App 都能用,会话跑在云端,最先拿到的是 Max 订阅用户,之后再逐步铺给其它计划。Claude Code 在 App 上面也可以使用云端环境,等等,这几个月更新了大量的功能。
有了利器,却不知道拿它撬什么
但是!尴尬的是,虽然有着利器,但是我不知道有什么东西可蹬。我经常看社交媒体上面很多人说额度不够用,几个 20x 的账号都不够用我就很好奇,到底是什么项目能用那么大的额度?难道是我的嗅觉不够敏锐,发现不了其中的商机?
每次额度刷新都是一次狂欢,当然这狂欢几乎是属于 Codex 的,Claude 几乎不会额外重置额度,而 Codex 那边甚至取消了 5 小时的限制,只保留了周限制。7 月中旬 OpenAI 说的是”临时”取消,没承诺永久,也没给恢复时间表。
Codex 对用户来说真的是福音了,几乎不封号,即使你是通过黑卡充值,它也仅仅回收你的订阅,而不像 Claude 一样动不动就封号。
但是弊端就是,Anthropic 前不久传出的营收数字相当惊人,营收提升了十几倍,估值直接暴涨了一波。二季度初步数字超过 115 亿美元,环比涨了一倍多,同比去年二季度的 7.87 亿美元大约扩大了 14 倍;截至 7 月末,年化营收运行速率超过 650 亿美元。5 月那轮融资的投后估值是 9650 亿美元,已经有投资者在讨论今秋上市的定价。
当然这不是本篇文章讨论的重点。
token 效率和缓存命中
提升很明显的还有模型处理相同问题的情况下,token 效率大大提高了。比起 5 月份的时候没跑几个任务就把 Claude 5x 的用量刷满,这次我几乎很难触发到 5 小时的限制。
除了 Claude 提升了 50% 的额度之外,还有一个原因可能是缓存命中的上升。那次每周限额上调从 5 月 13 日开始,官方又一路延期到了 8 月 31 日。而命中缓存的输入 token 只按正常价格的一成左右计费,Claude Code 这边还提供了把缓存 TTL 从 5 分钟拉长到 1 小时的开关,中间停顿久一点也不至于每次都重新预填一遍。
模型怎么选
至于 Fable 和 Opus,在 Opus 5 没有发布之前我用的是 Fable,但是 Opus 5 发布后我就一直用的是 Opus 5,目前看来是够用的,几乎在执行任务的时候不会出什么岔子,同时它额度比 Fable 多不少。
Opus 5 在软件工程基准 Frontier-Bench 上把 Opus 4.8 的成绩翻了一倍还多,单任务成本反而更低;在代理编码基准 CursorBench 上,最大努力档的表现和 Fable 5 的峰值只差 0.5% 左右,成本却只有一半。
而 Sonnet 5,我体感上它跟 Opus 还是有非常大的差距的,主要差距在于 agent 的分发以及工具的调用上,用 Sonnet 5 有时候就不会达到预期的效果。我个人推荐是用它来做做搜索这种简单的工作,还是不要用它来当生产力工具。
computer use 和能自己验证的开发闭环
还有就是 computer use 的巨大提升,现在已经可以很好地操作用户的电脑了。Anthropic 官方给的说法是,Opus 5 在 OSWorld 2.0 这个计算机操作基准上,以大约三分之一的成本超过了 Fable 5 的最好成绩。
以及 Claude 的浏览器插件可以很好地配合 Claude Code 和 Cowork。还有就是 Claude Code 的桌面端里面内置了浏览器功能、iOS 模拟器:7 月上旬上线的应用内浏览器可以读页面、点击、交互,而且是沙箱化、可配置的;7 月下旬又接上了 iOS 模拟器,能直接构建并运行 iOS 应用,模拟器就开在对话旁边的面板里。这让开发过程中 AI 可以直接对开发的功能进行测试,大大减少了使用过程中遇到 bug 的概率。
这些功能都值得单独介绍,不过这篇文章就先一笔带过。我感觉仅仅过了 3 个月,AI 的可用性已经完全不一样了,现在模型能力和相关生态一样重要,一个好的模型配备一个好的生态,绝对是生产力拉满。
转载协议
本文采用 CC BY-NC-SA 4.0 协议进行许可,转载请注明出处。 CC BY-NC-SA 4.0
允许转载、修改和分享,但必须注明作者和出处,且不得用于商业用途,衍生作品需采用相同协议。
☕ 请我喝杯咖啡
如果这篇文章对你有帮助,欢迎打赏支持!