从 Pi v0.85.1 的更新教哥们重新认知 Agent 的第一性

最近在看 Pi Agentharness 的 V2 版本,总结下来就是看完觉得惊为天人,直接解决了我许多的困惑和疑虑,爽翻了。 Pi 的 V2 版本为工具调用增加了持久化的执行状态、恢复策略和结果暂存,以及许多的边界真的越来越清晰了,这是让我最爱的点,边界清晰才能定义职责,职责清楚了才有优化方向。 ...

2026-09-09 · 13 分钟 · 6124 字 · zjding

做视频生成的自进化实验,再读 The Bitter Lesson

最近研究全链路自进化的视频转绘项目,我想做的事情:从原视频出发,理解剧情和人物,完成转绘与视频生成,再让系统根据结果发现问题、尝试改进。理想中,每跑一轮,下一轮应该更接近我想要的成片,但是这个过程中一个大的难点就是如何做审核?如何评估好坏,如果需要灌注人为的经验和知识进去该怎么办?流程跑完了,审核通过了,Agent 保留了一次修改,这些都容易留下记录。至于视频究竟有没有变好,我应不应该把自己的经验和注意力在这个环节灌入进去,真是该死这是最难的事情! ...

2026-09-07 · 6 分钟 · 2526 字 · zjding

WAL 如何把复杂提交缩成一次顺序写

最近看了一篇推,主要讲的是 PostgreSQL 执行一条 UPDATE 时,需要持久化的对象通常不止一行记录。heap page、相关索引页、事务状态和其他元数据可能一起变化;机器在写回过程中断电,磁盘就会留下部分新 page 和部分旧 page。数据库仍然要给出一个确定结果:这笔事务已经提交,或者恢复后继续把它完成。 ...

2026-08-18 · 6 分钟 · 2622 字 · zjding

为什么你的 Agent 知道得越多,表现越差

Princeton 给 GPT-4 换了一套接口,SWE-bench 分数从 3.97% 跳到 12.47%。同一个模型,同一组题,同样的算力预算。唯一的变量是 Agent 看到信息的方式。 同一时期,Anthropic 让 Opus 4.5 自主构建一个生产级 Web 应用——失败了。不是模型不够强:它试图一次做完所有功能,context 耗尽后留下一地半成品,下一个 session 看了一圈代码就宣布完成。Anthropic 没换模型,重新设计了运行环境。同一个模型开始交付可用的软件。 ...

2026-03-15 · 11 分钟 · 5344 字 · zjding

同一个模型,换套壳,排名从 Top 30 跳到 Top 5

Terminal Bench 2.0,同一个 Opus 4.6。一个团队仅靠改 harness——不换模型、不动权重——排名从 Top 30 跳到了 Top 5。 这不是个别现象。OpenAI 的 harness engineering 博客描述了一种新的工程形态:五个月产出一百万行代码,没有一行是人手写的。工程师做的事情是设计环境、构建反馈回路、编码架构约束——然后 Agent 负责写代码。他们给这种工作方式起了个名字:harness engineering。 ...

2026-03-10 · 9 分钟 · 4400 字 · zjding

一个 Markdown 文件让 Agent 快了 28%

有人把这件事量化了。 给 AI Coding Agent 一个 AGENTS.md 文件,任务完成时间中位数减少 28.64%,输出 token 中位数减少 16.58%。实验设计是配对受控:10 个真实仓库,124 个合并 PR,每个任务跑两次,一次有 AGENTS.md,一次没有,Docker 隔离环境,其他变量全部相同。 ...

2026-03-04 · 5 分钟 · 2195 字 · zjding

Agent 和人类工程团队犯一模一样的错

让 Claude Opus 4.5 用一条指令构建一个 claude.ai 克隆——它失败了。但失败的方式比成功更有意思。 1. 失败模式和人类团队一模一样 把失败拆开看,每一条都和人类工程团队犯的错一模一样: ...

2026-03-01 · 3 分钟 · 1362 字 · zjding