从 Pi v0.85.1 的更新教哥们重新认知 Agent 的第一性

最近在看 Pi Agentharness 的 V2 版本,总结下来就是看完觉得惊为天人,直接解决了我许多的困惑和疑虑,爽翻了。 Pi 的 V2 版本为工具调用增加了持久化的执行状态、恢复策略和结果暂存,以及许多的边界真的越来越清晰了,这是让我最爱的点,边界清晰才能定义职责,职责清楚了才有优化方向。 ...

2026-09-09 · 13 分钟 · 6124 字 · zjding

做视频生成的自进化实验,再读 The Bitter Lesson

最近研究全链路自进化的视频转绘项目,我想做的事情:从原视频出发,理解剧情和人物,完成转绘与视频生成,再让系统根据结果发现问题、尝试改进。理想中,每跑一轮,下一轮应该更接近我想要的成片,但是这个过程中一个大的难点就是如何做审核?如何评估好坏,如果需要灌注人为的经验和知识进去该怎么办?流程跑完了,审核通过了,Agent 保留了一次修改,这些都容易留下记录。至于视频究竟有没有变好,我应不应该把自己的经验和注意力在这个环节灌入进去,真是该死这是最难的事情! ...

2026-09-07 · 6 分钟 · 2526 字 · zjding

向量检索中的存储分层与低比特量化

最近在做一个内容创作相关的检索模块。以小说 Agent 为例,世界观、角色卡、章节和场景记忆会随着写作持续累积,它们都需要一套能长期工作的检索基建。 第一版沿用了熟悉的 Qdrant。它足够成熟,也能满足当前需求;但我已经很久没有系统关注向量检索,因此重新检查了一遍近几年的向量数据库、压缩索引和冷热分层方案,确认继续使用 Qdrant 是当前约束下的选择,而不只是路径依赖。 ...

2026-07-26 · 7 分钟 · 3069 字 · zjding

Kimi-K2.6 swarm 暴露的模型发展逻辑:执行内化,判断外挂

2026 年 6 月中旬,Movez 在 X 上那条 Kimi K2.6 swarm 的推文刷到接近一百万次浏览。标题写得很冲:《The Self-Improving Loop: a 300-agent swarm on Kimi K2.6, verified by Opus 4.8》。它讲的版本大概是:一个免费的开源模型,用单个 prompt 拉起 300 个并行 agent、跑 4000 步,在真实研究任务上超过贵它 5 倍的闭源旗舰。 ...

2026-06-20 · 11 分钟 · 5249 字 · zjding

本体论能不能救 AI Agent,取决于它躲不开的一个缺口

最近本体论的概念忽然冒出来了,看了下一些大厂商对这个东西的认知和技术博客,觉得和我平时 coding 的时候有些观念很相似,只不过换了种说法,并且抽象出来了,并且把之前感觉在大家口中已经埋葬了很久的知识图谱也再次挖了出来;于是有了下面这篇 blog: ...

2026-06-07 · 14 分钟 · 6571 字 · zjding

Mastra 中简单但又让我惊喜的记忆架构

最近看到赵纯想哥在推荐 Mastra,之前也用过,但后来在 laper 里面看到它已经被实战验证了,就想着再研究下。里面一个比较让我惊讶的就是记忆系统。我一开始把 Mastra 的 Observational Memory 当成又一版“上下文压缩”,翻完实现后感觉非常有意思。 ...

2026-05-22 · 6 分钟 · 2875 字 · zjding

HY-World 2.0 / Marble 1.1 / HappyOyster 横评:三家对「世界模型」的三种答案

TL;DR Hunyuan(HY-World 2.0):纹理最好、3D 资产全栈(Mesh+3DGS、多视图重建);但几何一换视角就塌、局部物体经不起放大、原图周边会被外扩改写。 Marble 1.1:近景复刻目前市面第一、形状最合理;但远景是 3DGS 数学意义上的必糊(原理问题,不是训练能救的),且不做重建。 HappyOyster:首帧复刻度最高、漫游前 20~30 秒沉浸感三家最强;场景里的人真的会动;远景不崩;但是其交互视频生成指令遵循和物理规则很乱、prompt 毫不起作用。 Genie 3(参照项,非自测):我没有账号,判断来自 DeepMind 官方说明和公开 hands-on;但它确实把"可交互视频"推到了更像实时仿真的位置:720p / 20~24 fps、几分钟一致性、约一分钟视觉记忆,跳跃、碰撞、回访记忆都能被公开测试拿出来压。 一句话:这篇主线还是 Hunyuan / Marble / HappyOyster 三家自测;Genie 3 更像旁边那根标尺。单帧惊艳已经不是门槛,真正的分水岭在第二帧之后——拉远、转视角、连续交互、prompt 改写。现在近景选 Marble,短时沉浸选 HappyOyster,资产管线看 HY-World;如果看下一代 Agent 环境,Genie 3 明显更接近答案。 2026 年 4 月 16 日和 17 日,腾讯开源了 HY-World 2.0,阿里发了 HappyOyster,两家间隔不到 24 小时。再加上李飞飞 World Labs 的 Marble 1.1 已经迭代到第二个小版本,我把这三款都跑了一遍——同一张罗马斗兽场的照片,一个文本 prompt,一个漫游测试。得出的结论不是"谁最好",而是"这三家在做三件不一样的事,把它们放一起比较本身就是误解"。 ...

2026-04-23 · 19 分钟 · 9367 字 · zjding

Cloud Agent 的架构分歧:Harness 放在哪一侧

Anthropic 最近发了一篇工程博客,公开了他们做 Cloud Agent 的完整技术演进。同一个月,OpenAI 的 Frontier 平台已经签下了 Uber、Oracle、State Farm。而第三条路线正在悄悄成型——有团队选择了 Anthropic 明确抛弃的那个架构。 ...

2026-04-10 · 8 分钟 · 3905 字 · zjding

RTK: 一个 Rust 写的 CLI 代理,把 LLM Token 消耗砍掉 80%

上图是我实际使用 RTK 后 rtk gain 的输出。17 次命令调用,输入 4.8K token,输出仅 607 token,节省了 4.2K(87.5%)。其中 git status 单次调用就省了 3.0K token(92.9%),ls 累计 7 次省了 1.2K(83.7%)。平均每次命令执行时间 18ms——几乎无感。 ...

2026-04-01 · 5 分钟 · 2448 字 · zjding

不要低估 Autoresearch 所带来的影响

Karpathy 前几天在 Twitter 上讲了个故事,他睡前启动了一个 630 行的 Python 脚本。醒来时,83 次实验已经跑完,15 次改进被保留,验证损失从 0.9979 降到 0.9697。他继续让它跑了两天——700 次实验,20 个可叠加的训练优化,迁移到更大模型后训练速度快了 11%。Shopify CEO Tobi Lütke 拿到代码的第二天早上,报告了 19% 的性能提升。 ...

2026-03-25 · 8 分钟 · 3622 字 · zjding