Cloud Agent 还要跑在 Linux 上多久?
Mirage 和 AGFS 都自称文件系统,底层却没有一个是文件系统。AGFS 的 queuefs,一次 enqueue 落地是 SQLite 的一条 INSERT 事务;Mirage 的 Workspace 类签名里摆着 consistency、history、index、session_id——全是数据库词汇。file 只是它们给 agent 看的壳,DB 才是里子。 ...
Mirage 和 AGFS 都自称文件系统,底层却没有一个是文件系统。AGFS 的 queuefs,一次 enqueue 落地是 SQLite 的一条 INSERT 事务;Mirage 的 Workspace 类签名里摆着 consistency、history、index、session_id——全是数据库词汇。file 只是它们给 agent 看的壳,DB 才是里子。 ...
TL;DR Hunyuan(HY-World 2.0):纹理最好、3D 资产全栈(Mesh+3DGS、多视图重建);但几何一换视角就塌、局部物体经不起放大、原图周边会被外扩改写。 Marble 1.1:近景复刻目前市面第一、形状最合理;但远景是 3DGS 数学意义上的必糊(原理问题,不是训练能救的),且不做重建。 HappyOyster:首帧复刻度最高、漫游前 20~30 秒沉浸感三家最强;场景里的人真的会动;远景不崩;但是其交互视频生成指令遵循和物理规则很乱、prompt 毫不起作用。 Genie 3(参照项,非自测):我没有账号,判断来自 DeepMind 官方说明和公开 hands-on;但它确实把"可交互视频"推到了更像实时仿真的位置:720p / 20~24 fps、几分钟一致性、约一分钟视觉记忆,跳跃、碰撞、回访记忆都能被公开测试拿出来压。 一句话:这篇主线还是 Hunyuan / Marble / HappyOyster 三家自测;Genie 3 更像旁边那根标尺。单帧惊艳已经不是门槛,真正的分水岭在第二帧之后——拉远、转视角、连续交互、prompt 改写。现在近景选 Marble,短时沉浸选 HappyOyster,资产管线看 HY-World;如果看下一代 Agent 环境,Genie 3 明显更接近答案。 2026 年 4 月 16 日和 17 日,腾讯开源了 HY-World 2.0,阿里发了 HappyOyster,两家间隔不到 24 小时。再加上李飞飞 World Labs 的 Marble 1.1 已经迭代到第二个小版本,我把这三款都跑了一遍——同一张罗马斗兽场的照片,一个文本 prompt,一个漫游测试。得出的结论不是"谁最好",而是"这三家在做三件不一样的事,把它们放一起比较本身就是误解"。 ...
Anthropic 最近发了一篇工程博客,公开了他们做 Cloud Agent 的完整技术演进。同一个月,OpenAI 的 Frontier 平台已经签下了 Uber、Oracle、State Farm。而第三条路线正在悄悄成型——有团队选择了 Anthropic 明确抛弃的那个架构。 ...
上图是我实际使用 RTK 后 rtk gain 的输出。17 次命令调用,输入 4.8K token,输出仅 607 token,节省了 4.2K(87.5%)。其中 git status 单次调用就省了 3.0K token(92.9%),ls 累计 7 次省了 1.2K(83.7%)。平均每次命令执行时间 18ms——几乎无感。 ...
Karpathy 前几天在 Twitter 上讲了个故事,他睡前启动了一个 630 行的 Python 脚本。醒来时,83 次实验已经跑完,15 次改进被保留,验证损失从 0.9979 降到 0.9697。他继续让它跑了两天——700 次实验,20 个可叠加的训练优化,迁移到更大模型后训练速度快了 11%。Shopify CEO Tobi Lütke 拿到代码的第二天早上,报告了 19% 的性能提升。 ...
583 次工具调用,311 个请求,58 美元。Random Labs 用一个 Sonnet 模型——不是 Opus,不是 o1——把一个 7 万星的 Python 库完整移植成了 TypeScript。两个小时,全程自主运行。 ...
Princeton 给 GPT-4 换了一套接口,SWE-bench 分数从 3.97% 跳到 12.47%。同一个模型,同一组题,同样的算力预算。唯一的变量是 Agent 看到信息的方式。 同一时期,Anthropic 让 Opus 4.5 自主构建一个生产级 Web 应用——失败了。不是模型不够强:它试图一次做完所有功能,context 耗尽后留下一地半成品,下一个 session 看了一圈代码就宣布完成。Anthropic 没换模型,重新设计了运行环境。同一个模型开始交付可用的软件。 ...
Terminal Bench 2.0,同一个 Opus 4.6。一个团队仅靠改 harness——不换模型、不动权重——排名从 Top 30 跳到了 Top 5。 这不是个别现象。OpenAI 的 harness engineering 博客描述了一种新的工程形态:五个月产出一百万行代码,没有一行是人手写的。工程师做的事情是设计环境、构建反馈回路、编码架构约束——然后 Agent 负责写代码。他们给这种工作方式起了个名字:harness engineering。 ...
Polymarket 上最基础的操作:买一张合约,赌某件事会不会发生。合约价格代表概率,0.70 就是 70% 的意思。大多数人的使用方式是看一眼价格,觉得低估了就买,觉得高估了就跳过。 ...
有人把这件事量化了。 给 AI Coding Agent 一个 AGENTS.md 文件,任务完成时间中位数减少 28.64%,输出 token 中位数减少 16.58%。实验设计是配对受控:10 个真实仓库,124 个合并 PR,每个任务跑两次,一次有 AGENTS.md,一次没有,Docker 隔离环境,其他变量全部相同。 ...