主题:翁荔新博客:自进化先从Harness开始,DeepSeek崔添翼转发附议
机制去防止,种群会逐渐坍缩成同一种方案的变体。Reward hacking。自我改进循环会优化给定的任何信号——奖励来自单元测试,模型可能就去过拟合测试;来自评委模型,就可能学会针对性地「讨好」评委;来自榜单分数,就可能去利用榜单本身的漏洞。长期健康和短期成功之间的矛盾。以coding agent为例,它们已经能实实在在提升软件工程的日常生产力,但优化目标大多还是短期的——能不能把眼前任务做完,而非能不能保护一个由成百上千工程师共同维护的代码库的长期健康。可维护性、权责边界、迁移成本、未来的调试负担,这些标准的沙盒训练基本还照顾不到。人类的角色。翁荔的认为:人类不会被踢出循环,而是要往「环外」移动——在合适的时机、合适的抽象层级上提供监督,这也是系统设计时需要考虑清楚的问题。过去,大模型竞争主要看参数、数据、算力和推理能力。但现在,另一个变量已经越来越难被忽略:Harness。同一个模型,放进不同Harness里,可能表现出完全不同的能力——这件事已然从少数人的观察成为了行业共识。从翁荔这篇博客也能看出,「AI自进化更现实的工程入口是什么」,将会是下一阶段要讨论的重点。博客原文:https://lilianweng.github.io/posts/2026-07-04-harness/参考链接:https://x.com/tianyi/status/2074475185957380379
回帖(15):全部回帖(15)»