我们想做的事情,说穿了就是把人的认知、决策、记忆、协作这些机制抽象出来,做成一套可运行、可控制、可工程化的系统。听着像句漂亮话,落到地上全是硬骨头:
[ol]
记忆。上下文窗口永远是稀缺资源,我们目前的思路是承认「完整历史不可能常驻」,转而做一个持续提取的过程——把长期交互里的关键事实、偏好、踩过的坑不断蒸馏到有限的 context 界面里。难点不在存,在"什么值得留"和"怎么让它在该出现的时候出现"。
可控性。Agent 越自主越难调试,现在业界的普遍做法是加各种护栏,但护栏多了又回到「精确编排」的老路。这个平衡点我们还没找到让自己完全满意的答案。
协作建模。多 Agent 分工听起来美好,实际最难的是搞清楚"人遇到模糊任务时是怎么拆解的"——这才是任务分派的真正模板。我们翻了不少认知科学的书,边看边挠头。
[/ol]
最近 Claude / Cloudflare 那几波故障我们也碰上了,顺带澄清下:我们的任务没有出现「丢单」或结果错乱,当时是上游 API 异常触发自动重试与任务挂起,恢复后按 checkpoint 续跑。设计上没有把"可用性"赌在单点上。
所以最后是标题那句话:人研究人,再把"人"工程化,某种意义上极其"反人性"——因为你永远在用不完美的心智模型去建模"不完美"本身。
想听听各位在做 Agent / LLM 应用工程时,记忆和可控性这两个坑是怎么处理的。

