5X 的 Codex 一天半烧完了,晒晒我的智障多 agent 工作流

查看 172|回复 22
作者:HakuZero   
充了 100 刀 codex 想做点正经东西,结果一天半就没了,项目还卡在半路,越想越亏,来吐槽一下。
我干了个挺蠢的事:一个项目塞了好几个 agent ,产品、测试、运营、后端、桌面端。本来想的是流程正规一点,学大厂那套需求评审测试验收,能少返工。

结果实际流程变成了这样——需求来了先丢给运营 agent 去"调研",调研完产品 agent 出方案,方案出来测试 agent 要先写测试用例,都齐了后端和桌面端才开始写代码。写完你以为完事了?天真,还要挨个过审:测试审一遍,产品审一遍,UI 审一遍,UX 单独再审一遍。我当时不知道哪根筋搭错,UI 和 UX 还拆成了俩 agent 。

它们审起来一个比一个能说。产品动不动就"不符合用户心智",UX 说交互路径太长要重做,测试说边界情况没覆盖要补用例,UI 说视觉规范不统一。最离谱的是,它们提的问题最后基本都得我自己动手改,返工不但没少,我还多了个活儿:给几个 agent 的意见当裁判。
钱主要烧在上下文上。每个 agent 都得喂历史记录,喂一次几百条 message ,光"对齐需求"就对齐了好几轮,我自己都不知道在干嘛了。

现在纠结要不要再充 100 刀。充吧,怕两天又烧没了;不充吧,东西不上不下的很难受。
就想问问,到底是我这流程本身有病——AI 干活根本不需要模拟人类团队那套官僚流程,还是我用法不对,应该让它们并行干而不是串行开会,还是单纯额度买少了,其实再充 100 刀就能成了?

Agent, 工作流, 返工

zed1018   
再充 100 刀不如直接升级到 20X
HakuZero
OP
  
@zed1018 感觉我这套工作流 20X 都顶不住,太麻烦,太慢了
sampeng   
我也在解决这个问题,有几个点可以优化。你可以看看 cf 和 google 怎么解决的:
https://blog.cloudflare.com/ai-code-review/
https://cloud.google.com/blog/topics/threat-intelligence/staying-ahead-of-adversarial-ai-through-agentic-source-code-review
你这一套我用了半年,干个活要 1 小时才能干好一个需求,太慢了,于是我在优化这个过程。这个痛点是显而易见的,因为每个模型都喜欢扣细节,然后就对不上。越多就越扯皮。我认可 cf 和 google 的处理方式,我也在测试,不要每个角色都给最牛逼的模型,按情况用低一档的就行,比如你说的那个 ui ,说实话,这是很机械的活,用用 opus/sol 是大炮打蚊子,不要给每个角色喂重复上下文,我的处理方式是我用 pi 来做,所以每个 agent 是一个独立的 session ,这一件事不完 session 是不结束的。这样就后面的重复其实缓存命中率非常高。
效果怎么样不好说,我要解决的是干活太慢,不是干活质量的问题。目标是 review 一次 5 分钟内解决战斗。
zzl93   
原来如此,那感觉是不是 AI 开发不能这么拆,是不是应该有一个大脑,其它智能体都是下级,子智能体是否调用看大脑,大脑需要有一定的 token 焦虑
homcrazy1   
直接实现功能,顶多写写单元测试
Fooooo0   
op 用的这个是什么工具啊?
HakuZero
OP
  
@sampeng 学到了,我也研究下,主要是不想返工,返工的时候 AI 又会整一堆的兼容写法,太麻烦了,就想着让它一次性处理好。
sampeng   
@HakuZero 倒不是返工,实话实说,我跑你这一套最的的困扰不是写出来的东西不能用,是能用,但实际代码里到处所谓兜底,你要全用 codex 的 sol ,就是他会考虑完全不存在的情况,各种莫名其妙的兜底,提示词都拉不回来那种。悄悄咪咪的加。一些简单的还好,每轮+1 个点,一跑就是 6-10 轮起步。就是 10 几坨屎进去了。我也很苦恼
HakuZero
OP
  
@Fooooo0 agency-agents 有很多 agent ,挑几个安装就行,然后再调整下每个 agent 用什么模型,像 UX 、UI 这类的就用 gpt-5.6-terra 之类的模型。
您需要登录后才可以回帖 登录 | 立即注册

返回顶部