温馨提示:文本由机器自动转译,部分词句存在误差,以视频为准
00:00
有团队把单体agent拆成多agent架构后,本以为更高效,结果token消耗翻了3倍。不是模型变贵了,而是agent之间开始互相聊天,每一步都广播状态,确认意图对其上下文。一项叫concordia的研究,拆开token账单,验证阶段吃掉59.4%的token,全花在agent互相确认上。业界给这部分起名叫通信税,你付钱买的不是答案,是agent之间那堆对齐对话。上下文随agent数量平方增长,5个agent不是5倍,开销是25倍的关系要维护。
01:03
有游戏公司一晚上烧掉200万token,某大厂单月agent相关支出逼近9亿美元。多agent的默认写法是大家都看全局上下文。于是每个agent都把别人的状态再读一遍。别让每个agent暴走全部历史。只得他当前子任务需要的那一块,上下文按需分发。用黑板或共享状态代替广播。一个写,其他人读,别让每个人都发一遍。路由格式转换、状态同步这些确定性步骤交给小模型,别让大模型来回确认。
02:05
通信税还会拖慢食盐用户等的不是推理,是N个agent的来回握手。多agent不是银蛋,先量清楚通信税,再决定要不要拆,否则省下的效率全还给了token。
我来说两句