温馨提示:文本由机器自动转译,部分词句存在误差,以视频为准
00:00
你给agent开了百万token窗口,他就真的记住了所有上下文吗?残酷实测,跨GPT5.2cloud OPS4.5gemini2.5PRO有效利用率只有54%~61%。原因很朴素,Lost in the middle模型更重视首尾,中间那段他其实看不清。Agents网上下文塞满历史,等于花大钱买了个用不满的仓库,还顺手烧了token。MCP工具更夸张,单任务79%的上下文预算花在skima和中间,结果真正任务相关只有三成。
01:00
成本成数也吓人,Garner估计AT工作流是同任务标准聊天的5~30倍,Token.那记忆怎么办?粗暴堆窗口是下册,真正有效的是外挂记忆向量库加结构化摘要。常用三招,绘画中期做摘要压缩,按任务动态加载工具,用promp把重复上下文打8折。更狠的是硬预算熔断,每绘画社token上限超了就压缩或转人工,别让循环自己滚雪球。别迷信越大越好,上下文窗口是成本上限,不是能力下限,会用笔绘又蛮重要。
02:02
落地清单记录美绘画有效利用率,给MCP+Sigma缓存网关POC阶段就上成本仪表盘。记忆的关键不在窗口多大。而在你往里放了什么,又舍得丢掉什么?
我来说两句