首页
学习
活动
专区
圈层
工具
发布
社区首页 >专栏 >哑巴模型爆红:当 AI 不再生成文字,Agent 的"控制平面"正在独立

哑巴模型爆红:当 AI 不再生成文字,Agent 的"控制平面"正在独立

原创
作者头像
用户12770437
发布于 2026-09-22 09:02:48
发布于 2026-09-22 09:02:48
1680
举报

2026 年 9 月 15 日,TypeSafe AI 发布了一个新模型,叫 Jev。 它没有对话框,不能聊天,写不出一个完整的句子。你给它一段状态描述和几个问题,它不回答你,只回几个数字和一个选项。 就是这样一个"哑巴模型",在 Hacker News 上拿到了 1917 分、超过 500 条评论。LangChain 在两天后写了集成指南,Vercel 把它接进了 AI Gateway,社区里冒出一堆围绕它的实验项目。 一个不会说话的模型,为什么值得这么多人认真讨论? 它把"生成"这一步整个删掉了 我们先看现在的通行做法。假设要判断一条客服消息是不是紧急、该转给谁、用户情绪如何,常见写法是把消息丢给大语言模型,让它输出一段 JSON: ```json {"urgent": true, "department": "billing", "emotion": "frustrated"} ``` 程序拿到这段字符串,再解析、再校验 schema,然后才能用。TypeSafe 官方文档对这件事的说法很直接:我们在把一个擅长生成文本的系统,硬拗成输出结构化判断,然后再把结果解析回代码能依赖的形式——这本身就是一次错配。 Jev 的做法是把中间那步砍掉。调用方提交两块内容:`state`(需要判断的当前状态,可以是字符串、对象或数组)和 `questions`(针对状态提出的类型化问题)。返回的是结构化数值和概率分布,官方给自己的定义是一句话: Unstructured state in, typed probabilistic decisions out. 没有长文本生成,没有 JSON 解析,也不需要模型额外"写一句话解释一下"。它在文档里被称作 TypeSafe 的第一个 System One 模型——借用认知心理学里"快思考 / 慢思考"的比喻,生成式大模型负责慢思考,它负责毫秒级的直觉反应。 三种原语,都很小 Jev 目前只提供三种问题类型,官方叫 primitives: Choice:从调用方给出的候选项里选一个。返回 `choice`、`probabilities` 和 `confidence`。比如"这张工单该给哪个团队",候选是 billing / technical / human_review 三选一,它回你 `human_review 0.65`。 Score:按调用方给的评分标准(rubric)打分。比如风险等级 0 到 3,它返回分值和概率分布。 Noul:判断一个命题成立的程度,返回 0 到 1 的数值。你问"这个操作危险吗",它不回"我认为可能危险",而是直接给 `risk_probability = 0.87`,程序可以立刻写成 `if risk_probability > 0.8: require_confirmation()`。 三种问题可以在一次请求里混着问,彼此独立评估同一份 state,加问题几乎不增加响应时间。 这里有一个设计细节值得记下来:候选项不是模型在云端临时创造的,而是调用方给的。它们通常来自代码里的固定枚举、配置中心的规则、或者当前用户有权调用的工具集合。模型只在给定边界内判断"选哪个",而"能不能执行"仍然属于你自己的代码。 真正值得关注的不是快,是校准过的置信度 官方公布的典型推理延迟大约 70–500 毫秒,定价约每百万输入 token 0.042 美元,输出不收费——因为压根没有传统意义上的 output token 生成。相比一些传统模型,官方称在适合 System One 的任务上有几十倍到近两百倍的速度优势。 但速度其实不是重点。 重点是另一个词:Calibrated Confidence,校准过的置信度。 今天让大模型判断一件事,它很容易给你一句"我有 95% 的把握"。问题是,这个 95% 通常只是它生成出来的一段文本,不意味着它在长期上真的有约 95% 的正确率。Jev 用了一种叫 RLCD(Reinforcement Learning for Calibrated Decisions)的训练方式,训练目标除了"选对答案",还包括"知道自己有多确定"。 这件事对自动化的意义在于:成熟系统的控制流不该只有是 / 否两态,而应该是高置信自动执行、中置信再验证、低置信交给更强模型或人。置信度本身成为程序分支的一部分。 需要说清楚的是,这不解决"模型一定对"的问题。官方资料和多位实测者都强调过同一个边界:置信度阈值必须用你自己的数据去标定。有工程师在落地笔记里写得很直白——他把 0.9 设为本地采纳门槛,同时补了一句"0.9 是我们人为设定的门槛,绝不代表模型有九成的真实准确率"。 它不是替代 LLM,而是把 LLM 从一些位置上挪开 Jev 发布后,社区很快找到了几个稳定的落点,规律非常一致:大家几乎不让它写文章、写代码、聊天、总结长文,而是让它做路由、选择、打分、排序、判定、拦截这类事。 工具选择是最直观的一个。早期一个 Agent 可能只有四五个工具,现在随着 MCP、Skills、Plugins 不断接入,几十上百个工具已经不算罕见。传统做法是把所有工具的 schema 全塞进 context,让模型选一个。而"选哪个工具"本质是分类问题,"生成参数"才是生成问题,完全可以拆开:让 Jev 从 100 个工具里挑出第 37 个,再把第 37 个的 schema 交给 LLM 去填参数。 模型路由是第二个。不必每个请求都调用最贵最强的模型,让决策模型先判断任务在语义上到底复杂不复杂,再决定分流到哪一档。 护栏是第三个。Agent 要执行删除、改生产环境、发邮件这类操作时,先过一次风险判断,再由应用代码决定放行、要求确认还是直接拦掉。 有人把这类系统的分层说得挺清楚:Decision Plane 回答"该不该、选哪个、多危险、继续还是停",Reasoning Plane 负责"为什么、怎么生成",Execution Plane 负责"去做"。用一句话概括就是: Jev decides. LLM reasons and generates. Harness executes and governs. 也有人真的接了,而且把话说得很实 一位开发者在自己的产品里做了灰度接入,两个落点都刻意选在边缘:模糊修改需求的意图提示、调研候选搜索词的分类打标。他给自己立了几条硬边界,读起来比宣传材料有用得多——只对内部账号和指定测试工作区开放;主生成模型不换、权限鉴权不换、付款和删除类流程完全不接;接口超时阈值强行设死在 1000 毫秒,超时即放弃、不设自动重试;保留一个环境变量作为一键全局熔断;额度锁死在 5 美元、30 天有效期,绝不开启自动充值。 验收数据他也写得很细:上线前新增测试 42/42 通过、上游回归 134/134 通过、独立探针 6/6 通过。离线跑分用的是 48 条冻结的合成样例——45 条给出的标签符合预设,2 条因为置信度低于 0.9 触发保护被安全回退,1 条因为是极短词在前置规则阶段就被排除,根本没进模型。 然后是最诚实的一句:截至发布时,在真实业务流量里尚未观察到真实命中。他说不会为了做演示去冒充触发了自然工作流。 争议:类型安全不等于事实正确 Jev 引爆讨论的同时,也带来了一批过度解读。 最容易踩的坑是把"类型安全"当成"事实正确"。模型输出一个严格落在 `['bug', 'feature']` 枚举里的结构体,只能保证它不会在 JSON 里漏打括号,绝不代表它的判断一定对。把"结构合法"偷换成"永远正确",是非技术讨论里最危险的一种幻觉。 另一个值得留意的技术判断来自独立分析者的观察:Jev 之所以能做到极高速度,主要来自推理策略层面的创新——通过严格受限的选择集实现单 token 或极简解码路径,而不是从底层重构了神经网络架构。这个判断并不贬低它,反而指出了它的适用前提:它的强项是封闭决策空间,核心问题是"选哪一个",而不是"发明一个"。 候选空间无法提前定义的场景,它帮不上忙。 还有人翻了几天里涌现的生态项目,提醒不要用项目数量推断生产采用率——大量项目仍然停在 Demo、PoC 和早期集成阶段。 更值得记住的,可能不是这个模型 把时间拉长一点看,AI 工程的重心过去几年挪了两步:从 Prompt Engineering 到 Context Engineering,现在有人开始谈 Harness Engineering。而 Harness Engineering 的一个标志性变化,就是开始把"大模型"拆开看。 生成是一种能力,推理是一种能力,检索是一种能力,记忆是一种能力,决策同样是一种能力。过去我们把它们全塞进同一个模型,遇到任何问题都去问 LLM。Jev 这类模型的出现,提醒的是一个更朴素的问题: 我们是不是让 LLM 做了太多它根本不需要做的事? 如果你的系统里到处是"意图分类、请求路由、打标签"这类高频小判断,并且已经开始被延迟和账单拖住,那么这类决策层确实值得开一个沙箱灰度试试。但如果只是想做聊天和内容生成,没有必要为了追新而多接一个外部依赖。 先写规则,再测边界,然后谨慎上线——对任何新技术,这套顺序都不过时。 参考链接 · TypeSafe AI 官方文档:Jev 与 System One 模型定义、三种 primitives、置信度说明 https://docs.typesafe.ai/introduction · 掘金《Jev:当 AI 不再生成 Token,而是直接做决策》(发布时间、定价、延迟、生态与边界) https://juejin.cn/post/7687422041256951835 · 掘金《Jev 不是 Agent:TypeSafe System One 如何成为离 LLM 最近的决策层》(架构分层与候选项来源) https://juejin.cn/post/7687180832369377323 · 掘金《Jev 是什么 AI 模型?不做自然语言生成为何引发热议》(HN 热度、接入实测与验收数据) https://juejin.cn/post/7687583607784636426

原创声明:本文系作者授权腾讯云开发者社区发表,未经许可,不得转载。

如有侵权,请联系 cloudcommunity@tencent.com 删除。

问题归档专栏文章快讯文章归档关键词归档开发者手册归档开发者手册 Section 归档