首页
学习
活动
专区
圈层
工具
发布
社区首页 >专栏 >一台自包含推理机的架构分层:统一内存底座、治理网关与智能体入口

一台自包含推理机的架构分层:统一内存底座、治理网关与智能体入口

原创
作者头像
Archive
发布于 2026-09-18 15:43:24
发布于 2026-09-18 15:43:24
1192
举报

私有环境里上大模型,卡点通常不在模型本身,而在环境拼装:推理引擎、计量网关、任务沙箱、业务前端,四套东西各自成体系,还得有人把它们缝在一起。把这几层压进一台小机器、通电联网登录就能用,前提是它们共用同一个硬件底座。下面按层拆一遍这类一体机的结构,以及每层各自的边界在哪。

一、底座:一块统一内存

先把硬件参数摆出来:

  • 整机 150×150×50.5 毫米,重约 1.2 公斤,配一个 240 瓦外置电源
  • 一颗 CPU 与 GPU 同封装的芯片,20 核 Arm CPU
  • 128 GB 统一内存,4 TB 固态盘
  • 一个万兆电口加两个 QSFP 端口
  • 标称 FP4 稀疏算力最高 1 PFLOP

最后一条要拆开看。FP4 是 4 位浮点,稀疏指的是权重里有一半是零、可以整批跳过不算,两个条件叠起来,标称算力就比实际能用的翻了一倍。真实模型没这么理想,这个数字看量级就够了,别当成有效算力去算账。

真正决定上层边界的是「统一内存」这四个字。独立显卡有自己的一块显存,模型大到装不下就得切开放、来回搬权重;这台机器上 CPU 和 GPU 共用同一块 128 GB,模型不需要在两块内存之间搬家。厂商标称的上限是单机 200B 推理、双机互联 405B。同样 128 GB,不同结构、不同量化精度的模型能塞进去的参数量差得不少,具体哪个型号能上,要看原厂说明,不能拿参数量直接换算。

还有一项参数是内存带宽,标称 273 GB/s,比高端显卡的独占显存低一个档。这一条后面会反复用到,因为它决定了这台机器「写」不快。

二、推理层:能力形状在这一层定型

大模型干活分两步。第一步把材料整篇读进去,一次算完,吃的是算力;第二步一个 token 一个 token 往外写,每写一个都要把模型权重完整过一遍,吃的是内存带宽。

算力不低,带宽中等,两头一凑,能力形状就出来了:读进去的那段占优,往外写的那段中等。一组实测数字看得出这个落差,一个 144K 的长提示,热路径下端到端 2.44 秒读完;同一件事冷启动要 51.8 秒,差 21 倍。所以在长文档上的体验,非常看有没有预热。

公开的一组吞吐实测:

  • 35B 主力档,单流每秒 84.1 个 token,四路并发总吞吐 213.2
  • 27B 档,单流 28.2,四路并发 71.1
  • 122B 档,单流 26.8,四路并发 55.0
  • 284B 档,双机互联张量并行,真实交互 39.1

前三档单机跑,284B 那档要两台机器直连。四路并发下总吞吐比单流多出一倍半,说明并发上去不容易被拖垮;但公开口径只压到四路,再往上挂多少人合适,得自己压一遍再定。这些数字出自厂商自有设备的实测,量化口径分别是 4 位浮点和官方 8 位权重,时间窗口跨三周,不构成服务等级承诺。同一个 284B 档还有一个 88.9,那是在输出长度可预测的测试里跑出来的;开放问答的输出长短不定,拿不到这个数。

缓存池方面:256K 上下文之外,KV 缓存池能放 141 万 token,约等于 5.4 个 256K。上限测试里五路各 25 万 token 全部跑完,内存峰值 59.0 GiB,没有发生一次抢占。

语音这一档,合成加识别在机器上跑通了,但处理一段录音花的时间比录音本身还长一点,实时率约 1.25。适合会后转写,不适合会中的实时字幕。

三、治理层:数据出不出域,由这一层的开关决定

私有化最常被问的一句是「数据到底出不出去」。答案是去看配置,而不是听承诺。

所有请求都从治理网关过一道。这层做四件事:应用归因、用量计量、敏感信息脱敏、准入与配额,对外提供 OpenAI 兼容入口。因为路由开关收在同一个地方,这次走本机模型还是走云端模型由它一处决定,你不需要逐个去查每个应用怎么写的代码,只看这一处配置,就能判断数据会不会出去。

出厂状态是只挂本机模型、云端路由关闭。保持这个状态,推理和素材都留在整机内,不经第三方。反过来也要说清楚:按需开启云端路由或者接入远程纳管之后,相应的数据和纳管元数据会出域;涉密场景按纯本地闭环交付。所以要判断一台机器出不出域,就看这几项的实际配置。

这一层还管计量。计量口径与上层集群或云端对齐,好处是同一份用量数据不用两套解释。

四、执行层:Agent 的动作得有地方落地

智能体和聊天不一样。它不光答话,还要跑代码、读写文件、调外部工具,这些动作不能直接落在宿主机上。沙箱就是这些动作的执行环境,和推理层解耦:模型负责想,沙箱负责做,权限和隔离策略收在沙箱这一侧。

五、应用层:业务人员唯一直接接触的一层

业务人员打开的是最上面那层。从智能体广场取现成能力,用画布式的编排把交互配好,再挂上技能和知识库。对话即入口,产出的字段、清单、报告可以导出成 Word、Excel、PDF。

这一层对下面的要求其实只有两条:推理稳定、用量可计量。至于模型怎么切、缓存怎么放,业务侧不该关心。

六、分层之后,三个选型结论变得清楚

  • 数据路径:默认本地闭环,素材不经第三方,前提是保持出厂那套配置。接口对外是 OpenAI 兼容语义,业务侧改动小,但它不是同一个生产集群,性能预期要另算。
  • 能力形状:读长文占优、逐字生成中等,所以合同审查、报表核对、制度问答、工艺文档抽取这类「输入很长、回答不长」的活最对得上;要它当几十人同时在线的聊天入口,就是在用它最一般的那一面。
  • 账单形态:容量固定,没有按量的峰值账单。这不等于更便宜,只是形状不同,买的是一台机器的容量,不是用掉多少算多少。

还有一件纯物理的事:1.2 公斤,比一本精装书还小一点,打包就能带走,可以拎到客户现场或者展会上演示。机柜和云都给不了这一条。

吞吐不够的时候有回落路径:回到 GPU 集群或云端,两边走同一个 OpenAI 兼容入口、同一套计量口径。所以它在这套体系里的位置是一个容量档位,接口和计量都跟上面那层对齐,装不下了往上走,不用换一套做法。

七、上线前的检查清单

  • 是否保持出厂配置,也就是只挂本机模型
  • 云端路由开关状态、是否已经接入远程纳管
  • 常驻策略与预热有没有配好
  • 单流与并发各压一遍,并发上限用自己压出来的数
  • 长提示做热、冷两组对比
  • 沙箱的隔离与权限策略
  • Word、Excel、PDF 三种导出各验证一遍

写在最后

装得下和跑得快,本来是两件事。一台机器在一个组织里的用处,多半取决于人们敢把哪些材料放进去。能力的边界之外,还有一层是信任的边界。

装得下,本身就是一种能力。

先拿一台跑起自己的文档,再决定要不要铺开。

原创声明:本文系作者授权腾讯云开发者社区发表,未经许可,不得转载。

如有侵权,请联系 cloudcommunity@tencent.com 删除。

目录
  • 一、底座:一块统一内存
  • 二、推理层:能力形状在这一层定型
  • 三、治理层:数据出不出域,由这一层的开关决定
  • 四、执行层:Agent 的动作得有地方落地
  • 五、应用层:业务人员唯一直接接触的一层
  • 六、分层之后,三个选型结论变得清楚
  • 七、上线前的检查清单
  • 写在最后
问题归档专栏文章快讯文章归档关键词归档开发者手册归档开发者手册 Section 归档