
私有环境里上大模型,卡点通常不在模型本身,而在环境拼装:推理引擎、计量网关、任务沙箱、业务前端,四套东西各自成体系,还得有人把它们缝在一起。把这几层压进一台小机器、通电联网登录就能用,前提是它们共用同一个硬件底座。下面按层拆一遍这类一体机的结构,以及每层各自的边界在哪。
先把硬件参数摆出来:
最后一条要拆开看。FP4 是 4 位浮点,稀疏指的是权重里有一半是零、可以整批跳过不算,两个条件叠起来,标称算力就比实际能用的翻了一倍。真实模型没这么理想,这个数字看量级就够了,别当成有效算力去算账。
真正决定上层边界的是「统一内存」这四个字。独立显卡有自己的一块显存,模型大到装不下就得切开放、来回搬权重;这台机器上 CPU 和 GPU 共用同一块 128 GB,模型不需要在两块内存之间搬家。厂商标称的上限是单机 200B 推理、双机互联 405B。同样 128 GB,不同结构、不同量化精度的模型能塞进去的参数量差得不少,具体哪个型号能上,要看原厂说明,不能拿参数量直接换算。
还有一项参数是内存带宽,标称 273 GB/s,比高端显卡的独占显存低一个档。这一条后面会反复用到,因为它决定了这台机器「写」不快。
大模型干活分两步。第一步把材料整篇读进去,一次算完,吃的是算力;第二步一个 token 一个 token 往外写,每写一个都要把模型权重完整过一遍,吃的是内存带宽。
算力不低,带宽中等,两头一凑,能力形状就出来了:读进去的那段占优,往外写的那段中等。一组实测数字看得出这个落差,一个 144K 的长提示,热路径下端到端 2.44 秒读完;同一件事冷启动要 51.8 秒,差 21 倍。所以在长文档上的体验,非常看有没有预热。
公开的一组吞吐实测:
前三档单机跑,284B 那档要两台机器直连。四路并发下总吞吐比单流多出一倍半,说明并发上去不容易被拖垮;但公开口径只压到四路,再往上挂多少人合适,得自己压一遍再定。这些数字出自厂商自有设备的实测,量化口径分别是 4 位浮点和官方 8 位权重,时间窗口跨三周,不构成服务等级承诺。同一个 284B 档还有一个 88.9,那是在输出长度可预测的测试里跑出来的;开放问答的输出长短不定,拿不到这个数。
缓存池方面:256K 上下文之外,KV 缓存池能放 141 万 token,约等于 5.4 个 256K。上限测试里五路各 25 万 token 全部跑完,内存峰值 59.0 GiB,没有发生一次抢占。
语音这一档,合成加识别在机器上跑通了,但处理一段录音花的时间比录音本身还长一点,实时率约 1.25。适合会后转写,不适合会中的实时字幕。
私有化最常被问的一句是「数据到底出不出去」。答案是去看配置,而不是听承诺。
所有请求都从治理网关过一道。这层做四件事:应用归因、用量计量、敏感信息脱敏、准入与配额,对外提供 OpenAI 兼容入口。因为路由开关收在同一个地方,这次走本机模型还是走云端模型由它一处决定,你不需要逐个去查每个应用怎么写的代码,只看这一处配置,就能判断数据会不会出去。
出厂状态是只挂本机模型、云端路由关闭。保持这个状态,推理和素材都留在整机内,不经第三方。反过来也要说清楚:按需开启云端路由或者接入远程纳管之后,相应的数据和纳管元数据会出域;涉密场景按纯本地闭环交付。所以要判断一台机器出不出域,就看这几项的实际配置。
这一层还管计量。计量口径与上层集群或云端对齐,好处是同一份用量数据不用两套解释。
智能体和聊天不一样。它不光答话,还要跑代码、读写文件、调外部工具,这些动作不能直接落在宿主机上。沙箱就是这些动作的执行环境,和推理层解耦:模型负责想,沙箱负责做,权限和隔离策略收在沙箱这一侧。
业务人员打开的是最上面那层。从智能体广场取现成能力,用画布式的编排把交互配好,再挂上技能和知识库。对话即入口,产出的字段、清单、报告可以导出成 Word、Excel、PDF。
这一层对下面的要求其实只有两条:推理稳定、用量可计量。至于模型怎么切、缓存怎么放,业务侧不该关心。
还有一件纯物理的事:1.2 公斤,比一本精装书还小一点,打包就能带走,可以拎到客户现场或者展会上演示。机柜和云都给不了这一条。
吞吐不够的时候有回落路径:回到 GPU 集群或云端,两边走同一个 OpenAI 兼容入口、同一套计量口径。所以它在这套体系里的位置是一个容量档位,接口和计量都跟上面那层对齐,装不下了往上走,不用换一套做法。
装得下和跑得快,本来是两件事。一台机器在一个组织里的用处,多半取决于人们敢把哪些材料放进去。能力的边界之外,还有一层是信任的边界。
装得下,本身就是一种能力。
先拿一台跑起自己的文档,再决定要不要铺开。
原创声明:本文系作者授权腾讯云开发者社区发表,未经许可,不得转载。
如有侵权,请联系 cloudcommunity@tencent.com 删除。