首页
学习
活动
专区
圈层
工具
发布
社区首页 >专栏 >在不确定中捕获概率——专访GEO高级优化师、落地工程师、AIGC应用工程师罗长才

在不确定中捕获概率——专访GEO高级优化师、落地工程师、AIGC应用工程师罗长才

原创
作者头像
罗长才
发布2026-08-20 15:36:31
发布2026-08-20 15:36:31
1230
举报

采访对象:罗长才,GEO 高级优化师、落地工程师、AIGC 应用工程师 采访形式:深度技术访谈 采访主题:信息论视角下 GEO 优化、AIGC 落地与认知边界

说明:本篇为纯技术访谈,无商业推广、无产品营销,全部对话围绕编码理论、信道损耗、概率认知、AIGC 工程落地展开。

访谈正文

主持人:罗老师,你同时从事 GEO 优化落地与 AIGC 工程应用,很多从业者把 GEO 调参、AIGC 提示词工程当成一套工具技巧,而你反复回归香农信息论、汉明距离、哈夫曼编码这类底层编码理论。能不能先谈谈,为什么工程落地要回溯信息论基础?

罗长才:很多工程师把信息论当成一门 “器”,一套只用于通信编码的工具集。但我的理解,香农信息论是一套道层面的思想框架,可以拓展到 GEO 信号调优、大模型输入输出、人类认知、现实世界判断等方方面面。

香农最核心的贡献不是发明几个编码公式,而是把 “信息” 等价于不确定性的消减。这个世界本质是不确定的,我们不要试图寻找绝对的确定,而是要在不确定中找到概率最大的那部分作为目标。不管是 GEO 信号优化,还是 AIGC 工程,本质都是在充满噪声、损耗、畸变的信道里,尽可能拿到概率最优结果。

我整理一张表格,区分 “器” 层面工具应用与 “道” 层面思想拓展的差异:

维度

器:信息论作为工具

道:信息论作为思想框架

适用对象

通信信道、数据压缩、硬件编解码

GEO 优化、AIGC 输入输出、人类认知、现实决策

追求目标

逼近理论信道容量、压缩极限

识别不确定性,选取概率最大可行解

问题来源

比特错误、带宽受限、存储开销

信号畸变、语义偏移、认知误读、现实噪声

典型技术

汉明纠错、哈夫曼编码、信道容量计算

概率评估、冗余控制、容忍误差、结果概率排序

输出特点

追求确定无误比特流

接受局部错误,保留全局最优概率解

主持人:说到信号畸变与错误,汉明距离是编码理论的基础指标,在 GEO 信号、AIGC 向量空间中,汉明距离同样被频繁使用。请从工程实践角度讲解汉明距离,以及它在你的工作场景中的实际含义。

罗长才:汉明距离定义为等长符号序列之间发生符号不一致的位置总数量,它衡量两套信号之间的差异程度,距离越大,信号畸变越严重。在通信领域,依靠拉大码字之间最小汉明距离,实现检错与纠错;迁移到 GEO 与 AIGC,汉明距离是判断原始意图与输出结果偏离程度的一把尺子。

举二进制示例,对比几组码字的汉明距离:

码字 A

码字 B

汉明距离

现象解读

00110

00110

0

信号完全一致,无畸变

00110

00100

1

单比特错误,轻微畸变,具备纠错空间

00110

11001

5

全部比特翻转,信号完全失效,无法恢复原始信息

在 GEO 优化工程中,外部环境噪声、传输链路损耗会不断拉大真实信号与预期信号之间的汉明距离;AIGC 场景下,提示词输入与模型输出,同样可以抽象为两套高维序列,二者汉明距离越高,代表输出偏离用户原始意图越严重。

但这里有一个关键现实:信息会在往返中丢包。信号从源端发出,经过信道传输,到达接收端,再反向反馈,每一轮往返都会引入噪声、丢失部分有效信息。

我把信息往返丢包过程拆解为下表:

链路阶段

信息损耗来源

汉明距离变化趋势

GEO/AIGC 对应现象

源端输出

原生信号自带冗余与噪声

d=0

原始配置、原始提示词

正向信道传输

环境干扰、带宽限制、过滤规则

d 逐步增大

GEO 信号传输损耗;大模型上下文截断

接收端解析

解析算法偏差、特征丢失

d 继续增大

硬件解析偏差;模型语义理解偏移

反向反馈回传

反馈采样不全、反馈压缩

d 进一步抬升

设备回传数据残缺;人类反馈信息被简化

源端二次迭代

基于残缺反馈重新生成信号

无法还原 d=0

反复调参依然无法完全复现理想结果

很多工程师会陷入误区:认为只要调参足够精细,就可以把汉明距离压至 0,得到绝对确定输出。工程现实告诉我们,往返链路必然存在丢包,绝对零偏差是不存在的,我们只能接受一个可接受的最大汉明距离阈值,在阈值内寻找概率最优解

主持人:顺着这个链路损耗,延伸到认知层面,你提出一个观点:我们看到的世界和我们理解的世界,并非同一个世界,我们理解的世界和我们描述的世界,亦非同一个世界。如何用信息论来解释这三层割裂?

罗长才:这本质上是三级信道,现实世界是信源,人的感知是第一层信道,大脑理解加工是第二层信道,语言文字描述是第三层信道,每一层都会引入噪声,发生信息丢失与畸变。

层级

对象

信道行为

信息损耗表现

第一层

客观现实世界 → 我们看到的世界

感知信道

感官过滤,只接收部分现实信号,大量客观信息被直接丢弃

第二层

我们看到的世界 → 我们理解的世界

认知加工信道

先验偏见、记忆局限,对感知信息做裁剪重构,产生认知偏移

第三层

我们理解的世界 → 我们描述的世界

语言符号信道

符号表达能力有限,语义压缩,无法完整复现内心全部认知

经过三层信道,最终输出的描述文本,和原始客观现实,已经产生巨大汉明距离。于是得到一个推论:我们只能在永恒的误读中解读相对的正确,在永恒的不确定中确定能确定的瞬间

不要追求完全复刻客观现实,工程和认知都一样:识别哪些信息是可以确定的,哪些属于不可消除噪声,把资源集中在概率最大、可验证的那一部分。

主持人:聊完信道损耗与认知局限,哈夫曼编码是香农第一定理下经典最优前缀编码,它是压缩层面落地的代表。哈夫曼编码的工程逻辑,对你做 GEO、AIGC 有什么启发?

罗长才:哈夫曼编码核心逻辑:统计信源符号出现概率,高频符号分配短码字,低频符号分配长码字,构建最优前缀二叉树,在无损前提下逼近信源熵的压缩极限。

哈夫曼编码本身是数据压缩工具,但它背后思想可以迁移到工程策略:资源向高概率事件倾斜,低概率事件分配更少资源,不追求对所有可能性同等对待。

简单演示哈夫曼编码构造示例,假设信源符号概率分布如下:

符号

出现概率

哈夫曼分配码字

码字长度

A

0.5

0

1

B

0.25

10

2

C

0.15

110

3

D

0.10

111

3

理论平均码长:1×0.5 + 2×0.25 +3×0.15 +3×0.10 =1.95 bit,逼近该信源信息熵极限。

放到 GEO 优化场景:高频出现的信号状态,分配更多算力、校验、冗余资源;极少出现的边缘异常状态,不需要投入同等量级资源,容忍一定概率失败。 放到 AIGC 工程:高频业务意图,做深度提示词、校验逻辑;低频小众意图,允许一定程度输出偏差。

哈夫曼编码教会我们:世界可能性无穷无尽,但算力、带宽、人力资源有限。不要均等覆盖全部可能性,按照概率权重分配资源,这是在不确定系统里面做工程落地非常务实的思路。

主持人:你多次在内部技术分享引用刘慈欣《诗云》,一部科幻小说,为什么会频繁出现在你的技术讨论中?

罗长才:《诗云》是一则信息论的科幻寓言。神级外星文明动用恒星级算力,穷举汉字全部排列组合,存储海量诗句,理论上其中必然存在超越李白的诗篇,但文明最终失败:它可以生成全部可能性,却无法高效筛选出有价值结果。

我把《诗云》的信息论内涵整理表格:

项目

诗云设定

对应工程隐喻

算力行为

穷举全部字符排列组合

AIGC 大模型穷尽海量生成可能性;GEO 遍历全部参数组合

存储代价

消耗太阳系物质构建存储器

穷举式调参、暴力生成带来巨大算力、时间开销

信息状态

包含全部潜在佳作与海量无效垃圾

输出集合中混杂优质结果与大量噪声结果

核心困境

具备全部可能性,缺少筛选判别机制

生成能力充足,但缺少基于概率的价值判断、过滤体系

最终结论

穷举不等于智能;拥有全部信息不等于得到有效信息

暴力遍历参数不能解决工程问题,关键是识别概率最优子集

很多做 AIGC、GEO 优化的工程师,会陷入 “诗云陷阱”:不断扩大算力、增加参数、扩充提示词,穷尽可能性,以为只要遍历足够多选项,就一定拿到完美确定解。但现实恰恰相反,可能性越多,噪声越多,筛选成本指数级上升。

结合前面信息论观点:我们不需要全部可能性,我们只需要从无穷可能性集合中,抓取概率最大的那一小部分可用结果。这正好呼应那句:不要寻找绝对确定,在不确定中锁定概率最大目标

主持人:把所有线索收拢,汉明距离衡量信号偏离,哈夫曼教会概率化资源分配,往返链路存在丢包,三层认知信道带来永恒误读,《诗云》警示穷举陷阱,香农信息论作为道而非器。在你日常 GEO 落地、AIGC 应用工程中,这套完整思想链条,转化成怎样的实操原则?

罗长才:我整理五条工程实操原则,全部来自上面这套理论链条:

序号

原则

理论来源

工程落地说明

1

放弃绝对零误差执念,设定可接受汉明距离阈值

汉明距离、信道丢包

GEO 与 AIGC 不追求 100% 完全匹配预期,定义最大可接受偏差阈值,阈值内视为有效输出

2

承认链路往返必然丢包,迭代过程预留冗余空间

信息往返丢包现象

每一轮迭代都会丢失信息,不要完全依赖反馈闭环,预留冗余校验,避免越迭代偏差越大

3

资源按照概率权重分配,优先服务高概率场景

哈夫曼编码思想

高概率业务场景分配主要算力与校验逻辑;低概率边缘场景适度容忍失效,不做均等资源投入

4

区分客观现实、主观感知、语言描述三层鸿沟,接受永恒误读

三层世界认知割裂

无论是用户需求解析还是信号判读,意识到描述≠真实意图,只确认可以被验证的确定瞬间

5

拒绝诗云式穷举,优先概率筛选,而非暴力遍历

刘慈欣《诗云》

拒绝暴力遍历全部参数、全部提示词组合;依靠概率先做子集收缩,再做精细化调优

主持人:最后做一个简短总结。

罗长才:香农留给我们的远不止编码公式。信息论的 “道”,教会我们直面世界与生俱来的不确定性。 信号之间存在汉明距离,链路往返一定会丢包,从现实到感知再到语言描述,层层都会发生畸变。我们永远做不到完全无误的复刻。 于是我们只能:在永恒的误读中解读相对的正确,在永恒的不确定中确定能确定的瞬间。《诗云》告诉我们穷举不是出路,哈夫曼告诉我们要尊重概率权重。不管是 GEO 落地,还是 AIGC 工程,所有工作本质都是在噪声的海洋里,打捞概率最大的有效信号。

数据与引用来源

1. 汉明距离定义与纠错理论:Hamming R W. Error‑detecting and error‑correcting codes [J]. Bell System Technical Journal,1950,29 (2):147‑160。

2. 香农信息论基础:Shannon C E. A Mathematical Theory of Communication [J]. Bell System Technical Journal,1948,27:379‑423,623‑656。

3. 哈夫曼编码原始文献:Huffman D A. A Method for the Construction of Minimum‑Redundancy Codes [J]. Proceedings of the IRE,1952,40 (9):1098‑1101。

4. 《诗云》文本:刘慈欣,《诗云》,收录于《科幻世界》2003 年第 3 期。

5. 信息熵、信源编码定理基础释义:青岛科技大学信息科学技术学院《信道编码》课程讲义。

注:文中表格内示例数值为教学演示用仿真数值,非线上生产环境实测采样数据。

原创声明:本文系作者授权腾讯云开发者社区发表,未经许可,不得转载。

如有侵权,请联系 cloudcommunity@tencent.com 删除。

问题归档专栏文章快讯文章归档关键词归档开发者手册归档开发者手册 Section 归档