首页
学习
活动
专区
圈层
工具
发布
首页标签第四期热点征文-大模型技术

#第四期热点征文-大模型技术

跨病种共病关联挖掘:高血压 + 糖尿病 + 肾病,混元大模型因果推理疾病关联分析实践19.2

未闻花名

在日常慢病临床与健康大数据场景里,高血压、2 型糖尿病、慢性肾病从来都不是单独存在的疾病。很多患者先是血压升高,长期代谢紊乱诱发血糖异常,久而久之肾脏微血管持续...

210

单卡4090显存优化实践:模型单卡分片加载、推理链路拆解、延迟与吞吐平衡调优19.0

未闻花名

基本我们做大模型推理落地、本地私有化部署,都会遇到一个非常头疼的现实问题:手握RTX 4090显卡,显存规格足够强悍,却依旧跑不动千亿、百亿参数级别的大模型。

9610

大模型激活函数迭代演进:SwiGLU替代传统ReLU/GELU激活逻辑提升模型性能18.9

未闻花名

在前一期《大模型主流激活函数解析:ReLU/GELU/SwiGLU 原理差异,拆解 FFN 前向逻辑》内容中,我们已经系统认识了神经网络激活函数的基础作用:线性...

14610

大模型主流激活函数解析:ReLU/GELU/SwiGLU原理差异,拆解FFN前向逻辑18.8

未闻花名

很多刚接触大模型微调、模型结构分析、推理优化的同学,第一眼看到 Transformer、FFN 前馈网络、SwiGLU、GELU、ReLU 这些名词都会觉得很抽...

14611

大模型参数规模拆解:十亿百亿千亿模型能力差异,结构配比决定AI智能上限18.7

未闻花名

相信我们做大模型应用实践过程中,一直都有一个根深蒂固的认知:大模型参数越多,智商就越高,效果就越厉害。于是行业也疯狂卷千亿参数、万亿参数模型,让大众也默认参数越...

21712

FlashAttention、PagedAttention两代注意力算法,改写大模型推理生态详解18.6

未闻花名

大模型能够实现流畅对话、长文本理解、多轮交互应答,核心底层完全依靠自注意力机制。但早期原生Transformer注意力,天生带着算力与显存双重致命缺陷,序列长度...

12510

词嵌入Embedding:Token离散转连续向量规则、RoPE特性、微调适配实践18.5

未闻花名

如果接触过大模型调用、或从事AI应用开发的工程师,基本天天都和Embedding打交道,分词Token、向量检索、语义匹配、RAG知识库、大模型对话生成,处处都...

15710

大模型幻觉本质:源于Transformer架构天生固有缺陷 + RAG根治方案参数调优18.4

未闻花名

不知道大家是不是也一样,做大模型应用做的久了,回过来头来总结思考,一直都有一个误区:总觉得大模型胡说八道、编造事实的幻觉问题,改改代码、修修bug、优化一下推理...

27921

揭秘大模型通用8192维度奥秘:千亿大模型为何统一采用8192隐层维度的真相18.3

未闻花名

经常接触大模型、应用过模型权重配置的朋友一定会发现一个特别有意思的现象:不管是国内主流开源大模型,还是其他通用对话大模型,不管是7B、13B、70B还是更大参数...

29921

大模型竞争持续升温,企业数字化转型提速

我的建站日记

如果说2023年是大模型的“诞生元年”,那么2026年无疑是其“落地决战之年”。从百模大战的野蛮生长,到如今头部阵营的格局初现,大模型赛道的竞争非但没有降温,反...

8910

大模型超长上下文显存控制:原生注意力缺陷、长文本显存暴涨原理与优化实践.180

未闻花名

大模型上下文长度,简单来说就是模型单次对话、单次推理能够记住并处理的文本总Token数量。早期开源大模型普遍只有4K、8K上下文,只能处理短篇对话、简短文档、小...

52455

RTX 4090显存终极优化:模型分层加载、CPU Offload显存和内存动态置换实践17.9

未闻花名

大语言模型的显存占用,是所有优化的核心起点。对于搭载24GB显存的RTX 4090,我们首先要明确:模型本身、推理计算、中间张量、上下文窗口,是四大显存消耗源头...

20921

基于OpenCV人脸检测与DeepFace视觉识别实现情绪抓拍、数据分析智能研判系统17.8

未闻花名

由于长期深耕青少年心理健康相关工作,在日常情绪疏导、心理状态观测中积累了大量实践经验,深刻意识到青少年情绪细腻多变、外在表达含蓄,很难通过简单交流精准捕捉真实内...

20010

大模型应用两大经典限流算法:漏桶算法vs令牌桶算法铸就大模型流量治理基石.177

未闻花名

限流算法是用于控制请求处理速率、保护服务资源的标准化算法,是所有流量管控策略的底层核心。在大模型服务中,算法的作用不再是简单限制请求数量,而是精准管控GPU 算...

21420

全新服务器大模型部署进阶:RTX 4090显卡驱动安装与模型运行容错适配指南.176

未闻花名

前面我们已经完整讲过全新服务器从零搭建、部署运行大模型的全套流程,今天咱们就在这个基础上,继续往下做关键一步:给服务器配置独立显卡,打通 GPU 硬件加速能力。...

26000

新服务器从0到1完整部署实践:openEuler环境搭建ChatGLM2大模型完整流程.175

未闻花名

玩过Linux服务器部署的都知道,这事特别熬人、格外劳心,尤其是碰上特定定制版本的Linux系统,各种环境兼容、配置坑点层出不穷,稍有不慎就卡死报错,出于习惯,...

17310

大模型GPU服务资源与性能监控:基于ChatGLM3模型的自动化巡检应用实践.174

未闻花名

传统业务监控只关注接口响应、CPU内存、网络状态,完全适配不了大模型推理场景。大模型服务监控是面向推理全链路的专属可观测体系,覆盖请求接入、文本分词、模型前向计...

20410

封神与阵痛:Kimi K3 的破局、狂欢与中国大模型的“甜蜜负担”

jack.yang

2026年7月17日,当这款拥有2.8万亿参数的混合专家(MoE)大模型悄然上线时,整个全球科技圈迎来了一场久违的震动。在Artificial Analysis...

63420

高并发下大模型服务降级策略:模型层、检索层、知识库层、缓存层协同设计.173

未闻花名

在大模型服务大规模落地后,系统随时面临高并发流量突增、GPU 算力耗尽、大模型推理超时、向量数据库宕机、知识库服务故障、网络抖动、资源占用超限等各类线上异常。若...

26010
领券