首页
学习
活动
专区
圈层
工具
发布
社区首页 >专栏 >AI Infra 系列 · 第六章 · GPU 性能工程(一):训练慢,先别改代码,先做一次性能体检

AI Infra 系列 · 第六章 · GPU 性能工程(一):训练慢,先别改代码,先做一次性能体检

作者头像
dongdonglog
发布2026-09-08 13:50:03
发布2026-09-08 13:50:03
440
举报
概述
大多数人的第一反应是改代码、换并行、加机器。这一篇想劝你一句:先别动手。慢在哪、为什么慢,是能测出来的——PyTorch Profiler、Nsight Systems、Nsight Compute 三层工具就是你的体检设备。一次 138ms 的训练步里,有 30.8ms 花在没人注意的 token 搬运上;GPU 利用率低,瓶颈可能在 CPU、在 I/O、在通信,唯独不一定在你盯着的那个算子。

原创声明:本文系作者授权腾讯云开发者社区发表,未经许可,不得转载。

如有侵权,请联系 cloudcommunity@tencent.com 删除。

问题归档专栏文章快讯文章归档关键词归档开发者手册归档开发者手册 Section 归档