首页
学习
活动
专区
圈层
工具
发布

#cuda

CUDA 护城河崩了 !Claude独自跑通AMD新GPU

Amusi

一句话,一个周末,Claude直接把自家最前沿的模型跑在了一台全新的AMD MI355X机架上!

30610

凯哥讲 AI | Claude 打穿 CUDA 的深度解读:从 All In AI 到 All By AI

凯哥

Claude 一个周末跑通 AMD 新 GPU 之后,真正崩塌的不是 CUDA,而是工业时代关于行业、组织、知识、时间、技术与工程边界的旧假设。

21310

对标英伟达彻底摊牌!AMD Helios硬核革新:架构合并+CUDA级生态突围

GPUS Lady

近期AMD年度AI盛会Advancing AI 2026正式开启,重磅发布全新高端AI集群系统Helios,同时官宣与Anthropic达成50亿美元深度合作协...

23810

CUDA 编程:Tensor Core 与混合精度 GEMM

Michael阿明

12200

ollama v0.32.3发布:模型下载卡顿修复、Windows ARM64 CUDA支持、Laguna工具调用全面升级

福大大架构师每日一题

2026年7月24日,ollama 发布 v0.32.3 版本。本次更新覆盖模型下载、模型集成、GPU 支持、推理引擎、工具调用、聊天能力、命令行与终端交互等多...

35310

CUDA 编程:cuBLAS SGEMM 与手写矩阵乘法性能对比

Michael阿明

矩阵乘法(GEMM, General Matrix Multiplication)是 GPU 计算中最重要的算子之一。

11310

CUDA编程:Histogram 直方图统计与 Atomic 优化

Michael阿明

它在图像处理、推荐系统、日志统计、token 分布统计、排序预处理、采样分析中都非常常见。

10600

Windows平台下CUDA安装及llama.cpp使用教程

王瑞MVP

本文将详细讲解Windows平台下,如何安装与NVIDIA RTX显卡匹配的CUDA工具包,并正确配置、使用llama.cpp加载大模型,实现模型高效运行(将模...

85810

CUDA 编程:Parallel Prefix Sum / Scan 并行前缀和

Michael阿明

所以它天然是链式依赖,不能像 vector add 那样每个线程独立计算一个元素。

15300

CUDA编程:Parallel Reduction 并行归约与 Warp Shuffle 优化

Michael阿明

注意:本实验计时主要是 GPU kernel 计算时间,不包含完整 H2D/D2H 端到端时间。

22500

CUDA 编程:Occupancy、Block Size 与 Kernel 启动配置调优

Michael阿明

前面我们已经看到:TILE、blockDim、shared memory、bank conflict 都会影响性能。

24010

用Rust写GPU内核:CUDA-Oxide完整开发流程与性能优化指南

GPUS Lady

CUDA-Oxide是一套基于Rust语言开发的NVIDIA GPU并行计算开发工具链,区别于传统用C/C++编写CUDA显卡并行程序的方式,它可以让开发者直接...

28710

2026四大GPU计算生态横评:一文分清CUDA、ROCm、OpenCL、oneAPI

GPUS Lady

2026年,GPU通用计算领域已经形成非常清晰的竞争格局:三家芯片厂商自研的闭源/开源专属计算栈,外加一套行业通用开放标准,四类方案各有优劣,分别适配AI训练推...

96010

Windows 升级 Cuda 驱动版本图文步骤

代码简单说

- Driver Version 为 cuda 驱动版本;CUDA Version 为该驱动支持的最高 cuda toolkit 版本;cuda 驱动支持向后...

62910

里程碑更新!CUDA 13.3 补齐C++/Python生态,硬核赋能底层算力开发

GPUS Lady

NVIDIA 正式推出CUDA 13.3版本更新,本次升级聚焦底层GPU开发场景,面向深耕硬件底层开发的开发者带来多项核心功能迭代与体验革新,大幅优化底层并行计...

51210

CUDA编程:Shared Memory Bank Conflict 与 Padding 优化

Michael阿明

Global Memory 的 Memory Coalescing:让 warp 内线程尽量访问连续 Global 内存地址。

27810

记录一次 vLLM 服务卡在模型加载的排查过程

goodgood_live

这次记录的是一台云主机上的 GPU 测试机问题:模型权重放在 NAS,服务用 Docker 跑 vLLM。容器能启动,端口也能看到,但接口一直没有 ready,...

30910

读懂CUDA流:解锁GPU并行计算的核心关键

GPUS Lady

在入门GPU编程,尤其是基于CUDA的并行开发时,大多数开发者会重点关注核函数、显存拷贝、算力调度等核心内容,却常常忽略一个决定GPU计算效率的核心细节——CU...

41710

异步拷贝与 CUDA Stream(计算与数据传输重叠)

Michael阿明

在串行执行模式下,程序按照 H2D → Kernel → D2H 顺序运行,数据传输时 GPU 计算单元空闲,kernel 计算时 copy engine 又可...

42610
领券