一句话,一个周末,Claude直接把自家最前沿的模型跑在了一台全新的AMD MI355X机架上!
Claude 一个周末跑通 AMD 新 GPU 之后,真正崩塌的不是 CUDA,而是工业时代关于行业、组织、知识、时间、技术与工程边界的旧假设。
近期AMD年度AI盛会Advancing AI 2026正式开启,重磅发布全新高端AI集群系统Helios,同时官宣与Anthropic达成50亿美元深度合作协...
2026年7月24日,ollama 发布 v0.32.3 版本。本次更新覆盖模型下载、模型集成、GPU 支持、推理引擎、工具调用、聊天能力、命令行与终端交互等多...
矩阵乘法(GEMM, General Matrix Multiplication)是 GPU 计算中最重要的算子之一。
它在图像处理、推荐系统、日志统计、token 分布统计、排序预处理、采样分析中都非常常见。
本文将详细讲解Windows平台下,如何安装与NVIDIA RTX显卡匹配的CUDA工具包,并正确配置、使用llama.cpp加载大模型,实现模型高效运行(将模...
所以它天然是链式依赖,不能像 vector add 那样每个线程独立计算一个元素。
注意:本实验计时主要是 GPU kernel 计算时间,不包含完整 H2D/D2H 端到端时间。
前面我们已经看到:TILE、blockDim、shared memory、bank conflict 都会影响性能。
CUDA-Oxide是一套基于Rust语言开发的NVIDIA GPU并行计算开发工具链,区别于传统用C/C++编写CUDA显卡并行程序的方式,它可以让开发者直接...
2026年,GPU通用计算领域已经形成非常清晰的竞争格局:三家芯片厂商自研的闭源/开源专属计算栈,外加一套行业通用开放标准,四类方案各有优劣,分别适配AI训练推...
- Driver Version 为 cuda 驱动版本;CUDA Version 为该驱动支持的最高 cuda toolkit 版本;cuda 驱动支持向后...
NVIDIA 正式推出CUDA 13.3版本更新,本次升级聚焦底层GPU开发场景,面向深耕硬件底层开发的开发者带来多项核心功能迭代与体验革新,大幅优化底层并行计...
Global Memory 的 Memory Coalescing:让 warp 内线程尽量访问连续 Global 内存地址。
这次记录的是一台云主机上的 GPU 测试机问题:模型权重放在 NAS,服务用 Docker 跑 vLLM。容器能启动,端口也能看到,但接口一直没有 ready,...
在入门GPU编程,尤其是基于CUDA的并行开发时,大多数开发者会重点关注核函数、显存拷贝、算力调度等核心内容,却常常忽略一个决定GPU计算效率的核心细节——CU...
在串行执行模式下,程序按照 H2D → Kernel → D2H 顺序运行,数据传输时 GPU 计算单元空闲,kernel 计算时 copy engine 又可...