首页
学习
活动
专区
圈层
工具
发布
社区首页 >专栏 >从零实现Gemma 3 270M ,普通笔记本也能跑

从零实现Gemma 3 270M ,普通笔记本也能跑

作者头像
用户11563501
发布2026-06-23 09:08:34
发布2026-06-23 09:08:34
1240
举报

Github64k的高星《从零构建大语言模型》的作者Sebastian Raschka, 把 Google 的 Gemma 3 270M 用纯 PyTorch 重新实现了(之前从零实现了qwen3),只需 1.49GB 内存,笔记本或者Google Colab 都能跑。

Google 推出超小杯 AI:Gemma 3 270M!可进手机和浏览器这个 270M 参数的小模型只用了 4 个 attention head,设计很极简。在大家都在拼大模型的时候,Google 反而走了轻量化路线。(Google 推出超小杯 AI:Gemma 3 270M!可进手机和浏览器

Sebastian 的代码风格一向干净,没有过度封装。想真正理解 Transformer 架构的,这比啃论文实用多了。已经有大学教授在用他的材料教学,从头实现确实比调 API 学得深。这种小模型更适合做学习工具或者特定任务的微调底座。有人想用它做 RAG 的 reranker,考虑到 60% 的 embedding 结构,倒是个有趣方向。

最重要的是门槛够低,普通笔记本就能跑,连 GPU 都不用,想入门 LLM 架构的可以试试。

想要系统学习的建议购买他的这本书:

GitHub:

https://github.com/rasbt/LLMs-from-scratch/blob/main/ch05/12_gemma3/

https://github.com/rasbt/LLMs-from-scratch/blob/main/ch05/11_qwen3/

本文参与 腾讯云自媒体同步曝光计划,分享自微信公众号。
原始发表:2025-08-18,如有侵权请联系 cloudcommunity@tencent.com 删除
问题归档专栏文章快讯文章归档关键词归档开发者手册归档开发者手册 Section 归档