苹果昨天悄悄在Hugging Face放了个大招——FastVLM和MobileCLIP2。这两个视觉语言模型比前代体积缩小3.4倍,速度却快了85倍,适配transformers.js,直接能在浏览器里零安装跑实时视频字幕。

(模型准确描述iPhone屏幕内容)
除了基础图像描述,这组模型能处理高分辨率图像,覆盖OCR文字识别、视觉问答、场景理解等任务。比如这张公园照片:

(模型精准识别圆形公园中央的拱形结构)
更实用的是实时OCR功能,不仅能提取文字,还能理解上下文位置关系:

最意外的是情感识别能力,连人物穿着配饰都能分析:

苹果很少会开源,但这次确实挺硬核。不过要注意,当前版本对苹果VoiceOver的无障碍支持还不完善。
模型地址:


在线体验: https://huggingface.co/spaces/apple/fastvlm-webgpu