在阅读正在阅读
FluidVoice 是一款为 macOS 设计的开源、本地优先的语音转文字听写应用,自称是“最快的 macOS 听写应用”以及“Wispr Flow 的本地替代品”。它主打离线运行、AI 智能增强和极低延迟,所有语音和文本默认不会离开你的设备。
功能
• 流动智能——设备端人工智能增强功能,用于智能格式设置、上下文感知大写和后期处理,所有这些都在您的Mac本地运行,无需数据离开您的设备
• 命令模式——通过语音控制您的Mac:启动应用程序、运行快捷指令、触发系统操作以及自动化工作流程,无需触摸键盘
• 书写模式——在任何应用程序的任何文本字段中直接书写或改写文本。选择文本并改写,或直接口述新内容
• 实时预览——支持刘海屏的实时转录覆盖,这样您说话时就能看到文字实时出现
• 多种语音模型——Nemotron Speech 3.5、Parakeet Flash、Parakeet TDT v3和v2、Cohere Transcribe、Apple Speech以及Whisper。选择适合您语言和延迟需求的模型
• 人工智能增强——可通过OpenAI、Groq、自定义提供商或本地流动智能进行可选的后期处理,以获得更清晰、更准确的转录内容
• 音频历史记录——可选的本地录音历史记录,带有预算控制和ZIP导出功能,这样您无需云存储即可查看过去的听写内容
• 今日使用情况统计——通过统计信息标题卡片和工具栏图标,一目了然地跟踪每日使用情况
• 自适应主题——跟随系统的亮/暗主题,带有紧凑的工具栏切换器
• 全局热键——无需切换应用程序,从任何位置即时捕获语音
• 智能输入——通过辅助功能API直接插入任何应用程序,实现可靠的、独立于应用程序的文本输入
• 菜单栏集成——从菜单栏快速访问、查看状态和设置
• 自动更新——无缝更新,可选的测试版通道可提前预览
• 应用程序特定配置——为不同应用程序分配不同的提示集,使您的听写能够适应您正在处理的任何内容。完全可选
• 刘海屏感知覆盖——转录覆盖能够完美适配MacBook的刘海屏,如果您的Mac没有刘海屏,也可使用标准覆盖
• 本地优先——除非您选择使用云人工智能提供商,否则您的语音和文本永远不会离开您的设备
• Mac上最快的Parakeet——macOS上最快的Parakeet原生实现之一,几乎即时转录且延迟极小
• 可配置覆盖——从药丸形状到大型覆盖尺寸中选择以显示实时预览,或者保持极简模式。所有内容都是可选的
• 一切皆可选——人工智能增强、流动智能、音频历史记录、分析和测试版版本均为可选加入。核心听写体验开箱即用,除了权限和热键外无需任何配置
支持模型
模型 | 适用场景 | 语言支持 | 下载大小 | 硬件要求 |
|---|---|---|---|---|
Nemotron Speech 3.5 — 超快低延迟 | 支持流式的多语言听写 | 约 40 种语言 | 约 670 MB | Apple Silicon |
Nemotron 3.5 多语言 | 高精度多语言听写 | 约 40 种语言 | 约 530 MB | Apple Silicon |
Parakeet Flash (测试版) | 最低延迟的实时英语听写 | 英语 | 约 250 MB | Apple Silicon |
Parakeet TDT v3 | 快速默认多语言听写 | 25 种语言 | 约 500 MB | Apple Silicon |
Parakeet TDT v2 | 最快的纯英语听写 | 英语 | 约 500 MB | Apple Silicon |
Cohere Transcribe | 高精度多语言听写 | 14 种语言 | 约 1.4 GB | Apple Silicon |
Apple Speech | 无需下载的原生 macOS 语音 | 系统语言 | 内置于系统 | Apple Silicon + Intel |
Whisper Tiny / Base / Small / Medium / Large | 广泛兼容性,支持 Intel Mac | 99 种语言 | 约 75 MB 至 约 2.9 GB | Apple Silicon + Intel |
Parakeet TDT v3 支持的语言: 保加利亚语、克罗地亚语、捷克语、丹麦语、荷兰语、英语、爱沙尼亚语、芬兰语、法语、德语、希腊语、匈牙利语、意大利语、拉脱维亚语、立陶宛语、马耳他语、波兰语、葡萄牙语、罗马尼亚语、俄语、斯洛伐克语、斯洛文尼亚语、西班牙语、瑞典语、乌克兰语。
苹果语音支持的语言
系统语言支持情况取决于您计算机上可用的macOS语音识别语言。
Whisper支持的语言
根据您选择的模型大小,Whisper最多支持99种语言。
快速入门
1. 使用Homebrew安装:
brew install --cask fluidvoice
2. 授予权限 - FluidVoice 将请求麦克风和辅助功能访问权限。这两项权限对于在其他应用中进行听写和打字都是必需的。
3.设置热键 - 在设置中选择一个全局热键,以便从任何地方触发语音捕捉。
4.完成入门引导 - 根据您的语言和延迟需求选择语音模型。模型范围从无需下载的苹果语音到高精度的 Nemotron 和 Whisper。
5.(可选)启用Fluid Intelligence - 在入门引导过程中下载本地人工智能模型,以增强设备端听写功能。所有操作都在本地运行,数据不会离开您的 Mac。
6.(可选)使用自己的人工智能提供商 - 添加OpenAI、Groq或自定义提供商的API密钥,以进行基于云的增强。密钥安全存储在macOS钥匙串中。选择“始终允许”以访问密钥。
7.(可选)选择加入测试版 - “设置”→“自动更新”→“测试版发布”,以便提前访问新功能。
要求
macOS 15.0(红杉)或更高版本
所有机型均需 Apple Silicon Mac
通过 Whisper 模型支持英特尔 Mac(从 1.5.1+ 版本开始)
语音模型约需 1GB 磁盘空间
流体智能模型约需 3.5GB 磁盘空间(可选)
麦克风访问权限
输入的辅助功能权限
从源代码构建
git clone https://github.com/altic-dev/FluidVoice.git
cd FluidVoice
open Fluid.xcodeproj
仅构建(不签名)
xcodebuild -project Fluid.xcodeproj -scheme Fluid -destination 'platform=macOS' build CODE_SIGNING_ALLOWED=NO
运行集成测试
xcodebuild test -project Fluid.xcodeproj -scheme Fluid -destination 'platform=macOS'
持续集成使用未签名的构建:
xcodebuild test -project Fluid.xcodeproj -scheme Fluid -destination 'platform=macOS' CODE_SIGNING_REQUIRED=NO CODE_SIGNING_ALLOWED=NO
隐私与分析
FluidVoice是本地优先的。您的语音、音频和转录文本永远不会离开您的设备,除非您明确选择加入云人工智能服务提供商。
收集内容(可选)
默认启用匿名分析,以跟踪应用运行状况和功能使用情况。你可以随时从“设置”→“共享匿名分析”中禁用此功能。
收集内容:
应用版本、内部版本、macOS 版本
低基数功能/配置标志(例如应用模式、主要设置)
大致使用范围(非精确值)
高级别成功/错误结果
不收集内容:
语音、原始音频或转录文本
选定文本、提示或人工智能回复
终端命令、窗口标题、文件路径、剪贴板或输入内容
任何个人或私密信息
项目地址:https://github.com/altic-dev/FluidVoice