最近,一个名为NovaSR的音频超分辨率模型开源。这个模型只有52KB大小,比一段3秒的音频文件还小,但功能却不简单:它能把模糊的16kHz音频增强成更清晰的48kHz版本。
根据开发者的介绍,NovaSR的处理速度非常快——在单GPU上,1秒内能处理100到3600秒的音频。这意味着它几乎可以实时处理音频流。
为什么这个小模型有用?
有网友测试后反馈,与开发者之前发布的FlashSR相比,NovaSR在处理女性语音时表现更好,减少了刺耳的齿音和音频伪影。虽然与更复杂的FlowHigh模型相比还有差距,但NovaSR在速度和质量的平衡上做得不错。
目前NovaSR仅使用了100小时的数据进行训练,开发者表示还有改进空间。但考虑到它的小巧尺寸,现有的音频质量已经相当令人印象深刻。
对于那些需要快速、轻量级音频增强解决方案的开发者来说,NovaSR值得一试。
地址: