首页
学习
活动
专区
圈层
工具
发布
社区首页 >专栏 >端到端语音翻译系统结合ASR与印度语大模型

端到端语音翻译系统结合ASR与印度语大模型

原创
作者头像
用户11764306
发布2025-08-23 22:41:07
发布2025-08-23 22:41:07
2620
举报

端到端语音翻译系统结合序列到序列自动语音识别模型与印度语大语言模型

本文介绍了针对IWSLT 2025印度语赛道的端到端语音到文本翻译系统,专注于英语-印度语及印度语-英语的双向翻译任务。为提升低资源场景下的翻译质量,提出了一种集成预训练Whisper自动语音识别(ASR)模型与印度语专用大语言模型(LLM)Krutrim的端到端系统。

实验结果表明,该端到端系统在英语到印度语方向取得了平均BLEU分数数学处理错误,在印度语到英语方向取得了平均BLEU分数数学处理错误。此外,研究还探索了思维链(Chain-of-Thought, CoT)方法。尽管该方法在成功解析的输出中显示出显著提升翻译质量的潜力(例如泰米尔语到英语的BLE分数提高了数学处理错误),但观察到模型在持续遵循所需CoT输出格式方面存在挑战。

技术细节

  • 使用预训练Whisper模型处理语音输入
  • 集成Krutrim大语言模型进行文本翻译优化
  • 针对低资源语言对设计端到端 pipeline
  • 评估指标采用BLEU分数,并分析CoT方法的效果与局限性

提交信息:7页,1张图表,已提交至IWSLT 2025会议

原创声明:本文系作者授权腾讯云开发者社区发表,未经许可,不得转载。

如有侵权,请联系 cloudcommunity@tencent.com 删除。

目录
  • 端到端语音翻译系统结合序列到序列自动语音识别模型与印度语大语言模型
问题归档专栏文章快讯文章归档关键词归档开发者手册归档开发者手册 Section 归档