全部版块 我的主页
› 论坛 › 数据科学与人工智能 › 人工智能 › 语音识别
184 0
2026-04-24

VoiceAssistant-400K 是一个专门为语音助手优化的数据集,旨在帮助模型在提供语音助手服务时减少生成代码符号,增强模型在真实应用中的实用性。该数据集是为了训练和优化 Mini-Omni 模型的语音输出而开发的,由清华大学的研究团队于 2024 年推出,相关论文成果为「Mini-Omni: Language Models Can Hear, Talk While Thinking in Streaming」。 Mini-Omni 是一个开源的多模态大型语言模型,具备实时对话能力和端到端的语音输入输出功能。通过独特的文本指导并行生成方法,实现了与文本能力一致的语音推理输出,仅需极少的额外数据和模块。 VoiceAssistant-400K 数据集通过三阶段训练过程对语音到文本和文本到语音适配器进行优化,以支持模型在提供语音助手服务时的性能。这些阶段包括模态对齐、适配训练和多模态微调。在模态对齐阶段,模型的语音识别和合成能力通过使用语音识别和语音合成的数据来训练。适配训练阶段专注于训练模型在给定音频输入时的文本能力。最后的多模态微调阶段则使用综合数据对整个模型进行微调,以确保多模态输出的质量。

附件列表

VoiceAssistant-400K.rar

大小:1.86 MB

只需: 1001 个论坛币  马上下载

磁力链接189.87G

本附件包括:

  • VoiceAssistant-400K.torrent

二维码

扫码加我 拉你入群

请注明:姓名-公司-职位

以便审核进群资格,未注明则拒绝

相关推荐
栏目导航
热门文章
推荐文章

说点什么

分享

扫码加好友,拉您进群
各岗位、行业、专业交流群