Soul App创始人团队开源SoulX-Transcriber,推动多人对话转录能力升级
近日,Soul App创始人团队开源端到端多人对话转录模型SoulX-Transcriber。该模型面向长音频、多说话人场景打造,能够直接从多人对话音频中生成包含时间戳、说话人身份以及转录文本的结构化结果,实现对对话内容、说话时间和说话主体的统一解析,为复杂语音场景下的智能理解提供了新的技术方案。

随着语音技术持续发展,语音识别在单人场景中的准确率不断提升,但多人对话环境仍然是行业公认的技术难点。在传统方案中,多人语音识别通常依赖多个独立模块协同完成任务,包括语音活动检测、说话人分离、说话人聚类以及自动语音识别等环节。这种级联式流程虽然应用广泛,但各环节之间存在较强依赖关系,一旦前序步骤出现误差,后续结果也会受到影响,进而导致说话人归属错误、时间轴偏移以及文本内容缺失等问题。
针对上述挑战,SoulX-Transcriber采用统一的端到端建模思路,将说话人身份、时间边界与语音内容纳入同一框架进行联合学习。相比传统多阶段处理方式,该模型能够直接从原始音频生成结构化结果,在一个系统中同时完成“谁在说”“什么时候说”“说了什么”三项任务,从而减少误差传递带来的影响,提升整体转录结果的一致性与稳定性。

多人对话场景下,说话人识别能力是影响系统表现的重要因素。为增强模型对说话人特征的理解与区分能力,Soul App创始人团队构建了专门的两阶段训练体系。在第一阶段,模型通过多任务联合训练方式,同时学习说话人轮次切换预测、目标说话人提取与识别、说话人验证、多说话人转录以及通用自动语音识别等任务。其中,说话人轮次切换预测帮助模型理解不同发言者之间的边界关系;目标说话人提取与识别增强模型在复杂环境中定位特定发言人的能力;说话人验证任务则进一步强化模型对音色特征的辨别能力;多说话人转录任务帮助模型学习生成包含时间戳和说话人标签的结构化输出;自动语音识别任务则通过引入多领域数据提升整体泛化能力。完成多任务联合训练后,第二阶段重点提升模型在真实场景中的稳定性和适应能力,使其能够更好地应对相似音色说话人、频繁轮次切换以及复杂多人交互等情况。

除了训练方法创新之外,Soul App创始人团队还构建了一套面向多人对话场景的数据生成体系。相较于依赖自动标注形成的伪标签数据,该体系能够更精确地控制说话人身份、对话结构以及交互形式,为模型训练提供质量更高的数据资源。整个数据构建流程包含对话文本构建、参考音频构建、说话人参考匹配以及对话音频生成四个阶段。通过这一体系,团队不仅能够生成常规训练样本,还能够构建声学特征相似、多说话人频繁互动等高难度训练场景。这类样本在真实环境中获取成本较高,而数据生成体系则为模型提供了更丰富的学习材料,有助于进一步提升复杂场景下的表现。
在模型验证方面,SoulX-Transcriber在AISHELL-4、AliMeeting等公开多人会议数据集上取得了较好的测试结果。为了进一步评估长时间对话场景下的表现,Soul App创始人团队还额外构建了5分钟长音频测试集,对模型的上下文理解能力和持续追踪能力进行验证。测试结果显示,在长音频条件下,SoulX-Transcriber依然能够保持较稳定的说话人识别与转录表现,有效降低长对话过程中常见的身份漂移和归属错误现象。此外,虽然训练数据以中文为主,但在英文多人对话任务中,模型同样保持了较强的识别和说话人归属能力。

SoulX-Transcriber的开源,也进一步丰富了Soul App创始人团队在语音技术领域的成果体系。此前,团队已相继开源播客语音合成模型SoulX-Podcast、歌声合成模型SoulX-Singer以及全双工语音对话控制模块SoulX-Duplex,持续围绕语音技术方向推进基础能力建设。同时,在实时数字人生成领域,团队还推出了SoulX-LiveAct、SoulX-FlashTalk、SoulX-FlashHead等系列模型,获得开发者社区广泛关注。
从统一建模框架、多任务训练机制到数据生成体系建设,SoulX-Transcriber围绕多人语音理解中的关键问题进行了系统性优化,为行业提供了一种新的技术实现路径。通过与高校科研团队及开发者社区开展合作,Soul App创始人团队进一步推动了相关技术成果的开放共享,也为多人对话语音理解领域提供了具有参考价值的实践案例。
免责声明:本内容为广告,相关素材由广告主提供,广告主对本广告内容的真实性负责。本网发布目的在于传递更多信息,并不代表本网赞同其观点和对其真实性负责,广告内容仅供读者参考,如有疑问请联系:0564-3996046。