
Speaker Diarization
Pyannote
说话人分离性能评估:Pyannote.audio vs Nvidia NeMo 及 GPT-4 后处理
通过 DER 分析和实时应用开发,对说话人分离框架进行比较评估。验证 Pyannote.audio 与 Nvidia NeMo 之间的性能差异。
Taishin Maeda - Waseda University
3 min
VoicePing的见解、技巧和更新

通过 DER 分析和实时应用开发,对说话人分离框架进行比较评估。验证 Pyannote.audio 与 Nvidia NeMo 之间的性能差异。
利用自注意力模型识别英语口语中音节重音级别的研究

利用 TF-IDF 检索为 GPT-4 翻译提供更优质的 In-Context Learning 示例,从而提升翻译性能的研究报告。

基于多种评估指标和5个基准翻译模型,对机器翻译质量进行综合评估与改进的研究

基于 OpenAI Whisper 和 Azure Speech Studio 对越南语及日语语音识别进行微调的研究成果。

涵盖 Whisper 微调、说话人分离以及多种 ASR 模型对比评估的综合研究报告。