- 最高票数
- 32
- 最佳排名
- #29
- 上榜次数
- 1 次
- 最近上榜
- 2026.06.10
产品介绍
构建一个全面的设备端语音代理,包含以下功能:自动语音识别(ASR,使用NVIDIA的Nemotron,支持多语言和实时流式处理)、文本转语音(TTS)、语音克隆、说话者分离、降噪,以及全双工语音转语音(使用NVIDIA的PersonaPlex)。此外,还有一个语音代理管道,支持轮流发言、打断和排队。可以在Mac、Windows、Linux和移动设备(iPhone和Android)上运行,并进行了NPU优化(支持CoreML和NNAPI)。提供Swift、Kotlin和C++的API。同时,还有Speech Studio,一个为创作者设计的桌面语音克隆应用。遵循Apache 2.0协议,完全在设备端运行。

- 语音人工智能
- 语音代理
- 设备端语音
- ASR
- TTS
- 语音克隆
- 对话分离
- 降噪
- 双工语音
- NVIDIA
