AuK — 騰訊混元開源語音基礎模型(生成+編輯)
- URL: https://www.facebook.com/will.fans/posts/1536637415157009/
- Date Saved: 2026-09-14
- Source: Facebook (Will 保哥的技術交流中心)
- Tags: ai-tools, asr
- Repo: https://github.com/Tencent-Hunyuan/AuK (848 stars)
Summary
- AuK 是騰訊混元團隊開源的語音基礎模型,參數量 1.5B
- 核心突破:把語音生成與編輯所有功能收斂至單一自然語言指令介面
- 支援的任務類型:
- 語音產生:Zero-shot TTS、Instruct TTS
- 內容編輯:歌詞編輯、語音內容編輯
- 聲學編輯:音高、語速、音量編輯
- 旁語言編輯:情緒、音色、去口音、非語言編輯、氣音轉換
- 增強與分離:語音增強、語音分離、音樂分離
- 兩個版本:標準版(高音質)、Flash 版(蒸餾技術,4 步快速推論)
- 支援 Apple Silicon、CPU 卸載(降低 VRAM 需求)
- MIT 授權,整合 ComfyUI 工作流
- 從純 TTS 走向全方位聲音編輯的統一模型
Notable Comments
- Will 保哥回覆:不只是 TTS,能力涵蓋語音生成、內容編輯、聲學編輯、旁語言編輯、增強與分離