Facebook (Will 保哥的技術交流中心)
ai-toolsasr
Original source

AuK — 騰訊混元開源語音基礎模型(生成+編輯)

Summary

  • AuK 是騰訊混元團隊開源的語音基礎模型,參數量 1.5B
  • 核心突破:把語音生成與編輯所有功能收斂至單一自然語言指令介面
  • 支援的任務類型:
    • 語音產生:Zero-shot TTS、Instruct TTS
    • 內容編輯:歌詞編輯、語音內容編輯
    • 聲學編輯:音高、語速、音量編輯
    • 旁語言編輯:情緒、音色、去口音、非語言編輯、氣音轉換
    • 增強與分離:語音增強、語音分離、音樂分離
  • 兩個版本:標準版(高音質)、Flash 版(蒸餾技術,4 步快速推論)
  • 支援 Apple Silicon、CPU 卸載(降低 VRAM 需求)
  • MIT 授權,整合 ComfyUI 工作流
  • 從純 TTS 走向全方位聲音編輯的統一模型

Notable Comments

  • Will 保哥回覆:不只是 TTS,能力涵蓋語音生成、內容編輯、聲學編輯、旁語言編輯、增強與分離