碩士論文研究 · CISC7498

Hachimi v4 數字人系統

Hoi Hou Hong · Prof. Derek F. Wong

現代數字人系統的結構與功能改進 — 低延遲、廣東語支持、本地/雲端雙模式的即時互動數字人。

使用的技術

WebRTCFastAPIaiortcFun-ASRvLLMQwen3-4BVoxCPMWav2LipRAGAWQ QuantizationPagedAttention Cantonese TTS

研究背景

數字人(Digital Human)是透過 CGI、AI 和 NLP 模擬人類外貌與智能的虛擬代理。 目標是創造自然、即時的人機互動體驗。

數字人進化三代

  • 第一代(CGI):電影驅動的真實感渲染(如《Final Fantasy》)
  • 第二代(生成式):深度學習唇形同步(如 HeyGen)— GAN、VAE、Diffusion
  • 第三代(互動式):LLM 整合的具身代理(如 Mio)— 多模態 AI 系統

專案目標

💰
低預算
可持續的本地 GPU 運行
高速度
端到端延遲約 2 秒
� cantonese
廣東語
原生語音和聲調支持
🎨
現代 UX
WebRTC 響應式界面

Hachimi v4 系統架構

  • 前端: Pure HTML/JS + WebRTC
  • 後端: FastAPI + aiortc 異步框架,處理 HTTP/WebSocket/WebRTC
  • 核心模組: ASR、LLM、TTS、Avatar 獨立子系統,支援熱插拔
  • Avatar 引擎: GPU 加速 Wav2Lip,批量推理 + 動態角色切換

子系統詳情

ASR 語音識別

• 本地:Fun-ASR-Nano (0.8B) — 31 語言,原生流式支持,VAD 邊界檢測

• 雲端:Alicloud FunASR Realtime

LLM 推理優化

• 引擎:vLLM + PagedAttention(2-4x 更高吞吐量)

• 本地:Qwen3-4B + AWQ 4-bit 量化(節省 70% VRAM)

• 雲端:Alicloud Qwen Plus

• Prompt:我是一個說廣東話的數字人助理,請用自然口語回應...

• 知識整合:本地 RAG via AnythingLLM + MCP servers

TTS 語音合成

• 本地:VoxCPM — 238.5 小時廣東語音頻微調(MCE + Common Voice),MOS 3.678

• 雲端:Alicloud CosyVoice v3 / MiniMax Speech-2.6-turbo(最佳廣東語質量)

Avatar 引擎:Wav2Lip 優化

• 算法:GAN 驅動唇形同步,基於 Mel-spectrogram 特徵

• 創新:Mirror Indexing 消除 IDLE 循環中的視覺不連貫

• 管道:音頻隊列、音頻幀隊列、特徵隊列、輸出幀隊列

• 批量推理:4 幀一次 GPU 推理,穩定 25 FPS

廣東語深度本地化

Bart-Cantonese 模組處理:

  • • 數字轉換規則(12:30 → 十二點半)
  • • 英文名詞與數字處理
輸入:
"要不然我們明天12:30去MACDONALD吧?"
輸出:
"不如我地聽日十二點半去MACDONALD啦?"

六層加速優化

ASR 六層加速
CUDA GPU 加速 → cuDNN 優化 → asyncio 異步 I/O → FunASR 優化 → VAD 語音檢測 → 流式識別
LLM 六層加速
AWQ 4-bit 量化 → Flash Attention → FP16 推理 → PagedAttention → KV Cache → 流式輸出
TTS 六層加速
GPU BF16 加速 → 多線程架構 → torch.compile → Flow Matching → LoRA 微調 → 並行預取
Avatar 六層加速
VRAM 預加載 → CUDA Streams → 批量推理(Batch=4) → MelSpectrogram GPU → Wav2Lip U-Net → IDLE 優化

效能評估

2.1 秒

端到端延遲(E2E Latency)

測試環境:RTX 5090, EPYC 7K62, 128GB DDR4
領先水平
ASR 廣東語 CER
3.678
TTS MOS (VoxCPM)
25 FPS 穩定
Avatar 幀率
150ms
TTS 首字延遲

相關資源