碩士論文研究 · CISC7498
Hachimi v4 數字人系統
Hoi Hou Hong · Prof. Derek F. Wong
現代數字人系統的結構與功能改進 — 低延遲、廣東語支持、本地/雲端雙模式的即時互動數字人。
使用的技術
WebRTCFastAPIaiortcFun-ASRvLLMQwen3-4BVoxCPMWav2LipRAGAWQ QuantizationPagedAttention Cantonese TTS
研究背景
數字人(Digital Human)是透過 CGI、AI 和 NLP 模擬人類外貌與智能的虛擬代理。 目標是創造自然、即時的人機互動體驗。
數字人進化三代
- • 第一代(CGI):電影驅動的真實感渲染(如《Final Fantasy》)
- • 第二代(生成式):深度學習唇形同步(如 HeyGen)— GAN、VAE、Diffusion
- • 第三代(互動式):LLM 整合的具身代理(如 Mio)— 多模態 AI 系統
專案目標
💰
低預算
可持續的本地 GPU 運行
⚡
高速度
端到端延遲約 2 秒
� cantonese
廣東語
原生語音和聲調支持
🎨
現代 UX
WebRTC 響應式界面
Hachimi v4 系統架構
- • 前端: Pure HTML/JS + WebRTC
- • 後端: FastAPI + aiortc 異步框架,處理 HTTP/WebSocket/WebRTC
- • 核心模組: ASR、LLM、TTS、Avatar 獨立子系統,支援熱插拔
- • Avatar 引擎: GPU 加速 Wav2Lip,批量推理 + 動態角色切換
子系統詳情
ASR 語音識別
• 本地:Fun-ASR-Nano (0.8B) — 31 語言,原生流式支持,VAD 邊界檢測
• 雲端:Alicloud FunASR Realtime
LLM 推理優化
• 引擎:vLLM + PagedAttention(2-4x 更高吞吐量)
• 本地:Qwen3-4B + AWQ 4-bit 量化(節省 70% VRAM)
• 雲端:Alicloud Qwen Plus
• Prompt:我是一個說廣東話的數字人助理,請用自然口語回應...
• 知識整合:本地 RAG via AnythingLLM + MCP servers
TTS 語音合成
• 本地:VoxCPM — 238.5 小時廣東語音頻微調(MCE + Common Voice),MOS 3.678
• 雲端:Alicloud CosyVoice v3 / MiniMax Speech-2.6-turbo(最佳廣東語質量)
Avatar 引擎:Wav2Lip 優化
• 算法:GAN 驅動唇形同步,基於 Mel-spectrogram 特徵
• 創新:Mirror Indexing 消除 IDLE 循環中的視覺不連貫
• 管道:音頻隊列、音頻幀隊列、特徵隊列、輸出幀隊列
• 批量推理:4 幀一次 GPU 推理,穩定 25 FPS
廣東語深度本地化
Bart-Cantonese 模組處理:
- • 數字轉換規則(12:30 → 十二點半)
- • 英文名詞與數字處理
輸入:
"要不然我們明天12:30去MACDONALD吧?"
輸出:
"不如我地聽日十二點半去MACDONALD啦?"
六層加速優化
ASR 六層加速
CUDA GPU 加速 → cuDNN 優化 → asyncio 異步 I/O → FunASR 優化 → VAD 語音檢測 → 流式識別
LLM 六層加速
AWQ 4-bit 量化 → Flash Attention → FP16 推理 → PagedAttention → KV Cache → 流式輸出
TTS 六層加速
GPU BF16 加速 → 多線程架構 → torch.compile → Flow Matching → LoRA 微調 → 並行預取
Avatar 六層加速
VRAM 預加載 → CUDA Streams → 批量推理(Batch=4) → MelSpectrogram GPU → Wav2Lip U-Net → IDLE 優化
效能評估
2.1 秒
端到端延遲(E2E Latency)
測試環境:RTX 5090, EPYC 7K62, 128GB DDR4
領先水平
ASR 廣東語 CER
3.678
TTS MOS (VoxCPM)
25 FPS 穩定
Avatar 幀率
150ms
TTS 首字延遲