2026 · 最新訓練

Qwen2.5-7B 日語 QLoRA 微調

全自動日語語言模型微調流水線,使用 QLoRA + 4-bit 量化在 RTX 5090 上訓練。

45K+
訓練樣本數
9.5h
訓練時間
0.64
最終 Training Loss
0.32
最終 Eval Loss

使用的技術

Qwen2.5-7B-InstructQLoRA (4-bit)bitsandbytesLLaMA-FactoryLora Rank: 64Lora Alpha: 128BF16 + SDPACosine Scheduler

處理流程

1
環境安裝
setup_env.py
2
資料準備
prepare_data.py
3
QLoRA 訓練
LLaMA-Factory
4
LoRA 合併
權重融合
5
日語評測
20 Prompt

訓練配置

  • Epochs:3
  • Learning Rate:2.0e-4
  • Batch Size (per device):2
  • Gradient Accumulation:8
  • Cutoff Length:1024
  • Warmup Ratio:0.05
  • Validation Size:1%

資料集

  • databricks-dolly-15k-ja — 15,000 樣本 (kunishou/databricks-dolly-15k-ja)
  • llm-japanese-dataset — 30,000 樣本 (izumi-lab/llm-japanese-dataset)
  • ELYZA-tasks-100 — 100 樣本 (elyza/ELYZA-tasks-100)

評測結果(20 個日語 Prompt)

日常会話良好

自己紹介をしてください。

ビジネス敬語良好

上司へのメールで、会議の日程変更をお願いする文章を書いてください。

説明有知識錯誤

機械学習とは何ですか?初心者にわかりやすく説明してください。

創作良好

桜をテーマにした短い詩を書いてください。

翻訳・変換夾雜英文

次の文章を敬語に変換してください。

指示遵守準確

「感謝」という言葉を使った文を3つ作ってください。

結論

  • 訓練收斂 — Loss 從 0.64 降至 0.32,收斂良好
  • 日常會話 — 自我介紹、週末計劃等任務表現穩定
  • 商務敬語 — 郵件寫作格式正確,語氣適當
  • 知識問答 — 存在知識幻覺,需補充專業領域資料
  • 創作質量 — 短文本良好,長篇創作出現亂碼
  • 翻譯能力 — 翻譯結果夾雜英文,需加強多語言對齊

硬體環境

RTX 5090 (sm_120, 32GB VRAM) | PyTorch cu128 nightly + LLaMA-Factory

心得

這是首個使用 QLoRA + 4-bit 量化訓練的日語模型,大幅節省 VRAM 的同時保持了訓練效果。 流水線全自動化的設計讓日後快速實驗不同數據集和超參數變得更容易。 未來計劃改進知識問答和翻譯能力,特別是減少英文混用的問題。