hello-llm · 模型训练与部署示范#
端到端小模型微调工程示范, Webapp + 模型卡 + 训练流水线 + 优化文档
核心功能#
- Qwen1.5-0.5B-Chat 训练示例 (LoRA r=8 + 4bit NF4)
- Model Card 完整模板 (MODEL_CARD.md)
- 训练 → 评估 → 合并 → GGUF → Ollama 一键流程
- 5 大类优化文档: 训练 / 量化 / 工程化 / 流水线
- check_hw.py 环境体检脚本
技术栈#
Python, Transformers, QLoRA, GGUF, Ollama, FastAPI
关键指标#
- 延迟: <3s
- 吞吐: 20 RPS