yuanduan-llm · 多模态模型产品线#
自研轻量多模态模型产品线, 9 个 mini 服务 + 2 个 yuanduan 正式模型, 4-6G 显存可跑
核心功能#
- QLoRA 微调 1.5B 编码模型: 15015 条样本 / 61MB → 训练 102 步 → 合并 → 转 GGUF
- before/after 对比测试 5 题 × 2 轮, 自动生成 Markdown 报告
- 多模态数据集: textscope / image_mini / video_mini / vl_image_mini
- 9 个 GPU 模型分时调度: 避免同时启动 OOM
- 生产 mock 模式: 无权重时返回合理结果, 方便联调
- OpenAI 兼容 API + 扩展 modal_data (text/image/audio/video 统一调度)
技术栈#
PyTorch, QLoRA 4bit, bitsandbytes, LoRA r=8, GGUF Q4_K_M, FastAPI, llama.cpp
关键指标#
- 效果提升: +69.5pp
- 延迟: P95 1.4s
- 吞吐: 8 RPS/worker