ITADN

[OCR] Phase 2-1: 完善 Qwen2-VL 模型推理能力

#2366Closedmessere1 创建于 2026-01-01
M
messere1commented
## 📋 任务概述 完善 Qwen2-VL 模型的推理能力,实现完整的模型调用流程,支持多种图像输入格式和批处理推理。 ## 🎯 目标 1. 增强 `qwen2vl.py` 中的模型推理方法 2. 实现批处理推理功能 3. 支持动态分辨率和多种图像格式 ## 📝 主要任务 ### 1.1 增强模型推理方法 **参考**: Qwen2-VL 官方示例 - [ ] 完善 `generate()` 方法 - 支持动态分辨率设置 (min_pixels, max_pixels) - 支持多种图像输入格式 (本地路径、URL、base64) - 集成 `qwen_vl_utils.process_vision_info()` - 实现正确的 token trimming 和解码 - [ ] 新增 `prepare_inputs()` 方法 - 准备模型输入 - 应用对话模板 - 处理视觉信息 - [ ] 新增 `decode_output()` 方法 - 解码生成的输出 - 处理 token trimming - 返回文本结果 ### 1.2 支持批处理推理 **参考**: PaddleOCR 批处理模式 - [ ] 实现 `batch_generate()` 方法 - 批量处理输入消息 - 批量推理以提高吞吐量 - 批量解码输出 ## 📦 涉及文件 - `src/mindnlp/ocr/models/qwen2vl.py` - `src/mindnlp/ocr/models/base.py` ## ✅ 验收标准 - [ ] 支持 Qwen2-VL 标准消息格式 - [ ] 支持本地路径、URL、base64 三种图像输入 - [ ] 支持动态分辨率配置 - [ ] 批处理推理功能正常工作 - [ ] 通过单元测试 ## 🔗 相关资源 - [Qwen2-VL 官方文档](https://huggingface.co/Qwen/Qwen2-VL-2B-Instruct) - [Phase 2 设计文档](src/mindnlp/ocr/docs/Phase2_Inference_Design.md) ## 📅 优先级 **P0** - 核心功能,阻塞后续开发 --- **父 Issue**: #2348 **阶段**: Phase 2 - 模型推理功能实现
关闭于 2026-01-02 0 条评论