[OCR] Phase 2-1: 完善 Qwen2-VL 模型推理能力
## 📋 任务概述
完善 Qwen2-VL 模型的推理能力,实现完整的模型调用流程,支持多种图像输入格式和批处理推理。
## 🎯 目标
1. 增强 `qwen2vl.py` 中的模型推理方法
2. 实现批处理推理功能
3. 支持动态分辨率和多种图像格式
## 📝 主要任务
### 1.1 增强模型推理方法
**参考**: Qwen2-VL 官方示例
- [ ] 完善 `generate()` 方法
- 支持动态分辨率设置 (min_pixels, max_pixels)
- 支持多种图像输入格式 (本地路径、URL、base64)
- 集成 `qwen_vl_utils.process_vision_info()`
- 实现正确的 token trimming 和解码
- [ ] 新增 `prepare_inputs()` 方法
- 准备模型输入
- 应用对话模板
- 处理视觉信息
- [ ] 新增 `decode_output()` 方法
- 解码生成的输出
- 处理 token trimming
- 返回文本结果
### 1.2 支持批处理推理
**参考**: PaddleOCR 批处理模式
- [ ] 实现 `batch_generate()` 方法
- 批量处理输入消息
- 批量推理以提高吞吐量
- 批量解码输出
## 📦 涉及文件
- `src/mindnlp/ocr/models/qwen2vl.py`
- `src/mindnlp/ocr/models/base.py`
## ✅ 验收标准
- [ ] 支持 Qwen2-VL 标准消息格式
- [ ] 支持本地路径、URL、base64 三种图像输入
- [ ] 支持动态分辨率配置
- [ ] 批处理推理功能正常工作
- [ ] 通过单元测试
## 🔗 相关资源
- [Qwen2-VL 官方文档](https://huggingface.co/Qwen/Qwen2-VL-2B-Instruct)
- [Phase 2 设计文档](src/mindnlp/ocr/docs/Phase2_Inference_Design.md)
## 📅 优先级
**P0** - 核心功能,阻塞后续开发
---
**父 Issue**: #2348
**阶段**: Phase 2 - 模型推理功能实现
关闭于 2026-01-02 0 条评论