[OCR] Phase 2-2: 增强 VLMOCREngine 推理流程
## 📋 任务概述
增强 VLMOCREngine 的端到端推理流程,实现完整的推理接口,包括单图推理、批量推理和 URL 图像推理。
## 🎯 目标
1. 完善端到端推理流程
2. 实现完整的推理接口
3. 优化图像预处理和 Prompt 构建
## 📝 主要任务
### 2.1 完善端到端推理流程
- [ ] 增强图像预处理 (`core/processor/image.py`)
- 支持图像旋转校正
- 支持图像质量增强
- 支持多种图像格式 (JPEG, PNG, BMP, TIFF, WebP)
- [ ] 优化 Prompt 模板 (`core/processor/prompt.py`)
- 通用 OCR Prompt
- 文档理解 Prompt
- 表格识别 Prompt
- 公式识别 Prompt
- [ ] 增强结果解析 (`core/parser/result.py`)
- 支持结构化输出解析
- 支持置信度提取
- 支持坐标信息提取
### 2.2 实现完整推理接口
- [ ] 实现 `predict()` 方法
- 单图像推理
- 完整的处理流程
- 构建 OCRResponse
- [ ] 实现 `predict_batch()` 方法
- 批量图像推理
- 批量预处理和后处理
- 性能优化
- [ ] 实现 `predict_url()` 方法
- 从 URL 下载图像
- 转换为标准请求
- 调用 predict()
## 📦 涉及文件
- `src/mindnlp/ocr/core/engine.py`
- `src/mindnlp/ocr/core/processor/image.py`
- `src/mindnlp/ocr/core/processor/prompt.py`
- `src/mindnlp/ocr/core/parser/result.py`
## ✅ 验收标准
- [ ] 支持 4 种 OCR 任务类型 (general, document, table, formula)
- [ ] 完整的预处理和后处理流程
- [ ] 三种推理接口正常工作
- [ ] 通过集成测试
## 🔗 相关资源
- [PaddleOCR 推理流程](https://github.com/PaddlePaddle/PaddleOCR)
- [Phase 2 设计文档](src/mindnlp/ocr/docs/Phase2_Inference_Design.md)
## 📅 优先级
**P0** - 核心功能,阻塞后续开发
---
**父 Issue**: #2348
**阶段**: Phase 2 - 模型推理功能实现
**依赖**: #2363 (Phase 2-1)
关闭于 2026-01-02 0 条评论