ITADN

[OCR] Phase 2-2: 增强 VLMOCREngine 推理流程

#2367Closedmessere1 创建于 2026-01-01
M
messere1commented
## 📋 任务概述 增强 VLMOCREngine 的端到端推理流程,实现完整的推理接口,包括单图推理、批量推理和 URL 图像推理。 ## 🎯 目标 1. 完善端到端推理流程 2. 实现完整的推理接口 3. 优化图像预处理和 Prompt 构建 ## 📝 主要任务 ### 2.1 完善端到端推理流程 - [ ] 增强图像预处理 (`core/processor/image.py`) - 支持图像旋转校正 - 支持图像质量增强 - 支持多种图像格式 (JPEG, PNG, BMP, TIFF, WebP) - [ ] 优化 Prompt 模板 (`core/processor/prompt.py`) - 通用 OCR Prompt - 文档理解 Prompt - 表格识别 Prompt - 公式识别 Prompt - [ ] 增强结果解析 (`core/parser/result.py`) - 支持结构化输出解析 - 支持置信度提取 - 支持坐标信息提取 ### 2.2 实现完整推理接口 - [ ] 实现 `predict()` 方法 - 单图像推理 - 完整的处理流程 - 构建 OCRResponse - [ ] 实现 `predict_batch()` 方法 - 批量图像推理 - 批量预处理和后处理 - 性能优化 - [ ] 实现 `predict_url()` 方法 - 从 URL 下载图像 - 转换为标准请求 - 调用 predict() ## 📦 涉及文件 - `src/mindnlp/ocr/core/engine.py` - `src/mindnlp/ocr/core/processor/image.py` - `src/mindnlp/ocr/core/processor/prompt.py` - `src/mindnlp/ocr/core/parser/result.py` ## ✅ 验收标准 - [ ] 支持 4 种 OCR 任务类型 (general, document, table, formula) - [ ] 完整的预处理和后处理流程 - [ ] 三种推理接口正常工作 - [ ] 通过集成测试 ## 🔗 相关资源 - [PaddleOCR 推理流程](https://github.com/PaddlePaddle/PaddleOCR) - [Phase 2 设计文档](src/mindnlp/ocr/docs/Phase2_Inference_Design.md) ## 📅 优先级 **P0** - 核心功能,阻塞后续开发 --- **父 Issue**: #2348 **阶段**: Phase 2 - 模型推理功能实现 **依赖**: #2363 (Phase 2-1)
关闭于 2026-01-02 0 条评论