PaddlePaddle/PaddleOCR
github.com原文 ↗
PaddleOCR 把 PDF 和图片转成 structured、LLM-ready 的 JSON/Markdown 数据。README 强调 100+ languages、70k+ stars,并提到 PaddleOCR-VL-1.6 0.9B 在 OmniDocBench v1.6 上达到 96.3% accuracy。它在 Trending 里的意义是 Document AI 正在成为 RAG/agent 应用的前置基础设施:没有可靠版面解析、表格、公式和坐标,后续 LLM 管线会从输入层就失真。
–浏览
评论 · Comments