OCR It
详细介绍
产品定位
OCR It 是 Firecrawl 团队开源的浏览器 OCR 插件(GitHub 仓库 thiagotigaz/ocr-it),可在 20ms 内将不可复制的 PDF 或网页内容提取为可复制的文本,完全离线运行、无需 API Key,专治「拷贝下载就要开会员」的场景。
核心功能
以浏览器插件形式提供,支持快捷键框选识别区域,点击捕获即可复制文本;可滚动页面分多次捕获,把多页文字全部提取出来并导出保存。实测在质量与 Docling 相当的前提下,速度比 Docling 快近 300 倍,200 份 PDF 仅需 2.8 秒。
使用场景
适合从付费文档站(如文库)、扫描版 PDF、无法复制的网页中提取文字内容,供文档编辑、资料整理、喂给 AI 阅读等用途。完全离线运行,数据不外传。
开源与限制
项目基于 MIT 协议开源,可自行编译;目前擅长处理版式简单、文字清晰的页面,对标题、脚注、表格、数学公式混排的复杂版面仍有提升空间。





