博文

目前显示的是标签为“Developer Manual”的博文

2026年PDF转Markdown工具横评-12款引擎实测对比

从 GitHub 高星项目到轻量命令行工具,覆盖 OCR 扫描件、数字原生 PDF、表格密集型文档三大场景。不只是参数罗列——给出具体选型建议和组合策略。 一、为什么你需要关注"PDF → Markdown"这件事 如果你在用 LLM 做 RAG(检索增强生成)、搭建个人知识库、或者批量处理文档做 AI 训练数据,你一定遇到过这个痛点: PDF 里的内容,LLM 读不懂或者读乱了 。 原因很简单:PDF 是一种"打印格式",不是"内容格式"。一个 PDF 页面可能把双栏论文的左右两栏混成一段不知所云的文字,也可能把表格拆成碎片,更不用说扫描件里的文字需要 OCR 才能提取。 而 Markdown 是 LLM 最友好的格式——结构清晰、语义明确、token 效率高。所以"PDF → Markdown"这道工序,几乎是每个 AI 知识工作流的必经之路。 这篇文章能帮你回答三个问题: 市面上一堆工具(PaddleOCR、MinerU、Docling、Marker……),到底哪个适合我的场景? 扫描件和数字 PDF 该用不同的工具吗? 有没有一个"通用组合"能覆盖 90% 的需求? 二、12 款工具速览(一表打尽) 工具 Stars 一句话定位 PDF→MD 表格 扫描件 CPU可用 协议 PaddleOCR 84.1k 百度出品的通用 OCR 引擎 ⭐⭐⭐ ⭐⭐⭐⭐⭐ ✅ ✅ Apache 2.0 MinerU 71.7k PDF→Markdown 专精 ⭐⭐⭐⭐⭐ ⭐⭐⭐⭐ ✅ ✅ Apache 2.0 定制 Docling 62.3k IBM 企业级文档理解 ⭐⭐⭐⭐⭐ ⭐⭐⭐⭐⭐ ✅ ✅ MIT Marker 36.6k 全格式→MD 全能手 ⭐⭐⭐⭐ ⭐⭐⭐⭐ ✅ ✅ 商用受限 EasyOCR 29.7k 三行代码上手的 OCR ⭐⭐ ❌ ✅ ✅ Apache 2.0 Surya 21k 3B 参数以下精度天花板 ⭐⭐⭐ ⭐⭐⭐⭐ ✅ ❌ 商用受限 olmOCR 17.6k All...

Git常用命令速查-从入门到高效协作

无需死记硬背,按使用场景整理 Git 高频命令,覆盖日常开发 90% 的需求。每个命令附带实际用法示例,看完就能用。 一、写在前面:Git 不是你想象的那么难 很多人学 Git 的体验是:第一天记了 20 个命令,第二天就忘了 15 个。这不是你的问题。 Git 的设计理念是"面向场景",不是"面向命令" 。你不该按字母顺序背命令,而应该按"我想做什么"来找命令。这篇文章就按这个思路组织。 读完这篇文章,你能搞定: - 把本地代码推送到 GitHub - 在团队中管理分支、合并代码、处理冲突 - 用 stash / reset / reflog 抢救翻车现场 - 看懂 git log 里那堆花里胡哨的输出 二、基础三板斧:从零到第一次 push 这是你装完 Git 后最先用到的几个命令,覆盖 80% 的单人开发场景。 2.1 初始化或克隆仓库 # 在已有项目目录里初始化 Git git init # 克隆远程仓库到本地 git clone https://github.com/user/repo.git # 克隆指定分支 git clone -b develop https://github.com/user/repo.git 2.2 工作区 → 暂存区 → 本地仓库 Git 的文件流转有三个区域,理解了就不会被 git status 搞晕: 工作区 (Working Directory) 暂存区 (Staging Area) 本地仓库 (Local Repo) │ git add │ git commit │ │ ──────────────────────────> │ ──────────────────────> │ │ │ │ └── 你正在编辑的文件 └── 准备提交的快照 └── 已保存的版本 # 查看当前状态(最常用,随时敲) git status ...