15 · 核心办公能力
PDF读取提取转换与轻工具
读 PDF 的重点不是生成一段流畅摘要,而是让每个关键结论都能回到页码、表格和原文。遇到扫描件、跨页表格和没有文本层的文件,要先识别限制。
读 PDF 的重点不是生成一段流畅摘要,而是让每个关键结论都能回到页码、表格和原文。遇到扫描件、跨页表格和没有文本层的文件,要先识别限制。
本章最终要解决的问题是:怎样读长 PDF、抽表格、转换并保留页码证据?
这一章怎么学
- 理解问题:怎样读长 PDF、抽表格、转换并保留页码证据?
- 完成练习:摘要、页码证据表、转换文件
每个办公任务都围绕真实文件、事实证据和可继续编辑的交付物展开。 阅读正文时,把注意力放在任务输入、真实动作、交付文件和人工判断点上。
资料说明:下面的具体步骤、案例和截图根据已收集的第三方教程重组。正文中的第一人称均指原教程作者,不代表曾俊本人的经历或实测;案例数字也不能直接视为官方承诺。

聊聊我是怎么用 WorkBuddy 把这套 PDF 工具,从一行代码打包成绿色版的 客户的PDF里夹着报价、LOGO、甚至别家的图纸,想删掉,却不敢用网上的工具——怕文件传上去就回不来了。 于是我让WorkBuddy给我写了一个,专门在我自己电脑上跑、文件不出本机的。 先说个真事。 QTD的工作主要是报价。如果客户的图纸上有需要外发询价的。每个公司一般都有保密协议,相关的信息需要保密(特别是客户的信息,如LOGO等)我要把敏感页删掉,再转发给PUR去询价。 我下意识想去搜个"PDF去水印在线工具"。手悬在回车键上,突然一激灵:这文件传上去,是真删了,还是被人悄悄存了一份?我赌不起。 我是安工,在制造业做报价和工程变更。那天我就想:这活儿,能不能有个工具,全程在我自己电脑上跑,文件不联网、不上传? 我把这念头跟WorkBuddy里的兰仔一说,它给我回了第一行能跑的代码。 起点:不是"我要写个软件",是"我有个麻烦" 很多人以为做工具得先会编程。我没系统学过。 我的起点很具体:一个.py脚本,兰仔用PDF处理类库帮我写出来的,功能就一个——把指定页删掉。我双击跑一下,"成了"。 那一刻我意识到:WorkBuddy不是让我去学编程,是让我的需求直接变成能跑的东西。 第一行代码长什么样 其实就是一段大白话需求:"读这个PDF,删掉第3页和5到8页,另存为新文件。" 兰仔把它翻译成代码。我不用看懂每一行,但我能确认"它理解对了我的意思"。★这点很重要——AI写代码不可怕,可怕的是你不知道它在干嘛。 从"能跑"到"能用":需求是我定的,活是它干的 一个能删页的脚本,离"工具"还差得远。接下来几轮,都是我在定需求,兰仔在实现: ▸删页不够,要脱敏——不是盖个白块糊弄,是把底层文字、图片真删掉,让别人用提取工具也拿不回来; ▸要能加"机密"水印,中文不能乱码; ▸要合并、拆分、PDF转图片; ▸后来还加了AES-256加密。 每加一个功能,兰仔先把我说的"人话"复述一遍,确认了再写。我坐在老板位上,只管"要什么",不管"怎么写"。 最关键的一条设计 我跟兰仔定了死规矩:所有编辑先动内存里的副本,只有点"保存"才真正写出;而且永远另存为新文件,绝不碰原稿。改错了?最多撤回20步。 教训:工具再智能,{{原稿安全得写死在流程里}},不能靠"记得别覆盖"。 从.py到双击即用:打包成绿色版 代码在我电脑上跑得欢,问题来了:同事也想用,难道让他们也装Python、配环境? 这就是"绿色版"要解决的——把Python、依赖库、我的代码,一起打包成一个exe,别人双击就能用,免安装、不写注册表、不联网、零依赖,甚至能塞进U盘带走。 我用WorkBuddy让兰仔走了标准打包流程(PyInstaller那一套):把脚本和依赖冻进一个文件夹,再压成zip分发。难点不是打包本身,是几个细节: ▸体积:依赖塞进去,包会有几十MB,得权衡带哪些库; ▸SmartScreen:没做代码签名,Windows会弹"已保护你的电脑",得在分发说明里教同事点"仍要运行"; ▸可信:我顺手做了个SHA256校验器,下载的人能比对官方值,确认文件没被改过。 为什么非要"绿色版" 因为要发给同事、发给客户对接人。他们电脑上什么环境都有,最稳的就是"什么都不依赖"。 要点:{{能跑在开发者电脑上≠能跑在别人电脑上}}。绿色版,就是把"我的环境"一起快递出去。 现在它躺在同事的U盘里 工具做完,我按上面说的打成绿色版,发给了常跟PDF打交道的几个同事。反馈就一句:"双击就能用,文件确实没联网。" 那一刻我挺感慨。从"客户PDF不敢用网工具"那个念头,到同事U盘里那个exe,中间隔着的不是编程功底,是一个敢把想法扔给AI、再自己把关需求的老板。 WorkBuddy没替我思考,但它让我的想法,跑得比我的手快。文件不联网,脑子不被绑住——这才是真安全。 ─────────────────────────────────── 想要这个工具?上一条《PDF工具分发说明》里有下载,全程离线、免费。 我是安工。关注「兰仔聊AI」,下次聊聊:怎么把更多"重复到想死"的活儿,也交给WorkBuddy。 如果你也常卡在"这个PDF不敢用网工具删",点个「在看」转给那个还在手工遮盖敏感信息的同事。安全的工具,该人人手一份。 #AI工具#WorkBuddy#兰仔聊AI#PDF#效率工具#人机协作
先判断你拿到的是哪一种 PDF
PDF 只是容器,里面可能是可复制的文本、扫描图片、混合排版、表格、合同附件或整本报告。处理前先检查页数、目录、文本层和目标页。能搜索文字的文件通常可以直接读取;只能看到图片的扫描件需要 OCR,识别结果必须抽查。密码保护、损坏文件和复杂跨页表格应先报告限制。
长 PDF 不适合直接要求“完整总结”。更稳的做法是先建立文档地图:目录、章节、页码范围、关键表格、附录和引用规则。接着围绕具体问题读取对应章节,最后再合并结论。这样能防止开头内容占满上下文,后半部分被忽略。
摘要必须带着证据走
建议让 WorkBuddy 同时交付两份内容:一份给人快速阅读的摘要,一份用于复核的证据表。
| 结论编号 | 结论 | 原文证据 | 页码 | 证据类型 | 状态 |
|---|---|---|---|---|---|
| C01 | 报告明确陈述的事实 | 保留关键原句 | 12 | 正文 | 已确认 |
| C02 | 根据两张表计算得到 | 列出表名与计算式 | 35、38 | 计算 | 需复核 |
| C03 | 材料不足 | 说明缺少什么 | — | 待补 | 未确认 |
摘要只使用“已确认”的事实。计算结论应保留单位、时间范围和公式;解释性判断写清它是作者观点、报告结论还是本文推断。
表格提取要单独验收
跨页表格常出现表头丢失、合并单元格错位、负号遗漏和单位只写在第一页的问题。提取时先记录表名、页码、列名和单位,再导出数据。验收至少检查首行、末行、合计行、一个含小数的单元格和一个跨页位置。发现布局无法可靠恢复时,保留原页码并要求人工录入关键数据。
转换 Word 或 Excel 时保存原 PDF,输出文件名带上“提取版”或“转换版”。转换文件用于继续编辑,原 PDF 继续承担证据底稿的角色。
把这一章真正跑一遍
下面这条任务可以直接放进 WorkBuddy。先用脱敏副本练习,确认无误后再替换成正式材料。
阅读 input/报告.pdf,输出摘要和“结论—证据—页码”表。没有文本证据的推断不得进入摘要;表格提取不确定时保留截图页码提示,但不要猜数值。
本章完成后,应留下这些结果:
- 摘要 已生成、能打开,关键内容能回到输入材料。
- 页码证据表 已生成、能打开,关键内容能回到输入材料。
- 转换文件 已生成、能打开,关键内容能回到输入材料。
最后再看一遍实际文件和变更记录。删除、覆盖、外发、发布、付款、审批和生产写入继续由有权限的人确认。遇到材料冲突、权限不足或外部状态不确定,让任务停下并列出待处理问题。
AI 办公产品教程 · 完整版