Python PDF批量处理工具
Python编写的PDF批量处理工具,支持多个PDF合并、按页拆分、提取文字、添加水印、加密解密、旋转页面,是办公和文档处理的实用工具,无需安装付费PDF软件。
详细内容
from PyPDF2 import PdfReader, PdfWriter
import glob, os
# 合并PDF
merger = PdfWriter()
for f in sorted(glob.glob('pdf/*.pdf')):
merger.append(f)
print(f'添加: {f}')
merger.write('merged.pdf')
merger.close()
print('合并完成: merged.pdf')
# 提取文字
import pdfplumber
with pdfplumber.open('merged.pdf') as pdf:
text = ''
for page in pdf.pages:
text += page.extract_text() + '\n'
with open('output.txt', 'w', encoding='utf-8') as f:
f.write(text)
print('文字提取完成: output.txt')
适配环境
依赖环境:Python 3.7+,需安装PyPDF2和pdfplumber
使用说明
1.安装Python 3.7+
2.pip install PyPDF2 pdfplumber
3.保存为pdf_tool.py
4.将PDF放在pdf文件夹
5.python pdf_tool.py 运行
合并前按文件名排序
提取文字用pdfplumber更准确
水印支持文字和图片
加密后请牢记密码
扫描版PDF文字提取需要OCR
2.pip install PyPDF2 pdfplumber
3.保存为pdf_tool.py
4.将PDF放在pdf文件夹
5.python pdf_tool.py 运行
合并前按文件名排序
提取文字用pdfplumber更准确
水印支持文字和图片
加密后请牢记密码
扫描版PDF文字提取需要OCR
常见问题
问:能处理扫描版PDF吗?
答:可以合并拆分,但提取文字需要OCR(如pytesseract)
问:加密的PDF能处理吗?
答:需要先解密,脚本支持输入密码解密