What problem does it solve?
This Skill automates a wide range of PDF tasks (text extraction, page manipulation, form handling, and document creation), reducing manual effort and enabling batch processing.
Core Features & Use Cases
- Extract text and tables from PDFs using pypdf, pdfplumber, and OCR when needed.
- Merge, split, rotate, and watermark PDFs; create new PDFs; fill fillable and non-fillable forms.
- Use cases: archiving, invoice processing, report generation, and mass document preprocessing.
Quick Start
Use Python to merge PDFs, extract text, and apply basic edits. For example:
- Merge PDFs:
from pypdf import PdfReader, PdfWriter
writer = PdfWriter()
for pdf in ['doc1.pdf','doc2.pdf']:
reader = PdfReader(pdf)
for page in reader.pages:
writer.add_page(page)
with open('merged.pdf', 'wb') as f:
writer.write(f)
- Extract text:
from pypdf import PdfReader
reader = PdfReader("document.pdf")
text = ""
for page in reader.pages:
text += page.extract_text() or ""
- Rotate first page:
reader = PdfReader("document.pdf")
writer = PdfWriter()
page = reader.pages[0]
page.rotate(90)
writer.add_page(page)
with open("rotated.pdf","wb") as f:
writer.write(f)