pdf-reader

Extract text, tables, and form data from PDF documents.

Updated Feb 26, 2026
One-click install
npx skills add https://github.com/gagan114662/exp --skill pdf-reader-gagan114662
Or copy as Structured Prompt for Agent
Please help me install this Agent Skill.
Skill: pdf-reader
Source: https://github.com/gagan114662/exp/tree/main/crates/openfang-skills/bundled/pdf-reader
Command: npx skills add https://github.com/gagan114662/exp --skill pdf-reader-gagan114662

SYSTEM DOCUMENTATION & REQUIREMENTS

💡 This Skill includes scripts (resource) and references (resource) components.

What problem does it solve?

This Skill addresses the challenge of extracting and interpreting information locked within PDF documents, making it accessible for analysis and use.

Core Features & Use Cases

  • Content Extraction: Extracts text, tables, and form data from various PDF types.
  • Data Structuring: Reconstructs tables and key-value pairs from forms.
  • Summarization & Analysis: Provides hierarchical summaries and can compare documents.
  • Use Case: Extract all tabular data from a financial report PDF and output it as a CSV file for further analysis.

Quick Start

Use the pdf-reader skill to extract all tables from the document 'financial_report.pdf'.

Frequently Asked Questions about pdf-reader

High-intent search queries and answers about installing and using this skill.

FAQPage Schema
How do I extract tables from a PDF document and export them as structured data?

To extract tables from PDF documents, you can reconstruct tabular data into structured formats like CSV. This allows you to pull financial or academic data from multi-column layouts and output it for further analysis.

Can I extract text from scanned PDFs that require OCR?

Yes, you can extract text from scanned PDFs using OCR. The extraction process supports optical character recognition to interpret image-based text, making scanned legal or financial documents accessible for analysis.

What is the best way to parse form data and key-value pairs from PDF files?

The best way to parse form data is by reconstructing key-value pairs directly from the PDF layout. This structuring process isolates form fields and their corresponding values, enabling accurate data extraction from various document types.

Does PDF extraction work for multi-column layouts in academic papers?

Yes, PDF extraction works effectively for multi-column layouts in academic papers. The analysis mechanism parses complex document structures, accurately differentiating columns to extract text and tables without mixing content.

Can I summarize and compare content across multiple PDF documents?

You can summarize and compare content across multiple PDF documents. The analysis provides hierarchical summaries of extracted text, enabling you to compare document contents and metadata across legal or financial reports.

How do I extract metadata from financial, legal, or academic PDFs?

To extract metadata from financial, legal, or academic PDFs, the analysis mechanism identifies document properties and structural information. This provides hierarchical summaries and contextual metadata for various document types.