duckdb-pdf
Read and extract content from PDF files in DuckDB — Poppler (text/words/lines/tables/metadata) + Tesseract OCR. A DuckDB community extension.
File Explorer
- MainDistributionPipeline.yml
- UPDATING.md
- pipeline.sql
- README.md
- rag_pdf_vss.sql
- description.yml
- embed_base14_fonts.py
- embed_tessdata.py
- extension-upload.sh
- gen_signed_pdf.py
- test_font_starved_redact.sh
- base14_fonts.hpp
- pdf_extension.hpp
- ocr_ops.cpp
- ocr_ops.hpp
- pdf_extension.cpp
- poppler_private_ops.cpp
- qpdf_ops.cpp
- qpdf_ops.hpp
- bad_garbage.pdf
- bad_text.pdf
- bad_truncated.pdf
- good1.pdf
- good2.pdf
- blank_split.pdf
- financial_right_aligned.pdf
- form_annots.pdf
- garbage_header.pdf
- gdocs_lists.pdf
- gen_blank_split.py
- gen_gdocs_lists.py
- gen_images_pdf.py
- gen_incremental_pdf.py
- gen_markdown_fixture.c
- gen_pdfa.py
- gen_redact.py
- gen_sign_cert.py
- gen_skewed_scan.py
- gen_table_fixtures.c
- hello.pdf
- images.pdf
- incremental.pdf
- markdown_fixture.pdf
- pdfa.pdf
- redact_secret.pdf
- ruled_lattice.pdf
- running_header.pdf
- scanned.pdf
- sign_cert.pem
- sign_key.pem
- sign_key_encrypted.pem
- signed.pdf
- signed_fixture_cert.pem
- signed_fixture_key.pem
- signed_tampered.pdf
- skewed_scan.pdf
- table.pdf
- text_as_pdf.pdf
- truncated.pdf
- two_pages.pdf
- zero.pdf
- copy_pdf_options.test
- copy_to_pdf.test
- pdf_blob.test
- pdf_chunks.test
- pdf_full_api.test
- pdf_images.test
- pdf_inspect.test
- pdf_lowlevel_api.test
- pdf_ocr_bundled_eng.test
- pdf_ocr_missing_model.test
- pdf_ocr_preprocess.test
- pdf_pdfa.test
- pdf_redact.test
- pdf_redact_lateral.test
- pdf_revisions.test
- pdf_scalars.test
- pdf_sign.test
- pdf_signatures.test
- pdf_split_blank.test
- pdf_to_markdown.test
- pdf_to_pdf.test
- pdf_to_png.test
- pdf_watermark.test
- pdf_write_page_images.test
- qpdf_ops.test
- qpdf_suite.test
- read_pdf_basic.test
- read_pdf_elements.test
- read_pdf_ignore_errors.test
- read_pdf_layout.test
- read_pdf_lines.test
- read_pdf_meta.test
- read_pdf_ocr.test
- read_pdf_ocr_words.test
- read_pdf_page_parallel.test
- read_pdf_parallel_scan.test
- read_pdf_tables.test
- read_pdf_text_layer.test
- read_pdf_validation.test
- read_pdf_words.test
- torture_concurrency.test
- torture_copy_pdf.test
- torture_idempotency.test
- torture_malformed.test
- torture_markdown.test
- torture_named_params.test
- torture_roundtrip.test
- write_pdf.test
- README.md
- COPYING
- d050000l.pfb
- LICENSE
- n019003l.pfb
- n019004l.pfb
- n019023l.pfb
- n019024l.pfb
- n021003l.pfb
- n021004l.pfb
- n021023l.pfb
- n021024l.pfb
- n022003l.pfb
- n022004l.pfb
- n022023l.pfb
- n022024l.pfb
- README.md
- README.upstream.md
- s050000l.pfb
- eng.traineddata
- LICENSE.tessdata_fast
- .clang-format
- .clang-tidy
- .editorconfig
- .gitattributes
- .gitignore
- .gitmodules
- CMakeLists.txt
- COOKBOOK.md
- duckdb
- extension-ci-tools
- extension_config.cmake
- LICENSE
- Makefile
- README.md
- ROADMAP.md
- vcpkg.json
# Use via CDN
jsDelivrjsDelivr serves any public GitHub repository as a CDN with zero setup. Pick a version and a file to get a ready-to-paste link and snippet.
Link
Example
// repository documentation
Was this content helpful?
(0 ratings)
