Trích xuất văn bản từ PDF

Lấy chữ ra khỏi file PDF để đọc hoặc chép ngay. Chạy được với mọi PDF có lớp văn bản thật.

…

Chạy hoàn toàn trong trình duyệt — file của bạn không rời khỏi máy.

Cách sử dụng

  1. Chọn file PDFKéo thả tài liệu vào khung, hoặc bấm để chọn.
  2. Chọn cách xuấtGiữ ngắt dòng để bám sát bố cục gốc, tắt đi thì chữ chạy liền thành đoạn. Bật đánh dấu trang nếu cần biết mỗi trang bắt đầu từ đâu.
  3. Chép hoặc tải vềVăn bản hiện ngay trên trang — bấm một nút để chép, hoặc lưu thành file .txt.

Vì sao công cụ này chạy ngay trong trình duyệt

Mọi bước đều diễn ra trên máy bạn bằng WebAssembly. Không có gì được tải lên, nên không phải xếp hàng chờ, không bị giới hạn dung lượng theo máy chủ, và không có bản sao tài liệu nằm trong kho lưu trữ của ai khác.

Câu hỏi thường gặp

Không ra chữ nào, vì sao?
Tài liệu gần như chắc chắn là bản scan. Trang scan là ảnh chụp của chữ chứ không phải chữ, nên không có gì để trích. Muốn đọc được phải dùng OCR, đó là một quy trình khác.
Có giữ nguyên bố cục gốc không?
Gần đúng. Ngắt dòng được dựng lại từ vị trí các từ trên trang, cách này chạy tốt với tài liệu thông thường. Trang chia nhiều cột và bảng phức tạp sẽ ra theo thứ tự đọc chứ không theo thứ tự nhìn thấy.
File PDF của tôi có được tải lên máy chủ không?
Không. Mọi công cụ chạy trong trình duyệt bằng WebAssembly. File không bao giờ rời khỏi máy bạn, không phải chờ tải lên, và chúng tôi không có gì để lưu hay xoá.