Cấu trúc, được dựng lại
Các cấp tiêu đề, danh sách, trích dẫn khối, và mã được trả về dưới dạng cú pháp markdown, và bố cục hai cột được đọc theo từng cột thay vì đọc ngang qua trang.
Các trình chuyển đổi cạnh tranh nhau ở thứ chúng giữ lại. Thứ làm hỏng bản markdown chính là dòng tiêu đề chạy lặp lại trên cả bốn trăm trang.
Một tệp PDF lưu các glyph tại các vị trí; cấu trúc mà bạn nhìn thấy không được ghi lại ở bất kỳ đâu trong đó. Việc dựng lại cấu trúc ấy, loại bỏ những gì lặp lại, và xử lý các bảng là những gì ba mục dưới đây làm.
Các cấp tiêu đề, danh sách, trích dẫn khối, và mã được trả về dưới dạng cú pháp markdown, và bố cục hai cột được đọc theo từng cột thay vì đọc ngang qua trang.
Tiêu đề chạy, chân trang, số trang, hình chìm, và dòng bảo mật trên mỗi trang đều bị lấy ra — cùng với những từ bị gạch nối qua ngắt trang. Bạn nhận được danh sách những gì đã bị bỏ đi.
Các bảng được trả về dưới dạng bảng markdown, và một bảng chạy qua ngắt trang được nối lại thay vì bắt đầu lại. Ở chỗ một ô được gộp không thể ánh xạ gọn gàng, điều đó được nói rõ ra thay vì đoán.
Ba bước từ một PDF đến markdown mà bạn có thể đưa thẳng vào một pipeline.
Một tệp hoặc cả một thư mục. Việc một người hay một mô hình đọc kết quả sẽ thay đổi thứ đáng giữ lại, nên cần nói rõ là trường hợp nào.
Nó tìm ra các cấp tiêu đề từ cách tài liệu dùng kiểu chữ, sắp xếp các cột, ánh xạ các bảng, và lấy ra mọi thứ lặp lại trên mỗi trang.
Kiểm tra danh sách những gì đã bị lấy ra trước khi bản markdown đi đến bất cứ đâu. Lưu lượt chạy thành một Playbook để lô tiếp theo từ cùng nguồn được xử lý y hệt.
Giữ lại mọi thứ thì dễ. Quyết định thứ gì không nên sống sót qua chuyến đi mới là công việc thực sự.
Không có cấp tiêu đề nào được lưu trong một PDF, và cũng không có đoạn văn — chỉ có các ký tự được đặt tại các tọa độ với một cỡ chữ nhất định. Mọi trình chuyển đổi đều đang suy ra cấu trúc từ cỡ chữ và khoảng cách, đó là lý do hai trình khác nhau cho ra bản markdown khác nhau từ cùng một tệp.
.jpeg&w=1920&q=75)
Cả nhóm sản phẩm cạnh tranh ở khả năng bảo toàn — giữ bảng, giữ tiêu đề. Nhưng một số trang và một dải bảo mật xuất hiện cứ mỗi năm trăm từ thì được bảo toàn trung thành mà lại gây hại, vì bất cứ thứ gì đọc tiếp sau đó đều phải bước qua chúng trong từng đoạn. Việc loại bỏ xứng đáng là một tính năng.
.jpeg&w=1920&q=75)
Trong một pipeline, markdown là thứ trung gian — được tạo ra, được nhúng, và không bao giờ được con người mở ra. Nên khi câu trả lời trả về sai, mô hình bị đổ lỗi còn khâu chuyển đổi thì không. Đó là lý do bước này nên cho bạn biết nó đã làm gì thay vì đưa bạn một thứ trông có vẻ sạch sẽ.
.jpeg&w=1920&q=75)
Các tài liệu từ cùng một nguồn chia sẻ phần trang của chúng — cùng một dải băng, cùng một chân trang. Khi điều đó đã được nhận diện ở tệp đầu tiên, ba trăm tệp còn lại được xử lý theo cùng một cách. AllyHub của bạn không bao giờ bắt đầu lại từ đầu nữa, nên mỗi lần nhập hàng loạt lại nhanh hơn.
.jpeg&w=1920&q=75)
Các nhóm xây dựng pipeline truy xuất, những người chuyển tài liệu vào ghi chú, các nhóm tài liệu đưa PDF vào quản lý phiên bản, và các kho lưu trữ dài hạn.
Bộ chia đoạn không biết rằng dòng nó vừa cắt chính là chân trang, nên chân trang lọt vào trong một đoạn vốn nói về chuyện khác. Nhân điều đó với mỗi trang trong kho ngữ liệu và việc truy xuất âm thầm tệ đi vì một lý do chẳng ai truy ngược về khâu nhập liệu.
Một tệp PDF nằm trong thư mục thực ra không thuộc về ghi chú của bạn — không thể liên kết tới, không thể trích dẫn ngay trong dòng, không thể tìm thấy bằng công cụ tìm kiếm bạn thực sự dùng. Chuyển đổi nó là điều biến nó thành một tài liệu nằm giữa các tài liệu của bạn thay vì một tệp đính kèm.
Một bản đặc tả đến dưới dạng PDF nằm ngoài hệ thống tài liệu: tìm kiếm riêng, lịch sử riêng, chỗ tra cứu riêng. Đưa nó vào nghĩa là nó được bảo trì cùng với mọi thứ khác thay vì trở thành tệp mà người ta quên mất là có tồn tại.
Một tệp PDF đọc được bây giờ và sẽ luôn khó chịu — khó tìm kiếm xuyên suốt, khó định dạng lại, gắn chặt với thứ đã tạo ra nó. Văn bản thuần với cấu trúc còn nguyên vẹn là phiên bản vẫn hữu ích khi công cụ gốc không còn.
Khám phá thêm các công cụ hỗ trợ AI trong nghiên cứu, nội dung và dữ liệu.

Amazon Bestsellers Scraper — pull any ranking list with rank position, ASIN, price, and rating. No code, no Amazon API, all marketplaces. Try AllyHub free.

Amazon Product Scraper — trích xuất dữ liệu sản phẩm có cấu trúc từ bất kỳ tên miền Amazon nào mà không cần mã hoặc API Amazon. Xuất JSON hoặc CSV. Dùng thử AllyHub miễn phí.

Amazon Niche Finder — bắt đầu từ sở thích của bạn, một danh mục, hoặc một đối thủ cạnh tranh, và nhận điểm cho các ngách chưa được phục vụ tốt dựa trên nhu cầu so với cạnh tranh. Dùng thử AllyHub miễn phí.
Bảng, bản quét, chi phí, và điều gì xảy ra với mọi thứ lặp lại.
Nó biến một PDF thành văn bản thuần mang theo cấu trúc — tiêu đề thành dấu thăng, danh sách thành dấu đầu dòng, bảng thành các hàng ngăn bằng dấu sổ. Nó quan trọng hơn trước đây vì các mô hình ngôn ngữ và chỉ mục tìm kiếm đọc markdown tốt còn PDF thì kém, nên việc chuyển đổi giờ là bước đầu tiên của rất nhiều pipeline thay vì chỉ là một tiện ích thỉnh thoảng dùng.
Có, mỗi lần một tệp. Các gói trả phí dành cho những trường hợp lặp lại: cả thư mục trong một lượt, các tài liệu có mẫu mang phần trang riêng cần nhận diện, và giữ cho cách xử lý đó nhất quán để tệp thứ bốn trăm trông giống tệp đầu tiên.
Bảng đơn giản ánh xạ gọn gàng sang markdown. Ô được gộp và tiêu đề lồng nhau không có tương đương trong markdown, nên phải có gì đó nhường bước — và thay vì âm thầm làm phẳng chúng, những trường hợp đó được nêu ra, để bạn có thể quyết định xem bảng đó cần giữ dưới dạng ảnh hay được tái cấu trúc bằng tay.
Hiện tại thì không. Một trang quét là ảnh của văn bản chứ không phải văn bản, và đọc ảnh không phải là việc công cụ này làm hiện nay. Có một cách kiểm tra nhanh: mở PDF và thử chọn một câu bằng con trỏ. Nếu chọn được, việc chuyển đổi cũng sẽ chạy; nếu không có gì được tô sáng, nó sẽ không chạy.
Hầu hết chỉ chuyển rồi dừng, đó là hình dạng đúng khi bạn chỉ có một tệp. Cái này được xây cho bốn trăm tệp từ cùng một nguồn: thứ gì được coi là phần trang trong mẫu đó được xác định một lần rồi áp dụng cho phần còn lại, và bạn được cho biết những gì đã bị loại bỏ thay vì phải tin rằng kết quả trông sạch sẽ là đầy đủ.