بیشتر از ۵۰ درصد فایلهای PDF که وارد پایپلاینهای RAG یا پردازش داده میشن، کاملاً متنی هستن و اصل…
انتشار: 2026/08/05 13:31 UTCدریافت: 2026/08/14 15:17 UTCآخرین مشاهده: 2026/08/14 15:17 UTC
بیشتر از ۵۰ درصد فایلهای PDF که وارد پایپلاینهای RAG یا پردازش داده میشن، کاملاً متنی هستن و اصلاً نیازی به مدلهای گرانقیمت Vision یا سرویسهای سنگین OCR ندارند. اما خیلی از سیستمها بدون تفکیک، همه فایلها رو سمت مدلهای بصری یا سرویسهای ابری میفرستن که هم هزینه رو بالا میبره و هم چند ثانیه تاخیر به فرایند اضافه میکنه.تیم Firecrawl برای حل این چالش کتابخانه متنباز pdf-inspector رو با Rust توسعه داده که با سرعت فوقالعاده بالا فایلهای PDF رو کلاسیفای و استخراج میکنه:• تشخیص هوشمند نوع سند (۱۰ تا ۵۰ میلیثانیه): فایل رو بررسی میکنه تا ببینه متنی (TextBased)، اسکنشده (Scanned) یا ترکیبی (Mixed) هست. با این کار فقط صفحاتی که واقعاً عکس هستن رو سمت OCR میفرستید.• تبدیل به مارکداون تمیز (زیر ۲۰۰ میلیثانیه): اسناد متنی رو بهصورت محلی به Markdown تبدیل میکنه؛ همراه با حفظ ساختار چندستونی، جدولها، تیترها و فونتها.• سرعت بینظیر: در بنچمارک روی ۲۰۰ سند، کل مجموعه رو ظرف ۰.۴۷ ثانیه پردازش کرده (در مقایسه با ۱۶ تا ۱۷ ثانیه برای PyMuPDF4LLM و MarkItDown).• بدون مدل ML و سبک: کاملاً با Rust نوشته شده و هیچ مدل سنگینی نداره. بایندرهای آماده برای Python، Node.js، WebAssembly و CLI هم داره.نمونه استفاده در پایتون:import pdf_inspectorresult = pdf_inspector.process_pdf("document.pdf")# تشخیص نوع سندprint(result.pdf_type) # "text_based", "scanned", "mixed"# خروجی مارکداونprint(result.markdown)لینک ریپوزیتوری گیتهاب:github.com/firecrawl/pdf-inspector%F0%9F%… @Ai_Tv