انتقل إلى المحتوى
PDF والمستندات

Extract نص من PDF عبر الإنترنت

Pull كل selectable نص خارج من PDF — نسخ إنه أو تنزيل كما.txt.

Updated 231 uses Read the guide
مساحة الأداة
الدليل والتفاصيل

Extract Text from PDF

Turn text-based or scanned PDFs into editable text, page by page, directly in your browser.

Upload a PDF

MAX 30 MB

Drop your PDF here

Choose a PDF up to 30 MB and 100 pages. Your document stays in your browser while it is processed.

Text extraction and OCR run in your browser. Do not upload documents you are not authorized to process. Verify names, dates, amounts, and OCR text against the original PDF.

Editable text preview

NO FILE
Choose a PDF to begin.
PAGES
DIRECT TEXT
OCR PAGES

Text PDFs are extracted directly. OCR is used only for pages with no usable embedded text when Auto mode is selected.

GET MORE FROM THIS TOOL

الدليل والتفاصيل

Extract نص من PDF عبر الإنترنت

استخدم هذا PDF نص extractor إلى turn PDF مستندات إلى editable, searchable نص. رفع regular PDF مع selectable نص أو ممسوح ضوئيًا مستند أن احتياجات OCR, اختر ال صفحات أنت تحتاج, و مراجعة ال extracted محتوى قبل نسخ أو تنزيل إنه.

إنه هو مفيد لـ research ورق, تقارير, فواتير, يدوي, نماذج, worksheets, و آخر مستندات أنت خاص أو هي مصرح إلى عملية. بدلًا من ذلك من يدويًا retyping نص, أنت يمكن extract إنه صفحة بواسطة صفحة و اجعل corrections مباشرة في ال معاينة.

كيف إلى extract نص من PDF

  1. رفع أو drag و drop خاصتك PDF ملف.
  2. حدد كل صفحات أو أدخل صفحة نطاق, مثل كما 3-8, 10.
  3. اختر تلقائي OCR, دائمًا استخدم OCR, أو embedded-نص extraction فقط.
  4. حدد ال OCR language لـ ممسوح ضوئيًا مستندات.
  5. Extract ال نص و مراجعة إنه في ال editable معاينة.
  6. نسخ كل نص أو تنزيل ال نتيجة كما TXT ملف.

ال أداة preserves صفحة separators لذلك أنت يمكن انظر حيث كل قسم من نص came من.

نص-بناءً على PDF مقابل. ممسوح ضوئيًا PDF

ليس كل PDF stores له نص في ال نفس طريقة.

نص-بناءً على PDF

نص-بناءً على PDF يحتوي embedded, selectable نص. هذا هو شائع في تقارير, رقمي يدوي, exported مستندات, و research ورق. ال أداة يمكن read هذا نص مباشرة, أي هو عادةً أسرع و أكثر دقيق من OCR.

ممسوح ضوئيًا PDF

ممسوح ضوئيًا PDF هو made من صفحة صور, مثل كما ممسوح ضوئيًا ليس, receipts, books, أو طباعة نماذج. لأن ال نص هو part من صورة, إنه cannot عادةً يكون محدد. OCR, أو optical حرف recognition, analyzes ال صفحة صورة و يحول مرئي أحرف إلى editable نص.

OCR هو مفيد, لكن إنه هو ليس perfect. صغير نص, خط اليد, unusual fonts, low-جودة scans, tables, صيغة, و blurred صور يمكن ينتج recognition أخطاء. دائمًا تحقق مهم أسماء, تواريخ, مرجع أرقام, و المبلغ مقابل ال أصلي مستند.

Extract محدد صفحات فقط

أنت افعل ليس تحتاج إلى extract كل صفحة من طويل مستند. أدخل صفحة نطاق متى أنت فقط تحتاج محدد chapter, فاتورة صفحة, appendix, أو قسم.

على سبيل المثال:

  • all extracts كل صفحة
  • 3-8 extracts صفحات 3 من خلال 8
  • 1, 4, 7 extracts فردي صفحات
  • 2-5, 9, 12-14 combines متعدد نطاق

Extracting فقط ال صفحات أنت تحتاج يمكن اجعل مراجعة و organizing ال نص أسهل.

Editable PDF نص معاينة

بعد extraction, ال مخرجات يظهر في editable نص مساحة. أنت يمكن صحيح OCR أخطاء, إزالة unwanted سطر, أضف ليس, أو تحضير ال محتوى لـ translation, summarization, research, accessibility عمل, أو كتابة.

ال تنزيل TXT ملف reflects أي edits أنت اجعل في ال معاينة.

إزالة repeated headers و footers

كثير PDF repeat ال نفس مستند عنوان, صفحة رقم, company name, أو footer على كل صفحة. متى هذا خيار هو enabled, ال أداة تحقق لـ repeated الأول و الأخير سطر عبر متعدد صفحات و إزالة إياهم حيث ممكن.

مراجعة ال نتيجة بعد باستخدام هذا خيار لأن repeated سطر قد أحيانًا يكون meaningful محتوى.

خصوصية و مستند معالجة

مستندات يمكن تحتوي confidential معلومات. هذا أداة عملية PDF محتوى في متصفحك لـ نص extraction و OCR; ال PDF itself هو ليس sent إلى مستند-عملية server بواسطة ال أداة.

فقط رفع مستندات أنت هي مصرح إلى وصول و عملية. تجنب مشاركة confidential ملفات على عام أو untrusted جهاز, و واضح ال معاينة متى أنت هي مكتمل.

شائع PDF نص extraction يستخدم

  • نسخ نص من research ورق و أكاديمي articles
  • تحويل ممسوح ضوئيًا ليس إلى editable دراسة مادة
  • Extract فاتورة تفاصيل و report محتوى
  • تحضير خاص مستندات لـ translation أو summarization
  • اجعل مستند نص أسهل إلى استخدم مع screen readers
  • Reuse مصرح يدوي, نموذج, أو policy نص
  • إنشاء searchable ليس من ممسوح ضوئيًا صفحات
  • Export محدد PDF صفحات كما plain نص

PDF نص extractor FAQs

يمكن أنا extract نص من ممسوح ضوئيًا PDF?

نعم. حدد تلقائي OCR أو OCR لـ كل صفحة. ال أداة يستخدم OCR متى صفحة يفعل ليس تحتوي usable embedded نص.

لماذا يفعل extracted نص أحيانًا look مختلف من ال PDF?

PDF قد استخدم columns, floating نص boxes, tables, headers, و unusual layouts. ال extractor يستخدم sensible سطر-بناءً على قراءة ترتيب حيث ممكن, لكن معقد صفحات قد تحتاج يدوي تحرير afterward.

يمكن أنا نسخ نص من كلمة المرور-protected PDF?

أنت يمكن أدخل ال كلمة المرور فقط متى أنت هي مصرح إلى فتح ال مستند. إذا ال PDF cannot يكون فتح أو هو damaged, ال أداة سوف عرض error.

يمكن أنا extract نص من فقط قليل صفحات?

نعم. استخدم صفحة نطاق مثل كما 3-8 أو combine نطاق مثل كما 1-3, 7, 10-12.

يفعل OCR guarantee perfect نص?

لا. OCR accuracy يعتمد على scan جودة, language, font, resolution, خط اليد, و صفحة layout. تحقق critical تفاصيل قبل relying على extracted نص.

ما هو ال أفضل مخرجات تنسيق لـ بسيط editable نص?

TXT هو ideal لـ نظيف, lightweight, searchable نص. أنت يمكن فتح إنه في Notepad, TextEdit, كلمة, Google Docs, أو معظم كتابة و research أدوات.