ข้ามไปยังเนื้อหา
FileMyLove

ทำให้

OCR ภาษาไทยฟรี: แปลง PDF สแกนหรือรูปถ่ายเป็นข้อความที่ค้นหาและคัดลอกได้

OCR คืออะไร ใช้แปลงเอกสารสแกนเป็นข้อความภาษาไทยได้อย่างไร วิธีทำ PDF ที่ค้นหาได้ในเบราว์เซอร์โดยไม่อัปโหลดไฟล์ และเคล็ดลับให้อ่านได้แม่นขึ้น

โดย ทีมงาน FileMyLoveอ่าน 3 นาที

เอกสารที่สแกนหรือถ่ายรูปมา แม้จะเห็นตัวหนังสือชัด แต่ในไฟล์เป็นแค่ รูปภาพ จึงค้นหาคำหรือคัดลอกข้อความไปใช้ต่อไม่ได้ OCR (Optical Character Recognition) คือการให้คอมพิวเตอร์อ่านตัวอักษรจากภาพออกมาเป็นข้อความ

OCR ภาษาไทยทำได้ไหม

ได้ Tesseract ซึ่งเป็นโปรแกรม OCR แบบโอเพนซอร์ส มีข้อมูลภาษาไทย (รหัส tha) ในชุดข้อมูลภาษาของตัวเอง เครื่องมือของเราใช้ Tesseract.js ที่ทำงานในเบราว์เซอร์ และใช้ข้อมูลภาษาแบบ tessdata_best ซึ่งเผยแพร่ภายใต้สัญญาอนุญาต Apache-2.0

ทำในเครื่องคุณ ไม่ต้องอัปโหลด

เครื่องมือ OCR ภาษาไทย รันตัวอ่านข้อความเป็น WebAssembly ในเบราว์เซอร์

  • ครั้งแรกเบราว์เซอร์จะโหลดตัวอ่านและข้อมูลภาษา (ไทยประมาณ 0.9 MB อังกฤษประมาณ 3 MB) จากเว็บของเรา
  • ไฟล์ของคุณ ไม่ถูกส่งออกไปไหน และถูกล้างหลังดาวน์โหลด
  • เหมาะกับเอกสารส่วนตัว เช่น สัญญา ใบเสร็จ หรือเอกสารราชการ

ผลลัพธ์ที่ได้

  1. PDF ที่ค้นหาได้: หน้าตาเหมือนเดิมทุกอย่าง แต่มีชั้นข้อความที่มองไม่เห็นซ้อนอยู่ ค้นหาคำและลากคัดลอกได้
  2. ไฟล์ข้อความ .txt: เอาไปวางต่อใน Word, Google Docs หรือแชทได้ทันที
  3. เลือก ทั้งสองแบบ ได้ และคัดลอกข้อความจากหน้าเว็บได้เลยหลังอ่านเสร็จ

เคล็ดลับให้อ่านได้แม่นขึ้น

  • คมชัด: ถ่ายในที่แสงพอ ไม่เบลอ ไม่มีเงามือ
  • ตรง: ถ้าถ่ายเอียง ใช้ สแกนเป็น PDF ดึงมุมกระดาษให้ตรงก่อน แล้วค่อย OCR
  • เลือกภาษาให้ตรง: เอกสารไทยปนอังกฤษใช้ "ไทย + อังกฤษ" เอกสารอังกฤษล้วนเลือก "อังกฤษ"
  • ตัวอักษรไม่เล็กเกินไป: เราขยายหน้าให้ละเอียดราว 300 dpi ก่อนอ่านอยู่แล้ว แต่ต้นฉบับที่ตัวเล็กมากหรือความละเอียดต่ำยังอ่านพลาดได้

ข้อจำกัดที่ควรรู้

  • ลายมือเขียน ฟอนต์ตกแต่ง และตัวอักษรบนพื้นลาย อ่านได้ไม่ดี
  • ตารางอาจได้ข้อความเรียงไม่ตรงคอลัมน์
  • ตรวจทานข้อความทุกครั้ง ก่อนนำไปใช้ โดยเฉพาะตัวเลขและชื่อ

ถ้าไฟล์ที่ได้ใหญ่เกินไป ใช้ ย่อขนาดไฟล์ PDF ต่อได้