เอกสารที่สแกนหรือถ่ายรูปมา แม้จะเห็นตัวหนังสือชัด แต่ในไฟล์เป็นแค่ รูปภาพ จึงค้นหาคำหรือคัดลอกข้อความไปใช้ต่อไม่ได้ OCR (Optical Character Recognition) คือการให้คอมพิวเตอร์อ่านตัวอักษรจากภาพออกมาเป็นข้อความ
OCR ภาษาไทยทำได้ไหม
ได้ Tesseract ซึ่งเป็นโปรแกรม OCR แบบโอเพนซอร์ส มีข้อมูลภาษาไทย (รหัส tha) ในชุดข้อมูลภาษาของตัวเอง เครื่องมือของเราใช้ Tesseract.js ที่ทำงานในเบราว์เซอร์ และใช้ข้อมูลภาษาแบบ tessdata_best ซึ่งเผยแพร่ภายใต้สัญญาอนุญาต Apache-2.0
ทำในเครื่องคุณ ไม่ต้องอัปโหลด
เครื่องมือ OCR ภาษาไทย รันตัวอ่านข้อความเป็น WebAssembly ในเบราว์เซอร์
- ครั้งแรกเบราว์เซอร์จะโหลดตัวอ่านและข้อมูลภาษา (ไทยประมาณ 0.9 MB อังกฤษประมาณ 3 MB) จากเว็บของเรา
- ไฟล์ของคุณ ไม่ถูกส่งออกไปไหน และถูกล้างหลังดาวน์โหลด
- เหมาะกับเอกสารส่วนตัว เช่น สัญญา ใบเสร็จ หรือเอกสารราชการ
ผลลัพธ์ที่ได้
- PDF ที่ค้นหาได้: หน้าตาเหมือนเดิมทุกอย่าง แต่มีชั้นข้อความที่มองไม่เห็นซ้อนอยู่ ค้นหาคำและลากคัดลอกได้
- ไฟล์ข้อความ .txt: เอาไปวางต่อใน Word, Google Docs หรือแชทได้ทันที
- เลือก ทั้งสองแบบ ได้ และคัดลอกข้อความจากหน้าเว็บได้เลยหลังอ่านเสร็จ
เคล็ดลับให้อ่านได้แม่นขึ้น
- คมชัด: ถ่ายในที่แสงพอ ไม่เบลอ ไม่มีเงามือ
- ตรง: ถ้าถ่ายเอียง ใช้ สแกนเป็น PDF ดึงมุมกระดาษให้ตรงก่อน แล้วค่อย OCR
- เลือกภาษาให้ตรง: เอกสารไทยปนอังกฤษใช้ "ไทย + อังกฤษ" เอกสารอังกฤษล้วนเลือก "อังกฤษ"
- ตัวอักษรไม่เล็กเกินไป: เราขยายหน้าให้ละเอียดราว 300 dpi ก่อนอ่านอยู่แล้ว แต่ต้นฉบับที่ตัวเล็กมากหรือความละเอียดต่ำยังอ่านพลาดได้
ข้อจำกัดที่ควรรู้
- ลายมือเขียน ฟอนต์ตกแต่ง และตัวอักษรบนพื้นลาย อ่านได้ไม่ดี
- ตารางอาจได้ข้อความเรียงไม่ตรงคอลัมน์
- ตรวจทานข้อความทุกครั้ง ก่อนนำไปใช้ โดยเฉพาะตัวเลขและชื่อ
ถ้าไฟล์ที่ได้ใหญ่เกินไป ใช้ ย่อขนาดไฟล์ PDF ต่อได้