สรุปสั้น ๆ (TL;DR)
- OCR ให้ผลเป็นข้อความดิบพร้อมค่าความมั่นใจรายคำ ส่วนการรู้ว่าตัวเลขไหนคือยอดรวมหรือเลขผู้เสียภาษีเป็นอีกขั้นหนึ่งที่เรียกว่า IDP
- OCR ภาษาไทยยากกว่าอังกฤษ เพราะไม่เว้นวรรคระหว่างคำ มีสระและวรรณยุกต์ซ้อนหลายชั้น และมีตัวอักษรหน้าตาคล้ายกัน เช่น ด/ต และ บ/ป
- Tesseract (โอเพนซอร์ส) และ Google Cloud Vision รองรับภาษาไทยทั้งคู่ แต่ความแม่นขึ้นกับคุณภาพภาพ จึงควรทดสอบกับเอกสารจริงของตัวเอง 50 ถึง 100 ใบ
- ข้อความที่ดึงจากสำเนาบัตรหรือแบบฟอร์มเป็นข้อมูลส่วนบุคคลตาม พ.ร.บ. คุ้มครองข้อมูลส่วนบุคคล พ.ศ. 2562 ต้องจำกัดฟิลด์ สิทธิ์เข้าถึง และระยะเวลาเก็บ
OCR คือ เทคโนโลยีที่อ่านตัวอักษรจากภาพหรือไฟล์สแกน แล้วแปลงออกมาเป็นข้อความที่คอมพิวเตอร์ค้นหา แก้ไข และส่งต่อเข้าระบบได้ สำหรับเจ้าของธุรกิจ ความหมายที่ใช้ได้จริงคือ OCR ช่วยลดงานพิมพ์ข้อมูลจากใบแจ้งหนี้ ใบเสร็จ สัญญา หรือนามบัตรเข้าระบบด้วยมือ แต่ผลลัพธ์จะมีประโยชน์ก็ต่อเมื่อข้อมูลที่อ่านได้ถูกตรวจสอบและไหลต่อไปยัง ERP, CRM หรือระบบการตลาดที่ทีมใช้อยู่จริง
บทความนี้เขียนสำหรับเจ้าของกิจการ ผู้จัดการฝ่ายบัญชี และนักการตลาดที่ได้ยินคำว่า OCR จากผู้ขายซอฟต์แวร์แล้วอยากรู้ว่ามันทำอะไรได้ ทำอะไรไม่ได้ ภาษาไทยมีปัญหาเฉพาะตรงไหน และควรเริ่มจากเอกสารประเภทไหนก่อน โดยไม่ต้องมีพื้นฐานการเขียนโปรแกรม
OCR คืออะไร อธิบายแบบไม่ต้องเป็นโปรแกรมเมอร์
OCR ย่อมาจาก Optical Character Recognition แปลตรงตัวว่าการรู้จำตัวอักษรด้วยแสง ลองนึกถึงไฟล์ PDF ที่ได้จากเครื่องสแกน หรือรูปถ่ายใบเสร็จจากมือถือ สำหรับคอมพิวเตอร์ ไฟล์พวกนี้เป็นแค่จุดสีเรียงกันเป็นภาพ ยังไม่มีคำว่า "ยอดรวม" หรือเลข "12,500.00" อยู่ในนั้นในรูปที่ค้นหาได้ ถ้าลองกด Ctrl+F หาคำในไฟล์สแกนแล้วไม่เจอ นั่นคือสัญญาณว่าไฟล์ยังไม่ผ่าน OCR
หลังผ่าน OCR ไฟล์เดิมจะได้ชั้นข้อความเพิ่มขึ้นมา ทำให้ค้นหาได้ คัดลอกได้ และที่สำคัญกว่าสำหรับธุรกิจคือ ส่งข้อความนั้นต่อไปให้ระบบอื่นประมวลผลได้ เช่น ดึงเลขที่ใบกำกับภาษี วันที่ และยอดเงินไปลงในระบบบัญชี
สิ่งที่ควรเข้าใจตั้งแต่ต้นคือ OCR อย่างเดียวให้ผลเป็น "ข้อความดิบ" คือรู้ว่าบนหน้ากระดาษมีตัวอักษรอะไรบ้าง แต่ยังไม่รู้ว่าตัวเลขไหนคือยอดรวม ตัวเลขไหนคือเลขประจำตัวผู้เสียภาษี งานแยกความหมายแบบนั้นเป็นอีกชั้นหนึ่งที่จะพูดถึงในหัวข้อ IDP ด้านล่าง
OCR ทำงานอย่างไร ทีละขั้น
ระบบ OCR แต่ละเจ้ามีรายละเอียดต่างกัน แต่ขั้นตอนหลักคล้ายกัน การรู้ขั้นตอนพวกนี้ช่วยให้เข้าใจว่าทำไมเอกสารบางใบอ่านได้ดี บางใบอ่านผิดเยอะ
- รับภาพเข้า จากเครื่องสแกน กล้องมือถือ ไฟล์ PDF หรือรูปที่ลูกค้าส่งมาทางแชต คุณภาพภาพในขั้นนี้มีผลกับทุกขั้นที่ตามมา
- ปรับภาพก่อนอ่าน ระบบจะหมุนหน้าที่เอียงให้ตรง ลดจุดรบกวน ปรับความคมชัด และมักแปลงเป็นภาพขาวดำเพื่อแยกตัวอักษรออกจากพื้นหลัง รอยพับ เงามือ หรือตรายางทับตัวหนังสือจะทำให้ขั้นนี้ยากขึ้น
- วิเคราะห์เลย์เอาต์ ระบบแยกว่าส่วนไหนเป็นย่อหน้า ส่วนไหนเป็นตาราง ส่วนไหนเป็นโลโก้หรือรูป แล้วกำหนดลำดับการอ่าน เอกสารที่มีหลายคอลัมน์หรือตารางซ้อนกันมักผิดที่ขั้นนี้
- รู้จำตัวอักษร ระบบรุ่นใหม่ส่วนใหญ่ใช้โมเดล machine learning อ่านทีละบรรทัดหรือทีละคำ แทนการเทียบรูปร่างตัวอักษรทีละตัวแบบระบบยุคเก่า จึงรับมือกับฟอนต์ที่หลากหลายได้ดีขึ้น
- ตรวจแก้หลังอ่าน ใช้พจนานุกรมหรือโมเดลภาษาช่วยแก้คำที่อ่านผิดให้เป็นคำที่มีอยู่จริง และส่งออกผลเป็นข้อความ พร้อมตำแหน่งบนหน้าและค่าความมั่นใจ (confidence score) ของแต่ละคำ
ค่าความมั่นใจในขั้นสุดท้ายเป็นตัวเลขที่ธุรกิจควรสนใจ เพราะใช้ตั้งกติกาได้ เช่น คำไหนที่ความมั่นใจต่ำกว่าเกณฑ์ที่กำหนด ให้ส่งไปให้พนักงานตรวจก่อน แทนที่จะปล่อยเข้าระบบบัญชีทันที
OCR ภาษาไทยแม่นแค่ไหน และข้อจำกัดคืออะไร
ความแม่นของ OCR ภาษาไทยไม่มีตัวเลขเดียวที่ใช้ได้กับทุกกรณี เพราะขึ้นกับคุณภาพภาพ ฟอนต์ ประเภทเอกสาร และเครื่องมือที่ใช้ เอกสารพิมพ์ที่สแกนชัดมักอ่านได้ดี ส่วนรูปถ่ายเอียง ๆ ในที่แสงน้อยหรือลายมือเขียนมักผิดมากขึ้นอย่างเห็นได้ชัด วิธีที่ซื่อตรงที่สุดคือทดสอบกับเอกสารจริงของธุรกิจเอง แทนการเชื่อตัวเลขความแม่นในโบรชัวร์
ภาษาไทยมีลักษณะที่ทำให้ OCR ยากกว่าภาษาอังกฤษหลายจุด
- ไม่มีช่องว่างระหว่างคำ ระบบต้องตัดคำเองหลังอ่านตัวอักษร ถ้าตัดผิด การค้นหาและการดึงข้อมูลต่อก็ผิดตาม
- วรรณยุกต์และสระซ้อนหลายชั้น สระบน สระล่าง และวรรณยุกต์อยู่เหนือหรือใต้พยัญชนะ ถ้าภาพไม่คมหรือมีเส้นตารางทับ เครื่องหมายเล็ก ๆ เหล่านี้หายหรืออ่านสลับได้ง่าย
- ตัวอักษรหน้าตาคล้ายกัน เช่น ด กับ ต, บ กับ ป, ถ กับ ภ, ข กับ ช ในฟอนต์บางแบบหรือภาพความละเอียดต่ำ ความต่างเหลือแค่หางหรือหยักเล็ก ๆ
- เลขไทยและเอกสารสองภาษา ใบเสร็จและเอกสารราชการบางแบบใช้เลขไทย หรือปนไทยกับอังกฤษในบรรทัดเดียว ระบบต้องรองรับทั้งสองแบบ
- ลายมือ การอ่านลายมือไทยยังเป็นจุดที่ผลลัพธ์ไม่สม่ำเสมอ ถ้าเอกสารหลักของธุรกิจเป็นแบบฟอร์มเขียนมือ ควรวางแผนให้มีคนตรวจเสมอ
เครื่องมือที่รองรับภาษาไทยมีทั้งแบบโอเพนซอร์สอย่าง Tesseract ที่มีโมเดลภาษาไทยให้ดาวน์โหลด และบริการคลาวด์อย่าง Google Cloud Vision ที่รองรับภาษาไทย นอกจากนี้ยังมีผู้ให้บริการในประเทศที่ทำโมเดลเฉพาะเอกสารไทย เช่น บัตรประชาชนหรือใบกำกับภาษี การเลือกเครื่องมือจึงควรตัดสินจากผลทดสอบกับเอกสารจริง ไม่ใช่จากชื่อแบรนด์
OCR ต่างจาก AI Document Processing (IDP) อย่างไร
นี่คือจุดที่ผู้ซื้อสับสนบ่อยที่สุด OCR ตอบคำถามว่า "บนหน้านี้เขียนว่าอะไร" ส่วน IDP (Intelligent Document Processing) ตอบคำถามว่า "เอกสารนี้คืออะไร และข้อมูลแต่ละช่องหมายถึงอะไร" IDP ใช้ OCR เป็นขั้นแรก แล้วเพิ่มอีกหลายชั้นทับลงไป
- จำแนกประเภทเอกสาร แยกว่าไฟล์ที่เข้ามาเป็นใบแจ้งหนี้ ใบเสร็จ ใบสั่งซื้อ หรือสำเนาบัตร
- ดึงข้อมูลเป็นช่อง หยิบชื่อผู้ขาย เลขประจำตัวผู้เสียภาษี วันที่ ยอดก่อนภาษี ภาษีมูลค่าเพิ่ม และยอดรวม ออกมาเป็นฟิลด์ที่มีชื่อชัดเจน
- ตรวจความถูกต้อง เช่น เช็กว่ายอดก่อนภาษีบวกภาษีเท่ากับยอดรวมหรือไม่ เลขผู้เสียภาษีมี 13 หลักหรือเปล่า หรือผู้ขายรายนี้มีอยู่ในระบบแล้วหรือยัง
- ส่งให้คนตรวจเมื่อไม่แน่ใจ เรียกว่า human-in-the-loop คือเอกสารที่ผ่านทุกเงื่อนไขไหลเข้าระบบเอง ส่วนที่ไม่ผ่านจะเข้าคิวให้พนักงานดู
ในช่วงหลัง โมเดล AI ที่อ่านได้ทั้งภาพและข้อความ (multimodal) ถูกนำมาใช้ดึงข้อมูลจากเอกสารได้โดยตรงด้วย วิธีนี้ยืดหยุ่นกับเอกสารที่หน้าตาไม่เหมือนกันเลย แต่ก็มีโอกาสให้คำตอบที่ดูน่าเชื่อแต่ผิดได้ ขั้นตรวจความถูกต้องและคนตรวจจึงยังจำเป็นอยู่ ไม่ว่าจะใช้เทคโนโลยีแบบไหน
สรุปสั้น ๆ ถ้าต้องการแค่ทำให้ไฟล์สแกนค้นหาได้ OCR ก็พอ ถ้าต้องการให้ข้อมูลเข้าระบบบัญชีหรือ CRM โดยลดการพิมพ์ซ้ำ ต้องคิดแบบ IDP ตั้งแต่แรก ซึ่งเป็นงานออกแบบกระบวนการมากพอ ๆ กับงานเลือกซอฟต์แวร์ ดูรายละเอียดแนวทางนี้ได้ที่ บริการจัดการเอกสารและข้อมูลที่ไม่มีโครงสร้าง
ธุรกิจใช้ OCR กับเอกสารอะไรได้บ้าง
ตารางด้านล่างสรุปเอกสารที่ธุรกิจไทยมักเริ่มใช้ OCR ว่าดึงอะไรได้ และจุดที่มักพลาด เพื่อใช้ประเมินว่าควรเริ่มจากเอกสารไหน
| ประเภทเอกสาร | ข้อมูลที่มักดึงออกมา | จุดที่ควรระวัง |
|---|---|---|
| ใบแจ้งหนี้และใบกำกับภาษีจากผู้ขาย | ชื่อผู้ขาย เลขผู้เสียภาษี 13 หลัก วันที่ ยอดก่อนภาษี VAT ยอดรวม | แต่ละผู้ขายใช้เลย์เอาต์ต่างกัน ต้องมีขั้นตรวจยอดรวมกับยอดย่อย |
| ใบเสร็จค่าใช้จ่ายพนักงาน | ร้านค้า วันที่ ยอดเงิน ประเภทค่าใช้จ่าย | กระดาษความร้อนซีดเร็ว รูปถ่ายมือถือมักเอียงและมีเงา |
| สำเนาบัตรประชาชนและเอกสารเปิดบัญชีลูกค้า | ชื่อ เลขประจำตัว 13 หลัก ที่อยู่ วันหมดอายุ | เป็นข้อมูลส่วนบุคคลตาม PDPA ต้องจำกัดสิทธิ์เข้าถึงและระยะเวลาเก็บ |
| นามบัตรและแบบฟอร์มลงทะเบียนจากงานอีเวนต์ | ชื่อ ตำแหน่ง บริษัท อีเมล เบอร์โทร | ต้องมีหลักฐานความยินยอมก่อนนำไปส่งการตลาด ลายมือในแบบฟอร์มอ่านพลาดง่าย |
| สัญญาและเอกสารสแกนเก่า | ข้อความทั้งฉบับสำหรับค้นหา คู่สัญญา วันเริ่มและวันสิ้นสุด | เอกสารยาวหลายหน้า ตรายางและลายเซ็นทับข้อความ |
สำหรับนักการตลาด แถวนามบัตรและแบบฟอร์มงานอีเวนต์น่าสนใจเป็นพิเศษ หลังงานแสดงสินค้า ทีมขายมักได้นามบัตรกลับมาเป็นกอง ถ้าต้องพิมพ์เข้า CRM ด้วยมือ กว่าจะส่งอีเมลติดตามก็ผ่านไปหลายวัน การใช้ OCR อ่านนามบัตรแล้วส่งเข้าระบบพร้อมแท็กชื่องาน ช่วยให้เริ่ม การตลาดอัตโนมัติ เช่นอีเมลขอบคุณหรือลำดับข้อความติดตามผลได้เร็วขึ้น โดยมีเงื่อนไขว่าต้องมีความยินยอมรับข่าวสารที่บันทึกไว้ชัดเจน
ตัวอย่างสมมติ: เวลาที่ใช้ก่อนและหลังมี OCR
ตัวอย่างนี้เป็นกรณีสมมติเพื่ออธิบายวิธีคิด ไม่ใช่ข้อมูลจากธุรกิจจริง สมมติบริษัทจัดจำหน่ายแห่งหนึ่งได้รับใบแจ้งหนี้จากผู้ขายเดือนละ 600 ใบ พนักงานบัญชีใช้เวลาเฉลี่ยใบละ 4 นาทีในการเปิดไฟล์ อ่าน และพิมพ์ข้อมูลเข้าระบบ รวมเป็น 2,400 นาที หรือ 40 ชั่วโมงต่อเดือน
ถ้าหลังติดตั้งระบบ OCR และขั้นตรวจอัตโนมัติ มีใบแจ้งหนี้ครึ่งหนึ่งผ่านเข้าระบบเองโดยพนักงานแค่กดยืนยัน (สมมติใบละ 1 นาที) และอีกครึ่งต้องแก้บางช่อง (สมมติใบละ 2 นาที) เวลารวมจะเหลือ 300 + 600 = 900 นาที หรือ 15 ชั่วโมงต่อเดือน
ตัวเลขจริงของแต่ละธุรกิจจะต่างไปตามคุณภาพเอกสารและจำนวนผู้ขาย สิ่งที่ตัวอย่างนี้ชี้คือ ตัวแปรที่มีผลมากที่สุดไม่ใช่ความเร็วของ OCR แต่เป็นสัดส่วนเอกสารที่ผ่านได้โดยไม่ต้องแก้ ซึ่งขึ้นกับการออกแบบขั้นตรวจและคุณภาพไฟล์ที่ได้รับ วิธีวัดที่ดีคือจับเวลาเอกสาร 50 ถึง 100 ใบจริงก่อนเริ่มโครงการ แล้ววัดซ้ำด้วยวิธีเดียวกันหลังใช้งานไปหนึ่งเดือน
ต่อ OCR เข้ากับ ERP และ CRM อย่างไร
ข้อความที่ OCR อ่านได้ ถ้าจบอยู่ในโฟลเดอร์ก็แทบไม่ต่างจากไฟล์สแกนเดิม คุณค่าจริงเกิดตอนข้อมูลไหลเข้าระบบที่ทีมทำงานอยู่ทุกวัน เส้นทางที่พบบ่อยมีแบบนี้
- จุดรับเอกสาร เช่น อีเมลกลางที่ผู้ขายส่งใบแจ้งหนี้เข้ามา โฟลเดอร์บนคลาวด์ หรือการอัปโหลดผ่านแชต
- ขั้น OCR และดึงข้อมูล อ่านเอกสาร แยกเป็นฟิลด์ และให้ค่าความมั่นใจของแต่ละฟิลด์
- ขั้นจับคู่ข้อมูล เทียบชื่อผู้ขายหรือเลขผู้เสียภาษีกับข้อมูลหลักในระบบ เทียบกับใบสั่งซื้อที่เปิดไว้ และจับรหัสบัญชีหรือศูนย์ต้นทุน
- ส่งเข้าระบบปลายทาง ผ่าน API ของ ERP หรือ CRM เพื่อสร้างรายการตั้งหนี้ บันทึกค่าใช้จ่าย หรือสร้างรายชื่อผู้ติดต่อใหม่ พร้อมแนบไฟล์ต้นฉบับไว้อ้างอิง
- คิวตรวจและบันทึกการแก้ไข รายการที่ไม่ผ่านเงื่อนไขเข้าคิวให้คนดู และเก็บประวัติว่าใครแก้ช่องไหน เพื่อใช้ตรวจสอบย้อนหลังและปรับกติกาต่อ
ขั้นที่ 3 และ 4 คือที่ที่โครงการ OCR ส่วนใหญ่ใช้เวลามากที่สุด เพราะข้อมูลหลักในระบบเดิมมักไม่สะอาด เช่น ผู้ขายรายเดียวถูกบันทึกไว้หลายชื่อ หรือไม่มีเลขผู้เสียภาษี งานเชื่อมระบบลักษณะนี้คือเนื้องานของ การเชื่อมต่อและซิงก์ข้อมูล ERP และ CRM และถ้าข้อมูลกระจายอยู่หลายระบบ อาจต้องเริ่มจาก การควบรวมข้อมูลให้อยู่ในมาตรฐานเดียวกัน ก่อน
อีกเรื่องที่ควรเช็กก่อนลงทุนคือ เอกสารบางประเภทไม่จำเป็นต้องใช้ OCR เลย ถ้าผู้ขายส่งใบกำกับภาษีอิเล็กทรอนิกส์ (e-Tax Invoice) ที่มาพร้อมไฟล์ข้อมูลแบบมีโครงสร้าง การอ่านข้อมูลจากไฟล์นั้นโดยตรงแม่นกว่าการแปลงภาพกลับเป็นข้อความ OCR เหมาะกับเอกสารที่มีแต่ภาพหรือกระดาษเท่านั้น
ข้อควรระวังเรื่องข้อมูลส่วนบุคคลและ PDPA
เมื่อเอกสารถูกแปลงเป็นข้อความ ข้อมูลส่วนบุคคลที่เคยซ่อนอยู่ในรูปภาพจะถูกค้นหาได้ ถูกคัดลอกได้ และถูกส่งต่อได้ง่ายขึ้นมาก นี่เป็นทั้งข้อดีและความเสี่ยง พระราชบัญญัติคุ้มครองข้อมูลส่วนบุคคล พ.ศ. 2562 (PDPA) ใช้กับข้อมูลเหล่านี้ไม่ว่าจะอยู่ในรูปกระดาษ ภาพ หรือข้อความ
- ระบุวัตถุประสงค์ให้ชัด ข้อมูลจากสำเนาบัตรที่เก็บเพื่อยืนยันตัวตน ไม่ควรถูกนำไปใช้ทำการตลาดโดยไม่มีฐานทางกฎหมายรองรับ
- ดึงเฉพาะฟิลด์ที่จำเป็น ถ้าต้องการแค่ชื่อและเลขประจำตัว ไม่ต้องเก็บข้อมูลอื่นบนบัตรเป็นข้อความ
- รู้ว่าข้อมูลถูกประมวลผลที่ไหน บริการ OCR บนคลาวด์ส่งภาพเอกสารไปประมวลผลบนเซิร์ฟเวอร์ของผู้ให้บริการ ควรอ่านเงื่อนไขเรื่องการเก็บข้อมูล ตำแหน่งเซิร์ฟเวอร์ และการนำข้อมูลไปใช้ฝึกโมเดล และทำสัญญาประมวลผลข้อมูลให้เรียบร้อย
- จำกัดสิทธิ์และตั้งระยะเวลาเก็บ กำหนดว่าใครเห็นข้อความที่ดึงได้ และลบทั้งไฟล์ต้นฉบับและข้อความเมื่อพ้นระยะเวลาที่จำเป็น
- ระวังข้อมูลอ่อนไหว เอกสารทางการแพทย์หรือเอกสารที่มีข้อมูลสุขภาพ เป็นข้อมูลที่ PDPA กำหนดเงื่อนไขเข้มกว่าข้อมูลทั่วไป ควรปรึกษาผู้รับผิดชอบด้านกฎหมายก่อนนำเข้าระบบอัตโนมัติ
เริ่มโครงการ OCR อย่างไรให้คุ้ม
ลำดับที่ใช้ได้ดีกับธุรกิจขนาดกลางมักเริ่มจากเล็กแล้วขยาย
- เลือกเอกสารหนึ่งประเภท ที่มีปริมาณสูง รูปแบบค่อนข้างซ้ำ และมีคนเสียเวลากับมันทุกสัปดาห์ ใบแจ้งหนี้จากผู้ขายรายใหญ่ไม่กี่รายมักเป็นจุดเริ่มที่ดี
- เก็บชุดทดสอบ เอกสารจริง 50 ถึง 100 ใบ รวมทั้งใบที่ภาพไม่ดี เพื่อไม่ให้ผลทดสอบสวยเกินจริง
- ทดสอบเครื่องมือ 2 ถึง 3 ตัวกับชุดเดียวกัน นับจำนวนฟิลด์ที่ถูกต้องครบ ไม่ใช่นับแค่ตัวอักษร เพราะเลขยอดเงินผิดหนึ่งหลักก็ทำให้ทั้งรายการผิด
- ออกแบบกติกาตรวจและคิวคนตรวจ ก่อนเชื่อมเข้าระบบจริง
- วัดผลด้วยตัวเลขเดียวกับก่อนเริ่ม เช่น เวลาต่อเอกสาร สัดส่วนที่ผ่านโดยไม่ต้องแก้ และจำนวนข้อผิดพลาดที่หลุดไปถึงระบบบัญชี
OCR มักเป็นก้าวแรกของงานใหญ่กว่านั้น คือการเปลี่ยนกระบวนการที่พึ่งกระดาษให้เป็นข้อมูลที่ระบบใช้ต่อได้ ถ้ามองในภาพนั้น ควรวางแผนร่วมกับ การทำ Digital Transformation ทั้งองค์กร เพื่อไม่ให้แต่ละแผนกซื้อเครื่องมือแยกกันแล้วข้อมูลไม่เชื่อมกัน
OCR ในบริบทธุรกิจไทย
ธุรกิจไทยจำนวนมากยังรับเอกสารในรูปแบบที่หลากหลายในเวลาเดียวกัน ทั้งกระดาษตัวจริง PDF ทางอีเมล และรูปถ่ายที่ลูกค้าหรือผู้ขายส่งมาทาง LINE ความหลากหลายนี้ทำให้ขั้นรับเอกสารและขั้นปรับภาพสำคัญกว่าในหลายตลาด ระบบที่ทดสอบกับ PDF คมชัดอย่างเดียวอาจใช้ไม่ได้ดีกับรูปถ่ายใบเสร็จที่ส่งมาทางแชต
อีกเรื่องคือเอกสารภาษาไทยปนอังกฤษ และเอกสารราชการที่ใช้เลขไทยหรือปีพุทธศักราช ระบบต้องแปลงปี พ.ศ. เป็นรูปแบบวันที่ที่ระบบปลายทางรับได้ ถ้าไม่ได้ตั้งไว้ วันที่ในระบบบัญชีอาจคลาดไป 543 ปี ซึ่งเป็นข้อผิดพลาดที่พบได้จริงเมื่อระบบต่างประเทศเจอปี พ.ศ. ครั้งแรก การทดสอบกับเอกสารไทยจริงจึงสำคัญกว่าการดูรายการภาษาที่ผู้ให้บริการบอกว่ารองรับ
คำถามที่พบบ่อยเกี่ยวกับ OCR
OCR คืออะไร พูดสั้น ๆ
OCR คือเทคโนโลยีที่แปลงตัวอักษรในภาพหรือไฟล์สแกนให้เป็นข้อความที่คอมพิวเตอร์ค้นหาและนำไปใช้ต่อได้ ตัวมันเองอ่านข้อความออกมา แต่การรู้ว่าข้อความไหนคือยอดเงินหรือชื่อผู้ขายต้องใช้ขั้นดึงข้อมูลเพิ่มเติม
OCR อ่านภาษาไทยได้แม่นไหม
อ่านเอกสารพิมพ์ที่สแกนชัดได้ค่อนข้างดี แต่ความแม่นลดลงเมื่อภาพเอียง มีเงา ความละเอียดต่ำ หรือเป็นลายมือ ภาษาไทยมีจุดยากเฉพาะ เช่น ไม่เว้นวรรคระหว่างคำและมีวรรณยุกต์ซ้อนหลายชั้น จึงควรทดสอบกับเอกสารจริงของธุรกิจก่อนตัดสินใจ
OCR กับ IDP ต่างกันอย่างไร
OCR แปลงภาพเป็นข้อความ ส่วน IDP ใช้ OCR เป็นขั้นแรกแล้วเพิ่มการจำแนกประเภทเอกสาร การดึงข้อมูลเป็นช่อง การตรวจความถูกต้อง และคิวให้คนตรวจ ถ้าต้องการให้ข้อมูลเข้าระบบบัญชีหรือ CRM โดยตรง ต้องคิดแบบ IDP
ใช้ OCR กับสำเนาบัตรประชาชนผิด PDPA ไหม
ไม่ผิดโดยตัวมันเอง ถ้ามีฐานทางกฎหมายและวัตถุประสงค์ที่ชัดเจน เช่น การยืนยันตัวตนตามสัญญา แต่ต้องดึงเฉพาะข้อมูลที่จำเป็น จำกัดสิทธิ์ผู้เข้าถึง ตั้งระยะเวลาเก็บ และตรวจเงื่อนไขของผู้ให้บริการคลาวด์ที่ประมวลผลภาพ
ธุรกิจเล็กควรเริ่มใช้ OCR จากตรงไหน
ควรเริ่มจากเอกสารประเภทเดียวที่มีปริมาณมากและรูปแบบซ้ำ เช่น ใบแจ้งหนี้จากผู้ขายหลักไม่กี่ราย ทดสอบกับเอกสารจริง 50 ถึง 100 ใบ แล้วค่อยเชื่อมเข้าระบบบัญชีหรือ CRM เมื่อกติกาตรวจทำงานได้
สรุป
OCR คือจุดเริ่มต้นของการเปลี่ยนกระดาษให้เป็นข้อมูล ไม่ใช่ปลายทาง ธุรกิจที่ได้ประโยชน์จริงคือธุรกิจที่คิดต่อว่าข้อมูลที่อ่านได้จะถูกตรวจอย่างไร ไหลเข้าระบบไหน และใครดูแลข้อมูลส่วนบุคคลในแต่ละขั้น ถ้ากำลังพิจารณาเรื่องนี้และอยากได้มุมมองว่ากระบวนการเอกสารของธุรกิจควรเริ่มตรงไหน ทีม Relevant Audience ยินดีคุยเรื่อง การจัดการเอกสารและข้อมูล และการเชื่อมข้อมูลเข้ากับระบบที่ใช้อยู่







