สรุปสั้น ๆ (TL;DR)
- llm สร้างข้อความด้วยการคาดเดา token ถัดไปซ้ำๆ เรียนรู้ 2 ช่วง คือฝึกล่วงหน้าด้วยข้อความจำนวนมาก แล้วปรับแต่งด้วยตัวอย่างคำสั่งและคำตอบ ร่วมกับความเห็นจากคนว่าคำตอบไหนดีกว่า (RLHF)
- GPT (OpenAI), Gemini (Google), Claude (Anthropic) และ Llama (Meta แบบ open-weight) เป็น llm ที่รู้จักกันดี ชื่อรุ่นเปลี่ยนทุกครั้งที่ออกเวอร์ชันใหม่
- คำตอบมาจากข้อมูลฝึกที่มีวันตัดข้อมูล หรือจากการค้นเว็บและ RAG ซึ่ง RAG ช่วยลด hallucination ได้แต่ไม่ได้ทำให้หายไป
- สำหรับ GEO หน้าที่ตอบคำถามในประโยคแรกของแต่ละหัวข้อ มีตารางและข้อเท็จจริงที่ตรวจสอบได้ และระบบเข้าถึงได้ จะถูก AI อ้างอิงได้ง่ายกว่า
- ก่อนให้พนักงานใช้ llm ให้ตรวจเงื่อนไขการเก็บข้อมูลและการนำไปฝึกของแต่ละแผนบริการ และภาระตาม PDPA เมื่อมีการใส่ข้อมูลลูกค้า
llm คือ Large Language Model หรือโมเดลภาษาขนาดใหญ่ เป็นโปรแกรม AI ที่ถูกฝึกด้วยข้อความจำนวนมหาศาลจนสามารถอ่าน เขียน สรุป แปล และตอบคำถามเป็นภาษามนุษย์ได้ หลักการทำงานพื้นฐานของมันคือการคาดเดาคำถัดไปที่น่าจะตามมาทีละส่วน จนประกอบเป็นประโยคและคำตอบทั้งหมด บทความนี้อธิบายแบบไม่ต้องเป็นโปรแกรมเมอร์ ว่า llm ทำงานอย่างไร ต่างจาก generative AI และแชทบอทตรงไหน มีตัวอย่างอะไรบ้าง ตอบคำถามจากข้อมูลแหล่งใด ทำไมบางครั้งตอบผิดอย่างมั่นใจ ธุรกิจควรปรับ SEO และ GEO อย่างไรเมื่อคนเริ่มถาม AI แทนการค้นหา และต้องระวังเรื่องข้อมูลอะไรเมื่อนำมาใช้ในองค์กร
llm (large language model) คืออะไร ทำงานอย่างไร แบบไม่ต้องเป็นโปรแกรมเมอร์
วิธีเข้าใจ llm ที่ง่ายที่สุดคือนึกถึงฟีเจอร์เดาคำในแป้นพิมพ์มือถือ เวลาพิมพ์ว่า "สวัสดี" มือถืออาจเสนอคำว่า "ครับ" หรือ "ค่ะ" ให้เลือก llm ทำสิ่งคล้ายกันแต่ในระดับที่ใหญ่กว่ามาก มันดูข้อความทั้งหมดที่อยู่ตรงหน้า แล้วคำนวณว่าส่วนถัดไปที่น่าจะตามมาคืออะไร เลือกส่วนนั้น แล้วทำซ้ำไปเรื่อยๆ จนได้คำตอบยาวหลายย่อหน้า
ข้อความถูกแบ่งเป็นหน่วยย่อยที่เรียกว่า token ซึ่งอาจเป็นคำ ส่วนของคำ หรือเครื่องหมาย โมเดลไม่ได้อ่านตัวอักษรแบบที่คนอ่าน แต่ทำงานกับ token เหล่านี้ในรูปตัวเลข ภาษาไทยที่ไม่มีการเว้นวรรคระหว่างคำมักถูกตัดเป็น token ในแบบที่ต่างจากภาษาอังกฤษ ซึ่งเป็นเหตุผลหนึ่งที่ข้อความภาษาไทยความยาวเท่ากันอาจใช้จำนวน token ต่างจากภาษาอังกฤษ
ความสามารถของ llm มาจากสองช่วงหลัก
ช่วงที่ 1: การฝึกล่วงหน้า (pre-training)
โมเดลถูกป้อนข้อความจำนวนมหาศาลจากหลายแหล่ง เช่น หน้าเว็บสาธารณะ หนังสือ และเอกสารต่างๆ ตามที่ผู้พัฒนาแต่ละรายเลือก แล้วฝึกให้เดาส่วนถัดไปของข้อความซ้ำหลายพันล้านครั้ง ทุกครั้งที่เดาผิด ค่าภายในของโมเดลที่เรียกว่าพารามิเตอร์จะถูกปรับเล็กน้อย เมื่อทำซ้ำมากพอ โมเดลจะจับรูปแบบของภาษา ข้อเท็จจริงที่พบบ่อย และวิธีให้เหตุผลที่ปรากฏในข้อความได้ คำว่า "ขนาดใหญ่" ใน Large Language Model หมายถึงจำนวนพารามิเตอร์และปริมาณข้อมูลฝึกที่สูงมาก
ช่วงที่ 2: การปรับแต่งให้ทำตามคำสั่ง
โมเดลที่ผ่านแค่ช่วงแรกจะเขียนต่อข้อความได้ แต่ยังไม่ได้ตอบคำถามแบบผู้ช่วย ผู้พัฒนาจึงฝึกต่อด้วยตัวอย่างคำถามและคำตอบที่ดี และใช้ความเห็นจากคนจริงว่าคำตอบไหนดีกว่า (เทคนิคที่รู้จักกันในชื่อ RLHF) เพื่อให้โมเดลตอบตรงคำถาม สุภาพ และปฏิเสธคำขอที่เป็นอันตราย ผลลัพธ์คือผู้ช่วยแชทที่คนทั่วไปใช้กันอยู่
ประเด็นที่ควรจำคือ llm ไม่ได้ "ค้นหา" คำตอบจากฐานข้อมูลแบบเครื่องมือค้นหา โดยพื้นฐานแล้วมันสร้างข้อความใหม่จากรูปแบบที่เรียนรู้มา ซึ่งอธิบายทั้งจุดแข็ง (เขียนได้ลื่นไหล ปรับรูปแบบได้ทุกแบบ) และจุดอ่อน (ตอบผิดได้โดยดูมั่นใจ) ที่จะพูดถึงในหัวข้อถัดไป
llm ต่างจาก generative AI และ chatbot อย่างไร
สามคำนี้ถูกใช้ปนกันบ่อย แต่อยู่คนละระดับ generative AI เป็นคำกว้างที่สุด หมายถึง AI ทุกแบบที่สร้างเนื้อหาใหม่ได้ ทั้งข้อความ ภาพ เสียง และวิดีโอ llm เป็นกลุ่มย่อยของ generative AI ที่เชี่ยวชาญด้านภาษา ส่วน chatbot คือหน้าตาของโปรแกรมที่คุยโต้ตอบกับผู้ใช้ chatbot บางตัวใช้ llm อยู่เบื้องหลัง แต่ chatbot รุ่นเก่าจำนวนมากทำงานด้วยกฎที่เขียนไว้ล่วงหน้า เช่น ถ้าลูกค้าพิมพ์คำว่า "ราคา" ให้ตอบข้อความชุดหนึ่ง ซึ่งไม่ใช่ llm เลย
ตารางด้านล่างเปรียบเทียบสามแนวคิดนี้
| คำ | หมายถึง | ตัวอย่างการใช้งาน |
|---|---|---|
| generative AI | AI ที่สร้างเนื้อหาใหม่ได้ ทั้งข้อความ ภาพ เสียง วิดีโอ | สร้างภาพประกอบจากคำบรรยาย สร้างเสียงพากย์ |
| llm | generative AI ประเภทที่ทำงานกับภาษา ฝึกจากข้อความจำนวนมาก | เขียนร่างอีเมล สรุปรายงาน แปลเอกสาร |
| chatbot แบบกฎ | โปรแกรมโต้ตอบที่ตอบตามเงื่อนไขที่เขียนไว้ล่วงหน้า | เมนูตอบคำถามอัตโนมัติที่ให้กดเลือกหัวข้อ |
| chatbot ที่ใช้ llm | หน้าแชทที่ส่งข้อความไปให้ llm สร้างคำตอบ | ผู้ช่วย AI ที่พิมพ์ถามเป็นภาษาธรรมชาติได้ |
ปัจจุบันโมเดลหลายตัวรับข้อมูลได้มากกว่าข้อความ เช่น อ่านรูปภาพหรือไฟล์เอกสาร ซึ่งเรียกว่าโมเดลแบบ multimodal แต่แกนของมันยังคงเป็นโมเดลภาษา
ตัวอย่าง llm ที่ใช้กันแพร่หลาย
ตัวอย่างที่คนทั่วไปรู้จักมีดังนี้ แต่ละรายออกรุ่นใหม่เป็นระยะ ชื่อรุ่นจึงเปลี่ยนเร็ว
- GPT พัฒนาโดย OpenAI เป็นโมเดลที่อยู่เบื้องหลัง ChatGPT
- Gemini พัฒนาโดย Google ใช้ในแอป Gemini และในบริการต่างๆ ของ Google
- Claude พัฒนาโดย Anthropic ใช้งานผ่านแอป Claude และผ่าน API
- Llama พัฒนาโดย Meta เป็นโมเดลแบบ open-weight ที่องค์กรนำไปติดตั้งบนระบบของตัวเองได้ภายใต้เงื่อนไขสัญญาอนุญาต
ความต่างระหว่างโมเดลอยู่ที่หลายด้าน เช่น ความสามารถในแต่ละงาน ความยาวของข้อความที่รับได้ในครั้งเดียว (context window) ราคาการใช้งานผ่าน API นโยบายข้อมูล และความสามารถด้านภาษาไทย ไม่มีโมเดลที่ดีที่สุดสำหรับทุกงาน วิธีที่ใช้ได้จริงคือทดสอบกับงานจริงขององค์กรตัวเองก่อนเลือก
llm ตอบคำถามจากไหน และทำไมถึง hallucinate
แหล่งที่ 1: ความรู้จากข้อมูลฝึก
สิ่งที่โมเดลรู้โดยไม่ต้องค้นหาเพิ่มมาจากข้อมูลฝึก ซึ่งมีวันตัดข้อมูล (training cutoff) ทุกอย่างที่เกิดหลังวันนั้น โมเดลจะไม่รู้ ถ้าถามเรื่องราคาสินค้าล่าสุดหรือข่าวเมื่อวาน โมเดลที่ไม่มีการค้นเว็บจะตอบได้แค่จากข้อมูลเก่า หรือบอกว่าไม่ทราบ
แหล่งที่ 2: การค้นเว็บและ RAG
ผู้ช่วย AI หลายตัวเปิดให้ค้นเว็บได้ ระบบจะค้นหาหน้าเว็บที่เกี่ยวข้อง ดึงเนื้อหามาใส่ไว้ในข้อความที่ส่งให้โมเดล แล้วให้โมเดลเขียนคำตอบจากเนื้อหานั้น และมักแสดงลิงก์แหล่งที่มา เทคนิคทั่วไปนี้เรียกว่า RAG (Retrieval-Augmented Generation) องค์กรก็ใช้ RAG แบบเดียวกันกับเอกสารภายใน เช่น คู่มือสินค้าหรือนโยบายบริษัท เพื่อให้ผู้ช่วย AI ตอบจากข้อมูลขององค์กรแทนการเดาจากความรู้ทั่วไป
ทำไม llm ถึง hallucinate
hallucination คือการที่โมเดลสร้างข้อมูลที่ฟังดูถูกต้องแต่ไม่จริง เช่น อ้างชื่อหนังสือที่ไม่มีอยู่ หรือให้ตัวเลขที่ไม่มีที่มา สาเหตุมาจากวิธีทำงานพื้นฐาน โมเดลถูกฝึกให้สร้างข้อความที่ "น่าจะตามมา" ไม่ใช่ข้อความที่ตรวจสอบแล้วว่าจริง เมื่อเจอคำถามที่ข้อมูลฝึกมีน้อยหรือไม่มีเลย โมเดลยังสร้างคำตอบที่มีรูปแบบเหมือนคำตอบจริงได้ ความมั่นใจของน้ำเสียงจึงไม่ได้บอกความถูกต้อง
RAG และการค้นเว็บช่วยลดปัญหานี้ได้เพราะโมเดลมีเอกสารจริงให้อ้างอิง แต่ไม่ได้ทำให้หายไป โมเดลยังอาจอ่านเอกสารผิด หยิบแหล่งข้อมูลที่ไม่น่าเชื่อถือ หรือสรุปเกินจากที่แหล่งเขียนไว้ แนวปฏิบัติที่ปลอดภัยคือให้คนตรวจตัวเลข ชื่อ วันที่ และข้อกฎหมายทุกครั้งก่อนนำไปใช้จริง
ธุรกิจต้องปรับ SEO และ GEO อย่างไรเมื่อคนถาม llm แทน Google
เมื่อผู้ใช้ถามผู้ช่วย AI แล้วได้คำตอบสรุปทันที เส้นทางการค้นหาข้อมูลก็เปลี่ยนไป บางคนอ่านคำตอบแล้วจบโดยไม่คลิกเข้าเว็บไซต์ใดเลย บางคนคลิกไปยังแหล่งที่ AI อ้างถึง แนวทางที่เรียกว่า GEO (Generative Engine Optimization) คือการทำให้แบรนด์และเนื้อหาของคุณถูกหยิบไปใช้และถูกอ้างอิงในคำตอบเหล่านั้น สิ่งที่ธุรกิจทำได้มีดังนี้
- ทำ SEO พื้นฐานให้แข็งแรงก่อน: ระบบ AI ที่ค้นเว็บส่วนใหญ่ต้องหาเนื้อหาให้เจอก่อนจะอ้างอิงได้ หน้าเว็บที่ถูกบล็อกจากการเก็บข้อมูล โหลดช้า หรือไม่มีโครงสร้างชัดเจน จะเสียเปรียบทั้งในการค้นหาแบบเดิมและในคำตอบของ AI
- ตอบคำถามตรงๆ ตั้งแต่ย่อหน้าแรก: ระบบ RAG ดึงเนื้อหาเป็นช่วงสั้นๆ หน้าที่ตอบคำถามชัดในประโยคแรกของแต่ละหัวข้อ จะนำไปใช้ได้ง่ายกว่าหน้าที่ต้องอ่านทั้งหน้าก่อนถึงคำตอบ
- ใส่ข้อเท็จจริงที่ตรวจสอบได้: ตาราง ขั้นตอน ข้อกำหนด และนิยามที่ชัดเจน เป็นเนื้อหาที่ระบบหยิบไปอ้างอิงได้ง่าย
- ให้ข้อมูลแบรนด์ตรงกันทุกที่: ชื่อธุรกิจ บริการ ที่อยู่ และรายละเอียดสำคัญควรตรงกันบนเว็บไซต์ โซเชียล และไดเรกทอรีต่างๆ เพื่อให้ข้อมูลที่ AI เห็นไม่ขัดแย้งกัน
- ใช้ structured data: schema markup ช่วยให้เครื่องมือค้นหาเข้าใจว่าหน้าไหนคือบทความ FAQ สินค้า หรือข้อมูลธุรกิจ
- ติดตามว่า AI พูดถึงแบรนด์อย่างไร: ลองถามผู้ช่วย AI หลายตัวด้วยคำถามที่ลูกค้าน่าจะถาม แล้วบันทึกว่าแบรนด์ถูกพูดถึงหรือไม่ และข้อมูลถูกต้องหรือเปล่า คำตอบเปลี่ยนได้ตามเวลาและตามผู้ถาม จึงควรเช็กซ้ำเป็นระยะ
รายละเอียดเชิงลึกของแนวทางนี้อยู่ในหน้าบริการ GEO (Generative Engine Optimization) และ AI SEO ของ Relevant Audience ส่วนธุรกิจที่สนใจการปรากฏในคำตอบของ ChatGPT โดยเฉพาะ ดูได้ที่ ChatGPT SEO
ความเสี่ยงเรื่องข้อมูลเมื่อใช้ llm ในองค์กร
การใช้ llm ในงานประจำวันช่วยประหยัดเวลาได้มาก แต่มีความเสี่ยงที่ต้องจัดการก่อนเปิดให้พนักงานใช้กันทั่วไป
การรั่วไหลของข้อมูลลับ
ข้อความที่พิมพ์ลงในผู้ช่วย AI ถูกส่งไปประมวลผลบนเซิร์ฟเวอร์ของผู้ให้บริการ ผู้ให้บริการแต่ละรายมีนโยบายต่างกันว่าจะเก็บข้อมูลนานเท่าไร และนำไปใช้ฝึกโมเดลหรือไม่ บางแผนบริการให้ผู้ใช้ปิดการนำข้อมูลไปฝึกได้ แผนสำหรับองค์กรมักมีเงื่อนไขด้านข้อมูลเข้มกว่าแผนส่วนบุคคล องค์กรควรอ่านเงื่อนไขของแผนที่ใช้อยู่จริง แทนการสันนิษฐาน
ข้อมูลส่วนบุคคลและ PDPA
ถ้าพนักงานนำข้อมูลลูกค้า เช่น ชื่อ เบอร์โทร หรือประวัติการซื้อ ไปใส่ในเครื่องมือ AI ภายนอก องค์กรต้องพิจารณาภาระตาม พ.ร.บ.คุ้มครองข้อมูลส่วนบุคคล (PDPA) เช่น ฐานทางกฎหมายในการประมวลผล และการส่งข้อมูลไปยังผู้ประมวลผลภายนอก ควรปรึกษาฝ่ายกฎหมายหรือเจ้าหน้าที่คุ้มครองข้อมูลก่อนกำหนดนโยบาย
คำตอบที่ผิดถูกนำไปใช้
ร่างสัญญา ข้อมูลภาษี หรือข้อความที่ส่งถึงลูกค้า ถ้ามีข้อผิดพลาดจาก hallucination และไม่มีใครตรวจ ความเสียหายจะตกกับองค์กร ไม่ใช่กับผู้ให้บริการ AI
prompt injection
เมื่อเชื่อม llm กับอีเมล เว็บไซต์ หรือเอกสารภายนอก ข้อความในแหล่งเหล่านั้นอาจมีคำสั่งแฝงที่พยายามให้ AI ทำสิ่งที่ผู้ใช้ไม่ได้ตั้งใจ ระบบที่ให้ AI ส่งข้อความหรือแก้ข้อมูลได้เองจึงต้องมีขั้นตอนให้คนอนุมัติ
แนวปฏิบัติเบื้องต้นที่ใช้ได้กับองค์กรส่วนใหญ่คือ กำหนดรายการเครื่องมือที่อนุญาต ระบุประเภทข้อมูลที่ห้ามใส่ ให้คนตรวจงานก่อนเผยแพร่ และบันทึกว่างานใดใช้ AI ช่วยทำ สำหรับธุรกิจที่ต้องการนำ AI ไปใช้ในกระบวนการตลาดแบบมีขั้นตอนควบคุม ดูได้ที่บริการ การตลาดอัตโนมัติ
ความหมายสำหรับนักการตลาดในไทย
คนไทยถามผู้ช่วย AI เป็นภาษาไทยได้แล้ว และ llm หลายตัวตอบภาษาไทยได้ แต่ปริมาณเนื้อหาภาษาไทยบนเว็บน้อยกว่าภาษาอังกฤษมาก ผลที่ตามมาคือเมื่อมีคนถามเป็นภาษาไทยในหัวข้อเฉพาะทาง ระบบอาจมีแหล่งภาษาไทยที่ดีให้หยิบได้ไม่มาก ธุรกิจที่มีเนื้อหาภาษาไทยที่ตอบคำถามชัดเจนและถูกต้องจึงมีโอกาสถูกนำไปใช้มากขึ้น นี่เป็นเหตุผลเชิงกลไก ไม่ใช่การรับประกันผล
อีกประเด็นคือการตัดคำ ภาษาไทยไม่เว้นวรรคระหว่างคำ ทั้งระบบค้นหาและโมเดลต้องตัดคำเอง เนื้อหาที่ใช้คำศัพท์ตรงกับที่คนค้นจริง และอธิบายศัพท์ภาษาอังกฤษควบคู่ภาษาไทย เช่น "llm" กับ "โมเดลภาษาขนาดใหญ่" ช่วยให้ทั้งคนอ่านและระบบเข้าใจได้ตรงกัน
สุดท้ายคือ PDPA ที่ทำให้การนำข้อมูลลูกค้าไปใช้กับเครื่องมือ AI ต้องมีกรอบชัดเจน นักการตลาดที่อยากใช้ llm วิเคราะห์ข้อมูลลูกค้าควรเริ่มจากข้อมูลที่ไม่ระบุตัวตนก่อน
คำถามที่พบบ่อยเกี่ยวกับ llm
llm กับ ChatGPT ต่างกันอย่างไร
llm คือตัวโมเดลภาษา ส่วน ChatGPT คือแอปพลิเคชันแชทของ OpenAI ที่ใช้โมเดลตระกูล GPT อยู่เบื้องหลัง เทียบได้กับเครื่องยนต์กับรถทั้งคัน แอปเพิ่มส่วนอื่นเข้ามา เช่น หน้าจอแชท การค้นเว็บ และการจำบทสนทนา
llm ฉลาดหรือเข้าใจสิ่งที่พูดจริงไหม
llm ทำงานโดยคำนวณรูปแบบทางสถิติของภาษา ไม่ได้มีความเข้าใจหรือประสบการณ์แบบมนุษย์ แม้จะแก้โจทย์และให้เหตุผลได้ดีในหลายงาน ผลลัพธ์จึงควรถูกตรวจทานเหมือนงานร่างจากผู้ช่วยคนหนึ่ง
จะลด hallucination ได้อย่างไร
วิธีที่ได้ผลที่สุดคือให้โมเดลตอบจากเอกสารที่เราแนบให้ หรือเปิดใช้การค้นเว็บและตรวจแหล่งที่อ้าง ควรเขียนคำสั่งให้โมเดลบอกว่าไม่ทราบเมื่อไม่มีข้อมูล และให้คนตรวจตัวเลข ชื่อ และวันที่ก่อนใช้งานเสมอ
ธุรกิจเล็กต้องทำ GEO หรือยัง
ควรเริ่มจากพื้นฐานที่ได้ประโยชน์ทั้ง SEO และ GEO ไปพร้อมกัน คือเนื้อหาที่ตอบคำถามลูกค้าตรงๆ ข้อมูลธุรกิจที่ตรงกันทุกช่องทาง และเว็บไซต์ที่ระบบค้นหาเข้าถึงได้ งานเหล่านี้ไม่เสียเปล่าแม้พฤติกรรมการค้นหาจะเปลี่ยนช้ากว่าที่คาด
ใส่ข้อมูลลูกค้าลงในผู้ช่วย AI ได้ไหม
ไม่ควรทำจนกว่าองค์กรจะตรวจเงื่อนไขของบริการที่ใช้ และมีนโยบายตาม PDPA รองรับ ทางที่ปลอดภัยกว่าคือลบข้อมูลที่ระบุตัวตนออกก่อน หรือใช้แผนบริการสำหรับองค์กรที่มีข้อตกลงด้านข้อมูลชัดเจน
สรุป
llm คือโมเดล AI ที่เรียนรู้รูปแบบภาษาจากข้อความจำนวนมาก แล้วสร้างคำตอบด้วยการคาดเดาส่วนถัดไปทีละขั้น มันเขียนและสรุปได้ดี แต่ตอบผิดอย่างมั่นใจได้ จึงต้องมีคนตรวจ และต้องมีนโยบายข้อมูลก่อนใช้ในองค์กร สำหรับฝั่งการตลาด การที่คนถาม AI มากขึ้นทำให้เนื้อหาที่ชัดเจน ตรวจสอบได้ และเข้าถึงได้มีค่ามากขึ้น ถ้าต้องการให้แบรนด์ของคุณพร้อมสำหรับการค้นหาผ่าน AI ดูรายละเอียดได้ที่หน้าบริการ GEO ของ Relevant Audience







