คู่มือ robots.txt: ไวยากรณ์ กฎ และข้อผิดพลาดที่ควรเลี่ยง

คู่มือ robots.txt: ไวยากรณ์ กฎ และข้อผิดพลาดที่ควรเลี่ยง

เอสอีโอ (Search Engine Optimization)October 8, 2026
By Antonio Fernandez

สรุปสั้น ๆ (TL;DR)

  • robots.txt ควบคุมเฉพาะการ crawl: Google ระบุว่า URL ที่ถูก disallow ยังถูก index ได้โดยไม่มีคำอธิบาย หากเว็บอื่นลิงก์มา
  • Google เก็บแคช robots.txt ได้นานถึง 24 ชั่วโมง อ่านไฟล์ได้ไม่เกิน 500 KiB และไม่รองรับ crawl-delay ส่วนรหัส 4xx (ยกเว้น 429) ถือว่าไม่มีข้อจำกัด
  • ภายในกลุ่มเดียวกัน กฎที่มีพาธจับคู่ยาวที่สุดชนะ หากเท่ากัน Google ใช้กฎที่เข้มงวดน้อยกว่า ดังนั้น Allow ชนะ Disallow
  • กลุ่ม Googlebot แทนที่กลุ่ม * สำหรับ Googlebot แทนการรวมกัน และบอต AI เช่น GPTBot และ ClaudeBot ต้องมีกลุ่มของตัวเองแยกกัน

robots.txt คือไฟล์ข้อความธรรมดาที่วางไว้ที่ราก (root) ของโฮสต์ เพื่อบอกบอตว่าเส้นทาง URL ไหนเข้าไปดึงข้อมูลได้ ไฟล์นี้ควบคุมการ "crawl" ไม่ใช่การ "index" URL ที่ถูกบล็อกใน robots.txt ยังปรากฏในผลการค้นหาของ Google ได้ มักไม่มีคำอธิบายใต้ชื่อ หากมีหน้าอื่นลิงก์มาหา คู่มือ robots.txt ฉบับนี้อธิบายไวยากรณ์ วิธีที่ Google เลือกกฎที่มีผล ชื่อ user-agent ของบอต AI วิธีทดสอบไฟล์ และข้อผิดพลาดที่สร้างความเสียหายมากที่สุด

robots.txt ทำอะไรได้ และทำอะไรไม่ได้

มองว่า robots.txt เป็นคำขอเรื่องปริมาณการเข้าเว็บที่ส่งถึงบอตที่ทำตามกติกา ก่อนที่ Google จะ crawl เว็บไซต์ Google จะดาวน์โหลดไฟล์ robots.txt มาอ่านก่อนว่าส่วนไหนของเว็บเรียกได้ บอตของ Google ทำตามโปรโตคอล Robots Exclusion Protocol ซึ่งเป็นมาตรฐานตาม RFC 9309 การใช้งานจริงมีขอบเขตแคบ เช่น กันบอตออกจากหน้ากรองสินค้าที่ผสมกันไม่รู้จบ หน้าผลค้นหาภายในเว็บ ขั้นตอนตะกร้าและชำระเงิน และ URL อื่นที่กินทรัพยากรเซิร์ฟเวอร์โดยไม่ช่วยให้ใครเจอเนื้อหาของคุณ

ข้อจำกัดสามข้อต่อไปนี้สำคัญกว่าตัวไวยากรณ์เสียอีก

  • ใช้ซ่อนหน้าเว็บไม่ได้ เอกสารของ Google ระบุว่าหน้าที่ถูกบล็อกด้วย robots.txt ยังถูก index ได้ หากเว็บอื่นลิงก์มา URL และบางครั้งรวมถึงข้อความลิงก์ (anchor text) จากลิงก์เหล่านั้นอาจปรากฏในผลการค้นหาโดยไม่มีคำอธิบาย หากต้องการให้หน้าหายจากผลค้นหา ให้ใช้ noindex ตั้งรหัสผ่าน หรือลบหน้านั้นออก
  • บังคับใครไม่ได้ บอตที่น่าเชื่อถือจะทำตาม ส่วนบอตขูดข้อมูลและบอตประสงค์ร้ายเมินได้ ดังนั้นไม่ใช่มาตรการความปลอดภัย ไฟล์ robots.txt ใครก็เปิดอ่านได้ การเขียนชื่อโฟลเดอร์ลับลงไปจึงเท่ากับประกาศให้คนรู้ว่ามีโฟลเดอร์นั้น
  • แต่ละบอตตีความไม่เหมือนกัน Googlebot เข้าใจไวลด์การ์ดและกฎ Allow แต่บอตบางตัวไม่เข้าใจ และกรณีขอบ (edge case) ก็ตีความต่างกัน

crawl กับ index เป็นคนละขั้นตอน

crawl คือการดึง URL ส่วน index คือการตัดสินใจเก็บและอาจแสดง URL นั้น คำสั่ง noindex อยู่ในตัวหน้า ทั้งแบบ robots meta tag และ HTTP header ชื่อ X-Robots-Tag บอตจึงต้องดึงหน้านั้นมาจึงจะเห็น กับดักที่พบบ่อยที่สุดเกิดตรงนี้ คือตั้ง Disallow ให้ทั้งหมวดแล้วใส่ noindex ในหน้าของหมวดนั้นพร้อมกัน Google จะดึงหน้าไม่ได้ จึงไม่เคยอ่าน noindex และอาจเก็บ URL เปล่า ๆ ไว้ในดัชนีต่อไป หากต้องการถอนหน้าออกจากการค้นหา ให้เปิดให้ crawl ได้จนกว่าหน้าจะหลุดจากดัชนี แล้วค่อยตัดสินใจว่าจะบล็อกหรือไม่

กรณีย้อนกลับก็เกิดได้ หากบล็อกหน้าไว้เพื่อลดภาระการ crawl แล้วภายหลังอยากให้หน้านั้นติดอันดับ หน้านั้นจะติดอันดับจากเนื้อหาไม่ได้ เพราะ Google ไม่เคยอ่านเนื้อหาของหน้า

ไฟล์ต้องวางที่ไหน และ Google ดึงไฟล์อย่างไร

ไฟล์ต้องชื่อ robots.txt และอยู่ระดับบนสุดของโฮสต์ เช่น https://www.example.com/robots.txt ไฟล์ที่อยู่ในโฟลเดอร์ย่อยจะถูกเมิน กฎมีผลเฉพาะโฮสต์ โปรโตคอล และพอร์ตที่ให้บริการไฟล์นั้น ซึ่งมีผลตามมาหลายข้อ

  • ไฟล์บน www.example.com ไม่ครอบคลุม example.com, shop.example.com หรือ http://www.example.com แต่ละซับโดเมนต้องมีไฟล์ของตัวเอง
  • ไฟล์ที่อยู่บนพอร์ตที่ไม่ใช่มาตรฐานครอบคลุมเฉพาะพอร์ตนั้น
  • URL ของไฟล์แยกตัวพิมพ์เล็กใหญ่ จึงควรใช้ robots.txt ตัวพิมพ์เล็ก

ไฟล์ต้องเป็นข้อความธรรมดาแบบ UTF-8 Google กำหนดขนาดสูงสุด 500 KiB และเมินเนื้อหาส่วนที่เกิน ไฟล์ที่ยาวมากจึงควรรวมกฎให้กว้างขึ้น โดยทั่วไป Google เก็บแคชของไฟล์ได้นานถึง 24 ชั่วโมง นี่คือเหตุผลที่การแก้ไขไม่มีผลทันทีหลังอัปโหลด

รหัสสถานะ HTTP กระทบกฎของคุณอย่างไร

Google เปิดเผยวิธีจัดการรหัสตอบกลับไว้ชัดเจน และควรรู้ไว้ เพราะเซิร์ฟเวอร์ที่มีปัญหาเปลี่ยนพฤติกรรมการ crawl ได้โดยที่คุณไม่ได้แก้ไฟล์เลย

  • 2xx: ประมวลผลไฟล์ตามที่เซิร์ฟเวอร์ส่งมา
  • 3xx: Google ตามการเปลี่ยนเส้นทางอย่างน้อยห้าครั้ง แล้วถือว่าเป็น 404 ของ robots.txt การเปลี่ยนเส้นทางด้วย JavaScript หรือ meta refresh จะไม่ถูกตาม
  • 4xx (ยกเว้น 429): ถือเหมือนไม่มีไฟล์ robots.txt จึงไม่มีข้อจำกัดการ crawl การตอบ 403 ที่ไฟล์นี้ไม่ได้บล็อกเว็บ แต่ทำให้กฎของคุณหายไป
  • 5xx: ใน 12 ชั่วโมงแรก Google หยุด crawl เว็บและพยายามดึงไฟล์ซ้ำ หลังจากนั้นใช้ไฟล์เวอร์ชันล่าสุดที่ดึงได้ต่อไปได้นานถึง 30 วัน หากข้อผิดพลาดยังอยู่เกิน 30 วัน และเว็บส่วนอื่นเข้าถึงได้ปกติ Google จะทำเหมือนไม่มีไฟล์

ไวยากรณ์ robots.txt: สี่ฟิลด์ที่ Google รองรับ

แต่ละบรรทัดประกอบด้วยชื่อฟิลด์ เครื่องหมายโคลอน และค่า ชื่อฟิลด์ไม่แยกตัวพิมพ์เล็กใหญ่ แต่ค่าพาธแยก คอมเมนต์ขึ้นต้นด้วย # Google รองรับสี่ฟิลด์ ส่วนฟิลด์อื่นอย่าง crawl-delay ไม่รองรับ

  • User-agent: ระบุบอตที่กฎด้านล่างใช้กับ เครื่องหมายดอกจันหมายถึงทุกบอตที่ไม่มีกลุ่มเฉพาะของตัวเอง
  • Disallow: พาธที่บอตตัวนั้นห้ามดึง ถ้าค่าว่างจะถูกเมิน
  • Allow: พาธที่บอตดึงได้ ใช้เจาะข้อยกเว้นออกจาก Disallow ที่กว้างกว่า
  • Sitemap: URL แบบเต็มของ sitemap วางตรงไหนของไฟล์ก็ได้ ไม่ผูกกับ user-agent และใส่ซ้ำได้หลายไฟล์

ตัวอย่างขั้นต่ำที่ใช้ได้ คือ User-agent: * ตามด้วย Disallow: /cart/ ตามด้วย Disallow: /search และ Sitemap: https://www.example.com/sitemap.xml พาธต้องขึ้นต้นด้วยเครื่องหมายทับและจับคู่จากต้นพาธของ URL ดังนั้น Disallow: /search บล็อกทั้ง /search, /search/results และ /searchable-guide หากหมายถึงโฟลเดอร์ให้ใส่เครื่องหมายทับท้าย

ไวลด์การ์ด

Google และเสิร์ชเอนจินหลักอื่นรองรับอักขระพิเศษสองตัวในพาธ ดอกจันแทนอักขระใดก็ได้ศูนย์ตัวขึ้นไป เครื่องหมายดอลลาร์แทนจุดสิ้นสุดของ URL Disallow: /*.pdf$ บล็อก URL ที่ลงท้ายด้วย .pdf ส่วน Disallow: /*?sessionid= บล็อก URL ใดก็ตามที่มีพารามิเตอร์นั้น เนื่องจากการจับคู่แยกตัวพิมพ์เล็กใหญ่ /Photos/ กับ /photos/ จึงเป็นคนละพาธ

การเลือกกลุ่มและลำดับความสำคัญของกฎ

เมื่อบอตอ่านไฟล์ของคุณ มีการตัดสินใจสองอย่างแยกกัน คือกลุ่มไหนใช้กับบอตตัวนี้ และกฎไหนในกลุ่มนั้นชนะสำหรับ URL หนึ่ง ๆ

กลุ่มไหนใช้ บอตหนึ่งตัวใช้ได้เพียงกลุ่มเดียว Google เลือกกลุ่มที่บรรทัด user-agent ตรงที่สุดและเมินกลุ่มที่เหลือ ลำดับของกลุ่มในไฟล์ไม่มีผล หากไฟล์มีหลายกลุ่มสำหรับ user-agent เดียวกัน Google จะรวมกฎเข้าด้วยกัน แต่กลุ่มเฉพาะไม่ถูกรวมกับกลุ่มดอกจัน นั่นหมายความว่ากลุ่ม Googlebot จะแทนที่กลุ่มดอกจันสำหรับ Googlebot ไม่ใช่เพิ่มเข้าไป กฎใดที่ต้องการให้ Googlebot ยังใช้อยู่ ต้องคัดลอกมาไว้ในกลุ่มของ Googlebot เอง

กฎไหนชนะ ภายในกลุ่ม กฎที่เจาะจงที่สุดชนะ วัดจากความยาวของพาธ หาก Allow กับ Disallow จับคู่ได้เท่ากัน Google ใช้กฎที่เข้มงวดน้อยกว่า คือให้ Allow ชนะ ตารางด้านล่างสรุปประเด็นที่ตัดสินกรณีขัดแย้งส่วนใหญ่ในทางปฏิบัติ

การเลือกกลุ่มและลำดับความสำคัญของกฎ
กรณีGoogle จัดการอย่างไร
Disallow: /folder/ กับ Allow: /folder/page.htmlพาธของ Allow ยาวกว่า จึงเจาะจงกว่า หน้านั้น crawl ได้
Allow: /folder กับ Disallow: /folder (ยาวเท่ากัน)ใช้กฎที่เข้มงวดน้อยกว่า จึงอนุญาตให้ crawl
Crawl-delayGoogle ไม่รองรับ บรรทัดนี้ไม่มีผล
robots.txt ใหญ่เกิน 500 KiBเนื้อหาส่วนที่เกินถูกเมิน
กลุ่ม Googlebot กับกลุ่มดอกจันGooglebot ใช้เฉพาะกลุ่มของตัวเอง ไม่ถูกรวมกับกลุ่มอื่น

user-agent ของบอต AI

robots.txt ยังเป็นเครื่องมือที่เจ้าของเว็บใช้บอกว่าผลิตภัณฑ์ AI ตัวไหนดึงเนื้อหาของตนได้ กลไกเหมือนบอตทั่วไป คือระบุชื่อ user-agent token แล้วกำหนดกฎ ที่ต่างคือแต่ละบริษัทมีบอตหลายตัวสำหรับวัตถุประสงค์ต่างกัน และชื่อ token เปลี่ยนได้ตามเวลา จึงควรตรวจชื่อล่าสุดจากเอกสารของแต่ละเจ้าก่อนนำไปใช้ รายชื่อต่อไปนี้เป็นชื่อที่เผยแพร่กันทั่วไป ณ เวลาที่เขียน

  • OpenAI: GPTBot (เก็บข้อมูลเพื่อฝึกโมเดล), OAI-SearchBot (ฟีเจอร์ค้นหา), ChatGPT-User (การดึงข้อมูลที่ผู้ใช้สั่ง)
  • Anthropic: ClaudeBot (ข้อมูลฝึกโมเดล), Claude-SearchBot (คุณภาพผลค้นหา), Claude-User (การดึงข้อมูลที่ผู้ใช้สั่ง)
  • Perplexity: PerplexityBot (ดัชนีค้นหาของตัวเอง) และ Perplexity-User (ผู้ใช้เป็นผู้สั่ง)
  • Google: Google-Extended เป็น token แยกใน robots.txt ที่ควบคุมว่าเนื้อหาที่ Google crawl จากเว็บไซต์ของคุณจะนำไปฝึกโมเดล Gemini รุ่นต่อไป และใช้อ้างอิงข้อมูล (grounding) ใน Gemini Apps และ Vertex AI ได้หรือไม่ token นี้ไม่มี user-agent string แยกต่างหาก Google ระบุว่าไม่กระทบการแสดงใน Google Search และไม่ใช่สัญญาณจัดอันดับ
  • Common Crawl: CCBot ซึ่งชุดข้อมูลสาธารณะของโครงการนี้องค์กรอื่นจำนวนมากนำไปใช้ต่อ

การเลือกนี้เป็นการแลกเปลี่ยน ไม่ใช่ค่าเริ่มต้นที่ตายตัว การบล็อกบอตฝึกโมเดลทำให้หน้าเว็บของคุณไม่เข้าชุดข้อมูลฝึกของผู้ให้บริการรายนั้น ส่วนการบล็อกบอตค้นหาหรือบอตดึงข้อมูลอาจทำให้ผู้ช่วย AI อ้างอิงหน้าของคุณเป็นแหล่งที่มาไม่ได้ ผู้ให้บริการแต่ละรายยังปฏิบัติต่อบอตที่ผู้ใช้สั่งไม่เหมือนกัน บางรายระบุว่ากฎ robots.txt อาจไม่ใช้กับบอตกลุ่มนี้ ควรอ่านหน้าของผู้ให้บริการแทนที่จะเดา และเนื่องจากการทำตามเป็นความสมัครใจ บันทึกเซิร์ฟเวอร์ (server log) คือวิธีเดียวที่ยืนยันได้ว่าใครเข้ามาดึงหน้าของคุณจริง

กฎเรื่องกลุ่มข้างต้นใช้ที่นี่ด้วย หากเขียนกลุ่มสำหรับ GPTBot กลุ่มนั้นจะแทนที่กลุ่มดอกจันสำหรับบอตตัวนั้น กลุ่มที่เขียนว่า User-agent: GPTBot ตามด้วย Disallow: / บล็อกทั้งเว็บเฉพาะบอตตัวนั้น

วิธีทดสอบไฟล์ robots.txt

  1. ดึงไฟล์เหมือนบอต เรียกไฟล์ด้วยเครื่องมือบรรทัดคำสั่งหรือเบราว์เซอร์ แล้วตรวจสามอย่าง คือสถานะเป็น 200 ประเภทเนื้อหาเป็นข้อความธรรมดา และเนื้อหาเป็นกฎที่ตั้งใจ ไม่ใช่หน้า error แบบ HTML ตรวจทุกโฮสต์ที่คุณใช้ รวมทั้งเวอร์ชัน www และไม่มี www
  2. ใช้รายงาน robots.txt ใน Search Console รายงานแสดงไฟล์ robots.txt ที่ Google พบจาก 20 โฮสต์แรกของพร็อพเพอร์ตีของคุณ เวลาที่ดึงล่าสุด และปัญหาการดึงหรือคำเตือนการอ่านไฟล์ รายงานนี้มีเฉพาะพร็อพเพอร์ตีระดับโดเมน (Domain property หรือ URL-prefix property ที่ไม่มีพาธ) โดยทั่วไป Google crawl ไฟล์นี้ซ้ำบ่อยอยู่แล้ว คำขอ crawl ซ้ำจากรายงานจึงมีไว้สำหรับกรณีเร่งด่วน เช่น แก้ข้อผิดพลาดในการดึงไฟล์แล้ว หรือเปลี่ยนกฎสำคัญ
  3. ตรวจ URL สำคัญ เครื่องมือตรวจสอบ URL (URL Inspection) มีช่อง Crawl allowed? ที่บอกว่ากฎ robots.txt บล็อกไม่ให้ Google crawl URL นั้นหรือไม่ ลองกับหน้า Landing Page หลัก บทความล่าสุด และ URL ที่ตั้งใจบล็อกไม่กี่หน้า ทั้งสามกลุ่มควรให้ผลตามที่คาด
  4. ดูรายงานการจัดทำดัชนีหน้า รายงานนี้แสดง URL ตามสถานะ เช่น Blocked by robots.txt และ Indexed, though blocked by robots.txt สถานะหลังคือกับดักเรื่อง crawl กับ index ที่เกิดขึ้นจริง
  5. ทดสอบซ้ำทุกครั้งที่ deploy robots.txt เป็นส่วนหนึ่งของการ build เว็บ การปล่อยเวอร์ชันใหม่อาจเขียนทับไฟล์โดยไม่มีใครรู้ตัว

ข้อผิดพลาดของ robots.txt ที่พบบ่อยในเว็บไทย

ข้อเหล่านี้เป็นกลไกทางเทคนิค ไม่ใช่เรื่องเล่า และตรวจสอบได้ง่ายทุกข้อ

กฎของเว็บทดสอบหลุดขึ้นเว็บจริง

เว็บระหว่างพัฒนามักถูกบล็อกด้วย User-agent: * และ Disallow: / หากไฟล์นี้ตามขึ้นเว็บจริงตอนเปิดตัวหรือย้ายเว็บ Google จะหยุด crawl ทุกอย่าง ควรเทียบไฟล์บนเว็บจริงกับไฟล์ที่ตั้งใจทุกครั้งหลังเปิดตัว

บล็อก CSS และ JavaScript

Google render หน้าเว็บ และเอกสารของ Google เตือนว่าการบล็อกไฟล์ทรัพยากรอาจทำให้ Google เข้าใจหน้าที่พึ่งพาไฟล์เหล่านั้นไม่ได้ บล็อกเฉพาะทรัพยากรที่แน่ใจว่าไม่สำคัญต่อหน้าที่ render ออกมา

ใช้ Disallow ปนกับ noindex

ตามที่อธิบายไว้ข้างต้น หน้าที่ถูก disallow แสดงแท็ก noindex ของตัวเองไม่ได้ ให้เลือกเครื่องมือให้ตรงเป้าหมาย ใช้ Disallow เพื่อจัดการการ crawl และใช้ noindex เพื่อกันหน้าออกจากผลค้นหา

จับคู่แบบขึ้นต้นแล้วโดนมากกว่าที่ตั้งใจ

เนื่องจากกฎจับคู่จากต้นพาธ กฎสั้น ๆ อาจครอบ URL ที่ไม่เกี่ยวข้อง บนเว็บสองภาษาที่หน้าไทยอยู่ใต้โฟลเดอร์ /th/ กฎที่ประมาทอย่าง Disallow: /t จะบล็อกโฟลเดอร์นั้นและพาธอื่นทุกอันที่ขึ้นต้นด้วย t เขียนกฎให้ยาวพอที่จะไม่กำกวม และทดสอบกับตัวอย่าง URL จริง

อักษรไทยใน URL

URL ที่ใช้ slug ภาษาไทยเป็นเรื่องปกติของเว็บในประเทศ Google ถือว่าอักขระ UTF-8 ดิบในกฎกับรูปแบบ percent-encoded เป็นสิ่งเดียวกัน จึงเขียนแบบไหนก็ได้ สิ่งที่ต้องระวังคือส่วนที่เป็นอักษรละตินในพาธซึ่งแยกตัวพิมพ์ เช่น /Blog/ กับ /blog/ และการสันนิษฐานว่ากฎของโฟลเดอร์หนึ่งครอบคลุมโฟลเดอร์ที่ชื่อคล้ายกัน

โฮสต์ผิดหรือโปรโตคอลผิด

หาก CDN ซับโดเมนทดสอบ หรือโฮสต์ของไฟล์สื่อมี robots.txt ของตัวเอง ไฟล์หลักจะไม่ครอบคลุมโฮสต์เหล่านั้น ตรวจทุกชื่อโฮสต์ที่ให้บริการเนื้อหาที่คุณสนใจ

เซิร์ฟเวอร์ตอบ error ให้ไฟล์

ไฟร์วอลล์หรือปลั๊กอินความปลอดภัยที่ตอบ 403 หรือ 5xx ให้บอตที่ /robots.txt จะเปลี่ยนวิธีที่ Google ปฏิบัติต่อทั้งเว็บ ตามที่ส่วนรหัสสถานะด้านบนอธิบาย ลองเรียกไฟล์จากหลายเครือข่าย และดูใน server log ว่า Googlebot ได้รับอะไรกลับไป

บรรทัด Sitemap แบบสัมพัทธ์

ฟิลด์ Sitemap ต้องเป็น URL เต็มที่มีโปรโตคอลและโฮสต์ การใส่เฉพาะพาธไม่ถูกต้อง

ความหมายต่อธุรกิจไทย

เว็บธุรกิจไทยส่วนใหญ่ใช้ WordPress, Shopify หรือแพลตฟอร์มอื่นที่สร้าง robots.txt ค่าเริ่มต้นให้ ค่าเริ่มต้นนี้เป็นจุดเริ่มที่สมเหตุสมผล แต่แพลตฟอร์มสร้าง URL ที่ค่าเริ่มต้นไม่ครอบคลุม เช่น หน้ารายการสินค้าที่กรองแล้ว หน้าค้นหาภายใน หน้าแท็ก และ URL ซ้ำจากพารามิเตอร์ติดตาม การจะ Disallow สิ่งเหล่านี้หรือไม่เป็นการตัดสินใจตามขนาดเว็บและกำลังของเซิร์ฟเวอร์ ไม่ใช่กฎสากล เว็บเล็กที่มี URL ไม่กี่ร้อยหน้าแทบไม่ต้องจัดการ crawl และไฟล์ที่เข้มงวดเกินไปทำร้ายมากกว่าช่วย

การตัดสินใจที่มีอายุยาวกว่าคือนโยบายต่อบอต AI ธุรกิจที่อยากถูกอ้างอิงในคำตอบของ AI มีเหตุผลที่จะอนุญาตบอตค้นหาและบอตดึงข้อมูล แม้ปฏิเสธบอตฝึกโมเดล ส่วนธุรกิจที่มีเนื้อหาได้รับอนุญาตสิทธิ์หรือเนื้อหาแบบสมาชิกอาจตัดสินใจตรงกันข้าม ไม่ว่าเลือกทางไหน ให้จดการตัดสินใจไว้ ทดสอบ และทบทวนรายชื่อ token ของแต่ละเจ้าทุกไม่กี่เดือน เพราะชื่อและวัตถุประสงค์เปลี่ยนได้ หากต้องการตรวจเชิงเทคนิคทั้งเรื่อง crawl, index และกฎ robots บนโดเมนของคุณ ดูได้ที่ บริการ SEO Audit และสำหรับงาน SEO ภาพรวม ดูที่ บริการ SEO ในประเทศไทย

คำถามที่พบบ่อยเกี่ยวกับ robots.txt

robots.txt ป้องกันไม่ให้หน้าขึ้นใน Google ได้หรือไม่

ไม่ได้ ไฟล์นี้เพียงหยุดไม่ให้ Google crawl หน้า และ URL ยังถูก index ได้หากเว็บอื่นลิงก์มา หากต้องการกันหน้าออกจากผลค้นหา ให้ใช้ noindex ตั้งรหัสผ่าน หรือลบหน้านั้น

ไฟล์ robots.txt วางที่ไหน

วางที่ระดับบนสุดของแต่ละโฮสต์ เช่น https://www.example.com/robots.txt ไฟล์ในโฟลเดอร์ย่อยไม่ถูกอ่าน และซับโดเมน โปรโตคอล และพอร์ตอื่นแต่ละอันต้องมีไฟล์ของตัวเอง

Allow กับ Disallow ขัดแย้งกัน กฎไหนชนะ

สำหรับ Google กฎที่มีพาธยาวและเจาะจงกว่าชนะ หากกฎที่ขัดแย้งกันเจาะจงเท่ากัน Google ใช้กฎที่เข้มงวดน้อยกว่า จึงเป็น Allow ที่มีผล

บล็อกบอต AI ใน robots.txt ทำอย่างไร

เพิ่มกลุ่มสำหรับ user-agent token ของบอตแต่ละตัว เช่น GPTBot หรือ ClaudeBot พร้อม Disallow: / เพื่อบล็อกทั้งเว็บสำหรับบอตนั้น ตรวจชื่อ token ล่าสุดจากเอกสารของผู้ให้บริการ และจำไว้ว่าการทำตามเป็นความสมัครใจ

แก้ robots.txt แล้วใช้เวลานานเท่าไรจึงมีผล

โดยทั่วไป Google เก็บแคชไฟล์ได้นานถึง 24 ชั่วโมง การเปลี่ยนแปลงจึงอาจใช้เวลาราวหนึ่งวัน หากแก้ข้อผิดพลาดหรือเปลี่ยนกฎสำคัญ ขอให้ crawl ไฟล์ใหม่ได้ในรายงาน robots.txt ของ Search Console

หากไม่แน่ใจว่าไฟล์ของคุณช่วยหรือทำร้ายเว็บ การตรวจไฟล์จริง sitemap และรายงานการ index จะให้คำตอบที่มีหลักฐาน ทีมของเราทำการตรวจนี้ได้ทั้งในรูปแบบ SEO Audit หรือรวมเป็นส่วนหนึ่งของ บริการ SEO แบบต่อเนื่อง

Antonio Fernandez

Antonio Fernandez

ผู้ก่อตั้งและ CEO ของ Relevant Audience ผู้นำด้านการตลาดดิจิทัลในเอเชียตะวันออกเฉียงใต้ ด้วยประสบการณ์กว่า 15 ปีในการพัฒนากลยุทธ์การตลาดดิจิทัล เขาได้นำพาทีมงานในการสร้างผลลัพธ์ที่ยอดเยี่ยมให้กับลูกค้าผ่านโซลูชันดิจิทัลที่มุ่งเน้นประสิทธิภาพ

แชร์ไปยัง:
คัดลอกลิงก์:

อ่านบทความของเราเป็นประจำใช่ไหม เพิ่ม Relevant Audience เป็นแหล่งข้อมูลที่คุณเลือก เพื่อให้บทความของเราปรากฏในผลการค้นหา Google ของคุณมากขึ้น