Technical SEO

Robots.txt คืออะไร

Robots.txt คือไฟล์ข้อความธรรมดาที่อยู่ที่ root ของโดเมน ทำหน้าที่บอก crawler ว่าส่วนใดของเว็บไซต์ที่เข้าถึงได้หรือเข้าถึงไม่ได้

มันควบคุมการ crawl ไม่ใช่การ index ดังนั้นหน้าที่ถูกบล็อกไว้ตรงนี้ก็ยังสามารถปรากฏในผลการค้นหาได้ หากมีลิงก์มาจากที่อื่น หากต้องการกันหน้าออกจาก index โดยสมบูรณ์ ให้ใช้แท็ก noindex แทน คุณสามารถดูไฟล์ของเว็บไซต์ใดก็ได้ด้วยการเติม /robots.txt ต่อท้ายโดเมน

ไฟล์นี้เล็กพอจะไล่อ่านด้วยตาและอันตรายพอที่จะสมควรทำ ความผิดพลาดที่แพงที่สุดใน SEO คือการปล่อยกฎ Disallow ของ staging ขึ้น production ซึ่งบล็อกการ crawl ทั้งเว็บและลบการมองเห็นได้ก่อนที่ใครจะทันสังเกต มีสองนิสัยที่ป้องกันได้ คือตรวจไฟล์บนเว็บจริงหลังทุกการ deploy ที่แตะโครงสร้างพื้นฐาน และตั้งการแจ้งเตือนเมื่อเนื้อหาไฟล์เปลี่ยน เพื่อให้มันบอกคุณแทนที่จะรอให้คนไปเจอ Search Console จะรายงานหน้าที่ถูกบล็อกพุ่งขึ้น แต่รายงานนั้นมาช้าหลายวัน ซึ่งนานพอที่จะสร้างความเสียหาย

ตัวอย่าง

เว็บเปิดตัวใหม่พร้อมบรรทัดเดียวที่หลุดมาจาก staging คือ Disallow: / ไม่มีอะไรพังให้เห็น เว็บใช้งานได้ปกติสำหรับผู้เข้าชมทุกคน แต่ crawler ถูกล็อกทั้งเว็บ อันดับเริ่มไหลลงภายในไม่กี่วัน กว่าจะเจอก็ผ่านไปสัปดาห์หนึ่งตอนตรวจตามรอบ การแก้ใช้เวลาหนึ่งนาที การกู้อันดับใช้เกือบสองเดือน

คำถามที่พบบ่อย

robots.txt กันไม่ให้หน้าโผล่ใน Google ได้ไหม
ไม่ได้ robots.txt ห้ามการ crawl ไม่ใช่การ index URL ที่ถูกบล็อกยังโผล่ในผลการค้นหาได้ถ้ามีหน้าอื่นลิงก์มา โดยมักไม่มีคำอธิบายแสดง ถ้าต้องการกันไม่ให้ขึ้นผลการค้นหาจริง ๆ ให้อนุญาต crawl แล้วใช้ meta tag noindex แทน
ควรบล็อกบอท AI ใน robots.txt ไหม
ขึ้นกับเป้าหมาย การบล็อก GPTBot, ClaudeBot หรือ PerplexityBot ป้องกันไม่ให้เนื้อหาถูกนำไปใช้ แต่ก็ตัดคุณออกจากคำตอบที่ AI สร้าง ซึ่งคู่แข่งจะยังปรากฏอยู่ สำหรับเว็บการตลาดส่วนใหญ่ การได้ปรากฏในคำตอบเหล่านั้นคุ้มกว่าการหวงเนื้อหา

คำศัพท์ที่เกี่ยวข้อง

กำลังทำเรื่อง Robots.txt อยู่ใช่ไหม? ดูว่าการตรวจสอบ SEO (SEO Audit)ของเราช่วยคุณได้อย่างไร

ดูการตรวจสอบ SEO (SEO Audit)