Technical SEO
Robots.txt คืออะไร
Robots.txt คือไฟล์ข้อความธรรมดาที่อยู่ที่ root ของโดเมน ทำหน้าที่บอก crawler ว่าส่วนใดของเว็บไซต์ที่เข้าถึงได้หรือเข้าถึงไม่ได้
มันควบคุมการ crawl ไม่ใช่การ index ดังนั้นหน้าที่ถูกบล็อกไว้ตรงนี้ก็ยังสามารถปรากฏในผลการค้นหาได้ หากมีลิงก์มาจากที่อื่น หากต้องการกันหน้าออกจาก index โดยสมบูรณ์ ให้ใช้แท็ก noindex แทน คุณสามารถดูไฟล์ของเว็บไซต์ใดก็ได้ด้วยการเติม /robots.txt ต่อท้ายโดเมน
ไฟล์นี้เล็กพอจะไล่อ่านด้วยตาและอันตรายพอที่จะสมควรทำ ความผิดพลาดที่แพงที่สุดใน SEO คือการปล่อยกฎ Disallow ของ staging ขึ้น production ซึ่งบล็อกการ crawl ทั้งเว็บและลบการมองเห็นได้ก่อนที่ใครจะทันสังเกต มีสองนิสัยที่ป้องกันได้ คือตรวจไฟล์บนเว็บจริงหลังทุกการ deploy ที่แตะโครงสร้างพื้นฐาน และตั้งการแจ้งเตือนเมื่อเนื้อหาไฟล์เปลี่ยน เพื่อให้มันบอกคุณแทนที่จะรอให้คนไปเจอ Search Console จะรายงานหน้าที่ถูกบล็อกพุ่งขึ้น แต่รายงานนั้นมาช้าหลายวัน ซึ่งนานพอที่จะสร้างความเสียหาย
ตัวอย่าง
เว็บเปิดตัวใหม่พร้อมบรรทัดเดียวที่หลุดมาจาก staging คือ Disallow: / ไม่มีอะไรพังให้เห็น เว็บใช้งานได้ปกติสำหรับผู้เข้าชมทุกคน แต่ crawler ถูกล็อกทั้งเว็บ อันดับเริ่มไหลลงภายในไม่กี่วัน กว่าจะเจอก็ผ่านไปสัปดาห์หนึ่งตอนตรวจตามรอบ การแก้ใช้เวลาหนึ่งนาที การกู้อันดับใช้เกือบสองเดือน
คำถามที่พบบ่อย
- robots.txt กันไม่ให้หน้าโผล่ใน Google ได้ไหม
- ไม่ได้ robots.txt ห้ามการ crawl ไม่ใช่การ index URL ที่ถูกบล็อกยังโผล่ในผลการค้นหาได้ถ้ามีหน้าอื่นลิงก์มา โดยมักไม่มีคำอธิบายแสดง ถ้าต้องการกันไม่ให้ขึ้นผลการค้นหาจริง ๆ ให้อนุญาต crawl แล้วใช้ meta tag noindex แทน
- ควรบล็อกบอท AI ใน robots.txt ไหม
- ขึ้นกับเป้าหมาย การบล็อก GPTBot, ClaudeBot หรือ PerplexityBot ป้องกันไม่ให้เนื้อหาถูกนำไปใช้ แต่ก็ตัดคุณออกจากคำตอบที่ AI สร้าง ซึ่งคู่แข่งจะยังปรากฏอยู่ สำหรับเว็บการตลาดส่วนใหญ่ การได้ปรากฏในคำตอบเหล่านั้นคุ้มกว่าการหวงเนื้อหา
คำศัพท์ที่เกี่ยวข้อง
กำลังทำเรื่อง Robots.txt อยู่ใช่ไหม? ดูว่าการตรวจสอบ SEO (SEO Audit)ของเราช่วยคุณได้อย่างไร
ดูการตรวจสอบ SEO (SEO Audit)