Technical SEO
Crawling คืออะไร
Crawling (การไต่หน้าเว็บ) คือกระบวนการที่บอทของ search engine ค้นพบหน้าเว็บต่าง ๆ บนอินเทอร์เน็ตด้วยการเดินตามลิงก์และอ่านเนื้อหา
Crawler อย่าง Googlebot จะดึงหน้าเว็บมา อ่านเนื้อหาและลิงก์ภายในหน้า จากนั้นนำลิงก์ใหม่ที่พบไปเข้าคิวเพื่อไต่ต่อ หากหน้าใดไม่สามารถถูก crawl ได้ โดยทั่วไปหน้านั้นก็จะไม่สามารถถูก index หรือจัดอันดับได้ การวางโครงสร้าง internal link ที่ชัดเจนและ sitemap ที่สะอาดจะช่วยให้ crawler ค้นพบทุกหน้าที่สำคัญได้
พฤติกรรมการ crawl สังเกตได้จริง และ server log คือที่เดียวที่เห็นมันตรง ๆ Analytics แสดงมนุษย์ Search Console แสดงสรุปแบบสุ่มตัวอย่าง แต่ log แสดงทุก request ที่ Googlebot ยิงเข้ามาจริงพร้อมสถานะที่ได้รับกลับไป ตรงนั้นคือที่ที่เจอเรื่องน่าตกใจที่กินงบ เช่น crawler ใช้ request ส่วนใหญ่ไปกับ URL ที่มีพารามิเตอร์ หรือวิ่งผ่าน redirect สี่ทอดทุกครั้ง หรือได้ error 500 ที่ไม่มีผู้ใช้คนไหนเคยเจอ สำหรับเว็บที่เกินไม่กี่พัน URL การไล่ log ปีละครั้งสองครั้งเจอปัญหาที่การจำลอง crawl ไม่เคยเห็น
ตัวอย่าง
log เซิร์ฟเวอร์หนึ่งวันของร้านค้าออนไลน์แสดงว่า Googlebot ยิงเข้ามา 9,400 ครั้ง 6,100 ครั้งไปเจอ URL ตัวกรองอย่าง /shoes?colour=red&sort=price อีก 200 ครั้งเจอ error และมีแค่ 3,100 ครั้งที่ถึงหน้าสินค้าจริง สินค้าใหม่ใช้เวลาสามสัปดาห์กว่าจะโผล่ในผลการค้นหา การบล็อกพารามิเตอร์ตัวกรองพาแรง crawl กลับไปหาหน้าที่ขายของได้
คำถามที่พบบ่อย
- ทำไม Google ไม่ crawl บางหน้าของเรา
- สาเหตุที่พบบ่อยคือไม่มีลิงก์ชี้ไปหน้านั้น robots.txt บล็อกพาธนั้นไว้ หน้าอยู่ลึกเกินไปในโครงสร้างเว็บ หรือ crawl budget ถูกใช้หมดไปกับ URL ที่ไม่มีคุณค่าก่อน รายงาน Pages ใน Search Console จะบอกว่าเป็นสาเหตุไหน แทนที่จะต้องเดา
- crawler รัน JavaScript ของเราหรือเปล่า
- Googlebot เรนเดอร์ JavaScript ได้ แต่ทำในรอบที่สองซึ่งอาจล่าช้า และ crawler อื่นอีกหลายตัวรวมถึงบอท AI หลายรายไม่เรนเดอร์เลย ถ้าเนื้อหาของคุณมีอยู่ก็ต่อเมื่อ JavaScript ทำงานแล้ว ให้ถือว่า crawler จำนวนไม่น้อยไม่เคยเห็นเนื้อหานั้น
คำศัพท์ที่เกี่ยวข้อง
กำลังทำเรื่อง Crawling อยู่ใช่ไหม? ดูว่าการตรวจสอบ SEO (SEO Audit)ของเราช่วยคุณได้อย่างไร
ดูการตรวจสอบ SEO (SEO Audit)