كل المقالات

robots.txt: كيف تقرر روبوتات البحث ما يمكنها فهرسته

robots.txt ملف نصي في جذر الموقع تقرأه روبوتات البحث قبل الزحف، لتعرف أي أقسام مسموح لها بزيارتها وأيها ممنوع. الملف بسيط في ظاهره، لكن قواعده تحتمل رموزًا خاصة قد تُفسَّر بشكل مختلف بين محرك بحث وآخر.

توجيهات User-agent وDisallow وAllow

يتكون الملف من كتل، تبدأ كل كتلة بسطر User-agent: يليه توجيها Disallow وAllow اللذان يحددان المسارات الممنوعة والمسموحة. يطبّق الروبوت أول كتلة يتطابق اسم User-agent فيها مع اسمه، وإن لم توجد كتلة مطابقة يلجأ إلى الكتلة العامة User-agent: *.

الرمزان * و$: امتداد غير رسمي أثبت نفسه

يدعم Googlebot ومعظم الروبوتات الحديثة الرمز * للدلالة على أي تسلسل من الأحرف، والرمز $ للدلالة على نهاية الرابط — فمثلاً Disallow: /*.pdf$ يمنع الزحف إلى جميع ملفات PDF أينما وُجدت في الموقع. لكن هذا الامتداد لم يكن جزءًا من مواصفة robots.txt الأصلية لعام 1994، لذلك قد تتجاهله بعض الروبوتات الأقدم أو الأقل شيوعًا وتتعامل مع الرمزين كحرفين عاديين في المسار.

توجيه Sitemap كإشارة للروبوت

يشير توجيه Sitemap: داخل robots.txt إلى موقع ملف sitemap.xml. هذا التوجيه اختياري لكنه مفيد: فلا يضطر الروبوت إلى تخمين مسار خريطة الموقع أو الاعتماد فقط على تسجيلها في أدوات مشرفي المواقع.

لماذا هذا الفحص مهم

  • التحقق من صحة صيغة robots.txt قبل نشره، حتى لا يؤدي خطأ إملائي بسيط إلى منع الموقع بأكمله من الزحف.
  • التأكد من أن أقسامًا مهمة من الموقع لم تُغلق بالخطأ بسبب تعارض القواعد بين الكتل المختلفة.
  • اختبار تركيبة معينة من user-agent ومسار فوري دون انتظار زحف جديد من الروبوت.

لماذا لا يخفي Disallow الصفحة من نتائج البحث

هذا هو الالتباس الأكثر شيوعًا: يمنع Disallow الروبوت من الزحف إلى محتوى الصفحة، لكنه لا يمنع فهرسة رابطها. فإذا كان هناك رابط لتلك الصفحة الممنوعة من موقع آخر مفهرس، قد يعرض Google رابطها في النتائج بلا وصف، لأن المحتوى لم يُزحَف إليه أصلاً.

جرّب الأداة