robots.txt साइट के रूट में रखी एक टेक्स्ट फ़ाइल है, जिसे सर्च क्रॉलर साइट को स्कैन करने से पहले पढ़ते हैं ताकि पता चले कि कौन-से हिस्से देखने की अनुमति है और कौन-से नहीं। दिलचस्प बात यह है कि Google खुद अलग-अलग काम के लिए अलग-अलग नाम वाले क्रॉलर भेजता है, न कि सिर्फ एक Googlebot।
User-agent, Disallow और Allow
फ़ाइल कई ब्लॉक में बंटी होती है, हर ब्लॉक User-agent: से शुरू होता है और उसके बाद Disallow तथा Allow निर्देश आते हैं, जो प्रतिबंधित और अनुमत पाथ बताते हैं। क्रॉलर उस पहले ब्लॉक के नियम अपनाता है जिसका User-agent उसके अपने नाम से मेल खाए, वरना User-agent: * वाला सामान्य ब्लॉक लागू होता है।
Googlebot-Image और Googlebot-News: एक ही कंपनी के अलग-अलग बॉट
बहुत से लोग सोचते हैं कि Google सिर्फ एक "Googlebot" भेजता है, लेकिन असल में इमेज सर्च के लिए Googlebot-Image और न्यूज़ सर्च के लिए अलग नामित क्रॉलर भी होते हैं। robots.txt में इनके लिए अलग User-agent ब्लॉक बनाकर, उदाहरण के लिए, इमेज गैलरी को इंडेक्स से रोका जा सकता है जबकि बाकी पेज सामान्य Googlebot के लिए खुले रहें।
Sitemap: क्रॉलर के लिए एक संकेत
Sitemap: निर्देश सर्च इंजन को बताता है कि sitemap.xml फ़ाइल कहाँ है। यह अनिवार्य नहीं है, पर सुविधाजनक है — क्रॉलर को साइटमैप का पाथ अंदाज़ा नहीं लगाना पड़ता और न ही केवल सर्च कंसोल में रजिस्ट्रेशन पर निर्भर रहना पड़ता है।
यह जांचना क्यों ज़रूरी है
- पब्लिश करने से पहले robots.txt का सिंटैक्स जांचें, ताकि एक छोटी टाइपो पूरी साइट को स्कैन से रोक न दे।
- यह पक्का करें कि अलग-अलग ब्लॉक के परस्पर विरोधी नियमों से कोई ज़रूरी हिस्सा अनजाने में बंद न हो जाए।
- किसी खास user-agent और पाथ का संयोजन तुरंत टेस्ट करें, अगले क्रॉल का इंतज़ार किए बिना।
Disallow पेज को सर्च नतीजों से क्यों नहीं हटाता
सबसे आम भ्रम यही है: Disallow बॉट को पेज की सामग्री स्कैन करने से रोकता है, लेकिन उस URL को इंडेक्स होने से नहीं रोकता। अगर किसी दूसरे इंडेक्स की गई साइट से उस बंद पेज का लिंक दिया गया हो, तो Google उसका URL बिना विवरण के नतीजों में दिखा सकता है, क्योंकि सामग्री कभी स्कैन ही नहीं हुई।