तेज़, साफ़ इंडेक्सिंग के लिए XML साइटमैप की सर्वश्रेष्ठ प्रथाएं
क्या शामिल करें, क्या बाहर रखें, साइज़ लिमिट, और साइटमैप की वे गलतियां जो चुपचाप क्रॉल बजट बर्बाद करती हैं।
साइटमैप एक संकेत है, गारंटी नहीं
सर्च इंजन साइटमैप को एक मज़बूत डिस्कवरी सिग्नल मानते हैं, कोई आदेश नहीं। यह कम-गुणवत्ता वाले पेजों को इंडेक्स होने पर मजबूर नहीं करेगा — यह जो करता है वह यह है कि आप किन URL को कैनोनिकल और क्रॉल करने लायक मानते हैं, इसमें कोई शक नहीं छोड़ता, जो बड़ी या नई साइटों पर सबसे ज़्यादा मायने रखता है।
क्या शामिल करें
- सिर्फ़ कैनोनिकल URL — वह सटीक वर्शन जिसे आप इंडेक्स करवाना चाहते हैं।
- सिर्फ़ वे URL जो 200 स्टेटस देते हैं और वाकई इंडेक्स करने लायक हैं (कोई
noindexटैग नहीं, robots.txt से ब्लॉक नहीं)। - एक सटीक
lastmodतारीख — इसे तभी अपडेट करें जब पेज का कंटेंट वाकई बदले, हर डिप्लॉय पर नहीं।
क्या बाहर रखें
noindexटैग वाले पेज — साइटमैप में एक को शामिल करना विरोधाभासी संकेत भेजता है।- रीडायरेक्ट या 404 होने वाले URL — इन्हें डिस्कवरी में मदद करने के बजाय साइटमैप एरर के तौर पर रिपोर्ट किया जाता है।
- एक ही पेज के डुप्लीकेट या पैरामीटराइज़्ड वर्शन (सॉर्ट ऑर्डर, सेशन ID, ट्रैकिंग पैरामीटर) — सिर्फ़ एक कैनोनिकल वर्शन लिस्ट करें।
- बहुत कम यूनीक कंटेंट वाले पतले, ऑटो-जनरेटेड पेज — ये "Crawled - currently not indexed" की एक आम वजह हैं, और सैकड़ों ऐसे पेज शामिल करने से महत्वपूर्ण पेजों के लिए साइटमैप का सिग्नल कमज़ोर हो जाता है।
साइज़ लिमिट
एक सिंगल साइटमैप फ़ाइल की सीमा 50,000 URL और 50MB अनकंप्रेस्ड है। बड़ी साइटों को एक विशाल फ़ाइल के बजाय एक साइटमैप इंडेक्स फ़ाइल की ज़रूरत होती है — एक फ़ाइल जो कई चाइल्ड साइटमैप लिस्ट करती है। ज़्यादातर फ्रेमवर्क (इस साइट सहित) यह अपने आप जनरेट करते हैं, लेकिन अगर आप इसे मैन्युअल रूप से बना रहे हैं तो यह जांचना ज़रूरी है।
इसे सबमिट और मेंटेन करना
इसे एक बार Google Search Console और Bing Webmaster Tools दोनों में सबमिट करें, और अपनी robots.txt में इसकी ओर पॉइंट करती एक Sitemap: लाइन जोड़ें — इस तरह जो भी क्रॉलर बिना पहले सबमिशन के आपकी साइट को खुद खोजता है, वह भी इसे ढूंढ सकता है। इसके बाद, कंटेंट बदलने पर साइटमैप को अपने आप रीजनरेट होना चाहिए; मैन्युअल रूप से मेंटेन किया गया साइटमैप लगभग हमेशा पुराना पड़ जाता है।
आम गलतियां जो चुपचाप क्रॉल बजट बर्बाद करती हैं
- इसे लॉन्च के समय एक बार जनरेट करना और पेज जोड़े या हटाए जाने पर कभी अपडेट न करना।
- हर बिल्ड पर हर URL के
lastmodको मौजूदा तारीख पर सेट करना — यह क्रॉलर को इस फ़ील्ड को असली बदलाव संकेत मानना बंद करने की ट्रेनिंग देता है। - किसी बड़े URL रीस्ट्रक्चर (जैसे डोमेन माइग्रेशन या परमालिंक बदलाव) के बाद फिर से सबमिट करना भूल जाना — Google को आखिरकार खुद पता चल जाएगा, लेकिन फिर से सबमिट करने से बदलाव तेज़ हो जाता है।
चाहते हैं कि आपका अगला पेज केवल ऑर्गेनिक क्रॉलिंग से कहीं तेज़ खोजा जाए?
IndexLaunch आपके क्यू करते ही हर URL को सीधे Bing, Yandex, Seznam और Naver तक IndexNow के ज़रिए पहुंचाता है।
मूल्य देखें