أجاب جون مولر من Google على سؤال حول ملف robots.txt وأوضح خطأ يسهل تفويته يمكن أن يؤثر على أهداف تحسين محركات البحث وفهرسة موقع الويب. كانت المشكلة المحددة تتعلق بفهرسة Google للرسائل غير المرغوب فيها في مربع البحث، ولكن هذا الخطأ يمكن أن يحدث لأي شخص بشكل عام تحت أي سياق.

مربع بحث الموقع الإلكتروني غير المرغوب فيه

كان الشخص الذي طرح السؤال على Reddit يعاني من هجوم البريد العشوائي في شريط البحث. ما يفعله مرسلي البريد العشوائي هو البحث باستخدام استعلام يعكس مكانتهم غير المرغوب فيها، ثم يقومون بإضافة رابط أو اسم موقع ويب. ما يحدث بعد ذلك هو أن شريط البحث ينشئ عنوان URL يمكن الرجوع إليه لإنشاء نتيجة بحث غير مرغوب فيها.

وهذا ما كان يحدث للشخص الذي كان يطرح السؤال. وكان ردهم هو إضافة سطر في ملف robots.txt لمنع Google من فهرسة الملف. لكن Google كان يقوم بفهرسة عناوين URL غير المرغوب فيها التي تم إنشاؤها بواسطة البحث على أي حال.

صفحات Google المفهرسة المحظورة بواسطة ملف Robots.txt

نشر أحد الأشخاص على Reddit أن مربع بحث Shopify الخاص بعميله كان يُنشئ صفحات ويب غير مرغوب فيها استجابةً لاستفسارات مرسلي البريد العشوائي وأن Google كانت تقوم بفهرستها على الرغم من وجود ملف robots.txt الذي يمنع Google من فهرسة تلك الصفحات. ما فعله العميل هو إعادة توجيه عناوين URL غير المرغوب فيها إلى صفحة ويب أخرى. لم يسأل الشخص الذي طرح السؤال عن كيفية إيقاف فهرسة الصفحات (وهو ما كان ينبغي أن يسأله)؛ لقد سألوا عما إذا كان يجب وضع علامة 404 على عناوين URL المعاد توجيهها بدلاً من ذلك.

سأل الشخص:

“العمل في متجر Shopify الخاص بالعميل حيث تمت إضافة /search كأمر غير مسموح به في ملف robots.txt، ومع ذلك لا تزال نتائج البحث هذه مفهرسة داخل Google.

ومع ذلك، إذا حاولت فتح إحدى هذه الصفحات، فستجد أنها تحتوي على مجموعة إعادة توجيه وتعيد التوجيه إلى صفحة مجموعة أخرى في المتجر. هل يجب أن نعرض صفحة 404 بدلاً من ذلك؟ ما هي أسهل طريقة لإصلاح هذا؟ “

لماذا تسبب ملف Robots.txt في فهرسة البريد العشوائي

اتخذ جون مولر من Google خطوة إضافية لتحديد ومراجعة ملف robots.txt الخاص بالعميل وحدد خطأ كان يتسبب في تجاهل Google للتوجيه الذي يمنع Googlebot من فهرسة صفحات نتائج البحث.

رد مولر:

“أيضًا، لست متأكدًا مما إذا كان موقعك، ولكن الموقع الذي وجدته مع عناوين URL مفهرسة مماثلة يحتوي على أقسام لـ “user-agent: Googlebot” (في كتلة “START: Custom Rules” في التعليقات) بالإضافة إلى المزيد في قسم “user-agent: *” في الأسفل. باستخدام ملف robots.txt، تفوز القواعد الأكثر تحديدًا، لذا إذا كان لديك وكيل مستخدم: قسم Googlebot، فسوف يستخدم *فقط* هذا القسم. إذا كنت تريد تطبيق جميع القواعد في قسم “وكيل المستخدم: *”، فأنت بحاجة إلى نسخها أيضًا، إذا كان هذا هو موقعك، فيمكنك فقط إدراج جميع وكلاء المستخدم الذين تريد أن تكون لديهم قواعد مشتركة معًا، على سبيل المثال:

وكيل المستخدم: googlebot

وكيل المستخدم:otherbot

وكيل المستخدم: imgsrc

وكيل المستخدم: Somethingpt

عدم السماح: / الأسماك

عدم السماح: /orange-cats

… إلخ …”

تحظى التوجيهات الخاصة بوكيل المستخدم بالأولوية

ما حدث هو أن العميل كان يعتمد على Google لاتباع التوجيهات في سطر يستهدف جميع وكلاء المستخدم، “user-agent: *”، ولكن نظرًا لوجود قسم آخر من ملف robots.txt خاص بـ Googlebot، تجاهلت Google توجيهات “user-agent: *” وامتثلت لتوجيهات Googlebot على وجه التحديد.

قد يبدو هذا غريبًا في الطريقة التي يعمل بها ملف robots.txt، ولكنه في الواقع منطقي لأن هذا يمكّن المستخدمين من استهداف برامج زحف محددة بقواعد فريدة واستهداف أي شخص آخر بمجموعة مختلفة من القواعد.

كيف تكون آمنًا من البريد العشوائي في مربع البحث

يمتلك كل من WordPress وShopify طرقًا للتخفيف من البريد العشوائي في مربع البحث.

يمتلك كل من WordPress وShopify طرقًا للتخفيف من البريد العشوائي في مربع البحث.

Shopify صندوق البحث للتخفيف من البريد العشوائي

يحتوي موقع Shopify على برنامج تعليمي حول كيفية إضافة توجيه noindex تلقائيًا إلى جميع نتائج البحث. سيؤدي هذا إلى منع فهرسة جميع صفحات نتائج البحث بشكل فعال. ومع ذلك، فمن الضروري عدم حظر صفحات البحث باستخدام ملف robots.txt حتى ينجح هذا الأمر.

يعد استخدام توجيه noindex أكثر فعالية من استخدام ملف robots.txt لأن ملف robots.txt لا يتحكم في الفهرسة؛ فهو يتحكم فقط في الزحف.

Shopify تعليمات:

“يمكنك إخفاء الصفحات غير المضمنة في ملف robots.txt.liquid الخاص بك عن طريق تخصيص قسم في ملف تخطيط theme.liquid الخاص بمتجرك. تحتاج إلى تضمين بعض رموز العلامات الوصفية لإيقاف فهرسة صفحات معينة.

من مسؤول Shopify الخاص بك، انتقل إلى المتجر عبر الإنترنت > السمات.

ابحث عن السمة التي تريد تحريرها، وانقر فوق الزر … لفتح قائمة الإجراءات، ثم انقر فوق تحرير التعليمات البرمجية.

في مجلد التخطيط، انقر فوق ملف theme.liquid.

لاستبعاد قالب البحث، الصق الكود التالي في سطر فارغ في قسم :

{% إذا كان القالب يحتوي على “بحث” %}
<اسم التعريف =”الروبوتات” المحتوى =”noindex”>
{% نهاية %}”

تخفيف البريد العشوائي في مربع بحث WordPress

من السهل جدًا التخفيف من البريد العشوائي في مربع البحث باستخدام WordPress. يتم تعيين مستخدمي المكونات الإضافية Yoast وRank Math وAIOSEO SEO على صفحات نتائج البحث الخاصة بهم تلقائيًا على noindex افتراضيًا. بالإضافة إلى ذلك، فإن بعض منشئي الصفحات والموضوعات مثل Divi (والموضوع الإضافي الخاص بها) لن يقوموا تلقائيًا بإنشاء كلمات وعناوين URL غير مرغوب فيها استجابةً لعمليات البحث، وبدلاً من ذلك سيضيفون بعض الجمل التي تشير إلى أن البحث لم ينتج عنه أي نتائج.

معرفة ملف Robots.txt

يتطلب تحسين محركات البحث الفعالة نطاقًا واسعًا من المعرفة. يحتوي ملف Robots.txt على بعض الأخطاء التي يمكن أن تجعله أقل فعالية مما هو مقصود، لذلك من المفيد قراءة المواصفات الرسمية لمواكبة التحديثات.

صورة مميزة بواسطة Shutterstock / Stockinq


اكتشاف المزيد من قمم التجارية للأعمال

اشترك للحصول على أحدث التدوينات المرسلة إلى بريدك الإلكتروني.

شاركها.
اترك تعليقاً