Back to articles

13% من المواقع المدققة تمنع الزاحف الذكي — تصحيح ما فعلناه 40.8%

SEOReport Team·
ai-crawlersrobots-txtai-searchgenerative-engine-optimizationtechnical-seodata-analysis

نقرأ كل ملف robots.txt في عينة الاختبار ووجدنا عيوب 2 في محللنا الخاص. المعدل المصحح هو 6 من 45 المواقع المدققة — 13.3%، وليس 40.8% الذي نشرناه أولاً. لا يزال تقسيم التدريب مقابل البحث يحدد ما إذا كان بمقدور مساعدين الذكاء الاصطناعي الاستشهاد بك.

تم تحديث August 31, 2026. الإصدار الذي نشرته هذه المقالة في أغسطس 20 كان بعنوان "20 من 49 المواقع التي تدققت — 40.8%". " كان هذا الرقم خاطئًا مرتين. 40.8% كان حصة تشغيلات التدقيق الفردية التي فشلت في الفحص، وليس حصة المواقع المتميزة، وعند ضربها مرة أخرى على عدد المواقع تم إنتاج "20 مواقع" لم يُعدها أحد. الأكثر سوءًا، عندما عدنا وقرأنا كل robots. txt في العينة مقابل المواصفة، عيوب 2 في محللنا الخاص تبين أنها تُنتج نصف الفشل. الأرقام المصححة أدناه، والتصحيح هو الآن النصف الأكثر فائدة من هذه المقالة. كل تدقيق نقوم به يجلب robots.txt ويقرأه بالطريقة التي سيقرأها الزاحف الذكي. في August 31, 2026 أعدنا جلب الملف من جميع المجالات المتميزة 48 التي تدققت في نافذة محركنا الحالية، و45 منها خدموا واحدًا. من بين تلك 45، 6 مواقع — 13.3% — أغلقت على الأقل 1 زاحف ذكاء اصطناعي رئيسي من الموقع بأكمله. في الطرف المقابل، لا توجد قواعد تنطبق على الزواحف الذكية على الإطلاق في 8 مواقع — ليس حتى توجيه عام لهم للامتثال. هذا هو 17.8% من العينة. يترك 31 مواقع — 68.9% من العينة — مع robots.txt يعلن سياسة سيقرأها الزاحف الذكي ويمنع أي منها على مستوى الموقع. في عام عندما يقتبس ChatGPT البحث، Perplexity، وClaude المصادر عن طريق جلبها، أصبح الملف الذي لم يفتحه معظم المالكين منذ الإطلاق بمثابة مفتاح للظهور. أقل عدد من الأشخاص أوقفوه عن العمل مما أبلغنا عنه في البداية. أكثر منهم لم يلمسه أبدًا.

تمنع على الأقل 1 زاحف ذكاء اصطناعي على مستوى الموقع613.3%
لا توجد قواعد تنطبق على الزواحف الآلية على الإطلاق817.8%
قواعد صريحة، لا حظر على مستوى الموقع3168.9%

المنهجية. السكان هم كل نطاق مميز مع تدقيق مكتمل في نافذة محركنا الحالية، التي تعمل من مايو 23 إلى August 31, 2026. هذا هو 48 نطاقات عبر 228 تشغيل تقارير. القرارات المخزنة تحمل إجابة المحلل المعيب، لذلك الجدول أعلاه ليس المجموع المخزن. إنه إعادة جلب في نفس اليوم لتلك الروبوتات الحية. ملفات txt، مقروءة في أغسطس 31 وتقييمها مع المحلل المصحح. 3 من 48 لم تعد تخدم روبوتات. txt على الإطلاق، وهو ما يفسر أن المقام هو 45. العينة مختارة ذاتيًا — هذه هي المواقع التي اختار شخص ما تشغيل تدقيق عليها — وتميل إلى الصغر إلى المتوسط. عامل القيم كاتجاهات للذيل الطويل للويب بدلاً من الويب بأكمله. النطاقات غير مسماة.

AI-Crawler Posture in robots.txt Across 45 Audited Sites (re-read 2026-08-31)

ما أخطأ فيه محللنا، وكيف وجدناه

التحقق نفسه بسيط. محركنا يحلل كل مجموعة robots.txt ويقيّم 6 وكلاء مستخدم مقابلها: GPTBot, OAI-SearchBot, PerplexityBot, ClaudeBot, Claude-SearchBot, وCCBot. يُعد الزاحف محظورًا فقط عندما تحمل المجموعة التي تحكمه Disallow: / على مستوى الموقع. الإيقاف الجزئي مثل Disallow: /admin يسجل كسياسة معلنة، وهو صحي، ويجتاز. تطبيق ذلك التعريف بشكل صحيح هو ما فشلنا فيه. إعادة قراءة جميع ملفات 45 أظهرت 2 عيوب مميزة، تسحب في اتجاهات متعاكسة. الـ Disallow: الفارغ ليس حظرًا. RFC 9309 هو واضح أن القاعدة بدون مسار تُتجاهل، مما يجعل Disallow: الطريقة الكنسية لقول السماح بكل شيء. يطلق Yoast نفس الملف بالافتراضي، وكذلك العديد من مضيفي المواقع المشتركة. اعتبر محللنا القيمة الفارغة مساوية لـ / وأشار إلى جميع الـ 6 خزائن كمنع. 5 من مواقع 10 التي حددها المحرك كانت تشغل ملفًا يسمح بكل شيء: 3 منهم كان حظر Yoast الافتراضي حرفيًا، 1 منهم ملف سطر واحد 2. تتجاوز المجموعة المسماة النمط العام. يذكر RFC 9309 أيضًا أن الزاحف يطيع المجموعة الأكثر تحديدًا التي تسميه ويتجاهل User-agent: * تمامًا عندما توجد مثل هذه المجموعة. قرأ محللنا كل مجموعة متطابقة حسب ترتيب الملف وأسمح للمجموعة الأخيرة بالفوز. هذا يقطع كلا الاتجاهين. منصة اجتماعية كبيرة في العينة تسمي GPTBot، ClaudeBot، و PerplexityBot بقواعد مسار ضيقة ثم تغلق الملف بمصطلح شامل User-agent: * / Disallow: / — أرسل محللنا تلك 3 خزائن المسماة المصطلح الشامل الذي كانوا معفيين منه. و 1 موقع تم حسابه بشكل خاطئ في الاتجاه الآخر: يمنع 3 خزائن الذكاء الاصطناعي بالاسم بالقرب من أعلى ملفه، ثم يذكر قواعد نمط أكثر تساهلاً في الأسفل، وأسمح محللنا للنمط العام بمحو حظر حقيقي ومقصود. كان ذلك الموقع يمرّ. تم إصلاح كلا العيبين الآن، مع اختبارات وحدة مبنية من الملفات الدقيقة التي كشفتهما. التأثير الصافي على هذه العينة: 5 المواقع التي كان المحلل القديم يطلق عليها منع ليست كذلك، و 1 الموقع الذي كان يطلق عليه نظيف هو. أرقام 3 جنبًا إلى جنب، جميعها من نفس النافذة: قراءات الأحكام المخزنة للمحرك هي 42.9% من 226 تشغيل تدقيق فردي و 21.3% من 47 مواقع؛ إعادة قراءة الملفات الحية مع المحلل المصحح تعطي 13.3% من 45 مواقع. آخر واحد فقط هو ادعاء حول المواقع، مقاسًا بمحلل يقرأ المواصفة بشكل صحيح. خاصية واحدة من الفحص تبقى على ما هي عليه: لا تزال محافظة. تحدي WAF، قاعدة بوت CDN، أو حظر جدار حماية لا يظهر أبدًا في robots.txt، لذا يبقى 13.3٪ حدًا أدنى لعدد المواقع التي تُبعد هذه الزواحف فعليًا. وما زال بإمكان الموقع حظر زاحف دون كتابة اسمه أبدًا — يمنع نمط عام شامل مكتوب لبيئة معاينة ينطبق على GPTBot تمامًا كما ينطبق على كل شيء آخر. 2 من 6 حواجز مؤكدة تصل على الأقل إلى 1 زاحف بهذه الطريقة: مضيف معاينة حيث يكون robots.txt بالكامل عبارة عن 3-سطر منع شامل، ومنصة كبيرة حيث يغسل المصطلح الشامل النهائي خزائن 3 التي لم يذكرها.

قاعدة مكتوبة في 2023 تجيب على السؤال الخاطئ في 2026

معدلنا المصحح الآن أقل من ما تقارنه عينات خارجية أكبر. تحليل مارس 2026 لـ 10,000 موقع بواسطة SEO Score Tools وجد 18.7٪ يوقفون GPTBot بنشاط و 41.3٪ لا يحملون قواعد robots محددة للذكاء الاصطناعي على الإطلاق. كلا من أرقامهم تقع أعلى من أرقامنا — الاختلافات في التعاريف بين العينات، عينةنا هي جزء من الحجم، وتحصيلنا للـ wildcard كمجموعة سياسة مطبقة حيث يبحث الآخرون عن المسمى. لا ندّعي أن 13.3% لدينا يدفع عكس 18.7%؛ عينة 45 لا يمكنها. ما يتفق عليه كلا المجموعتين هو الشكل: أقلية من الويب اتخذت قرارًا بخصوص الوصول للذكاء الاصطناعي، شريحة أخرى اتخذت قرارًا دون أن تعرف، والباقي لم يُطلب منهم. الجزء غير المُؤخذ في الاعتبار هو القصة، وبياناتنا المصححة حذرة بشأن أي جزء هو ذلك. الحظر 6 الذي أكدناه غالبًا مقصود — 4 يذكر الزاحف، و 2 من هؤلاء يشغلون قائمة إشارات المحتوى المُدارة من Cloudflare، وهي سياسة مكتوبة هذا العام وليست بقايا. ما لا يمكننا عرضه من مواقع 45 هو مدى انتشار قاعدة الويب الأوسع التي لا تزال تحمل قاعدة قديمة؛ هذا ما تُظهره العينات الخارجية أعلاه. الميكانيزم يستحق التوضيح على أي حال، لأنه ما يجعل قاعدة قديمة مكلفة. في 2023، عندما ظهر GPTBot لأول مرة في سجلات الخادم وأصبح CCBot مشهورًا كمصدر تدريب، كان النتيجة المعروفة الوحيدة للوصول هو تدريب النموذج — لذلك انتشرت قوائم حظر البوت، وأُرسلت الإضافات مع مفاتيح تبديل 1-click، وتوارثت ملفات robots.txt القيود التي لم يقرأها أحد منذ ذلك الحين. السؤال الذي أجابت عليه تلك القواعد كان "هل أريد أن يكون محتواي في مجموعة تدريب؟" السؤال الذي يهم في 2026 مختلف: "هل أريد أن أكون قابلًا للعثور عليه ومقتبسًا عندما يجيب مساعد على موضوعي؟" قاعدة مكتوبة للسؤال الأول الآن تجيب بصمت على الثاني.

يستحق عناكب التدريب وعناكب البحث إجابات مختلفة

عناكب 6 التي نفحصها تنقسم بوضوح إلى مهام 2، لكل وثائق البوت المنشورة لكل مشغل:

  • البحث والاسترجاع. OAI-SearchBot يُفهرس المحتوى بحيث يمكن لـ ChatGPT البحث إظهار وربطه به — OpenAI وثائق تفيد أن هذا الوصول، ولا هذا الوصول فقط، يحدد ما إذا كانت الصفحات تُعتبر للنتائج البحثية لـ ChatGPT. يبني PerplexityBot فهرس البحث الخاص بـ Perplexity. يُفهرس Claude-SearchBot لتحسين إجابات Claude المدعومة بالبحث. حظر أيٍّ من هذه يزيلك من اقتباسات ذلك المساعد.
  • التدريب. يجمع GPTBot المحتوى الذي قد يدرب نماذج OpenAI. يقوم ClaudeBot بالتنقيب المكافئ لـ Anthropic. يغذي CCBot Common Crawl، المجموعة المفتوحة خلف العديد من مجموعات بيانات البحث والتدريب. صرح OpenAI بأن حظر GPTBot لا يؤثر على شمول ChatGPT في البحث — الأنابيب 2 منفصلتين.

يجرى Google نفس التقسيم تحت أسماء مختلفة: يبرز AI الخاص به على أساس وصول Googlebot العادي، بينما يتحكم توكن Google-Extended المنفصل في تدريب Gemini وتأسيسه. غطينا تلك الآلية في دليلنا لبحث Google التوليدي.

graph TD A[يطلب الزاحف الذكي صفحتك] --> B{أي نوع?} B --> C["البحث والاسترجاع:<br/>OAI-SearchBot, PerplexityBot,<br/>Claude-SearchBot"] B --> D["التدريب:<br/>GPTBot, ClaudeBot, CCBot"] C -->|مسموح| E[مؤهل للإجابات الذكية والاستشهادات] C -->|غير مسموح| F[غير موجود في إجابات ذلك المساعد] D -->|مسموح| G[قد يُستخدم المحتوى لتدريب نماذج مستقبلية] D -->|غير مسموح| H[لا يؤثر على ظهور البحث الذكي]

التحويل يحول القلق الضبابي إلى قرار 2-جزء. حظر الزواحف التدريبية هو موقف مشروع حول كيفية إعادة استخدام محتواك، ولا يكلفك شيئًا في بحث الذكاء الاصطناعي. حظر الزواحف الاسترجاعية هو قرار مرئي — نفس الفئة كعدم الفهرسة بنفسك — ويستحق نفس الدقة.

اكتب ملف robots.txt يسجل القرار

إليك سياسة تبقى مرئية بالكامل في بحث الذكاء الاصطناعي مع حجب موافقة التدريب — أكثر تقسيمات متعمدة شيوعًا نراها:

# Search & retrieval — open, so assistants can find and cite this site
User-agent: OAI-SearchBot
Allow: /
User-agent: PerplexityBot
Allow: /
User-agent: Claude-SearchBot
Allow: /
# Training — withheld; this has no effect on AI search visibility
User-agent: GPTBot
Disallow: /
User-agent: ClaudeBot
Disallow: /
User-agent: CCBot
Disallow: /

إذا كنت تريد كل شيء مفتوحًا، قل ذلك صراحةً بدلاً من الإغفال — مجموعة Allow: / مسماة لكل زاحف توثق أن شخصًا ما قرر، وهو ما يفتقده الـ17.8% الذين لا توجد لديهم قواعد قابلة للتطبيق. خطوات 3 التحقق تغلق الحلقة. احصل على https://yoursite.com/robots.txt من خارج شبكتك واقرأ ما تقدمه الإنتاج فعليًا — يمكن للـCDNs والمنصات حقن أو تجاوز الملف في مستودعك، وبعض موفري الحافة يرسلون حظر بوت AI بنقرة واحدة يتجاوز تعليماتك بالكامل. افحص أي قواعد WAF أو إدارة بوت للوكالات 6 نفسها، لأن إذن robots.txt لا يعني شيئًا لزاحف يحصل على 403. ثم أعد تشغيل الفحص بعد كل تغيير في البنية التحتية؛ يمكن أن يغير مزود الخدمة هذا المفتاح دون لمس كودك. ملاحظة واحدة حول كيفية قراءة تدقيقنا للسياسة المتعمدة أعلاه: سيظل الإيقاف العام على GPTBot، ClaudeBot، وCCBot يظهر كإيجاد. هذا حسب التصميم. يجب أن يكون حظر الزاحف الذكي على مستوى الموقع قرارًا مؤكدًا دائمًا، والنتيجة هي حيث تؤكد ذلك — وضع الفشل الذي يهدف هذا الفحص إلى اكتشافه هو الحظر الذي لا يذكر أحد كتابته.

أرقى تدقيق للظهور ستجريه هذا العام

robots.txt هو 1 من 2 الملفات التي يتحدث عبرها موقعك إلى أنظمة الذكاء الاصطناعي — الأخرى هي llms.txt، حيث تُظهر بياناتنا 76% من الملفات تفشل في الوكلاء الذين كُتبت لهم. كلاهما يشارك نفس توقيع الفشل كالحصص في هذا التقرير: مكتوب مرة واحدة، معقول نحويًا، لا يُقرأ مرة أخرى. كذلك فعلنا محللنا، وهو الجزء غير المريح من هذا التصحيح — قاعدة لم تُعاد قراءتها منذ يوم كتابتها هي بالضبط ما يهدف هذا الفحص إلى اكتشافه، ولم تُعاد قراءتها أيضًا لدينا. الصورة المصححة أيضًا أكثر تشجيعًا من العنوان الذي أجريناه أولًا. 4 من مواقع 6 التي تمنع زاحفًا ذكاءً اصطناعيًا على مستوى الموقع باسم يحدده الزاحف صراحةً، و2 من تلك 4 يجرون حظر إشارات المحتوى المُدار من Cloudflare — سياسة 2026 اختارها شخص ما، وليس قاعدة 2023 لم يقرأها أحد. الحصص العرضية هي الباقي، وهي عدد قليل. الفجوة الأكبر في هذا العينة ليست في إغلاق المواقع للروبوتات الذكية؛ بل هي 8 المواقع التي لا يحتوي ملف robots.txt الخاص بها على أي شيء يمكن للروبوت الذكي قراءته على الإطلاق. قراءة ملفك الخاص تستغرق 2 دقيقة؛ التقرير المجاني (https://seoreport.dev) يقرأه لك، يذكر كل من 6 الزواحف، ويظهر بالضبط القاعدة التي تنطبق على كل منها — لذا القرار المسجل هو الذي قمت به فعلاً.

انظر كيف يصنف موقعك

احصل على تقرير مجاني مدعوم بالذكاء الاصطناعي SEO مع نتائج قابلة للتنفيذ وإصلاحات أولوية لموقعك.

لا حاجة للتسجيل.