كيف تعمل محركات البحث: الزحف والفهرسة والترتيب
![]() |
| كيف تعمل محركات البحث: الزحف والفهرسة والترتيب |
كما ذكرنا في الفصل الأول ، فإن محركات البحث هي آلات للرد على المكالمات. فهي موجودة لاكتشاف محتوى الإنترنت وفهمه وتنظيمه لتقديم النتائج الأكثر صلة بالأسئلة التي يطرحها الباحثون.
من أجل الظهور في نتائج البحث ، يجب أن يكون المحتوى الخاص بك مرئيًا لمحركات البحث أولاً. يمكن القول إنها أهم جزء في أحجية تحسين محركات البحث: إذا تعذر العثور على موقع الويب الخاص بك ، فلن تجد طريقك إلى صفحات نتائج محرك البحث (SERPs).
كيف عمل محركات البحث؟
لمحرك البحث ثلاث وظائف أساسية:
- الزحف: ابحث في الإنترنت عن المحتوى ، وابحث عن رمز / محتوى لكل عنوان URL يعثرون عليه.
- الفهرس: قم بتخزين وتنظيم المحتوى الموجود أثناء الزحف. بمجرد إدراج الصفحة في الفهرس ، يتم عرض عمليات البحث ذات الصلة مباشرة.
- تصنيف: يعرض المحتوى الذي يجيب على بحثك بشكل أفضل ، مما يعني أن النتائج مرتبة من الأكثر صلة إلى الأقل صلة.
ما هو محرك البحث الزحف؟
الزحف هو عملية الاكتشاف التي ترسل من خلالها محركات البحث مجموعة من الروبوتات (تسمى برامج الزحف أو العناكب) للعثور على محتوى جديد ومحدث. قد يختلف المحتوى - قد يكون صفحات ويب وصورًا ومقاطع فيديو وملفات PDF وما إلى ذلك - ولكن بغض النظر عن التنسيق ، يتم اكتشاف المحتوى من خلال الروابط.
يجلب Googlebot أولاً بعض صفحات الويب ويتبع الروابط الموجودة على تلك الصفحات للعثور على عناوين URL جديدة. من خلال التنقل على طول هذا المسار من الروابط الموجودة في هذه الصفحات ، يكون الزاحف قادرًا على العثور على محتوى جديد وإضافته إلى فهرس يسمى Caffeine - وهي قاعدة بيانات ضخمة لعناوين URL المكتشفة والمفهرسة - عندما يكون ذلك لاحقًا عند البحث في نتائج البحث يبحث شخص ما عن معلومات تتطابق بشكل وثيق مع ما هو موجود في عناوين URL هذه أو تطابق مصطلحات البحث التي قصدها الباحث.
ما هو فهرس محرك البحث؟
تقوم محركات البحث بمعالجة المعلومات التي يعثرون عليها وتخزينها في فهرسهم ، وهي قاعدة بيانات ضخمة تحتوي على كل ما يعثرون عليه أثناء الزحف ، وهو ما يكفي لخدمة الباحثين.
ترتيب نتائج محرك البحث
عندما يقوم شخص ما بإجراء بحث ، يقوم محرك البحث بمسح فهرسه بحثًا عن محتوى وثيق الصلة بمصطلح البحث المستخدم ، ثم يعرض هذا المحتوى للباحث ، ونأمل أن يجيب على مصطلح البحث المستخدم. تسمى طريقة ترتيب نتائج البحث حسب الصلة بالترتيب. بشكل عام ، يمكنك أن تفترض أنه كلما ارتفع ترتيب موقع الويب في نتائج البحث ، كلما كان هذا الموقع أكثر صلة بمصطلحات البحث المستخدمة ، كما تعتقد خوارزميات محرك البحث.
يمكنك منع برامج الزحف لمحركات البحث من الوصول إلى أجزاء معينة من موقع الويب الخاص بك أو موقع الويب بالكامل ، أو منع محركات البحث من تخزين صفحات معينة في فهارسها. على الرغم من وجود أسباب للقيام بذلك ، إذا كنت تريد أن يعثر الباحثون على المحتوى الخاص بك ، فيجب عليك أولاً التأكد من أنه قابل للزحف والفهرسة. خلاف ذلك ، فهم بخير ، ولكن ما الهدف منها عندما لا تكون مرئية لبرامج البحث أو المستخدمين؟
بنهاية هذا الفصل ، ستكون قادرًا على تحسين محتوى موقع الويب الخاص بك ليتوافق مع محركات البحث ، وليس ضدها!
ركز في مُحسّنات محرّكات البحث ، لا يتم إنشاء جميع محركات البحث على قدم المساواة.
يتساءل العديد من المبتدئين عن الأهمية النسبية لمحركات البحث الخاصة. يعرف معظم الناس أن Google لديها أكبر حصة في السوق ، ولكن ما مدى أهمية تحسين Bing و Yahoo وغيرهما؟ في الواقع ، بينما يوجد أكثر من 30 محرك بحث رئيسي على الويب ، فإن خبراء تحسين محركات البحث (SEO) يهتمون فقط بـ Google. لماذا ا؟
الإجابة المختصرة هي أن Google هي المكان الذي يبحث فيه الغالبية العظمى من الناس على الويب. إذا قمنا بتضمين صور Google وخرائط Google و YouTube ، فإن أكثر من 90٪ من جميع عمليات البحث على الويب تتم على Google - ما يقرب من 20 مرة أكثر من محركات بحث Bing و Yahoo.
بعد الزحف هل يمكن لمحركات البحث العثور على موقعك؟
كما تعلمت للتو ، فإن التأكد من الزحف إلى موقع الويب الخاص بك وفهرسته هو شرط أساسي للظهور في SERPs.
إذا كان لديك موقع ويب بالفعل ، فقد ترغب في البدء بالتحقق من عدد صفحاتك الموجودة في الفهرس. سيعطيك هذا نظرة ثاقبة حول ما إذا كان محرك بحث Google يقوم بالزحف والبحث في جميع الصفحات المهمة من موقعك التي تريد تضمينها في نتائج البحث ، وليس أي صفحات أخرى غير مهمة.
إحدى طرق التحقق من فهرسة صفحتك هي "site: yourdomain.com" ، عامل تشغيل بحث متقدم.
انتقل إلى Google واكتب "site: yourdomain.com" في شريط البحث واستبدل yourdomain.com بعنوان URL لموقعك على الويب. سيظهر هذا الروابط التي تمت فهرستها بالفعل بواسطة Google:
عدد الصفحات المفهرسة بواسطة Google هو 61،700 ، هذا الرقم ليس دقيقًا ، لكنه يمكن أن يعطيك فكرة عن عدد صفحات موقعك المفهرسة وكيف تظهر حاليًا في نتائج البحث.
للحصول على نتائج أكثر دقة ، راقب واستخدم تقرير تغطية الفهرس في Google Search Console.
إذا لم يكن لديك بالفعل حساب Google Search Console مجاني ، فيمكنك التسجيل للحصول على حساب. باستخدام هذه الأداة ، يمكنك إرسال خريطة موقع لموقع الويب الخاص بك ومراقبة عدد الصفحات المرسلة التي تمت إضافتها إلى فهرس Google والمزيد.
إذا لم يظهر موقعك في نتائج البحث ، فقد تكون هناك عدة أسباب:
- موقعك جديد ولم يتم الزحف إليه بعد.
- موقع الويب الخاص بك جديد ولا يحتوي على أي روابط خلفية من أي موقع ويب آخر.
- قد يجعل تصفح موقعك من الصعب على الروبوتات الزحف إليه بشكل فعال.
- يحتوي موقعك على بعض التعليمات البرمجية الأساسية التي تمنع عناكب محركات البحث وتقوم بفهرستها.
- تمت معاقبة موقعك من قبل Google بسبب تكتيكات البريد العشوائي.
كيف أخبر محركات البحث بكيفية الزحف إلى موقعك؟
إذا كنت تستخدم Google Search Console أو مشغل البحث المتقدم "site: domain.com" ووجدت أن بعض الصفحات المهمة مفقودة من الفهرس و / أو تمت فهرسة بعض الصفحات غير المهمة ، فهناك بعض التحسينات التي يمكنك تنفيذها لتوجيه Googlebot بشكل أفضل إلى لكيفية الزحف إلى محتوى الويب. لك. يمنحك إخبار محركات البحث بكيفية الزحف إلى موقعك مزيدًا من التحكم في ما يظهر في فهرس Google.
يفكر معظم الناس في التأكد من أن Google يمكنه العثور على صفحاتهم المهمة ، ولكن من السهل نسيان الصفحات المحتملة التي لا تريد أن يعثر عليها Googlebot. قد تتضمن هذه عناوين URL قديمة ذات محتوى رقيق وعناوين URL مكررة (مثل معلمات الفرز والتصفية للتجارة الإلكترونية) وصفحات الرموز الترويجية الخاصة وصفحات التدريج أو الاختبار والمزيد.
لإبقاء Googlebot بعيدًا عن صفحات وأقسام معينة في موقعك ، استخدم ملف robots.txt.
ملف robots.txt
يخبر ملف Robots.txt ، الموجود في جذر موقع الويب الخاص بك (على سبيل المثال ، yourdomain.com/robots.txt) ، محركات البحث بأجزاء موقعك التي يجب عليهم الزحف إليها وما يجب عليهم عدم الزحف إليها ، ومدى سرعة الزحف إلى موقعك .
كيف يتعامل Googlebot مع ملفات robots.txt
إذا تعذر على Googlebot العثور على ملف robots.txt الخاص بالموقع ، فسيستمر في الزحف إلى الموقع.
إذا عثر Googlebot على ملف robots.txt لأحد المواقع ، فعادةً ما يتبع النصيحة ويواصل الزحف إلى الموقع.
إذا واجه Googlebot خطأً عند محاولة الوصول إلى ملف robots.txt الخاص بالموقع ولم يتمكن من تحديد ما إذا كان الملف موجودًا ، فلن يقوم بالزحف إلى الموقع.
ميزانية الزحف
ميزانية الزحف أو التكلفة هي متوسط عدد عناوين URL التي يزحف إليها Googlebot على موقعك قبل مغادرته ، لذلك تضمن ميزانية تحسين الزحف أن Googlebot لا يضيع الوقت في الزحف إلى صفحاتك غير المهمة في خطر التغاضي عن الصفحات المهمة. بالنسبة إلى المواقع الكبيرة جدًا التي تحتوي على عشرات الآلاف من عناوين URL ، تعد ميزانية الزحف هي الأكثر أهمية ، ولكن ليس من الجيد أبدًا منع برامج الزحف من الوصول إلى المحتوى الذي لا تهتم به على الإطلاق. فقط تأكد من أنك لا تمنع برامج الزحف من الوصول إلى الصفحات التي تحتوي على إرشادات الزاحف عن طريق إضافة علامات canonical أو noindex. ومع ذلك ، إذا تم حظر Googlebot من الصفحات التي تحتوي على إرشادات خاصة ببرامج الزحف هذه ، فلن تتمكن برامج الزحف هذه من رؤية الإرشادات الموجودة على تلك الصفحات.
لا تتبع كل روبوتات الويب ملف robots.txt. أنشأ الأشخاص الخبثاء بعض الروبوتات التي لا تتبع هذا البروتوكول. في الواقع ، يستخدم بعض المتسللين ملفات robots.txt لاكتشاف مكان وجود محتوى مهم يمكن سرقته. في حين أنه قد يكون من المنطقي منع برامج الزحف من الوصول إلى الصفحات الخاصة مثل صفحات تسجيل الدخول وصفحات المسؤول حتى لا تظهر في الفهرس ، فإن وضع عناوين URL لهذه الصفحات المهمة في ملف robots.txt الخاص بك يجعلها متاحة للجمهور لعناكب البحث ، والتي يعني أيضًا أنه يمكن لمن لديهم نوايا ضارة العثور على هذه الصفحات بسهولة. لذلك من الأفضل NoIndex تلك الصفحات وإخفائها خلف نموذج تسجيل الدخول بدلاً من وضعها في ملف robots.txt الخاص بك.
حدد معلمات URL في GSC
تسمح بعض مواقع الويب (مواقع التجارة الإلكترونية الأكثر شيوعًا) بعرض نفس المحتوى على عدة عناوين URL مختلفة عن طريق إلحاق معلمات معينة بعنوان URL. إذا كنت تتسوق عبر الإنترنت ، فمن المحتمل أنك استخدمت المرشحات لتضييق نطاق البحث داخل المتجر. على سبيل المثال ، يمكنك البحث في أمازون عن "أحذية" ، ثم تخصيص بحثك حسب الحجم واللون. في كل مرة تقوم فيها بالتخصيص ، يتغير عنوان URL قليلاً ليبدو كما يلي:
https://www.youtube.com/products/women/dresses/green.htm
https://www.youtube.com/products/women?category=dresses&color=green
https://youtube.com/shopindex.php?product_id=32&highlight=green+dress
&cat_id=1&sessionid=123$affid=43
هل يستطيع الزاحف العثور على جميع الصفحات المهمة على موقعك؟
هل المحتوى الخاص بك مخفي وراء نموذج تسجيل الدخول؟
هل تعتمد على استمارات البحث؟
هل النص مخفي داخل محتوى غير نصي؟
هل تستطيع محركات البحث الاستمرار في تصفح موقعك؟
- يظهر التنقل عبر الهاتف المحمول نتائج مختلفة عن التنقل عبر سطح المكتب
- أي نوع من التنقل يستخدم تعليمات برمجية غير HTML لعناصر القائمة ، مثل التنقل الممكّن لـ JavaScript. أحرزت Google الكثير من التقدم في الزحف إلى جافا سكريبت وفهمها ، لكنها لا تزال غير عملية كاملة. لكي يتم العثور على شيء ما وفهمه وفهرسته بواسطة Google ، يجب عليك وضعه بتنسيق HTML.
- يمكن أن يبدو التخصيص ، أو عرض التنقل الفريد لأنواع معينة من زوار موقعك ، وكأنه غطاء لبرامج زحف محركات البحث.
- انسَ الاستشهاد بالصفحات الأساسية على موقعك - تذكر أن الروابط هي المسارات التي تتبعها برامج الزحف للوصول إلى صفحات جديدة!
هل لديك بنية معلومات منظمة؟
هل تستخدم خريطة الموقع؟
هل يرتكب الزاحف خطأ أثناء محاولة الوصول إلى عنوان URL الخاص بك؟
الفهرسة كيف تقرأ محركات البحث صفحات الويب الخاصة بك وتخزنها؟
هل يمكنني رؤية كيف يرى زاحف Googlebot صفحاتي؟
هل يمكن لمحرك البحث إزالة صفحة من فهرسها؟
أخبر محركات البحث بكيفية فهرسة موقعك
علامة التبويب "التوجيهات الوصفية للروبوتات"
العلامة الوصفية لبرامج الروبوت
<! DOCTYPE html><html><head><meta name = "robots" content = "noindex، nofollow" /></head><text> ... </text></html>
علامات X-Droid
<file ~ "\ /؟ no \ -bake \ /.*">مجموعة الرأس X-Robots-Tag "noindex ، nofollow"</document>أو لنوع ملف معين (مثل PDF):<file ~ "\ .pdf $">مجموعة الرأس X-Robots-Tag "noindex ، nofollow"</document>
الترتيب: كيف ترتب محركات البحث عناوين URL؟
كيف تضمن محركات البحث أنه عندما يكتب شخص ما كلمة رئيسية في شريط البحث ، سيحصل في المقابل على نتائج ذات صلة؟ تسمى هذه العملية الترتيب ، أو ترتيب نتائج البحث من الأكثر إلى الأقل صلة بمصطلح أو عبارة البحث.
كيف محركات البحث ترتيب عناوين المواقع
تصنيف
لتحديد مدى الصلة باستعلام ما ، تستخدم محركات البحث خوارزمية ، وهي عملية أو صيغة يمكن من خلالها استرداد المعلومات المخزنة وترتيبها بطريقة مفيدة. خضعت هذه الخوارزميات للعديد من التغييرات على مر السنين لتحسين جودة نتائج البحث. تقوم Google ، على سبيل المثال ، بإجراء تعديلات على الخوارزمية على أساس يومي - بعضها عبارة عن تعديلات طفيفة على الجودة ، في حين أن البعض الآخر عبارة عن تحديثات خوارزمية أساسية / واسعة يتم طرحها لمعالجة مشكلات محددة ، مثل Penguin لمعالجة الروابط الخلفية غير المرغوب فيها. تحقق من سجل التغيير في خوارزمية Google للحصول على قائمة بجميع تحديثات Google المؤكدة وغير المؤكدة التي تعود إلى عام 2000.
لماذا تتغير الخوارزميات بشكل متكرر؟ هل تحاول Google فقط إبقائنا متيقظين؟ على الرغم من أن Google لا تكشف دائمًا عن تفاصيل سبب قيامها بما تفعله ، إلا أننا نعلم أن هدف Google عند إجراء تعديلات على الخوارزمية هو تحسين جودة البحث الإجمالية. لهذا السبب ، عند الإجابة على سؤال تحديث الخوارزمية ، تستجيب Google بشيء مثل: "نحن دائمًا نجري تحديثات الجودة." قارن مع إرشادات بحث جودة المقيم ، وكلاهما مهم لاحتياجات محركات البحث.
ماذا تريد محركات البحث؟
لطالما أرادت محركات البحث الشيء نفسه: تقديم إجابات مفيدة لأسئلة الباحثين بأكثر الطرق إفادة ممكنة. إذا كان هذا صحيحًا ، فلماذا تبدو مُحسّنات محرّكات البحث مختلفة الآن عن السنوات الماضية؟
فكر في الأمر على أنه شخص يتعلم لغة جديدة.
في البداية ، كان فهمهم للغة بدائيًا جدًا. مع تطور فهمهم بمرور الوقت ، يتعلمون الدلالات - المعنى الكامن وراء اللغة والعلاقات بين الكلمات والعبارات. في النهاية ، مع الممارسة الكافية ، يعرف الطلاب اللغة جيدًا بما يكفي لتقدير الفروق الدقيقة والقدرة على الإجابة على الأسئلة الغامضة أو غير المكتملة.
عندما تبدأ محركات البحث للتو في تعلم لغتنا ، فمن السهل خداع النظام بالحيل والتكتيكات التي تنتهك إرشاداتنا الخاصة بالجودة. على سبيل المثال ، حشو الكلمات الرئيسية. إذا أردت أن تبدأ بكلمة رئيسية محددة مثل "نكت مضحكة" ، يمكنك إضافة كلمة "نكت مضحكة" عدة مرات على صفحتك ، وجعلها جريئة وملونة ، على أمل تعزيز ترتيبك لهذا المصطلح:
مرحبا بكم في نكت مضحكة! نقول أطرف النكات في العالم. نكت مضحكة و مجنونة. نكتة مضحكة في انتظارك. اجلس واقرأ النكات المضحكة لأن النكات المضحكة ستجعلك مستمتعًا ومضحكًا. بعض النكات المضحكة المفضلة لدي.
نتج عن هذا التكتيك العديد من تجارب المستخدمين السيئة ، حيث بدلاً من الضحك على النكات المضحكة ، ينزعج الناس من النص المزعج الذي يصعب قراءته. ربما نجح هذا في الماضي ، لكنه ليس ما تريده محركات البحث.
أهمية الروابط الخلفية في تحسين محركات البحث
عندما نتحدث عن الروابط ، يمكننا أن نعني شيئين. الروابط الخلفية أو "الروابط الواردة" هي روابط من مواقع ويب أخرى تشير إلى موقع الويب الخاص بك ، بينما الروابط الداخلية هي روابط على موقع الويب الخاص بك تشير إلى صفحاتك الأخرى (على نفس موقع الويب).
الفرق بين الروابط الخلفية والروابط الداخلية لموقعك
لعبت الروابط تاريخيًا دورًا كبيرًا في تحسين محركات البحث (SEO). منذ فترة طويلة ، احتاجت محركات البحث إلى المساعدة في تحديد عناوين URL الأكثر جدارة بالثقة من غيرها لمساعدتها في تحديد كيفية ترتيب نتائج البحث. احسب عدد الروابط التي تشير إلى أي موقع معين يساعدهم في القيام بذلك.
تعمل الروابط الخلفية إلى حد كبير مثل توصيات WoM (Word-of-Mouth) في العالم الحقيقي. لنأخذ مقهى يسمى Jenny's Coffee كمثال:
- شهادات من الآخرين = علامة جيدة على السلطة
- مثال: يقول لك العديد من الأشخاص المختلفين أن قهوة Jenny هي الأفضل في المدينة
- شهادات من نفسك = متحيزة ، لذا فهي ليست علامة جيدة على السلطة
- مثال: تدعي جيني نفسها أن قهوتها هي الأفضل في المدينة
- التوصيات الواردة من مصادر غير ذات صلة أو منخفضة الجودة = ليست علامة جيدة على السلطة ، وقد تجعلك تضع علامة على أنك بريد عشوائي
- مثال: تدفع جيني للأشخاص الذين لم يذهبوا إلى المقهى الخاص بها من قبل ليخدعوا بإخبارهم كم هو جيد.
- لا إحالات = أذونات غير واضحة
- مثال: قد تكون قهوة Jenny جيدة ، لكن لا يمكنك العثور على أي شخص يعلق عليها ، لذلك فأنت غير متأكد بشكل عام من جودة القهوة.
المشاركة المحلية
مشكلة العمل
اترك تعليقا:
