Googleクローラーとは?仕組みと巡回を促す方法・注意点を解説

SEO

「Googleクローラーって結局何をしているの?」「新しく公開したページがなかなか検索結果に出てこない」と感じたことはありませんか。

Googleクローラーの仕組みを理解しておくと、なぜインデックスに時間がかかるのか、どうすれば巡回を促せるのかが具体的に見えてきます。

この記事では、Googleクローラーの基本的な役割から種類、クロールの流れ、巡回を促す方法、よくあるトラブルの対処法までを解説します。

Googleクローラーとは

Googleクローラーとは、インターネット上のWebページを自動的に巡回し、内容を収集するプログラムのことです。

Googleの検索結果にページを表示させるためには、まずこのクローラーにページを発見してもらう必要があります。

クローラーが収集した情報はインデックスに登録され、ユーザーの検索キーワードに応じて検索結果に表示される仕組みです。

  • Googlebotという名前のプログラム
  • クローラーの役割(発見・インデックス登録)

Googlebotという名前のプログラム

Googleクローラーは、正式には「Googlebot」というプログラム名で呼ばれています。

「Googleクローム(Google Chrome)」というブラウザと名前が似ているため混同されることがありますが、両者はまったく別のものです。

Googlebotはユーザーが操作するブラウザではなく、Googleのサーバー側で自動的に動作するボットプログラムです。

この違いを押さえておくと、以降の説明も理解しやすくなります。

クローラーの役割(発見・インデックス登録)

Googlebotの主な役割は、新しいページや更新されたページを発見し、その内容をGoogleのデータベースに登録することです。

この登録作業のことをインデックス登録と呼び、インデックスに登録されて初めて検索結果に表示される対象になります。

逆にいえば、どれだけ質の高いページを作っても、クローラーに発見・インデックス登録されなければ検索結果には表示されません。

クローラーの巡回は、SEO対策の出発点にあたる重要な工程だといえます。

クロール状況を確認したい方へ

自社サイトが正しくクロールされているか不安なら、合同会社dock.へご相談ください。まずはお気軽に無料相談へお申込みください。

無料相談してみる →

Googleクローラーの種類

ひとくちにGoogleクローラーといっても、実際には目的別に複数の種類が存在します。

代表的なクローラーを一覧で確認しましょう。

  • 主なクローラーの一覧
  • どのクローラーが多く使われているか

主なクローラーの一覧

代表的なGoogleクローラーの種類は、次の表のとおりです。

クローラー名主な役割
Googlebot Smartphoneスマートフォン向けページのクロール
Googlebot Desktopパソコン向けページのクロール
Googlebot Image画像コンテンツのクロール
Googlebot Video動画コンテンツのクロール
Googlebot Newsニュースコンテンツのクロール
AdsBot広告の品質チェック用のクロール

それぞれのクローラーは、ユーザーエージェント文字列によって識別できます。

どのクローラーが多く使われているか

現在のGoogleは「モバイルファーストインデックス」という方針を採用しています。

そのため、スマートフォン向けのGooglebot Smartphoneを主体にクロール・評価を行うようになりました。

スマートフォンで正しく表示・操作できるページを作ることが、以前にも増して重要になっています。

パソコン向けのGooglebot Desktopは補助的な役割にとどまり、モバイル対応が不十分なサイトは評価面で不利になりやすい点に注意が必要です。

モバイル対応の状況を確認したい方へ

スマートフォン表示に不安があるなら、合同会社dock.へご相談ください。まずはお気軽に無料相談へお申込みください。

無料相談してみる →

クロールの仕組み・流れ

Googleクローラーがページを発見してから検索結果に表示されるまでには、いくつかの段階があります。

ここでは全体の流れを整理します。

  • リンクを辿って新しいページを発見する
  • クロール→インデックス→検索結果表示の流れ

リンクを辿って新しいページを発見する

クローラーは、既知のページに設置されたリンクを辿ることで新しいページを発見します。

そのため、どこからもリンクされていない孤立したページは、クローラーに発見されにくくなります。

サイトマップの送信や内部リンクの整備は、この「発見してもらう」段階を助けるための施策です。

サイト内の主要なページには、必ずどこかから内部リンクが張られている状態を保つことが基本になります。

クロール→インデックス→検索結果表示の流れ

ページが発見された後は、クロール・インデックス登録・検索結果への表示という順序で処理が進みます。

まずクローラーがページの内容を取得し、次にその内容がGoogleのデータベースへ登録される流れです。

最後に、ユーザーの検索キーワードとの関連性が評価され、検索結果に表示されるかどうかが決まります。

この一連の流れのどこかでつまずくと、ページがいつまでも検索結果に表示されない状態になってしまいます。

クロールからインデックスまでの流れを整理したい方へ

どこでつまずいているか特定したいなら、合同会社dock.へご相談ください。まずはお気軽に無料相談へお申込みください。

無料相談してみる →

クロール頻度の目安

Googleクローラーがサイトを訪れる頻度は、サイトによって大きく異なります。

ここでは頻度が変わる要因と、実際の頻度を確認する方法を紹介します。

  • サイトの更新頻度や重要度によって変わる
  • クロール頻度を確認する方法

サイトの更新頻度や重要度によって変わる

頻繁に更新される人気サイトほど、クローラーの巡回頻度が高くなる傾向があります。

一方で、更新が少なく規模の小さいサイトは、巡回頻度が低めになりやすいです。

新規サイトや立ち上げたばかりのサイトは、まだGoogleからの評価が定まっていないため、巡回頻度が低い状態からスタートするのが一般的です。

コンテンツを継続的に更新し、外部からの評価を積み重ねることで、徐々に巡回頻度が上がっていきます。

クロール頻度を確認する方法

実際のクロール頻度は、Google Search Consoleの「クロール統計情報」レポートで確認できます。

1日あたりのクロールリクエスト数やダウンロードデータ量、平均応答時間などが確認可能です。

クロール数が急激に減少している場合は、サーバーエラーやアクセス制限など何らかの問題が起きているサインかもしれません。

定期的にこのレポートをチェックする習慣をつけておくと、問題の早期発見につながります。

クロール統計情報の見方を相談したい方へ

数値の異常に気づけないなら、合同会社dock.へご相談ください。まずはお気軽に無料相談へお申込みください。

無料相談してみる →

クローラーを呼び込む・巡回を促す方法

クローラーの巡回をただ待つだけでなく、能動的に呼び込むための施策もあります。

代表的な方法は次の3つです。

  • サイトマップを送信する
  • インデックス登録をリクエストする
  • 内部リンクを整備する

サイトマップを送信する

XMLサイトマップは、サイト内のページ一覧をクローラーに伝えるためのファイルです。

Google Search Consoleからサイトマップを送信しておくことで、クローラーが新しいページを見つけやすくなります。

サイトマップの種類や作り方は、サイトマップとはで詳しく解説済みです。

特にページ数の多いサイトほど、サイトマップの整備効果を実感しやすい傾向があります。

インデックス登録をリクエストする

公開直後のページを早くクロールしてほしい場合は、Search Consoleの「URL検査」ツールからインデックス登録をリクエストできます。

この機能を使うと、通常のクロールを待たずに優先的に巡回してもらえる可能性が高まります。

なお、リクエストしたからといって必ず即座にインデックスされるとは限らない点には注意が必要です。

あくまで巡回のきっかけを与える機能として活用しましょう。

インデックス登録そのものの仕組みや、登録されない場合の原因・対策は別記事で詳しく解説しています。

内部リンクを整備する

新しく公開したページには、既存の関連ページから内部リンクを設置しておくことが有効です。

クローラーはリンクを辿って新しいページを発見するため、リンク元が多いページほど発見されやすくなります。

パンくずリストやカテゴリページからのリンクも、内部リンク構造を強化する手段の1つです。

孤立したページを作らないよう、公開時点で必ず1つ以上のリンクを設置する運用ルールを作っておくと安心です。

クロールを促す施策を一緒に整理したい方へ

新規ページのインデックスが遅いと感じるなら、合同会社dock.へご相談ください。まずはお気軽に無料相談へお申込みください。

無料相談してみる →

クロールを妨げる・制御する方法

クローラーの巡回は促すだけでなく、意図的に制御したい場面もあります。

代表的な2つの制御方法を確認しましょう。

  • robots.txtでクロールを制御する
  • noindexタグでインデックスを制御する

robots.txtでクロールを制御する

robots.txtは、クローラーに対して特定のディレクトリやページへのアクセスを許可・禁止するための設定ファイルです。

管理画面や検索結果に表示させたくない内部ページなど、クロールさせる必要のない領域を指定するのに使われます。

robots.txtの書き方や設置方法は、robots.txtとはで詳しく解説しているとおりです。

設定を誤ると重要なページまでクロールをブロックしてしまうため、慎重な設定が求められます。

noindexタグでインデックスを制御する

noindexタグは、クロール自体は許可しつつ、検索結果への表示だけを防ぐための指定です。

robots.txtがクロール自体をブロックするのに対し、noindexはクロールされた上でインデックスから除外する点が異なります。

重複コンテンツやテスト用ページなど、存在はしてもよいが検索結果には出したくないページに向いています。

どちらの制御方法を使うべきかは、ページの性質に応じて使い分けることが重要です。

クロール制御の設定を見直したい方へ

robots.txtやnoindexの設定に不安があるなら、合同会社dock.へご相談ください。まずはお気軽に無料相談へお申込みください。

無料相談してみる →

クロールバジェットとは

大規模なサイトを運営している場合、クロールバジェットという考え方も押さえておく必要があります。

  • クロールバジェットの定義
  • 大規模サイトで特に重要な理由

クロールバジェットの定義

クロールバジェットとは、Googleクローラーが1つのサイトに対して一定期間内に割り当てるクロール量の上限のことです。

サーバーの負荷やサイトの評価などをもとに、Googleがサイトごとにクロールの配分量を調整しています。

ページ数がそれほど多くない一般的なサイトでは、通常はあまり意識する必要のない概念です。

大規模サイトで特に重要な理由

数万〜数百万ページを抱える大規模サイトでは、クロールバジェットが不足し、すべてのページを十分に巡回しきれないことがあります。

この場合、重複ページやパラメータ違いの無駄なURLを削減し、クロールバジェットを重要なページに集中させることが重要です。

中小規模のサイトであれば、まずは前述のサイトマップ送信や内部リンク整備を優先するほうが効果的です。

クロールバジェットの最適化を相談したい方へ

大規模サイトのクロール効率に課題があるなら、合同会社dock.へご相談ください。まずはお気軽に無料相談へお申込みください。

無料相談してみる →

クロールとレンダリングの違い

Googleクローラーの仕組みを理解するうえで、クロールとレンダリングの違いも押さえておきたいポイントです。

両者を混同していると、JavaScriptを多用したページで思わぬ評価漏れが起こることがあります。

  • クロールはHTMLの取得、レンダリングは画面の描画
  • JavaScriptを多用するページで起こりやすい問題

クロールはHTMLの取得、レンダリングは画面の描画

クロールは、クローラーがページのHTMLファイルを取得する工程を指します。

一方でレンダリングは、取得したHTMLやCSS・JavaScriptをもとに、実際にブラウザで表示される画面を組み立てる工程です。

Googlebotはこの2つの工程を経てページの内容を最終的に評価しており、クロールだけでは把握できない情報もレンダリングを通じて理解しています。

JavaScriptを多用するページで起こりやすい問題

JavaScriptによって後から表示されるコンテンツは、レンダリングが正常に行われて初めて評価対象になります。

レンダリングに時間がかかりすぎたり、必要なリソースがブロックされていたりすると、本来表示されるはずのコンテンツが評価されないことがあるので注意しましょう。

Search Consoleの「URL検査」ツールでは、実際にGooglebotがレンダリングした結果のスクリーンショットを確認できます。

この機能を活用すれば、意図した内容が正しく評価されているかを確認できます。

JavaScriptサイトの評価漏れが心配な方へ

レンダリング周りの技術的な確認を任せたいなら、合同会社dock.へご相談ください。まずはお気軽に無料相談へお申込みください。

無料相談してみる →

クロールエラー・クロールされないときの対処法

クローラーが正常に巡回できないと、ページがいつまでもインデックスされない状態になります。

代表的な原因と対処法を一覧にまとめました。

症状・原因対処法
404エラーページへのリンクが残っているリンク先URLの修正、または適切なリダイレクト設定
サーバーエラー(5xx系)が頻発しているサーバーの負荷状況やレスポンス速度を確認する
robots.txtで誤ってブロックしているrobots.txtの記述内容を見直す
noindexタグが意図せず設定されている該当ページのmetaタグを確認・修正する

404エラーの具体的な原因やSEOへの影響は、404エラーとはで解説しているとおりです。

Search Consoleの「ページ」レポートを定期的に確認し、エラーの兆候を早めに見つける習慣をつけましょう。

クロールエラーの原因調査を任せたい方へ

自社での切り分けが難しいなら、合同会社dock.へご相談ください。まずはお気軽に無料相談へお申込みください。

無料相談してみる →

Googlebotかどうかを確認する方法

アクセスログに記録されたアクセスが本物のGooglebotなのか、なりすましなのかを見分けたい場面もあります。

  • ユーザーエージェントの確認
  • 逆引きでなりすましを見分ける

ユーザーエージェントの確認

Googlebotは、アクセス時に特定のユーザーエージェント文字列を送信しています。

サーバーのアクセスログを確認すれば、どのクローラーがいつアクセスしたかをある程度把握できます。

ただしユーザーエージェントは偽装が容易であるため、これだけで本物のGooglebotと断定することはできません。

逆引きでなりすましを見分ける

本物のGooglebotかどうかを確実に確認したい場合は、IPアドレスの逆引き(DNS lookup)と正引きの両方を行う方法があります。

Googleの公式ドキュメントでも、この逆引き・正引きによる確認方法が案内されています。

不審なアクセスが大量に発生している場合は、この方法でなりすましボットかどうかを見極めることが望ましいです。

不審なアクセスの調査を相談したい方へ

なりすましボットの疑いがあるなら、合同会社dock.へご相談ください。まずはお気軽に無料相談へお申込みください。

無料相談してみる →

Googleクローラーに関するよくある質問

Q. GoogleクローラーとGoogle Chromeは同じものですか?

A. 別のものです。Google Chromeはユーザーが操作するWebブラウザであるのに対し、Googleクローラー(Googlebot)はGoogleのサーバー側で自動的にWebページを巡回するプログラムです。名前が似ているため混同されやすいので注意しましょう。

Q. 新しく公開したページはどのくらいでクロールされますか?

A. サイトの評価や更新頻度によって幅がありますが、数日から数週間かかることもあります。サイトマップの送信やSearch Consoleでのインデックス登録リクエストを行うことで、巡回が早まる可能性があります。

Q. クロールされてもインデックスされないのはなぜですか?

A. クロールとインデックス登録は別の工程です。クロールされてもコンテンツの品質が低いと判断された場合や、noindexタグが設定されている場合は、インデックスに登録されないことがあります。

Q. クロールバジェットは小規模サイトでも気にすべきですか?

A. 一般的な中小規模のサイトでは、クロールバジェットが不足する状況はあまり起こりません。まずはサイトマップの送信や内部リンクの整備といった基本対策を優先するとよいでしょう。

Q. クロール頻度を自分で上げることはできますか?

A. クロール頻度を直接指定することはできませんが、サイトマップの送信やコンテンツの継続的な更新、内部リンクの整備によって、間接的に巡回頻度を高めることは可能です。

まとめ

Googleクローラー(Googlebot)とは、Webページを自動的に巡回し、内容を収集・インデックス登録するためのプログラムです。

クロールからインデックス登録、検索結果への表示までの流れを理解しておくと、なぜページが検索結果に出てこないのかを判断しやすくなります。

サイトマップの送信や内部リンクの整備で巡回を促しつつ、robots.txtやnoindexタグで不要な領域を適切に制御しましょう。

これが、健全なクロール環境づくりの基本です。

自社サイトのクロール状況に不安がある場合は、専門家への相談も検討してみてください。

お問い合わせ

Webのお悩みを一度整理してみませんか?

次の成長フェーズへ進むための準備を支援します。
まずは現状についてお聞かせください。

お問い合わせ