QwantBot est le robot d'indexation officiel de Qwant. Il parcourt le web pour construire et rafraîchir l'index qui alimente notre moteur de recherche.
Cette page explique comment l'identifier dans vos logs, comment vérifier qu'une requête provient réellement de Qwant, et comment contrôler son passage sur votre site.
Identifier QwantBot dans vos logs
Selon la version du robot, le User-Agent varie légèrement. Un élément reste constant et permet de le repérer : le mot-clé Qwantbot, en un seul mot.
Le format général est le suivant :
Mozilla/5.0 (compatible; Qwantbot{-news}/X.Y_{worker_id}; +https://help.qwant.com/bot/)Les éléments entre accolades { } sont optionnels : -news identifie le robot dédié à Qwant News, et worker_id désigne la machine à l'origine de la requête.
Voici deux exemples de User-Agents avec lesquels nous pouvons visiter votre site :
Mozilla/5.0 (compatible; Qwantbot/1.0_12345; +https://help.qwant.com/bot/) Mozilla/5.0 (compatible; Qwantbot-news/2.0; +https://help.qwant.com/bot/)
Vérifier qu'une requête vient bien de Qwant
Un User-Agent est purement déclaratif : n'importe quel robot peut prétendre être QwantBot. Si vous avez un doute sur des requêtes observées dans vos logs, deux méthodes permettent de trancher.
Méthode recommandée — résolution DNS inverse
- Effectuez une résolution DNS inverse sur l'adresse IP à l'origine de la requête, et vérifiez qu'elle pointe vers un nom se terminant par
qwant.com. - En complément, effectuez une résolution DNS directe sur ce nom pour confirmer qu'il renvoie bien vers la même adresse IP.
Sous Linux, avec la commande host :
> host 91.242.162.1 1.162.242.91.in-addr.arpa domain name pointer qwantbot-1-162-242-91.qwant.com. > host qwantbot-1-162-242-91.qwant.com qwantbot-1-162-242-91.qwant.com has address 91.242.162.1
Si le nom obtenu ne se termine pas par qwant.com, la requête ne provient pas de nos serveurs.
Méthode alternative — plages d'adresses IP
Vous pouvez également comparer l'adresse IP de la requête à la liste de nos plages publiées dans ce fichier : qwantbot.json
Contrôler QwantBot via robots.txt
QwantBot respecte le standard d'exclusion des robots décrit sur robotstxt.org
Le fichier robots.txt se place à la racine de chaque sous-domaine concerné : un fichier présent sur exemple.com ne s'applique pas à blog.exemple.com.
Autoriser QwantBot sur tout le site — c'est le comportement par défaut si aucune directive ne le cible :
User-agent: Qwantbot Allow: /
Interdire l'exploration d'un répertoire :
User-agent: Qwantbot Disallow: /prive/
Interdire l'exploration de l'ensemble du site :
User-agent: Qwantbot Disallow: /
Espacer les visites avec Crawl-delay
Si QwantBot sollicite trop souvent votre serveur, la directive Crawl-delay fixe un délai minimum, en secondes, entre deux requêtes :
User-agent: Qwantbot Crawl-delay: 8
robots.txt ou balise noindex ?
Les deux mécanismes répondent à des besoins différents et ne sont pas interchangeables.
| Mécanisme | Effet | À utiliser pour |
|---|---|---|
robots.txt |
La page n'est pas explorée, donc pas téléchargée. Elle ne peut pas être indexée. | Épargner votre serveur, exclure des sections entières du site |
Balise <meta name="robots" content="noindex">
|
La page est téléchargée, mais n'apparaît pas dans les résultats de recherche. | Retirer une page précise des résultats tout en la laissant accessible |
Fréquence de visite
QwantBot adapte sa fréquence de passage à la taille et à la popularité de votre site. Vous pouvez l'influencer de deux façons :
- en publiant un sitemap.xml valide et à jour ;
- en maintenant de bonnes performances serveur, un site rapide étant exploré plus souvent.
Signaler un comportement anormal
Si quelque chose s'est mal passé lors du passage de nos robots sur votre site, nous en sommes sincèrement désolés.
Signalez-nous tout problème par e-mail à qwantbot@qwant.com, en précisant :
- votre nom de domaine ;
- un échantillon de logs contenant les requêtes problématiques ;
- la période concernée.