La semaine dernière, un client m'appelle, paniqué. Il venait de découvrir que son catalogue de prix 2024 était indexé par Google, en accès libre, alors qu'il le croyait « rangé » dans un coin de son serveur. Il n'a fallu qu'une commande de recherche pour le dénicher. Pas un piratage. Juste quelqu'un qui savait quoi taper.
C'est ça, le Google Dorking : combiner des opérateurs de recherche avancée pour dénicher vite des informations que la recherche Google classique masque souvent. Rien de magique. Rien d'illégal en soi. Mais une technique qui sépare ceux qui subissent l'indexation de ceux qui la maîtrisent.
Points clés à retenir
- Le Google Dorking repose sur des opérateurs (
site:,intitle:,filetype:) qui filtrent les résultats au lieu de les subir. - Le terme « dork » désigne la requête elle-même, pas la personne qui la tape.
- Utilisé sans autorisation sur un système protégé, il peut basculer dans l'illégalité.
- La parade n'est pas de cacher, mais de corriger :
robots.txt, balisesnoindex, en-têtes HTTP. - La technique dépasse largement Google : tout moteur qui indexe est concerné.
- Un audit d'indexation trimestriel suffit à rattraper 90 % des fuites involontaires.
Qu'est-ce que le Google Dorking, concrètement ?
Prenons une recherche naïve : pollution plastique rapport PDF. Google vous noie sous des articles de blog, des pages Wikipédia, des communiqués. Maintenant la version « dork » :
filetype:pdf intitle:"rapport" "pollution plastique"
Google ne montrera que des PDF dont le titre contient le mot « rapport » et la phrase exacte « pollution plastique ». D'un coup, le bruit disparaît. Il ne reste que des documents bruts.
Que signifie « dorking » ?
Le mot vient de l'anglais dork, qui désigne familièrement quelqu'un d'un peu gauche, un « intello ringard ». Dans les milieux de la sécurité informatique, un « dork » a fini par désigner la requête elle-même : une chaîne d'opérateurs un peu bricolée, précise, qu'on assemble pour faire parler un moteur de recherche. Vous ne devenez pas un « dork » en la tapant. Vous tapez un dork. C'est le nom de l'outil, pas une insulte.
Le terme synonyme le plus courant est Google hacking, mais je le trouve trompeur. Le dorking, en lui-même, ne casse rien. Il demande à un moteur de vous montrer ce qu'il a déjà indexé, publiquement. La question de l'illégalité n'arrive qu'après, au moment où vous décidez quoi faire de ce que vous trouvez.
Les opérateurs que j'utilise vraiment
Il existe des dizaines d'opérateurs. Dans mon usage quotidien, j'en garde six. Au-delà, je les oublie.
site:— limite la recherche à un domaine ou sous-domaine.site:unep.org.intitle:— le mot-clé doit figurer dans le titre de la page.inurl:— le mot-clé apparaît dans l'URL. Très efficace pour repérer des chemins d'administration.filetype:— filtre par extension :filetype:xlsx,filetype:pdf,filetype:env.allintext:— cherche dans le corps du texte, pas dans les métadonnées.- Les guillemets
"..."— pour imposer une phrase exacte, sinon Google la découpe.
Un détail que j'ai mis des mois à comprendre : les opérateurs se cumulent, et c'est la combinaison qui fait la valeur. Un filetype:pdf seul ne donne rien d'exploitable. Un filetype:pdf intitle:"rapport", c'est déjà autre chose.
Quel est l'intérêt d'utiliser les opérateurs de recherche avancée ?
Gagner du temps, voilà l'intérêt premier. Mais il y a un second usage, moins avoué, et c'est celui qui intéresse les professionnels de la sécurité : voir son propre site tel que Google le voit.
Un exemple vécu. Sur un projet d'e-commerce, je soupçonnais des URLs de test restées indexées. Requête : site:monsite.fr inurl:test. Résultat : 14 pages oubliées, dont une avec des identifiants en clair dans l'URL. Nous les avons dépubliées en deux heures. Sans le dorking, personne n'aurait remarqué avant qu'un client curieux tombe dessus.
Auditer sa propre exposition en 20 minutes
Voici la routine que j'applique, dans cet ordre. Elle tient en une poignée de requêtes.
site:mondomaine.com filetype:pdf— repérer les documents sensibles indexés.site:mondomaine.com intitle:index of— détecter des listes de répertoires laissées ouvertes.site:mondomaine.com inurl:admin— vérifier ce que révèlent vos chemins d'administration.site:mondomaine.com "confidentiel"— chercher les mots qu'on n'aurait jamais dû publier.- Croiser avec
filetype:xlsxoufiletype:docx, souvent plus bavards que les PDF.
Le problème ? La plupart des sites mal configurés ne le sont pas par malveillance, mais par négligence. Un répertoire de sauvegarde oublié à la racine, une extension qui génère des URLs temporaires, un partage de fichiers trop permissif : ça arrive à tout le monde. Moi le premier, j'ai laissé traîner un fichier .env à la racine d'un projet perso pendant six mois sans m'en rendre compte.
Google Dorking : où est la ligne rouge ?
Utiliser un opérateur de recherche n'a rien d'illégal. Le contenu est public, indexé par un moteur, accessible à n'importe qui. Vous demandez simplement à Google de vous le montrer plus vite.
La bascule se joue ailleurs. Elle se joue au moment où vous contournez une protection, où vous accédez à un système pour lequel vous n'avez pas d'autorisation, ou où vous exploitez une donnée personnelle sans base légale. Un répertoire ouvert sur un site qui n'est pas le vôtre, que vous explorez et dont vous copiez le contenu : vous n'êtes plus dans la recherche d'information, vous êtes dans l'accès non autorisé. Le cadre varie selon les pays, mais le principe reste : regarder ce qu'un moteur affiche publiquement, c'est une chose. Franchir un écran de connexion pour aller plus loin, c'en est une autre.
Ma règle personnelle est simple : je ne lance un dork que sur mes propres domaines, sur ceux de clients qui m'ont mandaté, ou dans un cadre de bug bounty explicitement autorisé. Jamais sur un tiers, même « juste pour voir ». La curiosité n'est pas une excuse.
Pourquoi le Google Dorking ne concerne pas que Google
Le nom est trompeur, et c'est mon principal reproche à la discipline. Tout moteur qui indexe quelque chose est vulnérable à la même logique. Bing, GitHub, Shodan, des moteurs spécialisés dans les objets connectés exposés... La méthode est identique : des opérateurs, des filtres, une combinaison qui fait remonter ce que l'indexation automatique a laissé passer.
Sur GitHub, par exemple, un filename:.env fait remonter des fichiers de configuration oubliés en dépôt public. C'est la même famille de requête, la même mécanique. Vous trouverez d'ailleurs des bases de données communautaires de requêtes toutes prêtes, souvent désignées par l'acronyme GHDB, où des contributeurs partagent leurs dorks. Pratique pour apprendre. Dangereux si on les exécute sans réfléchir sur des cibles qui ne nous appartiennent pas.
Google dorking Instagram : est-ce que ça marche ?
Vous verrez passer des requêtes censées « pirater » un compte Instagram. Franchise : non. Instagram bloque l'indexation de son contenu par les moteurs externes, précisément pour éviter ce genre d'exploitation. Ce qui remonte via un dork, ce sont des profils publics, des pages déjà visibles par tout le monde, ou des sites tiers qui parlent du compte. Aucun dork sérieux ne donne accès à des conversations privées ou à un compte protégé. Les tutoriels qui le promettent vendent du vent.
Comment savoir si Google expose des choses qui ne devraient pas l'être
La vraie question n'est pas « comment pirater », mais « qu'est-ce que Google sait de moi que j'ignore ». Et là, il y a des parades techniques, simples, que presque personne n'applique.
| Ce que vous voulez protéger | La parade | Le piège à éviter |
|---|---|---|
| Un répertoire de fichiers | Balise noindex + mot de passe côté serveur | Croire que robots.txt suffit pour masquer |
| Des documents confidentiels | Retirer l'accès public, pas seulement l'indexation | Supprimer le lien de la page mais laisser le fichier en ligne |
| Des URLs de test | En-tête HTTP X-Robots-Tag: noindex | Mettre en production sans nettoyer les environnements de recette |
| Des données personnelles | Minimiser ce qu'on publie en amont | Penser qu'une suppression suffit : les caches traînent |
Un point que beaucoup ignorent : robots.txt demande aux robots de ne pas indexer, mais il ne protège rien. Un fichier « interdit » par ce fichier reste accessible si quelqu'un connaît son URL exacte. Bloquer l'indexation n'est pas bloquer l'accès. Ce sont deux choses différentes.
La surveillance dans le temps
Un audit une fois ne sert à rien. Ce qui compte, c'est la répétition : je relance les mêmes requêtes sur mes projets tous les trois mois. Entre deux passages, une extension a pu créer des URLs nouvelles, un collaborateur a pu téléverser un document trop permissif. Trois mois, c'est le délai au-delà duquel je commence à dormir mal.
Franchement, la meilleure défense reste la plus ennuyeuse : publier moins, et vérifier ce qui est publié. Le dorking ne crée pas les fuites. Il les révèle.
Google Dorks OSINT : ce que j'en pense vraiment
Le dorking est devenu une porte d'entrée standard de l'OSINT, la collecte d'informations à partir de sources ouvertes. Les praticiens l'utilisent pour cartographier un domaine, repérer des technologies, croiser des données publiques. C'est légitime dans un cadre professionnel, notamment en veille concurrentielle ou en audit de surface d'attaque.
Mais je vais être direct : ce n'est pas un superpouvoir. La plupart des résultats intéressants remontent avec deux ou trois opérateurs bien choisis, pas avec quarante. J'ai vu des débutants collectionner des listes de dorks sans jamais en comprendre la logique. Ils exécutent, ils obtiennent des résultats, ils ne savent pas pourquoi. C'est là que la technique devient dangereuse — quand on ne mesure plus ce qu'on fait.
Apprenez la logique des opérateurs, pas les recettes toutes faites. Une recette s'oublie. Une logique se réutilise.
Et si vous ne devez retenir qu'une chose de tout ça, ce serait celle-ci : le jour où vous tapez votre premier site: sur votre propre domaine, préparez-vous à une petite sueur froide. Il y a presque toujours quelque chose qui traîne. La question n'est pas de savoir si Google expose vos données, mais depuis combien de temps vous ne l'avez pas vérifié.