Comment fonctionne le Web profond

Dec 23 2013
Environ 40 % de la population mondiale utilise le Web pour l'information, le divertissement et la communication, mais en vérité, seule une partie de ce que nous appelons le World Wide Web est facilement accessible.
La nature inaccessible du Web profond peut évoquer des images de pirates faisant des choses néfastes, mais ce n'est pas vraiment exact.

Quelle toile emmêlée nous tissons, en effet. Environ 40 % de la population mondiale utilise le Web pour l'actualité, le divertissement, la communication et une myriade d'autres objectifs [source : Internet World Stats ]. Pourtant, même si de plus en plus de personnes se connectent, elles trouvent en fait moins de données stockées en ligne. C'est parce que seule une partie de ce que nous appelons le World Wide Web est facilement accessible.

Le soi-disant Web de surface , que nous utilisons tous régulièrement, se compose de données que les moteurs de recherche peuvent trouver et ensuite proposer en réponse à vos requêtes. Mais de la même manière que seule la pointe d'un iceberg est visible pour les observateurs, un moteur de recherche traditionnel ne voit qu'une petite quantité d'informations disponibles - un maigre 0,03 % [source : OEDB ].

Quant au reste ? Eh bien, une grande partie est enfouie dans ce qu'on appelle le Web profond . Le Web profond (également appelé sous-réseau, Web invisible et Web caché, entre autres surnoms) se compose de données que vous ne trouverez pas avec une simple recherche sur Google.

Personne ne sait vraiment quelle est la taille réelle du Web profond, mais il est des centaines (voire des milliers) de fois plus grand que le Web de surface. Ces données ne sont pas nécessairement masquées intentionnellement. Il est tout simplement difficile pour la technologie actuelle des moteurs de recherche de le trouver et de le comprendre.

Il y a un revers du Web profond qui est beaucoup plus trouble - et, parfois, plus sombre - c'est pourquoi il est également connu sous le nom de Web sombre . Dans le dark Web, les utilisateurs enterrent intentionnellement des données. Souvent, ces parties du Web ne sont accessibles que si vous utilisez un logiciel de navigation spécial qui aide à décoller les couches semblables à des oignons du dark Web.

Ce logiciel préserve la confidentialité de la source et de la destination des données et des personnes qui y accèdent. Pour les dissidents politiques comme pour les criminels, ce type d'anonymat montre l'immense pouvoir du dark Web, permettant des transferts d'informations, de biens et de services, légalement ou illégalement, au grand dam des pouvoirs en place partout dans le monde.

Tout comme un moteur de recherche ne fait qu'effleurer la surface du Web, nous ne faisons que commencer. Continuez à lire pour découvrir à quel point notre Web s'emmêle vraiment.

Contenu
  1. Caché dans un site ordinaire
  2. Juste sous la surface
  3. Potentiel profond
  4. Les ténèbres tombent
  5. Tor titillant
  6. Le côté lumineux des ténèbres
  7. Encore plus profond

Caché dans un site ordinaire

Le Web profond est énorme par rapport au Web de surface. Le Web d'aujourd'hui compte plus de 555 millions de domaines enregistrés. Chacun de ces domaines peut avoir des dizaines, des centaines voire des milliers de sous-pages, dont beaucoup ne sont pas cataloguées, et entrent donc dans la catégorie du Web profond.

Bien que personne ne le sache vraiment avec certitude, le Web profond peut être 400 à 500 fois plus grand que le Web de surface [source : BrightPlanet ]. Et le Web de surface et le Web profond deviennent de plus en plus gros chaque jour.

Pour comprendre pourquoi tant d'informations sont hors de vue des moteurs de recherche, il est utile d'avoir un peu de recul sur les technologies de recherche. Vous pouvez tout lire à ce sujet avec Comment fonctionnent les moteurs de recherche Internet, mais nous vous donnerons un bref aperçu ici.

Les moteurs de recherche créent généralement un index de données en trouvant des informations stockées sur des sites Web et d'autres ressources en ligne. Ce processus implique l'utilisation d' araignées ou de robots d'indexation automatisés , qui localisent des domaines, puis suivent des hyperliens vers d'autres domaines, comme un arachnide suivant les vrilles soyeuses d'un Web, créant en quelque sorte une carte tentaculaire du Web.

Cet index ou cette carte est votre clé pour trouver des données spécifiques qui correspondent à vos besoins. Chaque fois que vous entrez une recherche par mot-clé, les résultats apparaissent presque instantanément grâce à cet index. Sans cela, le moteur de recherche devrait littéralement commencer à chercher des milliards de pages à partir de zéro chaque fois que quelqu'un voulait des informations, un processus qui serait à la fois lourd et exaspérant.

Mais les moteurs de recherche ne peuvent pas voir les données stockées sur le Web profond. Il existe des incompatibilités de données et des obstacles techniques qui compliquent les efforts d'indexation. Il existe des sites Web privés qui nécessitent des mots de passe de connexion avant de pouvoir accéder au contenu. Les robots d'indexation ne peuvent pas accéder aux données nécessitant des recherches par mot-clé sur un site Web unique et spécifique. Il existe des sites à accès limité qui n'autorisent plus les vues publiques une fois qu'un certain délai est passé.

Tous ces défis, et bien d'autres, rendent les données beaucoup plus difficiles à trouver et à indexer pour les moteurs de recherche. Continuez à lire pour en savoir plus sur ce qui sépare le Web de surface et le Web profond.

Juste sous la surface

Si vous considérez le Web comme un iceberg, l'énorme section sous l'eau est le Web profond, et la plus petite section que vous pouvez voir au-dessus de l'eau est le Web de surface.

Comme nous l'avons déjà noté, il existe des millions et des millions de sous-pages éparpillées dans des millions de domaines. Il existe des pages internes sans liens externes, telles que internal.howstuffworks.com, qui sont utilisées à des fins de maintenance du site. Il existe des articles de blog non publiés ou non répertoriés, des galeries d'images, des répertoires de fichiers et des quantités incalculables de contenu que les moteurs de recherche ne peuvent tout simplement pas voir.

Voici juste un exemple. Il existe de nombreux sites Web de journaux indépendants en ligne, et parfois, les moteurs de recherche indexent quelques-uns des articles sur ces sites. C'est particulièrement vrai pour les grands reportages qui reçoivent beaucoup d'attention des médias. Une recherche rapide sur Google dévoilera sans aucun doute plusieurs dizaines d'articles sur, par exemple, les équipes de football de la Coupe du monde .

Mais si vous recherchez une histoire plus obscure, vous devrez peut-être vous rendre directement sur le site d'un journal spécifique, puis parcourir ou rechercher du contenu pour trouver ce que vous recherchez. Cela est particulièrement vrai à mesure qu'un reportage vieillit. Plus l'article est ancien, plus il est probable qu'il ne soit stocké que dans les archives du journal, qui ne sont pas visibles sur le Web de surface. Par la suite, cette histoire peut ne pas apparaître facilement dans les moteurs de recherche - elle compte donc comme faisant partie du Web profond.

Potentiel profond

Si nous pouvions déverrouiller le Web profond pour rechercher des bases de données professionnelles et des informations profondes difficiles d'accès, des domaines tels que la médecine en bénéficieraient immédiatement.

Les données du Deep Web sont difficiles à voir pour les moteurs de recherche, mais invisibles ne signifient pas sans importance. Comme vous pouvez le voir juste à partir de notre exemple de journal, il y a une immense valeur dans les informations cachées dans le Web profond.

Le Web profond est un référentiel sans fin pour une quantité ahurissante d'informations. Il existe des bases de données d'ingénierie, des informations financières de toutes sortes, des documents médicaux, des photos, des illustrations ... la liste est longue, en gros, pour toujours.

Et le Web profond ne fait que s'approfondir et se compliquer. Pour que les moteurs de recherche augmentent leur utilité, leurs programmeurs doivent comprendre comment plonger dans le Web profond et faire remonter les données à la surface. D'une manière ou d'une autre, ils doivent non seulement trouver des informations valides, mais aussi trouver un moyen de les présenter sans submerger les utilisateurs finaux.

Comme pour tout ce qui concerne les affaires, les moteurs de recherche sont confrontés à des préoccupations plus importantes que de savoir si vous et moi sommes en mesure de trouver la meilleure recette de croustillant aux pommes au monde. Ils veulent aider les grandes entreprises à trouver et à utiliser le Web profond de manière nouvelle et utile.

Par exemple, les ingénieurs en construction pourraient potentiellement rechercher des documents de recherche dans plusieurs universités afin de trouver les derniers et les meilleurs matériaux de construction de ponts. Les médecins pourraient rapidement localiser les dernières recherches sur une maladie spécifique.

Le potentiel est illimité. Les défis techniques sont de taille. C'est le tirage au sort du Web profond. Pourtant, il y a aussi un côté plus obscur du Web profond - un côté qui dérange beaucoup de gens pour de nombreuses raisons.

Les ténèbres tombent

Le Web profond est peut-être une terre obscure au potentiel inexploité, mais avec un peu d'habileté et un peu de chance, vous pouvez mettre en lumière de nombreuses informations précieuses que de nombreuses personnes ont travaillé à archiver. Sur le dark Web, où les gens cachent délibérément des informations, ils préféreraient que vous laissiez les lumières éteintes.

Le dark Web est un peu comme l'identité du Web. C'est privé. C'est anonyme . C'est puissant. Il libère la nature humaine sous toutes ses formes, bonnes et mauvaises.

Les mauvaises choses, comme toujours, font la une des journaux. Vous pouvez trouver des biens et des activités illégales de toutes sortes sur le dark Web. Cela inclut les drogues illicites, la pornographie juvénile, les numéros de carte de crédit volés, le trafic d'êtres humains , les armes, les animaux exotiques, les médias protégés par le droit d'auteur et tout ce à quoi vous pouvez penser. Théoriquement, vous pourriez même, disons, engager un tueur à gages pour tuer quelqu'un que vous n'aimez pas.

Mais vous ne trouverez pas ces informations avec une recherche Google. Ces types de sites Web nécessitent l'utilisation d'un logiciel spécial, tel que The Onion Router , plus communément appelé Tor .

Tor est un logiciel qui s'installe dans votre navigateur et configure les connexions spécifiques dont vous avez besoin pour accéder aux sites Web sombres. Surtout, Tor est une technologie cryptée qui aide les gens à maintenir l'anonymat en ligne. Il le fait en partie en acheminant les connexions via des serveurs du monde entier, ce qui les rend beaucoup plus difficiles à suivre.

Tor permet également aux gens d'accéder à des services dits cachés - des sites Web souterrains pour lesquels le Web sombre est connu. Au lieu de voir des domaines qui se terminent par .com ou .org, ces sites cachés se terminent par .onion. À la page suivante, nous allons éplucher les couches de certains de ces oignons.

Tor titillant

En octobre 2013, les autorités américaines ont fermé Silk après l'arrestation du propriétaire présumé du site, Ross William Ulbricht.

Le plus tristement célèbre de ces sites d'oignons était Silk Road, aujourd'hui disparu, un marché en ligne où les utilisateurs pouvaient acheter de la drogue, des armes à feu et toutes sortes d'autres articles illégaux. Le FBI a finalement capturé Ross Ulbricht, qui exploitait Silk Road, mais des sites imitateurs comme Black Market Reloaded sont toujours facilement disponibles.

Curieusement, Tor est le résultat de recherches effectuées par le US Naval Research Laboratory, qui a créé Tor pour les dissidents politiques et les lanceurs d'alerte, leur permettant de communiquer sans crainte de représailles.

Tor a été si efficace pour fournir l'anonymat à ces groupes qu'il n'a pas fallu longtemps aux criminels pour commencer à l'utiliser également.

Cela laisse les forces de l'ordre américaines dans la position ironique de tenter de suivre les criminels qui utilisent des logiciels parrainés par le gouvernement pour cacher leurs traces. Tor, semble-t-il, est une épée à double tranchant.

L'anonymat fait partie intégrante du Dark Web, mais vous vous demandez peut-être comment des transactions liées à l'argent peuvent se produire lorsque les vendeurs et les acheteurs ne peuvent pas s'identifier. C'est là que Bitcoin entre en jeu.

Si vous n'avez pas entendu parler de Bitcoin, il s'agit essentiellement d'une monnaie numérique cryptée. Vous pouvez tout lire à ce sujet sur How Bitcoin Works . Comme l'argent ordinaire, Bitcoin est bon pour les transactions de toutes sortes, et notamment, il permet également l'anonymat ; personne ne peut retracer un achat, illégal ou non.

Le bitcoin est peut-être la monnaie du futur - un type de monnaie décentralisé et non réglementé, libre des rênes d'un seul gouvernement. Mais parce que Bitcoin n'est soutenu par aucun gouvernement, sa valeur fluctue, souvent énormément. C'est tout sauf un endroit sûr pour stocker vos économies. Mais lorsqu'il est correctement associé à Tor, c'est peut-être ce qui se rapproche le plus d'un moyen infaillible d'acheter et de vendre sur le Web.

Le côté lumineux des ténèbres

Un aspect important de l'attrait de Bitcoin est l'anonymat des transactions.

Le dark Web a ses connotations inquiétantes. Mais tout n'est pas mauvais du côté obscur. Il existe toutes sortes de services qui ne vont pas nécessairement à l'encontre de la loi.

Le dark Web abrite des moteurs de recherche alternatifs, des services de messagerie électronique, le stockage de fichiers, le partage de fichiers, les médias sociaux, des sites de chat, des organes d'information et des sites de dénonciation, ainsi que des sites qui offrent un lieu de rencontre plus sûr pour les dissidents politiques et toute autre personne qui peuvent se retrouver en marge de la société.

À une époque où la surveillance de type NSA est omniprésente et où la vie privée semble appartenir au passé, le dark Web offre un certain soulagement aux personnes qui apprécient leur anonymat . Les moteurs de recherche du Dark Web ne proposent peut-être pas de résultats de recherche personnalisés, mais ils ne suivent pas non plus votre comportement en ligne et ne proposent pas non plus un flux incessant de publicités. Bitcoin n'est peut-être pas entièrement stable, mais il offre une confidentialité, ce que votre compagnie de carte de crédit ne fait certainement pas.

Pour les citoyens vivant dans des pays aux dirigeants violents ou oppressifs, le dark Web offre un moyen plus sûr de communiquer avec des personnes partageant les mêmes idées. Contrairement à Facebook ou Twitter, qui sont faciles à surveiller pour des autorités déterminées, le dark Web offre une couverture plus profonde et un certain degré de sécurité pour ceux qui dénigrent ou complotent pour saper les politiciens ou les seigneurs des entreprises.

Un article rédigé par des chercheurs de l'Université du Luxembourg a tenté de classer les matériaux les plus couramment consultés sur le dark Web. Ce qu'ils ont découvert, c'est que même si les sites vendant des activités illégales et du contenu pour adultes sont très populaires, ceux qui se préoccupent des droits de l'homme et de la liberté d'information le sont aussi [Source : ArXiv ].

Ainsi, bien que le dark Web ait définitivement son côté laid, il a aussi un grand potentiel.

Encore plus profond

Le Web profond ne fait que s'approfondir. Sa réserve de connaissances humaines et de trivialités s'agrandit chaque jour, compliquant nos efforts pour donner un sens à tout cela. En fin de compte, c'est peut-être le plus grand défi derrière Internet que nous ayons créé.

Les programmeurs continueront d'améliorer les algorithmes des moteurs de recherche , les rendant plus aptes à approfondir les couches les plus profondes du Web. Ce faisant, ils aideront les chercheurs et les entreprises à se connecter et à croiser les informations d'une manière qui n'aurait jamais été possible auparavant.

Dans le même temps, la tâche principale d'un moteur de recherche intelligent n'est pas simplement de trouver des informations. Ce que vous voulez vraiment qu'il fasse, c'est trouver les informations les plus pertinentes. Sinon, vous êtes submergé par une mer de données encombrées qui vous laisse souhaiter que vous n'ayez jamais cliqué sur ce bouton de recherche.

C'est le problème des soi-disant mégadonnées . Les mégadonnées désignent des ensembles de données si volumineux qu'ils deviennent ingérables et incohérents. Parce qu'Internet se développe si rapidement, notre monde entier est submergé de données, et il est difficile pour quiconque de comprendre tout cela - même tous ces ordinateurs puissants et omniscients au siège de Bing et de Google.

À mesure qu'Internet se développe, chaque grande entreprise dépense de plus en plus d'argent dans la gestion et l'analyse des données, à la fois pour assurer le fonctionnement de sa propre organisation et pour obtenir des avantages concurrentiels par rapport aux autres. L'exploitation et l'organisation du Web profond constituent un élément essentiel de ces stratégies. Les entreprises qui apprendront à exploiter ces données pour leurs propres usages survivront et changeront peut-être le monde grâce aux nouvelles technologies. Ceux qui s'appuient uniquement sur le Web de surface ne pourront pas rivaliser.

En attendant, le Web profond continuera de laisser perplexe et de fasciner tous les utilisateurs d'Internet. Il contient une quantité passionnante de connaissances qui pourraient nous aider à évoluer technologiquement et en tant qu'espèce lorsqu'elles sont connectées à d'autres éléments d'information. Et bien sûr, son côté le plus sombre sera toujours caché, tout comme il le fait toujours dans la nature humaine. Le Web profond parle du potentiel insondable et dispersé non seulement d'Internet, mais aussi de la race humaine.

Beaucoup plus d'informations

Note de l'auteur : comment fonctionne le Web profond

Le Deep Web est un endroit vague et ambigu. Mais en faisant des recherches sur cette histoire, il était facile de conclure au moins une chose avec certitude : la plupart des gros titres ont tendance à sensationnaliser le Web sombre et son côté plus minable, et mentionnent rarement le potentiel inexploité du Web profond. Les articles sur les drogues et les armes illégales attirent évidemment plus de lecteurs que ceux détaillant les défis techniques de la collecte de données sur le Web profond. Lisez les articles négatifs et haletants avec un grain de sel. Il convient de rappeler qu'il y a beaucoup plus dans le Web profond que l'élément criminel évident. Alors que les ingénieurs trouvent des moyens plus efficaces et plus rapides de cataloguer les magasins de données du Web, Internet dans son ensemble pourrait transformer notre société de manière étonnante.

Articles Liés

  • Comment fonctionne Google
  • Pourquoi les gens piratent-ils les logiciels ?
  • Comment fonctionne la MPAA
  • Comment fonctionne BitTorrent

Sources

  • Bagot, Martin. "Le marché criminel du Web profond disparaît complètement après '58 millions de braquages'". Le miroir. 3 décembre 2013. (6 décembre 2013) http://www.mirror.co.uk/news/technology-science/technology/sheep-marketplace-deep-web-criminal-2879995
  • Bergman, Michael K. « Livre blanc : Le Web profond : faire ressortir la valeur cachée ». Journal of Electronic Publishing." Août 2001. (6 décembre 2013) http://quod.lib.umich.edu/cgi/t/text/text-idx?c=jep;view=text;rgn=main ;idno=3336451.0007.104
  • Berman, Fran. "Deep Web Film ira à l'intérieur du monde de Bitcoin, Silk Road et au-delà." Mashable. 20 novembre 2013. (6 décembre 2013) http://mashable.com/2013/11/20/alex-winter-deep-web-documentary/
  • Biggs, John. "Les utilisateurs du Web profond sont prêts à lancer Silk Road 2.0." Crise technologique. 4 octobre 2013. (6 décembre 2013) http://techcrunch.com/2013/10/04/deep-web-users-are-ready-to-launch-silk-road-2-0/
  • Bingham, John et Kirkup, James. "David Cameron remporte le soutien du FBI pour la guerre du 'Dark Web' contre les pédophiles." Télégraphe. 18 novembre 2013. (6 décembre 2013) http://www.telegraph.co.uk/news/uknews/crime/10456108/David-Cameron-wins-FBI-support-for-dark-web-war -on-paedophiles.html
  • Bright Planet. "Comprendre le Deep Web en 10 minutes." 12 mars 2013. (6 décembre 2013) http://www.brightplanet.com/2013/03/whitepaper-understanding-the-deep-web-in-10-minutes/
  • Bright Planet. "Comment les données du Deep Web passent-elles des résultats à l'intelligence exploitable ?" 31 janvier 2013. (6 décembre 2013) http://www.brightplanet.com/2013/01/how-does-data-from-the-deep-web-go-from-results-to-actionable -intelligence/
  • Bright Planet. "L'avenir de la recherche en ligne." 27 août 2013. (6 décembre 2013) http://www.brightplanet.com/2013/08/the-future-of-online-search/
  • Cous, Andrew. "TorSearch facilite grandement la recherche de la prochaine route de la soie." Tendances numériques. 11 octobre 2013. (6 décembre 2013) http://www.digitaltrends.com/web/torsearch-tor-network-hidden-services/
  • Cous, Andrew. "C'était rapide : 2 sites rivalisent pour les clients criminels de Silk Road." Tendances numériques. 3 octobre 2013. (6 décembre 2013) http://www.digitaltrends.com/web/silk-road-fbi-ulbricht-sheep-marketplace-bmr/
  • Gallagher, Diane. "Éplucher les couches du 'Dark Web' WCNC." 19 novembre 2013. (6 décembre 2013) http://www.wcnc.com/news/local/The-Dark-Web-232606871.html
  • Ici et maintenant. "Le Web profond : là où Google ne vous emmènera pas." WBUR.org. 8 novembre 2013. (6 décembre 2013) http://hereandnow.wbur.org/2013/11/08/the-deep-web
  • Hockerson, Lauren. "TorSearch propose une recherche privée sur le Web profond." Gigaom. 11 octobre 2013. (6 décembre 2013) http://gigaom.com/2013/10/11/torsearch-offers-private-search-of-the-deep-web/
  • Lederman, Abe et Lederman, Sol. "Comprendre les technologies du Web profond." Ingénierie des nouvelles idées. Juin 2004. (6 décembre 2013) http://deepwebtech.com/PDFs/Understanding%20Deep%20Web%20Technologies.pdf
  • Je t'aime, Dylan. "Il existe un Internet secret pour les trafiquants de drogue, les assassins et les pédophiles." Interne du milieu des affaires. 6 mars 2013. (6 décembre 2013) http://www.businessinsider.com/tor-silk-road-deep-web-2013-3?op=1
  • Seymour, Andrew. "Le 'Deep Web' anonyme est la nouvelle frontière de l'exploitation des enfants, a déclaré la conférence." Citoyen d'Ottawa. 16 novembre 2013. (6 décembre 2013) http://www.ottawacitizen.com/business/Anonymous+deep+frontier+child+exploitation+conference+told/9175718/story.html
  • Rapide, Tim. "Qu'est-ce que le 'Deep Web'? Et d'autres questions sur le monde virtuel sombre de Silk Road." Soleil de Baltimore. 3 octobre 2013. (6 décembre 2013) http://articles.baltimoresun.com/2013-10-03/business/bal-silk-road-deep-web-explainer-20131003_1_satoshi-nakamoto-bitcoin-silk -route
  • Université de Californie, Berkeley. « Web invisible ou profond : qu'est-ce que c'est, comment le trouver et son ambiguïté inhérente ». (6 décembre 2013) http://www.lib.berkeley.edu/TeachingLib/Guides/Internet/InvisibleWeb.html