Dans quelles sources de données viennent piocher les IA ? episode artwork

EPISODE · Aug 14, 2025 · 2 MIN

Dans quelles sources de données viennent piocher les IA ?

from Choses à Savoir TECH

Si ChatGPT, Gemini ou encore Grok progressent aussi vite, c’est en grande partie grâce à un ingrédient-clé : les données massives disponibles sur Internet. Et désormais, on sait un peu mieux d’où elles proviennent. Une infographie publiée par Statista a analysé les réponses fournies par ChatGPT, Perplexity, AI Overviews et le mode IA de Google pour déterminer quelles sources ces intelligences artificielles exploitent le plus.En tête du classement, surprise : Reddit apparaît dans 40 % des réponses, loin devant Wikipedia (26,3 %), YouTube (23,5 %) et même Google (23,3 %). Autrement dit, le savoir collectif et les discussions informelles des internautes sont au cœur de l’entraînement des IA. Des plateformes comme Yelp, Tripadvisor ou Facebook fournissent aussi des données précieuses… et gratuites. C’est là que le débat s’ouvre : combien de temps encore ces trésors de contenu généré par les utilisateurs resteront-ils exploitables librement ? Déjà, les ayants droit peinent à faire respecter leur propriété intellectuelle. Et pour le contenu du domaine public, la récolte continue, sans que ses auteurs touchent quoi que ce soit.Exemple parlant : depuis juin, Meta utilise vos données personnelles pour entraîner son IA, Meta AI, sauf si vous vous y êtes formellement opposé. Tout ce que vous publiez ou commentez sur Facebook, Instagram, WhatsApp ou Messenger entre dans ses bases d’apprentissage. Pour l’instant, Meta AI est optimisée pour le public américain, mais la firme veut adapter son outil aux usages et à la culture européenne. En clair, vos interactions en ligne pourraient bientôt façonner un modèle pensé pour mieux répondre… à vous. Derrière la magie des réponses fluides et “intelligentes” des IA, il y a donc un constat simple : elles se construisent sur nos traces numériques, offertes souvent sans que nous en mesurions vraiment la valeur. Hébergé par Acast. Visitez acast.com/privacy pour plus d'informations.

Episode metadata supplied by the publisher feed · Published Aug 14, 2025

Embed this episode

NOW PLAYING

Dans quelles sources de données viennent piocher les IA ?

0:00 2:08

No transcript for this episode yet

We transcribe on demand. Request one and we'll notify you when it's ready — usually under 10 minutes.

No similar episodes found.

No similar podcasts found.

Frequently Asked Questions

How long is this episode of Choses à Savoir TECH?

This episode is 2 minutes long.

When was this Choses à Savoir TECH episode published?

This episode was published on August 14, 2025.

Can I download this Choses à Savoir TECH episode?

Yes. Use the download control on the episode player to save the publisher-provided media file.
URL copied to clipboard!