EPISODE · Jun 25, 2026
Gemini 3.5 Flash maîtrise enfin l'action sur écran
from IA7
DeepMind déploie la capacité « computer use » sur Gemini 3.5 Flash : l'IA peut désormais voir l'écran, cliquer, taper, naviguer comme un humain. C'est disponible via l'API et dans le web UI. Le coût reste celui de Flash — donc moins cher que Claude ou GPT-4V pour cette tâche. Cette capacité change le jeu pour l'automatisation : au lieu de parser des API ou bricoler du scraping, tu décris une action (« remplis ce formulaire », « retrouve cette info sur le site ») et l'IA l'exécute. Les retours d'usage montrent des taux de réussite stables sur les tâches répétitives et bien structurées. Limite connue : elle plante encore sur les interfaces complexes, les popups mal balisées, les captchas. Elle n'a pas la persistance d'une vraie automation (elle ne retient pas le contexte entre plusieurs étapes sans relance). Et comme toute IA vision, elle hallucine sur les petits textes. L'impact concret : pour les startups et les PME, c'est un raccourci vers l'automation sans code custom. Pour les grandes boîtes, ça remplace pas RPA mais ça accélère les prototypes. Le coût par action reste marginal — l'intérêt c'est la rapidité d'itération, pas l'économie.
Embed this episode
NOW PLAYING
Gemini 3.5 Flash maîtrise enfin l'action sur écran
No transcript for this episode yet
Similar Episodes
No similar episodes found.
Similar Podcasts
No similar podcasts found.