Gemini 3.5 Flash : on a testé le modèle rapide de Google (avis 2026)
Google a ouvert son I/O 2026 le 19 mai en lançant directement Gemini 3.5 Flash en version stable, avant même le Pro. Le pari est clair : faire du « petit » modèle rapide la machine que tout le monde utilise au quotidien. On l’a mis à l’épreuve sur cinq tâches concrètes et comparé aux deux autres minis du marché, Claude Haiku 4.5 et GPT-5.4 Mini.
Le verdict en 30 secondes
Gemini 3.5 Flash est un bon modèle rapide, mais ce n’est plus le modèle « pas cher » qu’on attendait de la gamme Flash. Il a gagné en intelligence (il bat l’ancien Gemini 3.1 Pro sur plusieurs tests agentiques) et il a triplé de prix par rapport à la version qu’il remplace.
Nos notes après test :
- Rapidité : 4,5/5 — sortie environ 4x plus rapide que la génération précédente
- Qualité générale : 4/5 — solide sur le raisonnement léger et les tâches multi-étapes
- Prix : 3/5 — devenu cher pour un Flash (1,50 $/9 $ par million de tokens)
- Écosystème : 4,5/5 — intégré partout (app Gemini, AI Studio, AI Mode dans la recherche, Workspace)
En pratique : à prendre si vous voulez un modèle qui enchaîne les appels d’outils et avale de gros documents. À éviter si votre seul critère est le coût au token brut, où Haiku et le mini d’OpenAI restent moins chers.
Gemini 3.5 Flash, c’est quoi exactement
C’est le premier modèle de la famille 3.5 de Google, sorti en accès général le jour de l’ouverture de Google I/O 2026. Particularité notable : Google a lancé le Flash avant le Pro, ce qui n’arrive presque jamais. Au 30 juin 2026, Gemini 3.5 Pro n’est toujours pas public : il a raté sa cible de juin et reste en preview limitée sur Vertex AI, avec un lancement repoussé à juillet. Résultat, pour l’immense majorité des utilisateurs, le Flash est aujourd’hui le seul modèle 3.5 réellement accessible.
Ce qu’il apporte par rapport au Gemini 3.1 Pro et à l’ancien Flash :
- Une fenêtre de contexte de 1 million de tokens, soit de quoi ingérer plusieurs gros PDF ou des bases de code entières
- Des entrées nativement multimodales : texte, image, audio, vidéo et PDF
- Une vitesse de sortie environ 4x supérieure à la génération précédente
- Des scores agentiques qui dépassent ceux du Gemini 3.1 Pro (par exemple 83,6 % sur MCP Atlas, 76,2 % sur Terminal-Bench, d’après la fiche modèle de Google)
Autre changement utile à connaître : le niveau de « réflexion » par défaut est passé de high à medium. Le modèle réfléchit donc un peu moins par défaut, ce qui le rend plus rapide et moins cher sur les tâches simples. Vous pouvez forcer low, medium ou high selon le besoin. Le mode low a été nettement amélioré pour le code et les tâches agentiques à faible nombre d’étapes.
Notre test sur 5 cas d’usage rapides
On a choisi cinq tâches typiques d’un petit modèle rapide, celles où on n’a pas besoin d’un modèle flagship.
1. Résumés de documents longs. On lui a passé un rapport PDF de 40 pages. Le résumé est arrivé en quelques secondes, structuré et fidèle. La fenêtre de 1 million de tokens permet de coller le document entier sans le découper, ce qui évite les erreurs de contexte qu’on voit avec les modèles à 200 K.
2. Classification de mails. Tri d’un lot d’emails par catégorie (facture, support, prospection, perso). Précision très bonne, latence faible. C’est le genre de tâche répétitive et à fort volume où Flash brille, parce que la vitesse compte plus que la finesse.
3. Génération de scripts courts. Petits scripts Python et bash. Le code part vite et tourne, mais sur des tâches de code un peu denses, on a senti la limite : le modèle est moins rigoureux que Claude Haiku 4.5, qui reste devant sur le code pur dans les benchmarks publics.
4. Chatbot léger. Brancher Flash comme moteur d’un assistant FAQ. Réponses rapides, ton naturel en français, bon suivi de consignes. Pour un chatbot de site ou de support de niveau 1, c’est largement suffisant.
5. Traitement en quasi temps réel. Enchaînement d’appels d’outils (recherche, extraction, mise en forme). C’est là que le profil agentique du modèle se voit : il gère bien les workflows multi-étapes, mieux que ce qu’on attend d’un mini.
Bilan du test : Flash est un excellent « cheval de trait » polyvalent. Il cale un peu sur le code exigeant, mais tient le choc sur tout le reste, surtout dès qu’il faut du volume, du multimodal ou de l’enchaînement d’actions.
Flash vs Claude Haiku 4.5 vs GPT-5.4 Mini : quel mini-modèle pour quoi
Les trois grands fournisseurs ont chacun leur petit modèle rapide. Voici comment ils se situent, prix API à la mi-2026.
| Modèle | Prix entrée /M | Prix sortie /M | Contexte | Point fort |
|---|---|---|---|---|
| Gemini 3.5 Flash | 1,50 $ | 9 $ | 1 M tokens | Agentique, multimodal natif, vitesse |
| Claude Haiku 4.5 | 1,00 $ | 5 $ | 200 K tokens | Code, fiabilité du suivi de consignes |
| GPT-5.4 Mini | 0,75 $ | 4,50 $ | Large | Le moins cher, écosystème OpenAI |
Comment choisir selon le cas :
- Vous traitez de gros documents, de la vidéo ou de l’audio : Flash, grâce au million de tokens et au multimodal natif
- Vous générez du code et vous voulez de la rigueur : Haiku 4.5, qui garde l’avantage sur le code dans les comparatifs
- Vous cherchez le coût le plus bas et vous êtes déjà chez OpenAI : GPT-5.4 Mini
- Vous voulez des workflows agentiques (appels d’outils en chaîne) : Flash, qui passe devant sur ce terrain
Le détail qui surprend : Flash est le plus cher des trois au token, alors que la gamme « Flash » était historiquement la moins chère de Google.
Le prix réel (et pourquoi il a triplé)
Côté API, Gemini 3.5 Flash coûte 1,50 $ par million de tokens en entrée et 9 $ en sortie, avec un cache d’entrée à 0,15 $ (réduction de 90 % sur le contexte réutilisé). C’est environ trois fois le tarif du Gemini 2.5 Flash qu’il remplace. Plusieurs observateurs y voient le signe que l’ère des petits modèles bradés touche à sa fin : Google facture désormais l’intelligence supplémentaire qu’il a mise dans le Flash, et la frontière entre « mini » et « grand » se brouille.
Pour un usage grand public, l’accès est plus simple :
- Gratuit dans l’app Gemini, dans Google AI Studio et dans l’AI Mode de la recherche Google, disponible en France
- Inclus dans les abonnements Google One AI, qui débloquent des quotas plus élevés et l’intégration Workspace (Gmail, Docs, Sheets)
En pratique : si vous testez ou si vous l’utilisez ponctuellement, le palier gratuit suffit. Si vous bâtissez un produit dessus et que vous comptez chaque centime, faites le calcul, car au token brut Haiku et GPT-5.4 Mini coûtent moins cher.
Si vous hésitez entre les abonnements payants des trois éditeurs, on a détaillé les offres dans notre comparatif des meilleurs abonnements IA 2026, et l’accès gratuit côté Anthropic dans notre guide Claude AI gratuit.
Quand prendre Flash plutôt qu’attendre 3.5 Pro
La question revient souvent, surtout que le Pro arrive en juillet. Notre lecture :
Prenez Flash maintenant si vos tâches sont du volume, du tri, du résumé, du chatbot, de l’enchaînement d’outils ou du multimodal. Pour 90 % des usages quotidiens, c’est le bon outil, et il est déjà là.
Attendez le 3.5 Pro si vous avez besoin de raisonnement profond, de code complexe ou de fiabilité maximale sur des tâches longues. Le Pro vise ce créneau premium, via les abonnements Gemini payants.
À noter pour le contexte : Flash sert déjà de moteur à une bonne partie de l’app Gemini et de l’AI Mode dans la recherche. Vous l’utilisez peut-être sans le savoir. Pour son rôle dans l’écosystème Google, voyez notre avis Gemini Advanced, et pour ses capacités vidéo, notre test de Gemini Omni Video — utile si vous voulez ensuite enchaîner sur de la création vidéo avec un outil comme Vidnoz.
Côté concurrence directe, nos comparatifs détaillés : GPT-5.5 pour la gamme OpenAI, Claude Opus 4.8 pour le haut de gamme Anthropic, et le face-à-face ChatGPT vs Claude.
Google AI Overview en France : où en est-on en juillet 2026
Google a confirmé fin juin 2026 (via une lettre aux éditeurs de presse français, relayée par Ouest-France, Les Échos et Le Monde) l’arrivée des AI Overviews et du AI Mode en France avant le 23 septembre 2026. Le retard s’explique par la loi française de 2019 sur les droits voisins : Google devait d’abord s’engager sur un droit d’opt-out, la transparence sur les impressions générées par l’IA, et une compensation des éditeurs. Au moment de la publication de cet article, la fonctionnalité n’est pas encore en ligne pour les recherches en France — l’annonce fixe seulement une fenêtre de déploiement cet été.
En pratique, pour un usage quotidien : Google Search avec AI Overview deviendra le réflexe pour les questions rapides une fois déployé. Pour les tâches ponctuelles qui demandent un modèle dédié plutôt qu’un résumé de recherche, la répartition reste la même qu’aujourd’hui : Gemini 3.5 Flash pour la vitesse et le low-cost, Gemini 3.5 Pro pour le raisonnement long. Notre avis Nano Banana Pro et notre avis Muse Image couvrent le reste de l’écosystème image du moment.
FAQ
Gemini 3.5 Flash est-il accessible gratuitement en France ?
Oui. Il est disponible sans frais dans l’app Gemini, dans Google AI Studio et dans l’AI Mode de la recherche Google, accessibles depuis la France. Les abonnements Google One AI débloquent des quotas plus larges et l’intégration Workspace.
Quelle est la taille de contexte maximale ?
1 million de tokens en entrée. C’est assez pour ingérer plusieurs gros PDF, de longues conversations ou des bases de code entières sans avoir à les découper.
Est-il vraiment plus rapide ?
Oui, sur la sortie. Google annonce une vitesse environ 4x supérieure à la génération précédente, et c’est ce qu’on a constaté sur les résumés et la classification. Le niveau de réflexion par défaut est passé à medium, ce qui aide la latence.
S’intègre-t-il à Google Workspace ?
Oui, via les abonnements Google One AI, dans Gmail, Docs et Sheets. Pour les développeurs, l’API passe par Google AI Studio et la plateforme Gemini.
Quelles sont ses limites sur le code et le raisonnement ?
Flash est rapide mais reste un petit modèle. Sur le code dense, Claude Haiku 4.5 garde l’avantage dans les benchmarks publics. Pour du raisonnement profond ou des tâches longues et complexes, mieux vaut attendre Gemini 3.5 Pro (annoncé pour juillet 2026) ou viser un modèle flagship.
