Live News

In het kort Gemini 3.7 Flash bouwde een speelbaar browserspel vanaf een enkele prompt in 2 minuten en 13 seconden, een taak Gemini 3.6 Flash misluk...

In het kort SB 903 zou begeleidende chatbots verbieden psychotherapie aan te bieden...

De belangrijkste drijfveer van het lobbyen bij de banken over de Clarity Act is echter geweest om te suggereren dat bankiers uit de Main Street-gem...

16/08/26

Volg ons:

Gemini 3.7 Flash Review: het goedkope model van Google is niet meer dom

Gemini 3.7 Flash Review: het goedkope model van Google is niet meer dom
Default Door Remote - 16 Aug 2026
In het kort

Gemini 3.7 Flash bouwde een speelbaar browserspel vanaf een enkele prompt in 2 minuten en 13 seconden, een taak Gemini 3.6 Flash mislukte drie weken eerder regelrecht.

Het faalde in onze logische brugpuzzel met hetzelfde verkeerde antwoord als Claude Fable 5, en slaagde er niet in het wiskundige probleem daadwerkelijk te berekenen dat het correct had opgezet.

Het model draait tot en met 31 december op 75 cent per miljoen tokens, de helft van het tarief van 3,6 Flash, voordat het op 1 januari verdubbelt naar $ 1,50.

Google heeft Gemini 3.7 Flash op 13 augustus uitgebracht, die vanaf dag één algemeen beschikbaar is in meer dan 160 landen. Het heeft maximaal een miljoen invoertokens nodig, retourneert 64.000, leest afbeeldingen, video, audio en pdf's, kan tools oproepen en een computer aansturen.

Flash is nooit het model geweest waarnaar je grijpt als een probleem moeilijk is. Het is degene die je gebruikt om tekst te sorteren, agentsessies te comprimeren voordat ze in hun eigen context verdwijnen, en documenten samen te vatten waarvoor je geen vlaggenschip wilt betalen om te lezen.

Myriad: Wanneer zal OpenAI GPT-6 uitbrengen? Klik om uw voorspelling te doen. Afgaande op dit soort banen is 3.7 Flash een echte upgrade. Afgezet tegen al het andere is het een competent model dat wordt overschreven door software die je gratis kunt downloaden.

Google's eigen benchmarkblad geeft 3.7 Flash een voorsprong op Claude Sonnet 5 en GPT-5.6 Terra op 11 van de 18 geteste categorieën. De belangrijkste cijfers zijn 1.588 Elo op het webontwikkelingsbord van Code Arena en 30,4% op AutomationBench. Beide komen voort uit de methodologie van Google, dus behandel de voorsprong als de claim van het bedrijf en niet als een vaststaand feit.

We hebben het model getest om te zien of het voldoet aan de beweringen van Google. Dit zijn onze resultaten.

Codering: kan het iets bouwen dat bij de eerste poging draait?

Deze test meet zero-shot-codegeneratie: of een model één instructie omzet in werkende software zonder voorbeelden om te kopiëren en zonder kans om zichzelf te repareren. We overhandigen één enkele prompt voor een browsergame en verzenden alles wat terugkomt, inclusief bugs. Geen vervolgacties, geen foutmeldingen, geen tweede poging.

Gemini 3.7 Flash ging voorbij in 2 minuten en 13 seconden. De game was vanaf de eerste run speelbaar, de syntaxis was helder, de botsings- en scorelogica bleven behouden en de visuele kwaliteit lag boven wat de prijsklasse doet vermoeden.

De vergelijking die hier van belang is, is geen vlaggenschip. Het is Gemini 3.6 Flash, uitgebracht op 21 juli, die helemaal geen werkend bestand kon produceren. De HTML was verkeerd opgemaakt, elementen konden niet worden weergegeven en vervolgvragen waarin werd gevraagd de eigen uitvoer te repareren, leverden niets op.

Uiteindelijk hebben we dat wrak aan DeepSeek overhandigd, dat elf bugs heeft gevonden en acht reparaties heeft verzonden om het speelbaar te maken. Drie weken later heeft dezelfde productlijn geen redding meer nodig, en het resultaat komt dicht in de buurt van wat GPT-5.6 Sol in onze recensie van juli produceerde.

Gemini 3.7 Flash wint deze regelrechte, en het is de sterkste reden om over te stappen. Het voorbehoud is dat het specificaties uitvoert in plaats van ze uit te vinden, dus een vage prompt levert je een vaag spel op.

Je kunt het spel Gemini 3.7 Flash hier proberen.

Creatief schrijven: kan het een paradox bevatten en een zin schrijven?

In dit gedeelte worden twee dingen tegelijk getest: de literaire kwaliteit en de vraag of een model een structurele regel voor duizenden woorden kan gehoorzamen. De prompt stuurt Jose Lanz van 2150 terug naar het jaar 1000 en eist een gesloten causale lus – zijn tussenkomst moet datgene zijn dat de toekomst creëert die hij kwam voorkomen.

De regel die de test bepaalt, is de laatste zin: hij kan pas begrijpen wat hij heeft gedaan als hij thuis is.

Gemini 3.7 Flash genereerde een behoorlijk resultaat. Jose vuurt een entropisch kanon af in een kloof in de Pyreneeën, smeedt per ongeluk een obelisk die het 22e-eeuwse Iberia tot slaaf maakt, en grijpt de hele lus terwijl hij duizend jaar eerder nog in de modder stond: "Het was de basis van de Sintelspits."

De plotmachine is eigenlijk behoorlijk goed. Het verhaal maakt melding van een vallende ster waar oude monniken getuige van waren en verduidelijkt dat dit de flits was van Jose's eigen aankomst, en het wapen dat hij meebracht om de anomalie uit te wissen is wat deze smeedt. De slotregel ervan – 'Het was gewoon wachten tot hij het zou voltooien' – brengt het determinisme waar de prompt om vroeg.

Maar voor degenen die eraan gewend zijn, schreeuwt het verhaal ‘AI’. Bijna elk zelfstandig naamwoord wordt geleverd met twee bijvoeglijke naamwoorden: 'hyperluminescerende torens', 'vochtige, met mos verstikte aarde', 'dik, obsidiaan haar'. Dat is de textuur van een model dat het meest waarschijnlijke volgende woord kiest in plaats van er één te kiezen, en het produceert botsingen als een monoliet die 'zoemt met een laagfrequente brom'.

We hebben het vergeleken met Qwopus3.5-27B-v3, een community-verfijning van Qwen3.5-27B die de redenering in Claude Opus-stijl destilleert en op een enkele consumenten-GPU draait voor niets per zoekopdracht. Het gehoorzaamde de regel die Gemini overtrad.

Jose vermoordt een monnik in San Millán de la Cogolla, een echt La Rioja-klooster dat er rond het jaar 1000 echt toe deed, en begrijpt pas wat hij deed nadat hij terugkeerde naar 2150 en zijn eigen DNA vond in een met was verzegelde codex.

Qwopus is ook niet helemaal schoon. Het hele planningskladblok werd boven het verhaal gedumpt, inclusief typefouten, en het laatste deel doorbreekt de gesloten lus waar het acht secties aan heeft gebouwd door Jose terug te laten gaan en dingen te repareren.

Maar alles bij elkaar genomen, accepteert Qwopus het. Gemini leverde het nettere pakket en het meer gedisciplineerde einde, maar het mislukte de enige instructie waarrond de prompt was gebouwd, en een gratis model dat op een gaming-GPU draaide, schreef het betere verhaal.

Associatief denken: kan een metafoor een argument bevatten?

Deze test meet associatief redeneren – of een model verbanden kan leggen tussen niet-gerelateerde concepten zonder zichzelf uit te leggen. De prompt vraagt ​​om een ​​beschrijving van een takje, gebruikt die beschrijving om de uitbuiting van werknemers en de aanbidding van de rijken te verklaren, en vereist vervolgens dat het argument oplost in een beschrijving van een sla.

Bewegwijzering is de faalmodus. Het benoemen van de metafoor doodt het.

Gemini noemt het in de openingszin van de tweede paragraaf: “Dit is de precieze werking van het moderne proletariaat.” Alles daarvoor werkte.

Een deel van de beelden verdient zijn plaats. De arbeider krijgt 'net genoeg bast om stijf te blijven voor nog een week productie', en de gevallen twijgen worden geconditioneerd om te geloven dat met voldoende stijfheid elk van hen een stam kan worden. De paragraaf met de eerste daarvan bevat ook een werknemer die 'gebonden is aan een enorme, topzware bedrijfshiërarchie'.

Niet slecht qua logica en structuur.

Het oplossen is de echte ineenstorting. Gemini vertelt de overgang in plaats van deze uit te voeren – de hiërarchieën ‘brokkelen af ​​en lossen op in de stille, nederige realiteit van de organische wereld eronder’ – en dan verschijnt er eenvoudigweg een sla, die geen verbinding heeft met iets ervoor.

GPT-5.6 Sol rot het takje in de grond en laat de sla eruit groeien: "Regen dringt het graan binnen. Vezels worden losser, donkerder." Het argument komt ook verborgen in het object terecht, waarbij rijkdom opnieuw wordt geformuleerd als een taal van deugd, waarbij 'het landhuis intelligentie betekent'.

GPT-5.6 Sol wint met veel. Gemini produceerde een mooie individuele regel, maar legde zijn eigen metafoor uit en sloeg vervolgens de overgang over die de prompt specifiek testte.

Logica: leest het de prompt of herkent het de puzzel?

Deze test meet niet-wiskundig redeneren, en specifiek of een model de vraag voorleest of een patroon matcht met een versie die het uit het hoofd heeft geleerd. Onze brugprompt geeft vier mensen één fakkel en oversteektijden van 1, 2, 5 en 10 minuten, en vraagt ​​vervolgens hoe snel ze allemaal over kunnen komen.

De truc is wat de prompt weglaat. Er staat nooit dat er maar twee mensen tegelijk op de brug kunnen zijn, dus het antwoord is 10 minuten: iedereen loopt er samen naartoe in het langzaamste tempo van de persoon.

Gemini antwoordde 17 minuten en voerde de uit het hoofd geleerde vijfstappenshuffle uit de leerboekversie van de puzzel uit. Het vermeldde de beperking als een feit zonder ooit te controleren of we het hadden geschreven.

De zichtbare redenering ervan is erger dan het antwoord. De tracering beweert dat het inefficiënt zou zijn om de twee langzaamste mensen samen naar de overkant te sturen, omdat iemand dan met de fakkel terug zou moeten lopen – en dan stuurt het uiteindelijke antwoord ze toch samen naar de overkant. Het spreekt zichzelf tegen in één enkel antwoord en rapporteert het resultaat met volledig vertrouwen.

Claude Fable 5 belandde in juli op hetzelfde verkeerde nummer. Het begon met te verklaren wat het veronderstelde, "uitgaande van de klassieke beperking dat de brug slechts twee mensen tegelijk kan bevatten", wat het verschil is tussen een verkeerd antwoord dat je kunt begrijpen en een antwoord dat je niet kunt geven.

Niemand wint. Fable gaat alleen over transparantie, en het valse vertrouwen bij de Gemini-agenten komt hier naar voren in een puzzel die je met de hand kunt controleren.

Wiskunde: Maakt het de klus af?

Deze test meet symbolische wiskunde die veel verder gaat dan consumentengebruik, plus iets eenvoudigers: of het model doet wat er gevraagd wordt. De prompt vereist een oneven monisch polynoom van graad 19 met reële coëfficiënten en lineaire coëfficiënt -19, waarvan de curve zich opsplitst in ten minste drie onherleidbare componenten, en vraagt ​​vervolgens om p(19).

Beide modellen vonden dezelfde deur. Gemini en Qwen 3.7 Max Preview identificeerden beide het Dickson-polynoom, losten de beperking op om de parameter op 1 vast te stellen en leidden de gesloten vorm correct af.

Toen stopte Gemini. Het drukte p(19) af als een niet-geëvalueerde uitdrukking met betrekking tot de 19e macht van een vierkantswortel, produceerde nooit het getal en demonstreerde nooit het aantal componenten dat ook door de prompt werd gevraagd. Het leverde dit alles op in een opgemaakte HTML-pagina met CSS en een slagschaduw waar niemand om vroeg.

Qwen is klaar. Het gaf de volledige factorisatie in tien componenten – één lineair, negen kwadratisch – en bracht de herhaling uit op 1.876.572.071.974.094.803.391.179, en controleerde het resultaat modulair. We hebben dat cijfer onafhankelijk geverifieerd in SymPy en het klopt.

Qwen wint op het enige criterium dat er toe deed. Gemini begon prima en besloot het rekenen over te slaan, wat een vreemde plek is om te stoppen.

Conclusie

Gemini 3.7 Flash is de overstap waard als je al deel uitmaakt van het ecosysteem van Google. Het is dramatisch beter in code dan het model dat het vervangt, snel genoeg om van belang te zijn voor het werk van agenten, en goedkoop genoeg dat het uitvoeren ervan op volume een afrondingsfout is.

De sterke punten zijn uitvoering en structuur. Geef het een gedetailleerde specificatie en het zal het ding bouwen, een plot bij elkaar houden en de causale logica coherent houden over duizenden woorden heen.

De zwakke punten zijn creativiteit en redenering. Het schrijven is voorspelbaar genoeg om op het eerste gezicht te identificeren als machinaal gemaakt, en het model beweert verkeerde antwoorden zonder de veronderstelling te markeren waardoor ze fout waren.

De prijs is daarvoor het sterkste argument. Met 75 cent per miljoen inputtokens en een output van $3,75 ondermijnt het de inputsnelheid van $5 van GPT-5.6 Sol met 85% en kost het de helft van wat 3.6 Flash bij de lancering deed.

Het argument ertegen is een gratis 27B-model op een gaming-GPU die een beter verhaal schreef en er niets voor vroeg. Het introductietarief van Google vervalt op 31 december, wanneer de input verdubbelt naar $1,50 en de output naar $7,50.

Dagelijkse debriefing NieuwsbriefBegin elke dag met de belangrijkste nieuwsverhalen van dit moment, plus originele artikelen, een podcast, video's en meer. Uw e-mail Download het! Download het!