Live News

Het ommekeerplan van PayPal-CEO Enrique Lores voor het fintech-bedrijf zou een verkoop van zichzelf kunnen omvatten...

Gen Z-traders op Binance wijzen een groeiend deel van hun aandelenactiviteit toe aan exchange-traded funds (ETF's), waarbij de producten begin augu...

De regering van Ierland heeft een alomvattende strategie tegen het witwassen van geld gepubliceerd, waarin gedetailleerd wordt beschreven hoe het l...

15/08/26

Volg ons:

Kog gaat dieper om meer gevolgtrekkingen uit GPU's te persen

Kog gaat dieper om meer gevolgtrekkingen uit GPU's te persen
Default Door Remote - 14 Aug 2026
De race om snellere AI-gevolgtrekkingen is begonnen, en de markten hebben Cerebras en zijn speciaal gebouwde chips een warm welkom gegeven bij zijn IPO-debuut in mei. Maar de Franse startup Kog gokt erop dat er veel meer kracht uit conventionele GPU's kan worden geperst.

De startup verscheen in mei op de voorpagina van Hacker News met een technische preview die moest bewijzen dat “extreem snelle decodering met één verzoek mogelijk is op de standaard datacenter-GPU’s die bedrijven al bezitten” – zoals de AMD MI300X en Nvidia H200 GPU’s die het voor zijn demo gebruikte.

Sommigen waren teleurgesteld toen ze hoorden dat dit niet gold voor GPU's in onze laptops, maar anderen zagen het potentieel. Nu de inferentiesnelheid en de kosten nu een cruciaal knelpunt vormen, trok Kogs belofte om nieuwe mogelijkheden op bestaande hardware te ontsluiten met software-optimalisatie meer dan toeschouwers. “We hadden 200 tastbare zakelijke leads”, vertelde CEO Gaël Delalleau aan TechCrunch. 

Op basis van vroege feedback verwacht de solo-oprichter dat software-engineering de eerste use case zal zijn. Veteraan Claude Code-gebruikers weten heel goed dat ze soms uren moeten wachten op resultaat. Anthropic begrijpt zelf dat snelheid geld waard is, en rekent een meerprijs aan voor Claude’s Fast Mode.

Kog hoopt zich te richten op klanten die door deze vertragingen worden afgeschrikt, meestal omdat ze voor professionele taken afhankelijk zijn van AI-workflows. Maar de startup heeft ook ontwerppartners waarmee gebruikers in een handomdraai games en apps kunnen genereren, en voor wie een sneller resultaat dankzij de Kog Inference Engine (KIE) meer inkomsten zou betekenen, zei Delalleau.

Het bedrijf realiseert zich dat deze markt nog niet helemaal volwassen is. Terwijl hij de vraag observeerde, ontdekte Kog dat zijn potentiële klanten niet bereid zijn om kleine modellen te verfijnen. “En daarom hebben we ons sinds de lancering volledig gefocust op het versnellen van de ontwikkeling van grotere modellen om aan de vraag te voldoen die we hebben gezien.”

Dit laat Kog een enorme sprong maken om zijn belofte van “30x snellere LLM-gevolgtrekking” waar te maken. De demo toonde een indrukwekkende 3.000 per-request tokens per seconde (TPS) – maar met een speciaal gebouwd klein model met slechts zo'n 2 miljard parameters, de nu open source Laneformer 2B. 

In tegenspraak met sceptici is Delalleau ervan overtuigd dat dezelfde aanpak net zo goed kan werken met LLM's, waarvan de omvang een uitdaging kan zijn voor inferentiechips. "GPU's hebben een mooie toekomst", zei hij. Voor de CEO van Kog is het idee dat ze niet goed geschikt zijn voor decodering een misvatting geworden; nieuwere GPU's hebben steeds meer geheugenbandbreedte die alleen maar smeekt om ontgrendeld te worden.

Kog is niet de enige die denkt dat software-optimalisatie GPU's kan helpen meer te doen dan er op de doos staat. ZML, ook uit Frankrijk, heeft hardware-agnostische software uitgebracht die de CUDA van Nvidia omzeilt om snelle gevolgtrekking tussen concurrerende chips te ondersteunen. Maar Delalleau zei dat Kog meer verwant is aan Stanford University lab Hazy Research, met een nog diepere focus op GPU-versnelling.

Delalleau zelf is geen onderzoeker, en zijn eerste startup, TechCrunch50 2009 aluin Stribe, heeft niets te maken met zijn nieuwe – behalve zijn voormalige mede-oprichter die VC Kamel Zeroual werd, wiens firma Varsity VC mede leiding gaf aan de zaadronde van Kog. Maar de diepgaande focus van de startup komt voort uit zijn unieke achtergrond.

Nadat hij vaste-stoffysica had gestudeerd aan de Franse École Polytechnique, ging hij aan de slag in offensieve cyberbeveiliging – ook wel bekend als white hat-hacking. Volgens Delalleau heeft dit de mentaliteit gevormd die hij zijn team nu aanmoedigt. Aan de wetenschappelijke kant “is er een mentaliteit van het begrijpen van de wetten van de natuurkunde en de wetten van de GPU om er het beste van te maken.”

Wat hacken betreft, zei de viervoudig finalist van het CTF-toernooi van DEFCON dat het hem leerde “dingen op een zeer laag niveau te reverse-engineeren – tot aan assembleertaal en binaire code – om te begrijpen hoe het werkt, en te proberen het te gebruiken om een ​​doel te bereiken waarvoor het niet noodzakelijkerwijs ontworpen was.”

Het nadeel van deze aanpak is dat het erg praktijkgericht en tijdrovend is. “Voor elke nieuwe GPU zullen we enkele weken of zelfs maanden besteden aan het echt in de details duiken en GPU-technisch onderzoek uitvoeren op die hardware.” Met een team van 11 mensen stelt dit een limiet aan het aantal chips waarmee Kog kan werken, in ieder geval voor de nabije toekomst.

Op de langere termijn hoopt Kog zijn methodologie in agent-gebaseerde pijplijnen te introduceren, waardoor het meer chips en modellen kan ondersteunen. Terwijl Europa probeert zijn eigen capaciteit op deze twee fronten op te bouwen, zou dit de soevereiniteit in de rug kunnen vergroten voor de startup, die al wordt ondersteund door Scaleway en wordt ondersteund door het Franse Bpifrance en het Franse Tech 2030-programma.

Maar voorlopig moet Kog de wereld bewijzen dat zijn aanpak werkt op LLM's. Dit zal ook van cruciaal belang zijn om meer financiering binnen te halen. “Zodra we ons eerste grote model op 10x snelheid hebben geïmplementeerd, wat volgens mij in september zal gebeuren, zullen we in staat zijn om de tractie van klanten te demonstreren en van daaruit onze Series A te verhogen”, aldus Delalleau.