De AI-machines van 2026: Van model race naar workflow-economie
Geen tijd om het volledige artikel te lezen? Gebruik dan de onderstaande punten voor de kern.
■ De relevante concurrentie-eenheid is niet langer het foundation model, maar de complete AI-machine: model, post-training, reasoning, tools, memory, agent runtime, compute, energie, data, distributie, evaluatie en governance. Wie slechts naar benchmarks kijkt, ziet daardoor steeds minder van de werkelijke economische machtsverhoudingen.
■ OpenAI, Google DeepMind en Anthropic vormen het sterkste algemene frontiercluster, maar hun moats verschillen wezenlijk. OpenAI heeft de sterkste zelfstandige AI-productfranchise, Google de meest geïntegreerde stack en Anthropic een bijzonder sterke positie in coding en betrouwbaar professioneel kenniswerk.
■ China is structureel onderdeel van de frontier. DeepSeek drukt vooral de inference cost curve, Alibaba/Qwen combineert modellen, cloud en eigen silicon, Huawei bouwt met Ascend en Pangu een alternatieve compute- en modelstack, terwijl Kimi, ByteDance, Z.ai, Tencent, Baidu en MiniMax het speelveld verder verbreden.
■ Cost per completed workflow wordt belangrijker dan cost per token. Een duur model kan de goedkoopste keuze zijn wanneer het een taak vrijwel zonder menselijke rescue afrondt, terwijl goedkope inference economisch duur kan worden door retries, tool failures, lange runtimes en menselijke correctie.
■ Coding is de eerste grote markt waarin digitale arbeid objectief kan worden gemeten. Codex, Claude Code, Cursor, GitHub Copilot, Devin, Factory en Replit worden uiteindelijk niet afgerekend op gegenereerde regels code, maar op werkende features, geslaagde tests, succesvolle migrations en mergeable pull requests.
■ Een nieuwe machtslaag ontstaat boven de foundation models. Microsoft, Google, Amazon, Perplexity, OpenRouter en andere orchestrators kunnen bepalen welke intelligence welke taak krijgt, terwijl Databricks, Snowflake, Glean, Salesforce en gespecialiseerde platforms de context, data en permissions controleren waarop die intelligence moet handelen.
■ NVIDIA hoort centraal in de analyse. GPU's, networking, CUDA, inference software en Nemotron geven NVIDIA invloed op de economics van vrijwel iedere agentstack, terwijl CoreWeave, Nebius, Nscale, Crusoe, Groq, Cerebras, Together, Fireworks, Baseten en Modal een nieuwe infrastructuur- en servinglaag vormen.
■ Deze analyse is nadrukkelijk een snapshot van 22 september 2026. Modelnamen en benchmarkleiders kunnen binnen weken veranderen; compute, workflow ownership, data, distribution, energy en regulatory access verschuiven veel langzamer.
Wil je alle artikelen kunnen lezen en elke podcast beluisteren? Neem dan een abonnement en krijg toegang tot alle artikelen en de database met duizenden berichten.
De AI-sector is in korte tijd verschoven van een wedstrijd tussen taalmodellen naar een concurrentiestrijd tussen complete machines. Nieuwe releases krijgen nog altijd de meeste aandacht, maar een model dat deze maand bovenaan een benchmark staat, kan enkele weken later zijn ingehaald zonder dat de economische positie van de onderneming erachter wezenlijk is veranderd. De duurzame verschillen ontstaan steeds vaker buiten het foundation model zelf.
Dat vraagt om een andere analytische meetlat. Zodra AI niet alleen tekst genereert, maar zelfstandig code wijzigt, websites bedient, documenten onderzoekt, spreadsheets manipuleert, klantprocessen uitvoert of een robot aanstuurt, is intelligentie slechts één component van het economische resultaat. Tool reliability, memory, context, latency, permissions, retries en menselijke interventie bepalen mede hoeveel een taak werkelijk kost.
Daarom staat in deze analyse cost per completed workflow centraal. Daarmee bedoelen we niet simpelweg de API-rekening, maar alle kosten die nodig zijn voordat een taak correct is afgerond: nieuwe tokens, cached context, retrieval, browser- en code-execution, externe tools, retries, human review, recovery en uiteindelijk de compute- en energie-infrastructuur waarop de agent draait. Voor banken en andere arbeidsintensieve kennisorganisaties kan menselijke correctietijd al snel een veel grotere kostenpost zijn dan inference zelf.
Wil je alle artikelen kunnen lezen en elke podcast beluisteren? Neem dan een abonnement en krijg toegang tot alle artikelen en de database met duizenden berichten.
Twee workflows maken de economics concreet
Neem eerst een institutionele researchworkflow. Een agent ontvangt een 10-K, de laatste 8-K, een earnings transcript, consensusdata, peer-documenten en een spreadsheet met verwachtingen en moet daaruit een investment committee memo bouwen waarin veranderingen, risico's, afwijkingen ten opzichte van consensus en implicaties voor de waardering correct worden gecombineerd. Stel illustratief dat hiervoor ongeveer 300.000 nieuwe inputtokens en 20.000 outputtokens nodig zijn; afhankelijk van het model loopt de kale modelrekening dan uiteen van minder dan een dollar tot enkele dollars.
Dat prijsverschil zegt weinig zolang reliability buiten beeld blijft. Wanneer een duur frontiermodel de memo in één run goed genoeg produceert en een analist tien minuten nodig heeft voor fact-checking, terwijl een goedkoper model twee pogingen nodig heeft, een spreadsheetfout maakt en 25 minuten menselijke correctie vraagt, kan het duurste model per saldo de goedkoopste workflow opleveren. Bij hoge arbeidskosten domineert human rescue de economics veel sneller dan het verschil tussen een API van enkele dubbeltjes en enkele dollars.
Een codingworkflow maakt hetzelfde mechanisme nog scherper zichtbaar. Een agent krijgt bijvoorbeeld de opdracht een feature aan een omvangrijke repository toe te voegen, bestaande interfaces intact te houden, unit- en integration tests te schrijven, CI-fouten op te lossen en een pull request klaar te zetten. Het economisch relevante resultaat is dan niet hoeveel tokens het model heeft gebruikt of hoeveel regels code het heeft geschreven, maar hoeveel engineerstijd nodig was voordat de feature werkelijk kon worden gemerged.
Een goedkoop codingmodel dat snel produceert maar regressies veroorzaakt, tests verkeerd interpreteert en de engineer drie keer terugroept, kan per voltooide feature duurder zijn dan een premium model dat vrijwel zelfstandig van requirement naar geverifieerde pull request komt. Coding is daarom een van de eerste markten waarin agent economics werkelijk kunnen worden gemeten, omdat een build, test of PR veel minder subjectief is dan de kwaliteit van een algemeen chatbotantwoord.
| Model — snapshot 22 september 2026 | Input/output per 1M tokens | Economische sweet spot | Belangrijkste beperking |
|---|---|---|---|
| GPT-6 Astra | circa $10 / $50 | moeilijke computer use, coding, research en high-value knowledge work | hoge prijs moet aantoonbaar worden terugverdiend via minder failures en human rescue |
| Claude Fable 5.1 | circa $10 / $50 | zeer complexe coding- en knowledge-agents, vooral met veel hergebruikte context | duur voor grote hoeveelheden verse context |
| Claude Opus 5 | circa $5 / $25 | frontierachtige dagelijkse agent- en codingworkloads | hogere cost base dan workhorse-tiers |
| Claude Sonnet 5 | circa $2 / $10 | high-volume coding, tools en enterprise agents | niet bedoeld voor iedere maximale frontier-taak |
| Gemini 3.8 Flash | circa $0,75 / $3,75 tot eind 2026 | high-volume agents, coding en production workflows | Flash-workhorse en geen equivalent van Google's zwaarste frontierlaag |
| Grok 4.7 | circa $2 / $6 | relatief goedkope coding-, search- en agentworkloads | reliability blijft op moeilijke lange trajectories wisselender |
| Mistral Medium 3.5 | circa $1,50 / $7,50 | private en regionale enterprise deployment | kleinere frontier- en distributieschaal |
| DeepSeek V4.1-Flash | circa $0,30 / $1,20 op piektarief | enorme volumes, contextintensieve agents en open inference | geopolitiek, governance en leading-edge hardwaretoegang |
Deze tabel is geen ranglijst, maar een routerkaart. Een financiële instelling kan DeepSeek of een andere goedkope tier gebruiken voor extractie, Sonnet of Gemini Flash voor normalisatie en toolwerk en Astra, Fable of Opus alleen inzetten voor moeilijke synthesis, exception handling of workflows waarin fouten zeer duur zijn. De optimale architectuur wordt daarmee steeds minder een keuze voor één leverancier en steeds meer een portefeuille van intelligence.
OpenAI: de sterkste zelfstandige AI-franchise, maar frontier leadership blijft essentieel
GPT-6 Astra is het huidige publieke frontierproduct van OpenAI en is ontworpen voor moeilijke end-to-end workflows rond reasoning, coding, computer use, research en documentproductie. De vooruitgang is groot, maar het zou te ver gaan om daaruit af te leiden dat autonoom kenniswerk nu een opgelost probleem is. Ook zeer capabele agents kunnen nog vastlopen, verkeerde tools gebruiken of op cruciale momenten menselijke controle nodig hebben.
OpenAI zelf maakt bovendien duidelijk dat de publieke frontier niet noodzakelijk gelijkloopt met de interne researchfrontier. Dat verschil is strategisch relevant, omdat een publieke modelranking daardoor nooit volledig laat zien welke capability al intern beschikbaar is of op welke gespecialiseerde domeinen een lab verder staat dan zijn commerciële product.
De bredere OpenAI-machine is inmiddels belangrijker dan Astra alleen. ChatGPT, Work, Codex, computer use, de Agents API, realtime voice en gespecialiseerde producten zoals financiële en cybersecurity-workflows geven OpenAI controle over steeds meer onderdelen rond het foundation model. De distributie via de eigen producten, Microsoft Azure en AWS Bedrock verlaagt bovendien de enterprisefrictie.
Die verbreding vermindert de afhankelijkheid van één modelrelease, maar heft haar niet op. De merkwaarde en pricing power van OpenAI hangen nog steeds zwaar aan perceived frontier leadership. Wanneer OpenAI structureel zou achterlopen op moeilijke professionele taken, zou dat ook de aantrekkelijkheid van de productlaag rond de modellen raken.
De komende fase draait daarom minder om de vraag of Astra nóg hoger kan scoren en meer om de vraag of Codex, Work en de agentstack werkelijk steeds grotere eenheden menselijke arbeid kunnen absorberen. Het verschil tussen een indrukwekkende assistent en een economische arbeidsmachine zit uiteindelijk in de hoeveelheid menselijke interventie die na iedere opdracht nog nodig blijft.
Google DeepMind: de meest complete verticale AI-machine
Google bezit een combinatie die geen onafhankelijk model-lab volledig kan repliceren. Gemini staat naast eigen TPU's, Google Cloud, Search, Workspace, Android, YouTube, Maps en een wereldwijde consumerdistributie, waardoor Google modelarchitectuur, compute, context en eindproduct gezamenlijk kan optimaliseren. Daardoor hoeft de onderneming niet op iedere losse API-call of benchmark de nummer één te zijn om een uitzonderlijk sterke economische positie te hebben.
Gemini 3.8 Flash moet in dat kader correct worden gelezen. Google positioneert het als zijn intelligentste Flash-workhorse voor long-horizon software engineering, autonomous agents en complexe enterprise workflows, niet als vervanging van iedere zwaardere frontier-tier. De introductieprijs van ongeveer $0,75 per miljoen inputtokens en $3,75 output maakt juist de combinatie van capability en prijs aantrekkelijk.
Die opbouw geeft Google een natuurlijke interne router. Relatief eenvoudige taken kunnen op goedkope Flash-capacity draaien, terwijl zwaardere reasoning naar andere tiers kan worden geëscaleerd. Omdat Google tegelijk de TPU-infrastructuur bezit en veel van de eindapplicaties controleert, kan het de economics optimaliseren over de volledige keten in plaats van alleen per model.
Dezelfde logica strekt zich uit naar physical AI. Gemini Robotics 2 koppelt multimodaal begrip aan fysieke actie en whole-body control, waardoor Google niet alleen meedoet in digitale agents maar ook een serieuze uitgangspositie heeft wanneer reasoning steeds meer naar robots verschuift. De zwakke plek blijft vooral productcoherentie: Google bezit enorm veel bouwstenen, maar moet ze nog steeds overtuigend tot één herkenbare agentervaring samenbrengen.
Anthropic: reliability en economische segmentatie als strategie
Anthropic moet niet tot Fable worden gereduceerd. Sonnet 5, Opus 5 en Fable 5.1 vormen een gelaagde stack waarin enterprises verschillende niveaus van capability en cost kunnen kiezen, terwijl restrictievere varianten zoals Mythos laten zien dat dezelfde frontierintelligence afhankelijk van het risicoprofiel anders kan worden gedistribueerd.
Dat prijsverschil is economisch relevant. Sonnet 5 zit rond $2/$10 per miljoen tokens en Opus 5 rond $5/$25, terwijl Fable op ongeveer $10/$50 ligt en juist zeer goedkope cache reads biedt. Voor langlopende coding- of researchagents die voortdurend dezelfde repository of documentcontext hergebruiken, kan cache-economie daardoor net zo belangrijk worden als de headlineprijs.
Claude Code vormt daarbij een van Anthropic's sterkste strategische assets. Coding maakt reliability zichtbaar via tests, repositories en tool calls en is daardoor een veel betere omgeving om agentkwaliteit te beoordelen dan algemene chatbenchmarks. Anthropic heeft zich juist op dat kruispunt van coding, long-context work en professioneel kenniswerk sterk gepositioneerd.
De relatief beperkte consumerdistributie hoeft daarom geen doorslaggevend nadeel te zijn. Wanneer enterprises vooral betalen voor betrouwbare completion, controlled deployment en minder human rescue, kan Anthropic een zeer waardevolle franchise bouwen zonder dezelfde massamarkt als Google of Meta te controleren.
xAI en Grok: snelle convergentie en scherpe economics
xAI behoort tot de relevante frontiergroep, maar Grok 4.7 moet niet automatisch als gelijkwaardige peer van Astra of de sterkste Claude-tier op iedere workload worden neergezet. Het sterkste argument voor xAI is de combinatie van zeer snelle modeliteratie, grote geconcentreerde compute-investeringen, lage prijzen en een vroege focus op persistent agents.
Grok 4.7 kost ongeveer $2 per miljoen inputtokens en $6 output en ondersteunt een groot contextvenster. Op verschillende coding- en knowledge-work taken is de kwaliteit sterk, terwijl langere agenttrajecten op sommige onafhankelijke evaluaties nog duidelijk zwakker uitvallen. Zulke benchmarks zijn nuttig als proxy voor workflow reliability, maar geen algemene ranglijst van intelligence.
Economisch hoeft Grok niet overal de absolute nummer één te zijn. Wanneer xAI de capability snel genoeg verhoogt en tegelijkertijd veel lagere inferenceprijzen kan handhaven, kan Grok voor een groot deel van production workloads aantrekkelijk worden. De beslissende vraag blijft of die prijsvoorsprong standhoudt nadat retries, supervision en governance worden meegerekend.
Meta: Muse verandert de oude Llama-thesis
Meta is niet langer eenvoudigweg de grote open-modelspeler. Llama blijft strategisch belangrijk voor open-weight adoption, maar Muse Spark en de daarop gebouwde Muse-agent vormen inmiddels een afzonderlijke proprietary laag. Muse Spark is volgens Meta ontworpen voor reasoning, multimodaliteit en agentic work, terwijl Muse op een eigen secure virtual machine werkt en namens een gebruiker taken kan uitvoeren.
Daarmee ontstaat een veel complexere Meta-strategie. Open models vergroten ecosystem reach en developer influence, terwijl de gesloten Muse-laag rechtstreeks kan worden geïntegreerd in WhatsApp, Instagram, Facebook, Messenger en AI-brillen. Meta hoeft daardoor niet één monetisatiemodel voor alle intelligence te gebruiken.
De distributie is uitzonderlijk, maar de economics zijn niet vanzelfsprekend. Agents gebruiken veel meer inference dan traditionele social features, terwijl consumenten gewend zijn aan grotendeels gratis Meta-producten. Daarnaast vraagt een agent die mail verstuurt, reizen boekt of persoonlijke context gebruikt veel diepere permissions, waardoor vertrouwen en privacy direct invloed krijgen op adoption.
Wil je alle artikelen kunnen lezen en elke podcast beluisteren? Neem dan een abonnement en krijg toegang tot alle artikelen en de database met duizenden berichten.
DeepSeek: de prijsdruk wordt een structurele kracht
DeepSeek V4.1-Flash is belangrijk omdat de architecturele keuzes direct op inference economics zijn gericht. Het model heeft 552 miljard totale MoE-parameters, maar activeert slechts 8 miljard voor input en 16 miljard voor output, terwijl de KV-cache volgens DeepSeek veel minder HBM en SSD-capaciteit vraagt dan de vorige generatie. Bij agents die langdurig dezelfde context hergebruiken, kan juist die cache-efficiency een substantieel deel van de total cost bepalen.
De API-prijzen versterken dat effect. Op piektarief zit een cache miss rond $0,30 per miljoen inputtokens en output rond $1,20, terwijl cache hits nog veel goedkoper zijn en daluren opnieuw lager liggen. Daarmee zet DeepSeek niet alleen andere Chinese labs, maar de volledige wereldwijde prijsstructuur onder druk.
Voor westerse labs met verse, dure infrastructuur is dat ongemakkelijk. Nieuwe clusters met dure accelerators, HBM, networking en langlopende energiecontracten moeten nog worden afgeschreven terwijl de marktprijs van voldoende goede intelligence blijft dalen. DeepSeek hoeft daardoor niet de standaardleverancier van banken te worden om hun procurementgesprekken te beïnvloeden.
Alibaba/Qwen en Huawei: twee routes naar Chinese full-stack autonomie
Alibaba bouwt met Qwen, Alibaba Cloud en eigen acceleratorplannen een steeds meer geïntegreerde AI-stack. De Qwen-familie bestrijkt grote multimodale modellen, kleinere production tiers, open weights en agentfuncties, waardoor Alibaba verschillende workloads op verschillende cost points kan draaien. Het bedrijf heeft daarnaast nieuwe chip- en datacenterplannen aangekondigd, maar dergelijke capaciteit hoort als toekomstige ambitie te worden beschreven zolang deze nog niet volledig operationeel is.
Huawei volgt een andere route en is voor de Chinese sovereign stack minstens zo belangrijk. openPangu 2.0 is specifiek ontwikkeld rond Ascend-native training en inference, terwijl Huawei tegelijk Ascend compute, Huawei Cloud en HarmonyOS steeds dichter bij elkaar brengt. Huawei heeft in september bovendien een agentic computingstrategie rond SuperPoDs en SuperClusters uiteengezet en toegang tot grote Ascend-clusters voor het ecosysteem aangekondigd.
Dat maakt Huawei meer dan een lokale modelbouwer. De onderneming probeert een alternatief systeem te bouwen van accelerator tot model, cloud en operating environment. De internationale adoption wordt door geopolitiek en exportbeperkingen begrensd, maar binnen China is juist die onafhankelijkheid van Amerikaanse hardware en software de strategische waarde.
Kimi en ByteDance: schaal tegenover productbreedte
Moonshot's Kimi toont hoe ver sparse open-weight scaling inmiddels is gekomen. Het headlinecijfer van biljoenen parameters zegt op zichzelf weinig, omdat slechts een beperkte expert-subset per token wordt geactiveerd. Routing, memory en interconnect bepalen daardoor veel meer van de deployment economics dan de totale parameteromvang.
ByteDance kiest een andere route. Seed2.1 wordt expliciet gepositioneerd voor real-world productivity, code engineering en multi-step agents, terwijl dezelfde researchorganisatie met Seedance, Seedream en realtime audio een brede multimodale stack bouwt. ByteDance kan die technologie bovendien rechtstreeks testen binnen omvangrijke consumerplatforms.
Beide strategieën laten zien waarom China niet meer als één homogeen AI-blok kan worden behandeld. Moonshot maximaliseert open architecturele schaal, terwijl ByteDance juist de verbinding tussen foundation models, media en consumer distribution exploiteert.
Z.ai, Tencent, Baidu en MiniMax: relevant, maar niet allemaal hoofdspelers van hetzelfde gewicht
Z.ai/GLM is vooral interessant vanwege de snelle ontwikkeling van agentic engineering en de toenemende rol van post-training. Reinforcement learning, synthetic environments en execution feedback maken het mogelijk de capability sterk te verhogen zonder iedere vooruitgang aan een volledig nieuwe pretrainingrun te koppelen.
Tencent en Baidu hebben weer andere moats. Hunyuan kan binnen messaging, gaming, cloud en enterprise software worden geïntegreerd, terwijl ERNIE profiteert van Search en Baidu Cloud. MiniMax combineert general-purpose models met voice, video en music en vertegenwoordigt daarmee een bredere multimodale productstrategie.
Deze bedrijven moeten in een mondiale spelerskaart worden genoemd, maar hoeven niet dezelfde hoeveelheid ruimte te krijgen als Google, OpenAI of DeepSeek. Hun relevantie zit in specifieke distributie- of capabilityvoordelen, niet in een kunstmatig symmetrische rangorde.
Mistral, Cohere/Aleph Alpha en IBM: sovereign en regulated enterprise AI
Mistral blijft Europa's duidelijkste zelfstandige frontier- en sovereign AI-case. De onderneming combineert open deployment met multimodale en agentic modellen en kan voor banken of overheden interessant zijn wanneer data residency, auditability en controle over de deploymentlocatie zwaarder wegen dan enkele extra benchmarkpunten.
Cohere en Aleph Alpha hebben inmiddels een definitieve fusieovereenkomst gesloten, maar de transactie wacht nog op regulatory approval. De strategische logica is duidelijk: Cohere brengt enterprise models en commerciële distributie, terwijl Aleph Alpha zijn Europese sovereignty- en public-sectorpositionering toevoegt. De combinatie probeert daarmee een markt te bedienen waarin klanten modellen in eigen of regionaal gecontroleerde infrastructuur willen draaien.
IBM kiest met Granite 4.2 bewust voor een andere schaal. De 3B-, 8B- en 30B-modellen combineren reasoning, coding en tool use in formaten die voor private en resource-constrained enterprise deployment veel praktischer zijn dan gigantische frontiermodellen. IBM hoeft daarmee niet de algemene benchmarkleider te worden om waarde te creëren in gereguleerde organisaties waar beheersbaarheid en integratie zwaarder wegen.
Microsoft, Amazon, Perplexity en Manus: agents boven de modelgrens
Microsoft bouwt een eigen MAI-modelstack, maar de diepste moat ligt waarschijnlijk hoger in de architectuur. Outlook, Word, Excel, Teams, GitHub, SharePoint, Windows, Azure en enterprise identity bevatten de data, permissions en workflows waarin daadwerkelijk kenniswerk plaatsvindt. Microsoft kan daardoor verschillende modellen achter dezelfde Copilot- of agentlaag laten concurreren zonder de user relationship af te staan.
Amazon volgt via Bedrock en AgentCore een vergelijkbare logica vanuit infrastructuur. Het hoeft Nova niet tot de absolute frontierkampioen te maken wanneer AWS de runtime, identity, memory, observability en governance levert waarin verschillende modellen worden ingezet. Modelneutraliteit kan juist waardevol worden wanneer klanten workloads voortdurend tussen providers willen verschuiven.
Perplexity probeert die orchestrationpositie onafhankelijker te bezetten. Computer wordt door Perplexity gepositioneerd als een general-purpose digital worker die meerdere modellen en subagents kan orkestreren en langdurige workflows kan uitvoeren, terwijl Personal Computer dezelfde logica uitbreidt naar lokale bestanden en applicaties. De strategische waarde zit daarmee minder in één proprietary model dan in de harness die modellen, tools en context combineert.
Manus volgt een vergelijkbare agent-first strategie. De Cloud Computer is een persistent virtual environment waarin bestanden, geïnstalleerde tools en processen tussen sessies actief blijven, terwijl de desktopomgeving ook lokale bestanden en command-line tools kan gebruiken. De vraag voor zowel Manus als Perplexity is of onafhankelijke orchestration voldoende defensible blijft wanneer hyperscalers dezelfde functies in hun bestaande platforms integreren.
NVIDIA: de machine achter de machines
NVIDIA verdient een centrale positie omdat het veel meer controleert dan alleen de accelerator. GPU's, NVLink-achtige interconnect, CUDA, inference libraries, kernels, quantization en deploymentsoftware vormen samen een geïntegreerde infrastructuur waarop een groot deel van de AI-industrie draait. Daardoor kan NVIDIA de cost per completed workflow verbeteren zonder zelf de eindgebruiker te hoeven bezitten.
Nemotron past rechtstreeks in die strategie. NVIDIA ontwikkelt verschillende open modeltiers voor long-running agents, waaronder efficiënte executionmodellen en zwaardere reasoningmodellen, en bouwt met NeMo Switchyard bovendien routingsoftware rond die stack. Het doel is niet noodzakelijk om ChatGPT te vervangen, maar om meer agentische workloads efficiënt op NVIDIA-hardware te laten draaien.
Dat model-hardware co-design is een belangrijke moat. Wanneer een agent duizenden routinecalls doet, kan een efficiënt klein model de bulk uitvoeren terwijl een zwaardere tier alleen voor planning en moeilijke uitzonderingen wordt ingezet. NVIDIA profiteert dan zowel van de hardwarevraag als van de software die bepaalt hoe efficiënt die hardware wordt gebruikt.
Coding agents: de eerste echte markt voor digitale arbeid
Software engineering is inmiddels de meest volwassen proeftuin voor agents omdat de output objectief kan worden gevalideerd. Codex, Claude Code, Cursor, GitHub Copilot, Cognition/Devin, Factory en Replit proberen allemaal de eenheid van automatisering te vergroten van code completion naar complete features, migrations, bug fixes en deployment.
Cursor positioneert Projects bijvoorbeeld als een omgeving voor grotere bodies of work met langdurige projectcontext, cloud agents en parallelle subagents. Dat zijn productclaims van Cursor zelf en geen bewijs dat iedere complexe softwaretaak al autonoom kan worden uitgevoerd, maar de richting is belangrijk: de developer stuurt steeds meer het resultaat en steeds minder iedere individuele codewijziging.
Cognition positioneert Devin expliciet als software-engineer, Factory bouwt modelagnostische Droids voor enterprise development en Replit probeert de afstand tussen requirements en een werkende applicatie te verkleinen. GitHub heeft vanuit een andere uitgangspositie toegang tot repositories, pull requests en developerdistributie, waardoor Copilot een bijzonder krachtige integratiepositie behoudt.
De economische maatstaf wordt daardoor steeds duidelijker. Niet de hoeveelheid gegenereerde code maar de hoeveelheid daadwerkelijk geaccepteerd softwarewerk per engineer bepaalt de ROI. Daarmee is coding waarschijnlijk de eerste sector waarin cost per completed workflow op grote schaal meetbaar wordt.
Enterprise context: Glean, Salesforce, Harvey en Sierra
Glean adresseert een probleem dat foundation models niet vanzelf oplossen: een agent moet weten welke bedrijfsinformatie relevant, actueel en toegestaan is. Permissions-aware enterprise search en context kunnen daardoor een grotere praktische verbetering opleveren dan een marginale stap in raw model intelligence.
Salesforce bezit een vergelijkbare moat, maar dichter bij execution. Agentforce en gespecialiseerde reasoninglagen werken direct binnen CRM-records, permissions en bestaande processen, waardoor agents niet alleen informatie kunnen interpreteren maar daadwerkelijk business actions kunnen uitvoeren. Dat maakt proprietary workflowdata een potentiële trainings- en executionmoat.
Harvey laat in legal zien hoe een volledig verticale AI-laag kan ontstaan bovenop meerdere foundation providers. Legal content, documentworkflows, governance en modelselectie worden samengebracht in één gespecialiseerde omgeving. Sierra positioneert zich in customer service juist rond agents en outcome-based economics, waardoor het zelf een sterke prikkel heeft om modelkeuze, latency en human handoff op daadwerkelijke resultaten te optimaliseren.
Databricks, Snowflake en Hugging Face: data en distributie als AI-infrastructuur
Databricks en Snowflake kunnen in enterprise AI uiteindelijk belangrijker worden dan verschillende zelfstandige model-labs omdat de governed bedrijfsdata al op hun platformen staat. Wanneer agents rechtstreeks op die data, semantic layers en permissions kunnen opereren, wordt het data platform steeds meer een operating layer voor enterprise intelligence.
Beide ondernemingen bouwen daarom model serving, retrieval, orchestration en routing rond hun bestaande data-infrastructuur. De onderliggende foundation models kunnen dan worden gewisseld zonder de volledige applicatielaag opnieuw te ontwerpen. Dat vermindert de lock-in van één modelprovider en versterkt de positie van het data platform.
Hugging Face vervult een vergelijkbare neutraliteitsfunctie voor open AI. De Hub verbindt modeldistributie steeds directer met verschillende inferenceproviders, waardoor een nieuwe open-weight release wereldwijd beschikbaar kan worden zonder dat het lab erachter eerst een eigen hyperscale cloud hoeft te financieren.
Wil je alle artikelen kunnen lezen en elke podcast beluisteren? Neem dan een abonnement en krijg toegang tot alle artikelen en de database met duizenden berichten.
Neoclouds en inference: CoreWeave, Nebius, Nscale, Crusoe, Groq, Cerebras, Together, Fireworks, Baseten en Modal
CoreWeave, Nebius, Nscale en Crusoe controleren geen frontiermodel, maar wel een steeds schaarser product: toegang tot accelerators, datacenters, networking en stroom. De enorme investeringsbedragen in deze laag laten zien dat AI-infrastructuur steeds meer op project finance lijkt, waarbij utilization, financieringskosten en langlopende klantcontracten de uiteindelijke economics bepalen.
Crusoe is daarbij interessant omdat het zich expliciet verticaal probeert te positioneren van energie en datacentercapaciteit tot cloud en managed inference. De recente kapitaalronde onderstreept hoeveel financiering nodig is om deze infrastructuur op schaal te bouwen. Dat maakt de balans en de cost of capital onderdeel van de AI-concurrentie.
Groq en Cerebras vallen het inferenceprobleem vanuit hardwarearchitectuur aan, terwijl Together en Fireworks vooral open models production-ready proberen te maken. Baseten positioneert zich nadrukkelijk als high-performance inferenceplatform en biedt model-labs zelfs serving en distributie onder hun eigen merk, terwijl Modal een meer code-first infrastructuurmodel biedt waarmee workloads elastisch over GPU-capacity kunnen schalen.
Deze laag is belangrijk omdat open weights zonder efficiënte serving economisch weinig betekenen. Een model kan vrij beschikbaar zijn, maar blijft praktisch ontoegankelijk wanneer deployment een gespecialiseerd team en een duur cluster vereist. Inferenceproviders transformeren open research daardoor in een werkelijk substituut voor proprietary API's.
Routing en OpenRouter: intelligence wordt een portfolio
OpenRouter maakt expliciet wat hyperscalers intern al doen: models en providers worden uitwisselbare resources achter één interface. Wanneer prijs, latency of capability verschuiven, kan traffic relatief snel naar een andere combinatie worden verplaatst.
Die routerlaag kan uiteindelijk veel macht krijgen omdat hij production data verzamelt over welke modellen daadwerkelijk op echte workloads werken. Microsoft, Google en Amazon hebben dezelfde informatie binnen hun eigen ecosystems, terwijl Perplexity routing als productcomponent gebruikt en NVIDIA met Switchyard op de infrastructuurlaag dezelfde logica ondersteunt.
Daarmee verschuift model procurement van een periodieke vendorselectie naar iets wat steeds meer lijkt op dynamic asset allocation. De onderneming kiest niet één AI voor drie jaar, maar laat modellen voortdurend concurreren op kwaliteit, latency, locality, risk en total cost.
Evaluation: zonder eigen meetlaag is routing blind
Die router kan alleen functioneren wanneer enterprises veel betere evaluaties hebben dan publieke benchmarks. METR's task-horizononderzoek is daarom interessant omdat het probeert te meten hoe lang een taak kan worden voordat autonome completion significant afneemt, wat veel dichter bij de economische vraag rond digitale arbeid ligt dan een klassieke multiple-choice test.
Braintrust, LangSmith en Arize zitten dichter bij production observability. Zij helpen traces, regressions, tool failures en veranderingen tussen modelversies te volgen, terwijl grote ondernemingen steeds vaker eigen proprietary evalsets bouwen rond daadwerkelijke workflows.
Voor banken wordt dit een verlengstuk van model risk management. Een modelprovider kan een systeem aanpassen waarna een eerder goedgekeurde workflow anders reageert, terwijl een nieuwe routerconfiguratie weer een ander failure profile creëert. Continuous evaluation wordt daardoor geen researchfunctie maar operationele infrastructuur.
Physical AI: dezelfde thesis met een veel hardere failure function
Physical AI brengt reasoning en agents naar een omgeving waarin fouten veel duurder zijn. Google Gemini Robotics 2, NVIDIA Isaac/Cosmos/GR00T en bedrijven zoals Figure, Skild AI, Physical Intelligence, Tesla, 1X, Apptronik, Agility Robotics en Unitree proberen robots minder taak-specifiek en meer generalistisch te maken.
De cost function verandert daarbij fundamenteel. Een software-agent die faalt kan meestal opnieuw proberen, terwijl een robot een productielijn kan stilleggen, materiaal kan beschadigen of een veiligheidsincident kan veroorzaken. Cycle time, recovery time, uptime, human takeover en safety sign-off horen daarom allemaal in de berekening.
Cost per completed workflow wordt hier feitelijk cost per safely completed physical task. Dat verklaart waarom physical AI economisch enorm kan worden zonder dat dezelfde reliabilitydrempel als bij coding voldoende is. Een coding-agent met regelmatige human rescue kan nuttig zijn; een industriële robot die regelmatig faalt niet.
Wil je alle artikelen kunnen lezen en elke podcast beluisteren? Neem dan een abonnement en krijg toegang tot alle artikelen en de database met duizenden berichten.
Creative AI: meerdere frontiermarkten naast elkaar
Creative AI is inmiddels te divers om als één multimodale categorie te behandelen. Midjourney blijft sterk in aesthetics en creator preference, Ideogram legt meer nadruk op typography en design control en Black Forest Labs bouwt FLUX verder uit als een developergerichte generatieve stack. Runway en Luma bewegen tegelijk richting bredere productieomgevingen waarin verschillende modellen kunnen worden gecombineerd.
Google's Veo-lijn, Alibaba Wan, Kling van Kuaishou en Grok Imagine verbreden de videomarkt verder. De relevante ontwikkeling is dat de differentiatie verschuift van één spectaculaire gegenereerde clip naar temporal consistency, editing, references, audio en integratie in echte productieworkflows.
Adobe heeft juist distributie als belangrijkste voordeel. Firefly is geïntegreerd in Photoshop, Premiere, Illustrator en andere professionele software, waardoor een voldoende sterk model binnen de bestaande workflow economisch waardevoller kan zijn dan een iets betere standalone generator.
ElevenLabs en Suno bewijzen vervolgens opnieuw dat iedere modaliteit een eigen cost function krijgt. Voice concurreert sterk op latency, interruption handling en conversational naturalness, terwijl bij muziek licensing en copyright een veel groter onderdeel van het economische model worden.
Compute, capex en energie: intelligence heeft een balans
De spectaculaire daling van tokenprijzen kan verhullen hoeveel kapitaal achter AI blijft staan. Accelerators, HBM, advanced packaging, high-speed networking, datacenters en cooling moeten worden gefinancierd en afgeschreven. Een cluster dat al grotendeels is afgeschreven kan daardoor tegen heel andere marginale tarieven draaien dan splinternieuwe capaciteit die op de piek van de hardwarecyclus is gefinancierd.
Dit maakt DeepSeek-achtige prijsdruk extra relevant. Wanneer de marktprijs van inference sneller daalt dan nieuwe infrastructuur kan worden afgeschreven, komt het rendement op vers kapitaal onder druk. Hyperscalers kunnen capaciteit makkelijker tussen interne workloads en externe klanten verschuiven, terwijl onafhankelijke labs en neoclouds vaak sterker afhankelijk zijn van hoge utilization.
TSMC, advanced packaging en HBM blijven ondertussen fysieke bottlenecks, terwijl elektriciteit steeds vaker bepaalt waar nieuwe capaciteit überhaupt kan worden gebouwd. Zonder grid connection, cooling en baseload power bestaat een nieuw AI-cluster alleen op papier.
De hyperscalers behandelen energie daarom steeds meer als strategische procurement. Kernenergie, renewables, gas, storage en transmission worden in langlopende overeenkomsten vastgelegd, waardoor AI steeds duidelijker eigenschappen krijgt van zowel software als zware infrastructuur.
Sovereign AI: Europa, India en het Midden-Oosten
De AI-wereld bestaat niet alleen uit de Verenigde Staten en China. Europa probeert via Mistral, lokale clouds, sovereign clusters en regelgeving meer controle te behouden over kritieke modellen en data. De voorgenomen Cohere/Aleph Alpha-combinatie past eveneens in die beweging naar regulated enterprise AI die binnen lokale infrastructuur kan draaien.
India combineert een enorme developerbasis met lokale talen, groeiende digitale infrastructuur en steeds meer sovereign compute-investeringen. Het land hoeft niet iedere frontiertraining zelf te uitvoeren om een enorme application- en inference-market te worden.
Het Midden-Oosten bezit weer een andere combinatie: kapitaal, energie en geopolitieke ambitie. G42 en andere regionale partijen laten zien dat grote computeclusters relatief snel kunnen worden gebouwd wanneer financiering en stroomvoorziening samenkomen.
Voor banken en overheden betekent sovereignty uiteindelijk veel meer dan serverlocatie. Jurisdiction, contractuele controle, logging, modelupdates, data access en de exacte locatie van inference kunnen allemaal de keuze voor een model of cloud beïnvloeden.
Regulering en datarechten worden productarchitectuur
De EU AI Act wordt gefaseerd van kracht en delen ervan zijn inmiddels daadwerkelijk enforceable. Daardoor zijn documentatie, transparency, model evaluation, copyrightbeleid en incidentprocessen niet langer alleen juridische voorbereidingen maar onderdelen van production engineering. Een iets minder capabel model dat veel eenvoudiger door model risk en compliance komt, kan economisch de betere keuze zijn.
Datarechten bewegen dezelfde kant op. Muziek, nieuws, code, boeken, beeld en video worden steeds vaker expliciet gelicentieerd of juridisch betwist, waardoor trainingsdata langzaam veranderen van bijna gratis externality naar betaalde input of proprietary asset.
Synthetic data, reinforcement learning en self-play kunnen de afhankelijkheid van ruwe webdata verkleinen, maar hoogwaardige domain data wordt daardoor juist waardevoller. Voor legal, healthcare en finance kan twintig jaar aan goed gepermissioneerde workflowdata uiteindelijk een grotere moat worden dan een tijdelijk beter algemeen model.
Waar de structurele macht uiteindelijk ligt
De AI-sector ontwikkelt meerdere soorten macht naast elkaar. OpenAI en Anthropic bezitten sterke frontier- en knowledge-workfranchises, Google en Meta combineren models met enorme distribution en proprietary context en Microsoft en Amazon kunnen de enterprise relationship behouden via cloud, identity, workflow en routing.
DeepSeek en Qwen drukken de prijs van intelligence, terwijl Huawei een alternatieve Chinese hardware- en softwarestack opbouwt. NVIDIA verdient aan een groot deel van al die ecosystemen door compute, networking, CUDA en inference-optimalisatie te leveren, terwijl neoclouds en inferenceproviders ervoor zorgen dat capaciteit en open models economisch beschikbaar worden.
Databricks, Snowflake, Glean, Salesforce en Harvey tonen vervolgens dat data en workflow ownership zelfstandige moats kunnen worden. Cursor, Codex, Claude Code, Devin en andere codingagents laten zien hoe digitale arbeid meetbaar wordt, terwijl physical AI dezelfde economische logica uiteindelijk naar fabrieken, warehouses en andere fysieke omgevingen kan brengen.
Het speelveld wordt daarmee minder gecentreerd rond één supermodel en meer rond een netwerk van modellen, routers, data platforms, runtimes, chips en infrastructuur. Dat maakt AI economisch complexer, maar ook veel minder waarschijnlijk winner-takes-all.
Conclusie
De AI-sector op 22 september 2026 is een momentopname en geen stabiel evenwicht. Modelreleases volgen elkaar binnen weken op, openbare benchmarks kunnen snel verzadigen en de researchfrontier hoeft niet gelijk te zijn aan het product dat vandaag via een API wordt aangeboden. De exacte rangorde van modellen is daarom minder duurzaam dan de structuur waarin ze worden gebouwd en gebruikt.
Voor enterprises en investeerders is cost per completed workflow daardoor een betere meetlat dan cost per token. Een goedkope API kan een dure digitale werknemer blijken wanneer mensen voortdurend moeten corrigeren, terwijl een premium model economisch goedkoop kan zijn wanneer het high-value work vrijwel zelfstandig afmaakt. Omgekeerd is maximale frontierintelligence pure verspilling wanneer een goedkoper workhorse-model dezelfde routineworkflow betrouwbaar uitvoert.
De grootste organisaties zullen daarom geen één-modelstrategie voeren. Zij bouwen portfolio's waarin verschillende modellen, agentharnesses, data platforms en inferenceproviders continu tegen elkaar worden geëvalueerd en workloads worden gerouteerd op capability, reliability, latency, locality, risk en totale economische kosten.
De doorslaggevende vraag voor de volgende fase van AI is daarmee niet welk model vandaag het hoogste intelligentiecijfer laat zien. Het is welke complete machine intelligence betrouwbaar kan omzetten in werkelijk afgerond werk tegen de laagste totale economische kosten.
Wil je alle artikelen kunnen lezen en elke podcast beluisteren? Neem dan een abonnement en krijg toegang tot alle artikelen en de database met duizenden berichten.
English version
The AI machines of 2026: from model race to workflow economics
No time to read the full article? The points below capture the core view.
■ The relevant competitive unit is no longer the foundation model but the complete AI machine: model, post-training, reasoning, tools, memory, agent runtime, compute, energy, data, distribution, evaluation and governance. Looking only at benchmarks increasingly misses where economic power actually sits.
■ OpenAI, Google DeepMind and Anthropic remain the strongest general frontier cluster, but their moats differ materially. OpenAI has the strongest independent AI product franchise, Google the most integrated stack and Anthropic an unusually strong position in coding and reliable professional knowledge work.
■ China is structurally part of the frontier. DeepSeek pressures the inference cost curve, Alibaba/Qwen combines models, cloud and proprietary silicon, Huawei is building an alternative stack around Ascend and Pangu, while Kimi, ByteDance, Z.ai, Tencent, Baidu and MiniMax broaden the competitive field.
■ Cost per completed workflow is becoming more important than cost per token. An expensive model can be the cheapest option if it completes a task with little human rescue, while cheap inference can become economically expensive through retries, tool failures and human correction.
■ Coding is the first major market where digital labour can be measured objectively. Codex, Claude Code, Cursor, GitHub Copilot, Devin, Factory and Replit will ultimately be judged on working features, passing tests, successful migrations and mergeable pull requests rather than generated lines of code.
■ A new power layer is emerging above foundation models. Microsoft, Google, Amazon, Perplexity, OpenRouter and other orchestrators can determine which intelligence receives which task, while Databricks, Snowflake, Glean, Salesforce and specialised platforms control the context, data and permissions on which that intelligence acts.
■ NVIDIA belongs at the centre of the analysis. GPUs, networking, CUDA, inference software and Nemotron give NVIDIA influence over the economics of almost every agent stack, while CoreWeave, Nebius, Nscale, Crusoe, Groq, Cerebras, Together, Fireworks, Baseten and Modal form a new infrastructure and serving layer.
■ This analysis is explicitly a snapshot of 22 September 2026. Model names and benchmark leaders can change within weeks; compute, workflow ownership, data, distribution, energy and regulatory access move far more slowly.
The AI industry has rapidly shifted from a competition between language models toward a contest between complete machines. New releases still attract most of the attention, but a model that leads a benchmark this month can be overtaken several weeks later without materially changing the economic position of the company behind it. Durable competitive differences increasingly emerge outside the foundation model itself.
That requires a different analytical framework. Once AI does more than generate text and begins modifying code, operating websites, researching documents, manipulating spreadsheets, executing customer processes or controlling robots, intelligence becomes only one component of economic output. Tool reliability, memory, context, latency, permissions, retries and human intervention all influence the actual cost of completing work.
Cost per completed workflow is therefore the central metric in this analysis. It includes new tokens, cached context, retrieval, browser and code execution, external tools, retries, human review, recovery and ultimately the compute and energy infrastructure on which the agent operates. In labour-intensive knowledge industries such as banking, human correction time can quickly exceed the underlying cost of inference.
Two workflows make the economics concrete
Consider first an institutional research workflow. An agent receives a 10-K, the latest 8-K, an earnings transcript, consensus data, peer documents and a forecast spreadsheet and is asked to produce an investment-committee memo combining changes, risks, consensus deviations and valuation implications. If the task consumes roughly 300,000 new input tokens and 20,000 output tokens, the raw model bill ranges from less than a dollar to several dollars depending on the model.
That difference tells us little without reliability. If a premium frontier model produces an acceptable memo in one run and an analyst spends ten minutes validating it, while a cheaper model needs two attempts, makes a spreadsheet error and requires 25 minutes of correction, the premium model can easily produce the lower total workflow cost. At high professional labour rates, human rescue rapidly dominates small differences in API pricing.
Software engineering makes the same mechanism even clearer. An agent may be asked to add a feature to a large repository, preserve existing interfaces, write unit and integration tests, repair CI failures and prepare a pull request. The economically relevant output is not the number of tokens consumed or lines of code generated but the amount of engineer time required before the feature can actually be merged.
A cheap coding model that generates code rapidly but creates regressions, misreads tests and repeatedly pulls an engineer back into the loop can cost more per shipped feature than a premium model that moves from requirement to verified pull request largely independently. Coding is therefore one of the first markets in which agent economics can be measured credibly because builds, tests and pull requests are substantially less subjective than chatbot answers.
| Model — snapshot 22 September 2026 | Input/output per 1M tokens | Economic sweet spot | Main limitation |
|---|---|---|---|
| GPT-6 Astra | roughly $10 / $50 | difficult computer use, coding, research and high-value knowledge work | premium pricing must be repaid through fewer failures and less human rescue |
| Claude Fable 5.1 | roughly $10 / $50 | highly complex coding and knowledge agents, particularly with reused context | expensive for large amounts of fresh context |
| Claude Opus 5 | roughly $5 / $25 | frontier-class everyday agent and coding workloads | higher cost base than workhorse tiers |
| Claude Sonnet 5 | roughly $2 / $10 | high-volume coding, tools and enterprise agents | not intended for every maximum-frontier task |
| Gemini 3.8 Flash | roughly $0.75 / $3.75 through 2026 | high-volume agents, coding and production workflows | Flash workhorse rather than Google's heaviest frontier tier |
| Grok 4.7 | roughly $2 / $6 | lower-cost coding, search and agent workloads | reliability remains more uneven on difficult long trajectories |
| Mistral Medium 3.5 | roughly $1.50 / $7.50 | private and regional enterprise deployment | smaller frontier and distribution scale |
| DeepSeek V4.1-Flash | roughly $0.30 / $1.20 peak rate | very large volumes, context-intensive agents and open inference | geopolitics, governance and leading-edge hardware access |
This is not a ranking but a routing map. A financial institution can use a low-cost model for extraction, a Sonnet- or Gemini-class workhorse for normalisation and tool use, and reserve Astra, Fable or Opus for difficult synthesis, exception handling or tasks where failure is expensive. The optimal architecture increasingly resembles a portfolio of intelligence rather than a single vendor decision.
OpenAI: the strongest independent AI franchise, with continued dependence on frontier leadership
GPT-6 Astra is OpenAI's current public frontier product and is designed for demanding end-to-end work across reasoning, coding, computer use, research and document creation. The improvement is significant, but it would be excessive to interpret Astra as evidence that autonomous knowledge work is already solved. Even highly capable agents can still fail, misuse tools or require human intervention at critical points.
OpenAI itself also demonstrates why the public frontier need not coincide with the internal research frontier. This matters strategically because a public model ranking can never fully show which capabilities already exist internally or where a laboratory may be ahead in a specialised domain.
The broader OpenAI machine is now more important than Astra alone. ChatGPT, Work, Codex, computer use, the Agents API, realtime voice and specialised financial and cybersecurity workflows give OpenAI control over an increasing share of the environment surrounding the foundation model. Distribution through OpenAI's own products, Microsoft Azure and AWS Bedrock further reduces enterprise deployment friction.
This breadth reduces dependence on one frontier release but does not remove it. OpenAI's brand value and pricing power still rely heavily on perceived frontier leadership. A sustained capability gap on difficult professional work would therefore affect the attractiveness of the broader product franchise as well.
The next phase is therefore less about whether Astra can move a few benchmark points higher and more about whether Codex, Work and the agent stack can absorb increasingly large units of human labour. The difference between an impressive assistant and an economic labour machine ultimately lies in how much human intervention remains after each assignment.
Google DeepMind: the most complete vertical AI machine
Google owns a combination no independent model laboratory can fully reproduce. Gemini sits alongside proprietary TPUs, Google Cloud, Search, Workspace, Android, YouTube, Maps and global consumer distribution, allowing Google to optimise model architecture, compute, context and end product together.
Gemini 3.8 Flash should be interpreted in that framework. Google positions it as its most intelligent Flash workhorse for long-horizon software engineering, autonomous agents and complex enterprise workflows rather than as a replacement for every heavier frontier tier. Its introductory pricing makes the capability-to-cost ratio central to the product.
This architecture gives Google a natural internal router. Routine workloads can run on lower-cost Flash capacity, while heavier reasoning can be escalated to other tiers. Because Google also owns the TPU infrastructure and many end applications, it can optimise economics across the full stack rather than on an individual API call.
The same logic extends into physical AI. Gemini Robotics 2 links multimodal understanding with action and whole-body control, giving Google a serious position if reasoning increasingly moves from screens into robots. Google's recurring weakness remains product coherence: it owns exceptional building blocks but still needs to turn them into a consistently understandable agent experience.
Anthropic: reliability and economic segmentation as strategy
Anthropic should not be reduced to Fable. Sonnet 5, Opus 5 and Fable 5.1 create a tiered stack in which enterprises can choose different points on the capability-cost curve, while more restricted systems show how the same frontier intelligence can be distributed differently depending on risk.
The pricing structure matters. Sonnet 5 is around $2/$10 per million tokens and Opus 5 around $5/$25, while Fable is roughly $10/$50 and offers particularly inexpensive cache reads. For long-running coding or research agents repeatedly reusing the same repository or document context, cache economics can therefore matter almost as much as headline pricing.
Claude Code remains one of Anthropic's most important strategic assets because coding exposes reliability through tests, repositories and tool calls. Anthropic is particularly well positioned at the intersection of coding, long-context work and professional knowledge tasks where one expensive failure can matter more than marginal inference cost.
The lack of Google- or Meta-scale consumer distribution is therefore not necessarily decisive. If enterprises pay for completion, controlled deployment and reduced human rescue, Anthropic can build a highly valuable franchise without owning the largest mass-market assistant.
xAI and Grok: rapid convergence and aggressive economics
xAI belongs among the relevant frontier players, but Grok 4.7 should not automatically be treated as a complete peer of Astra or the strongest Claude tier on every workload. The stronger argument for xAI is the combination of rapid iteration, concentrated compute investment, low prices and an early emphasis on persistent agents.
Grok 4.7 is priced at roughly $2 per million input tokens and $6 output, with a large context window. Performance is strong on several coding and knowledge tasks, while some longer agentic evaluations remain weaker. Such benchmarks are useful as proxies for workflow reliability rather than universal rankings of intelligence.
Economically, Grok does not need to lead every dimension. If xAI raises capability quickly while maintaining lower inference cost, the system can become attractive across large production volumes. The critical question is whether that advantage survives after retries, supervision and governance are included.
Meta: Muse changes the old Llama thesis
Meta is no longer simply the major open-model player. Llama remains strategically important for open-weight adoption, but Muse Spark and the Muse agent now form a distinct proprietary layer. Meta describes Muse Spark as designed for reasoning, multimodality and agentic work, while Muse operates on a secure virtual machine and can take actions on behalf of a user.
This creates a much more sophisticated strategy. Open models increase ecosystem reach and developer influence, while the proprietary Muse layer can be integrated directly into WhatsApp, Instagram, Facebook, Messenger and AI glasses.
Distribution is extraordinary, but the economics are not automatic. Agents consume far more inference than traditional social features while users remain accustomed to largely free Meta products. An agent capable of sending mail, booking travel or using personal context also requires deep permissions, making trust and privacy direct adoption variables.
DeepSeek: price pressure becomes a structural force
DeepSeek V4.1-Flash matters because architectural choices are directly aimed at inference economics. The model contains 552 billion total MoE parameters but activates only 8 billion for input and 16 billion for output, while its KV-cache reportedly requires substantially less HBM and storage than the previous generation.
This is highly relevant for long-running agents, where repeated context and KV-cache can become major cost centres. DeepSeek attacks not only compute per token but also the marginal costs of long agent trajectories.
API pricing reinforces that position. Peak cache-miss input is around $0.30 per million tokens and output around $1.20, with much cheaper cache hits and lower off-peak rates. DeepSeek therefore influences procurement even in organisations that may never deploy it directly.
Alibaba/Qwen and Huawei: two paths toward Chinese full-stack autonomy
Alibaba is building an increasingly integrated stack around Qwen, Alibaba Cloud and proprietary accelerator plans. The Qwen family spans large multimodal systems, smaller production tiers, open weights and agent capabilities, allowing different workloads to run at different cost points.
Huawei is at least as important for China's sovereign stack. openPangu 2.0 is designed around Ascend-native training and inference, while Huawei is bringing Ascend compute, Huawei Cloud and HarmonyOS closer together. Its latest agentic-computing strategy around SuperPoDs and SuperClusters highlights the ambition to build an alternative system from accelerator through model and operating environment.
Huawei's international adoption remains constrained by geopolitics, but within China that independence from US hardware and software is precisely the strategic value. Alibaba and Huawei therefore represent two different but complementary routes toward greater full-stack autonomy.
Kimi and ByteDance: scale versus product breadth
Moonshot's Kimi demonstrates how far sparse open-weight scaling has progressed. Headline parameter counts are less important than the limited expert subset active per token, making routing, memory and interconnect central to deployment economics.
ByteDance takes a broader approach. Seed2.1 is positioned around real-world productivity, code engineering and multi-step agents, while Seedance, Seedream and realtime audio extend the same research organisation across media and multimodal interaction.
The contrast is useful: Moonshot pushes open architectural scale, while ByteDance exploits the link between foundation models, media and consumer distribution. Both demonstrate why the Chinese market can no longer be treated as a homogeneous second tier.
Z.ai, Tencent, Baidu and MiniMax: relevant without artificial symmetry
Z.ai/GLM illustrates how much capability can increasingly come from post-training, reinforcement learning and execution feedback rather than an entirely new pretraining run.
Tencent and Baidu derive more of their strategic power from distribution through messaging, gaming, Search and cloud, while MiniMax combines general-purpose models with speech, video and music. These companies belong on a global map, but their relevance lies in specific technical or distribution advantages rather than an artificially symmetrical ranking.
Mistral, Cohere/Aleph Alpha and IBM: sovereign and regulated enterprise AI
Mistral remains Europe's clearest independent frontier and sovereign-AI case. Open deployment, multimodal capability and regional inference can be attractive when data residency, auditability and contractual control matter more than a marginal benchmark lead.
Cohere and Aleph Alpha have signed a definitive merger agreement that remains subject to regulatory approval. The strategic rationale is to combine enterprise models and commercial distribution with European sovereignty and public-sector positioning, targeting customers that want greater control over deployment and infrastructure.
IBM takes a deliberately different approach with Granite 4.2. Its 3B, 8B and 30B reasoning models combine coding and tool use in sizes that are more practical for private enterprise deployment. IBM does not need to win the global frontier race if regulated organisations value transparency, manageability and integration more highly.
Microsoft, Amazon, Perplexity and Manus: agents above the model boundary
Microsoft's deepest moat may sit above its own MAI models. Outlook, Word, Excel, Teams, GitHub, SharePoint, Windows, Azure and enterprise identity already contain the data, permissions and workflows in which knowledge work occurs, allowing Microsoft to route different models behind one agent layer while retaining the customer relationship.
Amazon applies a similar logic through Bedrock and AgentCore. AWS can provide runtime, memory, identity, observability and governance around many model families, making model neutrality itself commercially valuable.
Perplexity approaches orchestration more independently. Computer is positioned as a general-purpose digital worker capable of coordinating models and subagents across long-running workflows, while Personal Computer extends this idea into local files and applications. The value proposition lies in the harness and routing layer rather than ownership of one frontier model.
Manus follows a related agent-first strategy. Its Cloud Computer provides a persistent virtual machine in which files, tools and processes remain active across sessions, while its desktop environment can interact with authorised local files and command-line tools. The strategic question for both Perplexity and Manus is whether independent orchestration remains defensible as hyperscalers integrate similar functions into their own platforms.
NVIDIA: the machine behind the machines
NVIDIA deserves a central position because its control extends well beyond accelerators. GPU hardware, networking, CUDA, inference libraries, kernels, quantisation and deployment software form a system-level stack used across much of the AI industry.
Nemotron fits directly into this strategy. NVIDIA builds open model tiers for long-running agents and is also developing routing software such as NeMo Switchyard, allowing routine calls to be handled by efficient execution models while more expensive intelligence is reserved for difficult planning and exceptions.
This model-hardware co-design gives NVIDIA influence over cost per completed workflow without owning the end-user relationship. Even as individual models become cheaper, NVIDIA can benefit if aggregate inference demand expands faster than efficiency gains reduce compute per task.
Coding agents: the first genuine market for digital labour
Software engineering is the most mature test bed for agents because output can be validated objectively. Codex, Claude Code, Cursor, GitHub Copilot, Cognition/Devin, Factory and Replit are all attempting to increase the unit of automation from individual code completions to complete features, migrations and fixes.
Cursor positions Projects around long-lived project context, cloud execution and multiple subagents. These remain Cursor's product claims rather than proof that every large engineering project is autonomously solvable, but the direction is significant: developers increasingly supervise outcomes rather than individual code changes.
Cognition positions Devin as a software engineer, Factory its Droids as model-agnostic enterprise development agents and Replit its agent around the path from requirement to deployed application. GitHub remains unusually powerful because Copilot already sits directly inside repositories, pull requests and developer workflows.
The economic metric therefore becomes accepted software work per engineer rather than generated tokens. Coding is likely to become the first domain in which dynamic model allocation can be connected directly to labour productivity.
Enterprise context: Glean, Salesforce, Harvey and Sierra
Glean addresses a problem foundation models do not solve by themselves: an enterprise agent needs current, relevant and permissioned context. Many failures are not reasoning failures but context failures, making a strong enterprise knowledge layer economically valuable.
Salesforce sits even closer to execution because Agentforce and specialised reasoning operate inside CRM records, permissions and established processes. Proprietary workflow data can therefore become both training context and an execution moat.
Harvey demonstrates in legal how multiple foundation providers, proprietary domain content, governance and document workflows can create a vertical operating layer. Sierra positions its customer-service agents around outcome economics, aligning its own incentives with reducing failed actions, latency and unnecessary human handoffs.
Databricks, Snowflake and Hugging Face: data and distribution as infrastructure
Databricks and Snowflake already hold governed enterprise data, which gives them a natural position as agents increasingly operate directly on proprietary information and semantic layers. Routing, retrieval, orchestration and model serving can be added above the existing data plane without moving the underlying business context elsewhere.
This can gradually turn the warehouse or lakehouse into an operating layer for enterprise intelligence in which foundation models become more substitutable beneath the workflow.
Hugging Face plays an analogous role for open AI by connecting model discovery and distribution to multiple inference providers. A new open-weight release can therefore reach a global developer base without its creator first building a hyperscale serving network.
Neoclouds and inference: from CoreWeave to Modal
CoreWeave, Nebius, Nscale and Crusoe control a scarce resource: accelerators, datacentres, networking and power. Their economics are highly capital intensive, making utilisation, financing cost and customer concentration first-order variables.
Crusoe is particularly notable for pushing vertical integration from energy and datacentre capacity toward cloud and managed inference. This demonstrates how AI infrastructure increasingly resembles project finance as much as software.
Groq and Cerebras attack inference from hardware architecture, while Together and Fireworks productionise open models. Baseten positions itself as high-performance model serving and even provides infrastructure through which model laboratories can distribute their own APIs, while Modal offers code-first elastic GPU infrastructure for inference and other ML workloads.
This layer matters because open weights are only economically meaningful if serving them is reliable and affordable. Inference providers can turn an open research release into a practical substitute for a proprietary API.
Routing and evaluation: the control plane of multi-model AI
OpenRouter makes explicit what large platforms increasingly do internally: models and providers become interchangeable resources behind one interface. Traffic can move as capability, latency and price change, turning model selection into dynamic portfolio management.
The same logic appears inside Microsoft, Google and Amazon, while Perplexity applies it at the agent layer and NVIDIA supports routing closer to the compute stack. Whoever controls this layer sees which models succeed on real production workloads and can use that information to optimise both quality and cost.
That requires continuous evaluation. METR's task-horizon work is relevant because it moves closer to measuring the length of tasks agents can complete reliably, while Braintrust, LangSmith and Arize focus on traces, regressions, tool failures and production evaluation.
For banks this is ultimately an extension of model risk management. A model or router configuration can change after validation, which means proprietary test sets and continuous evals increasingly become operational infrastructure rather than occasional research.
Physical AI: the same thesis under a harsher failure function
Physical AI applies the same agent logic in environments where failure costs are far higher. Google, NVIDIA, Figure, Skild AI, Physical Intelligence, Tesla, 1X, Apptronik, Agility Robotics and Unitree are all working toward broader physical autonomy rather than narrowly preprogrammed behaviour.
A software-agent failure generally costs time and compute. A robot failure can create downtime, damage or injury, making cycle time, recovery, uptime, human takeover and safety certification part of the economic calculation.
Cost per completed workflow therefore becomes cost per safely completed physical task. The opportunity is enormous, but the required reliability threshold is far higher than in browser or coding agents.
Creative AI: several frontier markets rather than one winner
Creative AI has fragmented into specialist markets. Midjourney remains strong in aesthetics, Ideogram in typography and design control, while Runway and Luma increasingly build broader production environments.
Black Forest Labs continues to develop FLUX, while Google's Veo, Alibaba's Wan, Kling and Grok Imagine broaden the video landscape. Competition is moving away from isolated impressive clips toward consistency, editing, references, audio and complete production workflows.
Adobe owns a different moat through Firefly's integration with Creative Cloud. A somewhat weaker model embedded deeply in professional workflow can capture more value than a technically superior standalone generator.
ElevenLabs and Suno demonstrate again that every modality has its own economics. Voice depends heavily on latency and interruption handling, while music is unusually exposed to licensing and copyright structures.
Compute, capex and energy: intelligence has a balance sheet
Falling token prices do not mean AI is becoming costless. Accelerators, HBM, advanced packaging, high-speed networking, datacentres and cooling remain expensive capital assets that must be financed and depreciated.
This creates radically different cost curves between old and new clusters. Price pressure from efficient open models hurts freshly financed capacity more than substantially depreciated infrastructure, while hyperscalers have the advantage of being able to shift capacity between internal and external workloads.
TSMC, packaging capacity and HBM remain physical constraints, while power increasingly determines where new clusters can be built. Hyperscalers are therefore treating energy procurement as a strategic function and signing long-term agreements across nuclear, renewables, gas, storage and transmission.
AI increasingly behaves as both software and infrastructure. Balance-sheet strength, utilisation and access to megawatts become technology moats in their own right.
Sovereign AI, regulation and data rights
The map now extends well beyond the US and China. Europe is building regional compute and sovereign AI around security, regulation and industrial policy, India combines a vast developer base with growing local infrastructure and the Middle East can bring sovereign capital and energy into large compute clusters.
For regulated organisations, sovereignty means more than server location. Jurisdiction, auditability, logging, model updates and contractual control over inference can all affect procurement.
The EU AI Act is being phased into force, with parts already enforceable. Documentation, transparency, evaluation and incident processes therefore increasingly affect production engineering rather than remaining a future legal concern.
Data rights are changing as well. News, music, code, books, images and video increasingly become licensed or contested inputs, while proprietary datasets become more valuable as general foundation models commoditise. In finance, legal and healthcare, high-quality permissioned workflow data can ultimately be a more durable moat than a temporary lead in general intelligence.
Where structural power ultimately sits
The AI industry is developing several forms of power simultaneously. OpenAI and Anthropic own strong frontier and knowledge-work franchises, while Google and Meta combine models with enormous distribution and proprietary context. Microsoft and Amazon can retain the enterprise relationship through cloud, identity, workflow and routing.
DeepSeek and Qwen push down the marginal price of intelligence, while Huawei builds a Chinese alternative across hardware and software. NVIDIA benefits from many of these ecosystems through compute, networking, CUDA and inference optimisation, while neoclouds and inference providers make capacity and open models economically accessible.
Databricks, Snowflake, Glean, Salesforce and Harvey demonstrate that data and workflow ownership can become moats of their own. Coding agents show how digital labour becomes measurable, while physical AI can ultimately extend the same economic logic into factories, warehouses and other physical environments.
The industry is therefore becoming less centred on one universal supermodel and more dependent on a network of models, routers, data platforms, runtimes, chips and infrastructure. This makes AI economically more complex, but also considerably less likely to become a simple winner-takes-all market.
Conclusion
The AI sector on 22 September 2026 is a snapshot rather than a stable equilibrium. Model releases arrive within weeks, public benchmarks can saturate quickly and the research frontier need not be identical to the product available through an API today. Exact model rankings are therefore less durable than the structures in which those models are built and deployed.
For enterprises and investors, cost per completed workflow is consequently a better metric than cost per token. A cheap API can become an expensive digital worker when humans continually need to intervene, while a premium model can be economically inexpensive when it completes high-value work with little rescue. Maximum frontier intelligence is equally wasteful when a cheaper workhorse can execute the same routine workflow reliably.
Large organisations will therefore not operate a one-model strategy. They will build portfolios in which models, agent harnesses, data platforms and inference providers are continuously evaluated and workloads are routed according to capability, reliability, latency, locality, risk and total economic cost.
The defining question for the next phase of AI is no longer which model can display the highest intelligence score today. It is which complete machine can convert intelligence into reliable finished work at the lowest total economic cost.
Disclaimer Aan de door ons opgestelde informatie kan op geen enkele wijze rechten worden ontleend. Alle door ons verstrekte informatie en analyses zijn geheel vrijblijvend. Alle consequenties van het op welke wijze dan ook toepassen van de informatie blijven volledig voor uw eigen rekening.
Wij aanvaarden geen aansprakelijkheid voor de mogelijke gevolgen of schade die zouden kunnen voortvloeien uit het gebruik van de door ons gepubliceerde informatie. U bent zelf eindverantwoordelijk voor de beslissingen die u neemt met betrekking tot uw beleggingen.