Über die Zeit
Die Kontrolle verlagert sich zu den Ebenen, die KI-Nutzung leiten, steuern und finanzieren
Die Linie der vergangenen Monate wirkt nun schärfer: Der Vorteil verlagert sich weg vom Modell für sich genommen und hin zu den Ebenen, die entscheiden, wohin eine Anfrage geht, zu welchen Bedingungen und mit wessen Geld dahinter. Stripe hat die Übernahme von OpenRouter abgeschlossen. Snowflake hat seinem KI-Gateway und seinen Produkten dynamisches Modell-Routing, Kostenverfolgung, Quoten und Ausgabenkontrollen hinzugefügt. AWS hat OpenAI-Modelle in Bedrock aufgenommen für Kunden, bei denen die Inferenz innerhalb Indiens bleiben muss. Microsoft kündigte einen einheitlichen Copilot-Client an und fügte mehr Stellen hinzu, an denen Copilot und Agenten-Tools innerhalb seiner Software und Partnerkanäle sitzen.
Das scheint die Lesart der vergangenen Woche zu Full Stacks zu etwas Spezifischerem auszuweiten: Der dauerhafte Kontrollpunkt ist zunehmend die Vermittlungsstelle statt des Modells. Das ist auch über Microsoft hinaus wichtig, weil Käufer sich nicht mehr so früh auf einen einzelnen Modellanbieter festlegen müssen, wenn Gateways, Clouds und Arbeitssuiten Modelle austauschen, Budgets durchsetzen und den Workflow beibehalten können. Es scheint auch zu verändern, was für Anbieter als Verteidigungsfähigkeit zählt. Eine schnellere Modellklasse von OpenAI und ein günstigeres Arbeitsmodell von Google DeepMind sind weiterhin wichtig, wirken aber eher wie Eingaben in die Systeme anderer Unternehmen als wie das ganze Produkt.
Gleichzeitig werden die wirtschaftlichen Grundlagen hinter diesen Systemen schwerer, nicht leichter. Nvidia erklärte sich bereit, Kredite von bis zu 105 Milliarden Dollar für OpenAIs Campus in Ohio zu unterstützen und in neue Stromerzeugung sowie Netzinfrastruktur für den Standort zu investieren. Gartner veröffentlichte eine Prognose zu KI-Inferenzkosten pro agentischem Workflow bis 2028. OpenAI sagte zudem, dass es das Reinforcement-Learning-Training bei seinen neuesten für die Ausbringung bestimmten Modellen pausiert hat und seinen grössten geplanten Frontier-Lauf ausgesetzt hielt, während es stärkere Schutzmassnahmen hinzufügte. Das deutet darauf hin, dass Fortschritt an der Frontier nicht mehr allein von Chips bestimmt wird. Er scheint ebenso sehr vom Zugang zu finanzierter Energie, von der Toleranz für höhere Betriebskosten und von der Bereitschaft abzuhängen, die Ausbringung zu verlangsamen, wenn sich die Risikofläche ausweitet.
Die Wirkung erreicht den gewöhnlichen Geschäftseinsatz von beiden Seiten. Auf der einen Seite verdichtet sich das Angebot an Open-Weight-Modellen weiter: Qwen veröffentlichte ein Open-Weight-Modell mit 2,4 Billionen Parametern, und vLLM fügte am ersten Tag Unterstützung hinzu, um es über eine OpenAI-kompatible API bereitzustellen - eine Schnittstelle, die die Art kopiert, wie OpenAI Anfragen annimmt, sodass andere Werkzeuge sich mit wenig Umschreiben anschliessen können. Diese Kombination dürfte den Markt weiter in segmentierte Abschlüsse drängen: Einige Käufer werden Daten und Abhängigkeit gegen Bequemlichkeit tauschen, während andere für klarere Grenzen zahlen oder offene Modelle dort nutzen werden, wo sie sowohl das Modell als auch den Datenpfad selbst halten können.
Unsere Prognose
Die nächste sichtbare Trennung dürfte zwischen KI-Anbietern verlaufen, die lediglich Modelle verkaufen, und solchen, die Routing, Budgetdurchsetzung oder Zahlungswege darum herum kontrollieren.
woran wir uns messen lassenFällig 2026-11-30
Bis 2026-11-30 muss mindestens ein grosser Anbieter ausser Microsoft, AWS oder Snowflake entweder öffentlich ein Modell-Routing-Gateway mit Ausgabenkontrollen oder eine Zahlungsebene eingeführt haben, die es KI-Agenten erlaubt, externe Dienste unter vom Anbieter verwalteten Leitplanken zu kaufen.
Belege
- 2026-08-16 Stripe has finalized a deal to acquire AI gateway startup OpenRouter for more than $7 billion, adding a single access point service to hundreds of AI models to its generative AI infrastructure offerings. techcrunch.com
- 2026-08-18 Snowflake launched dynamic model routing in its Cortex AI Gateway and AI products CoCo and CoWork, added access to new open models such as DeepSeek‑V4‑Flash 0731 and GLM‑5.3, and introduced tools to track AI usage, allocate costs, set quotas and manage AI spend across teams and agents. snowflake.com
- 2026-08-18 AWS added support for OpenAI GPT-5.6 Terra and Luna models in India via new India Geo cross-Region inference profiles in Amazon Bedrock, allowing customers with in-country inference and data residency requirements to run these models at scale while keeping processing within India. aws.amazon.com
- 2026-08-13 Microsoft announced it is beginning to roll out a unified Copilot app that combines its consumer Copilot and Microsoft 365 Copilot into a single client supporting personal, work and school accounts, while retiring several consumer‑only features. thurrott.com
- 2026-08-18 Microsoft’s Azure Cosmos DB team introduced new Visual Studio Code extension features that integrate GitHub Copilot tools and Cosmos DB skills into the Query Editor, add an optional MCP-based Azure Cosmos DB Shell path with Emulator support, and extend tooling for migration and account health in agentic applications. devblogs.microsoft.com
- 2026-08-18 Microsoft updated Partner Center documentation to support Dragon Copilot marketplace offers, enabling partners to publish Dragon Copilot Physician Apps and Agents that embed custom capabilities into the AI assistant at the point of care for U.S. healthcare customers. learn.microsoft.com
- 2026-08-17 Nvidia agreed to provide up to $105 billion in credit backing for OpenAI’s planned AI data centre campus in Pike County, Ohio, and to invest $1.5 billion in SoftBank’s SB Energy to help build 10GW of new power generation and at least $4.2 billion in regional grid infrastructure to support the site. cnbc.com
- 2026-08-13 OpenAI introduced Ultrafast, a new OpenAI API service tier that runs GPT‑5.6 Sol up to 14× faster than standard processing and is launching in preview for time‑sensitive applications such as incident response and real‑time customer support. openai.com
- 2026-08-13 Google DeepMind unveiled Gemini 3.7 Flash, a new workhorse model optimized for coding and agentic workflows that improves benchmark performance and web/app generation quality while launching at roughly half the price per million tokens of Gemini 3.6 Flash. blog.google
- 2026-08-17 Gartner released a forecast stating that AI inference costs per agentic workflow are expected to increase more than fivefold through 2028 as providers shift from simple chatbot interactions to more compute-intensive multimodel agent workflows. gartner.com
- 2026-08-18 OpenAI reported that, following the OpenAI–Hugging Face incident and early signs that its upcoming Astra model may hit a critical cybersecurity capability threshold, it has paused reinforcement learning training on its latest deployment-bound models, kept its largest planned frontier RL run on hold, and implemented stronger monitoring, alignment and security safeguards to pace frontier model development. openai.com
- 2026-08-13 Qwen released the open-weight Qwen3.8-2.4T-A95B Mixture-of-Experts language model on Hugging Face, publishing weights and configuration for a 2.4-trillion-parameter, 95-billion-active model compatible with vLLM, SGLang, TokenSpeed and other local inference engines for self-hosted deployments. huggingface.co
- 2026-08-12 The vLLM team announced day‑0 support for the Qwen3.8-2.4T-A95B open-weight model, including FP4 quantization and performance optimizations to enable efficient deployment of the 2.4T/95B-active Mixture-of-Experts model across NVIDIA GPUs and edge systems via vLLM’s high-throughput engine and OpenAI-compatible API. vllm.ai
- 2026-08-18 AWS made Amazon Bedrock AgentCore payments generally available, enabling AI agents to autonomously pay for paid APIs, MCPs and content via integrations with Coinbase and Stripe Privy wallets, orchestrated across protocols such as x402 and the Machine Payment Protocol with spending guardrails and observability. aws.amazon.com