KI & Microsoft.
Aus unserer Sicht.

OpenAI unterstellt ein Frontier-Modell strengeren Kontrollen, während Anthropic einen engen Sicherheitsengpass lockert

OpenAI sagte, interne Evaluierungen seines kommenden Astra-Modells deuteten im Rahmen seines Preparedness Framework auf potenzielle Cyber-Fähigkeiten auf kritischem Niveau hin. Das Unternehmen sagte, es fahre die Robustheitstests hoch, verhänge strengere Sicherheitskontrollen für Modelle mit hoher Leistungsfähigkeit, pausiere Arbeiten an Astra, die diese Kontrollen noch nicht erfüllten, und führe eine universelle Überwachung riskanter Handlungen über agentische Nutzungen von Astra hinweg ein.

Das scheint die Sicherheit von Frontier-Modellen aus einer Policy-Ebene in den Produktbetrieb zu verlagern: OpenAI beschreibt nicht nur einen Schwellenwert, sondern verändert, wie ein Modell entwickelt und genutzt werden darf. Das dürfte über OpenAI hinaus relevant sein, denn eine veröffentlichte Pause, die an interne Fähigkeitstests geknüpft ist, gibt anderen Anbietern einen klareren Präzedenzfall dafür, die Bereitstellung zu verlangsamen, wenn eine Evaluierung ihre eigene Grenze überschreitet.

Anthropic sagte, Aktualisierungen der Biologie-Schutzvorkehrungen von Claude Fable 5 verringerten in seinen Produkten den Rückgriff auf weniger leistungsfähige Modelle bei biologiebezogenen Fällen um etwa 85%. Das Unternehmen sagte, die Änderung erweitere die Fähigkeit des Modells, Gesundheitsfragen, Biologiefragen im Bildungsbereich und einige klinische Aufgaben zu beantworten, während es bei Dual-Use-Themen wie Virologie, Toxikologie und molekularem Design weiterhin auf Claude Opus 5 zurückgreife.

Das deutet darauf hin, dass die derzeitige Wettbewerbsarbeit nicht einfach darin besteht, mehr Verweigerungen hinzuzufügen, sondern sie enger zu fassen, damit eine sicherere Handhabung mehr gewöhnliche Nutzung abdeckt, ohne die sensibelsten Bereiche zu öffnen. Zusammengenommen dürften OpenAIs strengere Cyber-Kontrollen und Anthropics engere Biologie-Rückgriffe dieselbe Verschiebung zeigen - weg von breiter Blockierung hin zu feiner abgestufter Steuerung innerhalb der Modellebene selbst.

Belege
  • 2026-08-07 OpenAI reported that internal evaluations of its upcoming Astra model indicate potential critical-level cyber capabilities under its Preparedness Framework and announced scaled-up robustness testing, stricter security controls for high-capability models, a pause on Astra activities that do not yet meet those controls, and universal monitoring for risky actions across agentic uses of Astra. openai.com
  • 2026-08-07 Anthropic announced updates to Claude Fable 5’s biology safeguards that reduce biology-related fallbacks to less capable models by about 85% across its products, expanding the model’s ability to handle health and educational biology questions and some clinical tasks while continuing to fall back to Claude Opus 5 on dual-use topics such as virology, toxicology and molecular design. anthropic.com