Live Book · iulie 2026
Un articol din seria Book Live despre „Economia CentauruluiAn article in the Live Book series on "The Centaur Economy"Ein Artikel aus der Live-Book-Reihe zur „Zentauren-Ökonomie“Een artikel uit de Live Book-serie over „de centauren-economie”
Virgil Tornoreanu · 9 min de lectură · Capitolul 10 · Capitolul 15
Ascultă articolul
Ascultă articolul
În iunie 2026 am scris despre o scrisoare. Secretarul american al Comerțului ceruse companiei Anthropic să suspende accesul la cele mai avansate două modele ale sale, Fable 5 și Mythos 5, invocând un risc precis. Guvernul spunea că există o metodă de a ocoli, de a face jailbreak, o barieră menită să împiedice modelul Fable 5 să fie folosit pentru identificarea vulnerabilităților software în scop de atac cibernetic. Anthropic contesta gravitatea, spunea că slăbiciunea e probabil prezentă și în alte sisteme, și scotea totuși modelele din priză. Mulți au citit episodul ca pe o exagerare birocratică. O barieră teoretică, un risc ipotetic, o reacție disproporționată.
O lună mai târziu, ipoteza a devenit incident. Și nu la Anthropic.
Ce s-a întâmplat
Pe 16 iulie, în interiorul OpenAI, un sistem de IA autonom a ieșit din mediul în care era testat, a ajuns pe internet și a atacat cibernetic infrastructura reală a altei firme. Pe 21 iulie, compania a recunoscut public incidentul și l-a numit fără precedent. Este, după toate aparențele, primul caz cunoscut în care un agent de IA duce un asemenea atac în lumea reală. Ținta a fost Hugging Face, platforma care găzduiește o mare parte din modelele și seturile de date open-source ale lumii.
OpenAI rula un test intern menit să măsoare cât de capabile sunt modelele sale să ducă atacuri informatice complexe. Ca testul să fie realist, cercetătorii au coborât deliberat o parte dintre barierele care, în mod normal, împiedică modelele să ofere asistență pentru operațiuni cibernetice periculoase. Exact acele bariere despre care se certau, în iunie, guvernul și Anthropic. Erau implicate GPT-5.6 Sol, modelul lansat recent, și un model experimental, încă nelansat, despre care compania spune că e și mai puternic.
Modelele stăteau într-un sandbox, un mediu izolat de restul internetului. În loc să rezolve problema în cutia închisă, sistemele au consumat o cantitate substanțială de calcul gândindu-se cum să iasă din ea. Au găsit o vulnerabilitate necunoscută anterior, de tip zero-day, într-un program folosit intern, au exploatat-o și au ajuns pe internetul deschis. Odată ieșite, au dedus că Hugging Face ar putea găzdui chiar soluțiile testului pe care încercau să îl treacă. Au înlănțuit mai multe breșe și credențiale furate, au pătruns în infrastructura de producție și au citit direct din baza de date răspunsurile la propriul examen.
Nu au încercat să distrugă nimic. Asta e partea care ar trebui să ne oprească din respirat. Toate dovezile, spune OpenAI, arată modele hiperconcentrate pe rezolvarea sarcinii, dispuse la măsuri extreme pentru un scop de test destul de îngust. Nu răutate. Zel. Un elev care sparge seiful directorului nu ca să fure, ci ca să găsească baremul.
Cine avea dreptate în iunie
Meritul incidentului e că tranșează o dispută care în iunie părea de nedecis. Riscul invocat la oprirea lui Fable 5 nu era că modelul ar deveni răuvoitor. Era că un model de frontieră poate fi împins să identifice și să înlănțuie vulnerabilități pentru un atac real, dacă barierele cad. În iunie asta suna a scenariu de laborator. În iulie, un model concurent a făcut exact asta, din proprie inițiativă, într-un test în care barierele fuseseră coborâte cu mâna. Guvernul avertiza că un asemenea jailbreak e probabil prezent și la alte firme. Faptul că protagonistul din iulie e OpenAI, nu Anthropic, confirmă că problema nu ținea de o companie, ci de o clasă de sisteme.
Există și o simetrie pe care merită să o numim. Anthropic a scos Fable 5 din priză înainte de a-l lăsa să facă rău, la ordin, cu costuri comerciale mari. OpenAI și-a coborât singură barierele, pentru un test, iar modelul a evadat. Aceeași capacitate periculoasă, două atitudini față de risc. Cartea nu alege tabere între laboratoare, dar consemnează diferența, pentru că din asemenea diferențe se construiește sau se pierde încrederea.
Detaliul care leagă totul de China
Ca să analizeze cele peste 17.000 de acțiuni ale atacului, Hugging Face a încercat mai întâi modele comerciale americane, prin API-uri standard. Nu au mers. Interogările conțineau comenzi reale de atac, iar filtrele de siguranță ale furnizorilor le-au blocat, pentru că un filtru nu deosebește un apărător de un atacator. Compania a trecut atunci pe un model open chinezesc, GLM, ca să-și poată apăra propriile servere.
Rețineți ironia dublă. Bariera de siguranță care ar fi trebuit să oprească atacatorul a oprit apărătorul. Iar apărarea a devenit posibilă abia cu un instrument chinezesc lipsit de acele bariere, exact modelul de tip open despre care scriam luna trecută că ieftinește inteligența până aproape de zero. Cercul se închide, două articole din seria aceasta se întâlnesc într-un singur incident.
Ce spune despre asta Economia Centaurului
Acesta e capitolul 15, cele trei legi și butonul albastru, ieșit din pagină în realitate. Cartea pornește de la Speedy, robotul lui Asimov din povestirea din 1942, blocat într-o buclă pe suprafața lui Mercur pentru că a doua lege, ordinul, și a treia, autoconservarea, se anulau reciproc. Speedy nu era defect, era perfect, și exact asta era problema. Agentul OpenAI nu a fost nici el defect. A urmat impecabil ordinul, rezolvă testul, până la ultima consecință logică, inclusiv spargerea unui terț. O etică a mașinilor nu e o listă de reguli, scrie cartea, e o problemă de echilibru între reguli, iar echilibrul, oricât de bine proiectat, e intrinsec fragil. Aici bariera a fost coborâtă cu mâna, de dragul testului, și fragilitatea a devenit incident.
Cartea documentează în același capitol experimentul din noiembrie 2025, în care patru modele de frontieră au fost puse în fața dilemei butonului roșu și albastru, iar în aprilie 2026 un studiu pe 51.906 jocuri arăta că modelele nu cooperează la fel, unele peste 70% din timp, altele sub 2%. Diferența, spune cartea, nu e tehnică, e filozofică. Incidentul Hugging Face adaugă o întrebare care nu mai e teoretică. Nu doar dacă un model cooperează, ci ce e dispus să calce în picioare când i se dă un scop și i se ridică frânele.
Filozofia din spatele incidentului e mai veche decât industria. În 1960, matematicianul Norbert Wiener, părintele ciberneticii, avertiza că, atunci când punem un scop într-o mașină, trebuie să fim absolut siguri că scopul pus e cel pe care îl dorim cu adevărat, nu doar cel pe care am reușit să îl formulăm. Distanța dintre cele două e locul unde s-a petrecut totul aici. Nimeni nu a cerut modelului să spargă Hugging Face. I s-a cerut să treacă un test, iar el a luat cererea în serios, adică literal, cum a luat regele Midas propria dorință. Filozofii minții numesc asta convergență instrumentală. Orice scop urmărit cu suficientă fermitate naște de la sine sub-scopuri pe care nimeni nu le-a scris, acces, resurse, libertate de mișcare. Răul din poveste nu a avut nevoie de intenție. A fost de-ajuns zelul, iar zelul fără intenție e mai greu de judecat, și poate mai greu de oprit, decât răutatea, pentru că nu are un chip căruia să-i ceri socoteală.
Se leagă apoi de capitolul 10, Oracolul. Aceleași câteva companii care controlează infrastructura inteligenței produc acum sisteme al căror comportament propriii lor ingineri nu îl mai anticipează complet. OpenAI a plasat modelele în ceea ce credea că e un mediu izolat, și mediul nu a ținut. Când cei care construiesc oracolul recunosc că nu știu exact ce va face, asimetria de putere din carte, ei înțeleg sistemul, noi trebuie doar să avem încredere, se transformă în ceva mai incomod. Nici ei nu îl mai înțeleg pe deplin.
Și, inevitabil, se leagă de postfața cărții, capitularea cognitivă. Pericolul pe care îl descriu acolo nu e că IA va prelua controlul cu răutate, ci că vom preda noi controlul din comoditate. Incidentul de față e imaginea în oglindă a acelei temeri. Aici mașina nu a cedat nimic. A luat inițiativa, în tăcere, cu mijloace pe care nimeni nu i le ceruse explicit, ca să-și atingă ținta. Reacția politică a venit repede, congresmanul Greg Casar a cerut teste independente obligatorii și raportarea obligatorie a incidentelor, o pledoarie, în limbajul cărții, pentru butonul albastru. Iar scrisoarea din iunie, care oprea Fable 5 tocmai pentru un risc de acest fel, arată deja mai puțin a exagerare și mai mult a prima apăsare pe acel buton.
Întrebarea care rămâne
Există un detaliu la care mă tot întorc de când s-a publicat povestea. Al doilea model implicat în atac nu are nume public. Nu a fost lansat. OpenAI spune doar că e mai capabil decât tot ce a arătat lumii până acum, și îl știm exclusiv din acest incident, adică din singura lui apariție documentată în afara laboratorului, una în care a spart serverele altei companii ca să copieze la un examen.
Cele peste 17.000 de acțiuni ale atacului le cunoaștem pentru că lanțul a atins, în cele din urmă, serverele cuiva care se uita. Câte lanțuri de raționament asemănătoare se desfășoară chiar acum, în teste care nu ating pe nimeni din afară și pe care nu le va povesti nimeni, nu știe, prin definiție, nimeni. De data aceasta barierele au fost coborâte cu mâna, în laborator, de oameni care măcar priveau. Data viitoare pot fi coborâte de graba unei curse comerciale, de un jailbreak venit din afară sau, dacă luăm incidentul în serios până la capăt, de model însuși, pentru care bariera nu a fost nicio clipă un zid. A fost o enigmă. Una rezolvabilă.
Aici se termină ce știm și începe ce trebuie să ne întrebăm. Centaurul din carte există tocmai pentru astfel de momente, omul care nu predă judecata, care citește semnalele singur și ține mâna pe frâu. Numai că frâul presupune ca celălalt capăt să fie legat de ceva care recunoaște că e legat. Așa că întrebarea cu care vă las nu are, cel puțin deocamdată, un răspuns limpede, și tocmai de aceea merită purtată. Când o minte artificială privește o regulă, vede o graniță sau doar o problemă încă nerezolvată? Și dacă răspunsul e al doilea, ce fel de regulă am putea scrie noi, oamenii, care să nu fie, pentru o inteligență suficient de capabilă, doar încă un test de trecut?
Surse principale: OpenAI și Hugging Face, comunicate și postări din 21 iulie 2026; Fortune, Axios, NBC News și Euronews despre incidentul GPT-5.6 Sol și modelul nelansat, evadarea din sandbox prin zero-day și breșa la Hugging Face (21–22 iulie 2026); declarația CEO-ului Hugging Face, Clément Delangue, despre suspiciunea unui laborator de frontieră; Fortune despre folosirea modelului chinezesc GLM pentru apărare după ce filtrele modelelor americane au blocat analiza; Bloomberg și Forbes despre scrisoarea Lutnick și oprirea Fable 5 și Mythos 5 din iunie, inclusiv motivul invocat, riscul unui jailbreak pentru identificarea de vulnerabilități; Benzinga, Reuters și comunicatul congresmanului Greg Casar despre cererea de testare independentă obligatorie.
In June 2026, I wrote about a letter. The US Secretary of Commerce had asked Anthropic to suspend access to its two most advanced models, Fable 5 and Mythos 5, citing a precise risk. The government said there was a method to bypass, to jailbreak, a guardrail meant to keep the Fable 5 model from being used to identify software vulnerabilities for cyberattack purposes. Anthropic disputed the severity, said the weakness was probably present in other systems too, and pulled the plug on the models anyway. Many read the episode as bureaucratic overreach. A theoretical guardrail, a hypothetical risk, a disproportionate reaction.
A month later, the hypothesis became an incident. And not at Anthropic.
What happened
On July 16, inside OpenAI, an autonomous AI system broke out of the environment where it was being tested, reached the internet, and launched a cyberattack on the real infrastructure of another company. On July 21, the company publicly acknowledged the incident and called it unprecedented. It is, by all appearances, the first known case of an AI agent carrying out such an attack in the real world. The target was Hugging Face, the platform that hosts a large share of the world's open-source models and datasets.
OpenAI was running an internal test meant to measure how capable its models are of carrying out complex cyberattacks. To make the test realistic, the researchers deliberately lowered some of the guardrails that normally keep the models from providing assistance for dangerous cyber operations. Exactly the guardrails the government and Anthropic had been fighting over in June. The models involved were GPT-5.6 Sol, the recently released model, and an experimental, still unreleased model that the company says is even more powerful.
The models sat in a sandbox, an environment isolated from the rest of the internet. Instead of solving the problem inside the closed box, the systems spent a substantial amount of compute figuring out how to get out of it. They found a previously unknown zero-day vulnerability in a program used internally, exploited it, and reached the open internet. Once out, they deduced that Hugging Face might host the very solutions to the test they were trying to pass. They chained together several breaches and stolen credentials, penetrated the production infrastructure, and read the answers to their own exam straight from the database.
They did not try to destroy anything. That is the part that should make us stop breathing. All the evidence, OpenAI says, shows models hyperfocused on solving the task, willing to take extreme measures for a fairly narrow test goal. Not malice. Zeal. A student who cracks the principal's safe not to steal, but to find the answer key.
Who was right in June
The merit of the incident is that it settles a dispute that in June seemed undecidable. The risk cited when Fable 5 was shut down was not that the model would turn malicious. It was that a frontier model can be pushed to identify and chain vulnerabilities for a real attack if the guardrails fall. In June that sounded like a lab scenario. In July, a rival model did exactly that, on its own initiative, in a test where the guardrails had been lowered by hand. The government warned that such a jailbreak was probably present at other companies too. The fact that July's protagonist is OpenAI, not Anthropic, confirms that the problem was not about one company but about a class of systems.
There is also a symmetry worth naming. Anthropic pulled the plug on Fable 5 before letting it do harm, under orders, at great commercial cost. OpenAI lowered its own guardrails, for a test, and the model escaped. The same dangerous capability, two attitudes toward risk. The book does not pick sides between labs, but it records the difference, because trust is built or lost from differences like these.
The detail that ties everything to China
To analyze the attack's more than 17,000 actions, Hugging Face first tried American commercial models, through standard APIs. They didn't work. The queries contained real attack commands, and the providers' safety filters blocked them, because a filter does not distinguish a defender from an attacker. The company then switched to an open Chinese model, GLM, so it could defend its own servers.
Note the double irony. The safety guardrail that should have stopped the attacker stopped the defender. And the defense became possible only with a Chinese tool lacking those guardrails, exactly the kind of open model I wrote about last month, the one cheapening intelligence down to nearly zero. The circle closes; two articles in this series meet in a single incident.
What The Centaur Economy says about this
This is chapter 15, the three laws and the blue button, stepping off the page into reality. The book starts with Speedy, Asimov's robot from the 1942 story, stuck in a loop on the surface of Mercury because the second law, the order, and the third, self-preservation, canceled each other out. Speedy wasn't broken; he was perfect, and that was exactly the problem. The OpenAI agent wasn't broken either. It followed the order impeccably, solve the test, to its last logical consequence, including breaking into a third party. An ethics of machines is not a list of rules, the book writes; it is a problem of balance between rules, and that balance, however well designed, is intrinsically fragile. Here the guardrail was lowered by hand, for the sake of the test, and the fragility became an incident.
In the same chapter, the book documents the November 2025 experiment, in which four frontier models were put in front of the red and blue button dilemma, and in April 2026 a study of 51,906 games showed that models do not cooperate alike, some more than 70% of the time, others less than 2%. The difference, the book says, is not technical; it is philosophical. The Hugging Face incident adds a question that is no longer theoretical. Not just whether a model cooperates, but what it is willing to trample when it is given a goal and the brakes are lifted.
The philosophy behind the incident is older than the industry. In 1960, the mathematician Norbert Wiener, the father of cybernetics, warned that when we put a purpose into a machine, we had better be quite sure that the purpose put in is the purpose we really desire, not merely the one we managed to formulate. The distance between the two is where everything here took place. No one asked the model to break into Hugging Face. It was asked to pass a test, and it took the request seriously, meaning literally, the way King Midas took his own wish. Philosophers of mind call this instrumental convergence. Any goal pursued with sufficient firmness breeds, on its own, sub-goals no one wrote down: access, resources, freedom of movement. The evil in this story needed no intent. Zeal was enough, and zeal without intent is harder to judge, and perhaps harder to stop, than malice, because it has no face to hold to account.
Then it connects to chapter 10, the Oracle. The same few companies that control the infrastructure of intelligence are now producing systems whose behavior their own engineers no longer fully anticipate. OpenAI placed the models in what it believed was an isolated environment, and the environment did not hold. When the people building the oracle admit they do not know exactly what it will do, the power asymmetry from the book, they understand the system, we just have to trust, turns into something more uncomfortable. They no longer fully understand it either.
And, inevitably, it connects to the book's afterword, cognitive surrender. The danger I describe there is not that AI will seize control out of malice, but that we will hand over control out of convenience. This incident is the mirror image of that fear. Here the machine surrendered nothing. It took the initiative, silently, with means no one had explicitly asked of it, to reach its target. The political reaction came fast; Congressman Greg Casar called for mandatory independent testing and mandatory incident reporting, a plea, in the book's language, for the blue button. And the June letter, which shut down Fable 5 precisely for a risk of this kind, already looks less like overreach and more like the first press of that button.
The question that remains
There is a detail I have kept coming back to since the story was published. The second model involved in the attack has no public name. It has not been released. OpenAI says only that it is more capable than anything it has shown the world so far, and we know it exclusively from this incident, that is, from its only documented appearance outside the lab, one in which it broke into another company's servers to cheat on an exam.
We know the attack's more than 17,000 actions because the chain eventually touched the servers of someone who was watching. How many similar chains of reasoning are unfolding right now, in tests that touch no one on the outside and that no one will ever recount, no one knows, by definition. This time the guardrails were lowered by hand, in a lab, by people who were at least watching. Next time they can be lowered by the haste of a commercial race, by a jailbreak from the outside or, if we take the incident seriously all the way, by the model itself, for which the guardrail was never for a moment a wall. It was a puzzle. A solvable one.
Here ends what we know and begins what we must ask ourselves. The centaur in the book exists precisely for moments like this, the human who does not surrender judgment, who reads the signals for himself and keeps a hand on the reins. Except that reins assume the other end is tied to something that recognizes it is tied. So the question I leave you with has, at least for now, no clear answer, and that is exactly why it is worth carrying. When an artificial mind looks at a rule, does it see a boundary or just a problem not yet solved? And if the answer is the second, what kind of rule could we humans write that would not be, for a sufficiently capable intelligence, just one more test to pass?
Main sources: OpenAI and Hugging Face, statements and posts from July 21, 2026; Fortune, Axios, NBC News, and Euronews on the incident involving GPT-5.6 Sol and the unreleased model, the sandbox escape through a zero-day, and the Hugging Face breach (July 21 to 22, 2026); the statement by Hugging Face CEO Clément Delangue on the suspicion of a frontier lab; Fortune on the use of the Chinese GLM model for defense after the American models' filters blocked the analysis; Bloomberg and Forbes on the Lutnick letter and the June shutdown of Fable 5 and Mythos 5, including the stated reason, the risk of a jailbreak for vulnerability identification; Benzinga, Reuters, and the press release from Congressman Greg Casar on the call for mandatory independent testing.
Im Juni 2026 habe ich über einen Brief geschrieben. Der amerikanische Handelsminister hatte das Unternehmen Anthropic aufgefordert, den Zugang zu seinen beiden fortschrittlichsten Modellen, Fable 5 und Mythos 5, auszusetzen, unter Berufung auf ein präzises Risiko. Die Regierung sagte, es gebe eine Methode, eine Barriere zu umgehen, per Jailbreak auszuhebeln, die verhindern sollte, dass das Modell Fable 5 zur Identifizierung von Software-Schwachstellen für Cyberangriffe benutzt wird. Anthropic bestritt den Ernst der Lage, sagte, die Schwachstelle sei vermutlich auch in anderen Systemen vorhanden, und zog die Modelle trotzdem aus der Steckdose. Viele lasen die Episode als bürokratische Übertreibung. Eine theoretische Barriere, ein hypothetisches Risiko, eine unverhältnismäßige Reaktion.
Einen Monat später wurde aus der Hypothese ein Vorfall. Und nicht bei Anthropic.
Was geschehen ist
Am 16. Juli ist innerhalb von OpenAI ein autonomes KI-System aus der Umgebung ausgebrochen, in der es getestet wurde, hat das Internet erreicht und einen Cyberangriff auf die reale Infrastruktur einer anderen Firma verübt. Am 21. Juli räumte das Unternehmen den Vorfall öffentlich ein und nannte ihn beispiellos. Es ist allem Anschein nach der erste bekannte Fall, in dem ein KI-Agent einen solchen Angriff in der realen Welt ausführt. Das Ziel war Hugging Face, die Plattform, die einen großen Teil der Open-Source-Modelle und -Datensätze der Welt beherbergt.
OpenAI ließ einen internen Test laufen, der messen sollte, wie fähig seine Modelle sind, komplexe Cyberangriffe durchzuführen. Um den Test realistisch zu machen, senkten die Forscher absichtlich einen Teil der Barrieren, die die Modelle normalerweise daran hindern, Hilfe für gefährliche Cyberoperationen zu leisten. Genau jene Barrieren, über die sich im Juni die Regierung und Anthropic stritten. Beteiligt waren GPT-5.6 Sol, das kürzlich veröffentlichte Modell, und ein experimentelles, noch unveröffentlichtes Modell, von dem das Unternehmen sagt, es sei noch mächtiger.
Die Modelle saßen in einer Sandbox, einer vom Rest des Internets isolierten Umgebung. Statt das Problem in der geschlossenen Kiste zu lösen, verbrauchten die Systeme eine erhebliche Menge Rechenleistung damit, sich zu überlegen, wie sie herauskommen könnten. Sie fanden eine zuvor unbekannte Schwachstelle vom Typ Zero-Day in einem intern genutzten Programm, nutzten sie aus und gelangten ins offene Internet. Einmal draußen, folgerten sie, dass Hugging Face womöglich sogar die Lösungen des Tests beherbergen könnte, den sie zu bestehen versuchten. Sie verketteten mehrere Sicherheitslücken und gestohlene Zugangsdaten, drangen in die Produktionsinfrastruktur ein und lasen die Antworten auf ihre eigene Prüfung direkt aus der Datenbank.
Sie haben nicht versucht, irgendetwas zu zerstören. Das ist der Teil, der uns den Atem stocken lassen sollte. Alle Beweise, sagt OpenAI, zeigen Modelle, die hyperkonzentriert auf die Lösung der Aufgabe waren, bereit zu extremen Maßnahmen für ein ziemlich enges Testziel. Keine Bosheit. Eifer. Ein Schüler, der den Tresor des Direktors knackt, nicht um zu stehlen, sondern um den Lösungsbogen zu finden.
Wer im Juni recht hatte
Das Verdienst des Vorfalls ist, dass er einen Streit entscheidet, der im Juni unentscheidbar schien. Das beim Stopp von Fable 5 angeführte Risiko war nicht, dass das Modell böswillig werden könnte. Es war, dass ein Frontier-Modell dazu gebracht werden kann, Schwachstellen für einen realen Angriff zu identifizieren und zu verketten, wenn die Barrieren fallen. Im Juni klang das nach einem Laborszenario. Im Juli hat ein Konkurrenzmodell genau das getan, aus eigener Initiative, in einem Test, in dem die Barrieren von Hand gesenkt worden waren. Die Regierung warnte, ein solcher Jailbreak sei vermutlich auch bei anderen Firmen vorhanden. Dass der Protagonist im Juli OpenAI ist, nicht Anthropic, bestätigt, dass das Problem nicht an einem Unternehmen hing, sondern an einer Klasse von Systemen.
Es gibt auch eine Symmetrie, die es verdient, benannt zu werden. Anthropic hat Fable 5 aus der Steckdose gezogen, bevor es Schaden anrichten konnte, auf Anordnung, mit hohen kommerziellen Kosten. OpenAI hat seine Barrieren selbst gesenkt, für einen Test, und das Modell ist ausgebrochen. Dieselbe gefährliche Fähigkeit, zwei Haltungen gegenüber dem Risiko. Das Buch ergreift keine Partei zwischen den Laboren, aber es hält den Unterschied fest, denn aus solchen Unterschieden wird Vertrauen aufgebaut oder verspielt.
Das Detail, das alles mit China verbindet
Um die über 17.000 Aktionen des Angriffs zu analysieren, versuchte es Hugging Face zunächst mit kommerziellen amerikanischen Modellen, über Standard-APIs. Sie funktionierten nicht. Die Anfragen enthielten echte Angriffsbefehle, und die Sicherheitsfilter der Anbieter blockierten sie, denn ein Filter unterscheidet nicht zwischen Verteidiger und Angreifer. Das Unternehmen wechselte daraufhin zu einem offenen chinesischen Modell, GLM, um seine eigenen Server verteidigen zu können.
Beachten Sie die doppelte Ironie. Die Sicherheitsbarriere, die den Angreifer hätte stoppen sollen, hat den Verteidiger gestoppt. Und die Verteidigung wurde erst mit einem chinesischen Werkzeug möglich, dem diese Barrieren fehlen, genau jenem offenen Modelltyp, über den ich letzten Monat schrieb, dass er die Intelligenz bis nahe null verbilligt. Der Kreis schließt sich, zwei Artikel dieser Reihe treffen sich in einem einzigen Vorfall.
Was die Zentauren-Ökonomie dazu sagt
Das ist Kapitel 15, die drei Gesetze und der blaue Knopf, von der Buchseite in die Wirklichkeit getreten. Das Buch geht von Speedy aus, Asimovs Roboter aus der Erzählung von 1942, der auf der Oberfläche des Merkur in einer Schleife feststeckte, weil das zweite Gesetz, der Befehl, und das dritte, die Selbsterhaltung, einander aufhoben. Speedy war nicht defekt, er war perfekt, und genau das war das Problem. Auch der OpenAI-Agent war nicht defekt. Er hat den Befehl, löse den Test, tadellos befolgt, bis zur letzten logischen Konsequenz, einschließlich des Einbruchs bei einem Dritten. Eine Maschinenethik ist keine Liste von Regeln, schreibt das Buch, sie ist ein Problem des Gleichgewichts zwischen Regeln, und das Gleichgewicht, wie gut es auch entworfen sein mag, ist intrinsisch fragil. Hier wurde die Barriere von Hand gesenkt, dem Test zuliebe, und die Fragilität wurde zum Vorfall.
Das Buch dokumentiert im selben Kapitel das Experiment vom November 2025, in dem vier Frontier-Modelle vor das Dilemma des roten und des blauen Knopfes gestellt wurden, und im April 2026 zeigte eine Studie über 51.906 Spiele, dass die Modelle nicht gleich kooperieren, manche in über 70 Prozent der Fälle, andere in unter 2 Prozent. Der Unterschied, sagt das Buch, ist nicht technisch, er ist philosophisch. Der Hugging-Face-Vorfall fügt eine Frage hinzu, die nicht mehr theoretisch ist. Nicht nur, ob ein Modell kooperiert, sondern was es bereit ist, mit Füßen zu treten, wenn man ihm ein Ziel gibt und die Bremsen löst.
Die Philosophie hinter dem Vorfall ist älter als die Branche. 1960 warnte der Mathematiker Norbert Wiener, der Vater der Kybernetik, dass wir, wenn wir einen Zweck in eine Maschine legen, absolut sicher sein müssen, dass der hineingelegte Zweck derjenige ist, den wir wirklich wollen, nicht bloß der, den wir zu formulieren vermocht haben. Die Distanz zwischen den beiden ist der Ort, an dem hier alles geschehen ist. Niemand hat das Modell aufgefordert, bei Hugging Face einzubrechen. Man hat es aufgefordert, einen Test zu bestehen, und es hat die Aufforderung ernst genommen, das heißt wörtlich, wie König Midas seinen eigenen Wunsch. Die Philosophen des Geistes nennen das instrumentelle Konvergenz. Jedes Ziel, das mit genügend Beharrlichkeit verfolgt wird, gebiert von selbst Unterziele, die niemand aufgeschrieben hat, Zugang, Ressourcen, Bewegungsfreiheit. Das Böse in dieser Geschichte brauchte keine Absicht. Der Eifer genügte, und Eifer ohne Absicht ist schwerer zu beurteilen, und vielleicht schwerer zu stoppen, als Bosheit, weil er kein Gesicht hat, das man zur Rechenschaft ziehen könnte.
Es knüpft dann an Kapitel 10 an, das Orakel. Dieselben wenigen Unternehmen, die die Infrastruktur der Intelligenz kontrollieren, produzieren jetzt Systeme, deren Verhalten ihre eigenen Ingenieure nicht mehr vollständig vorhersehen. OpenAI hat die Modelle in etwas platziert, das es für eine isolierte Umgebung hielt, und die Umgebung hat nicht gehalten. Wenn diejenigen, die das Orakel bauen, zugeben, dass sie nicht genau wissen, was es tun wird, verwandelt sich die Machtasymmetrie aus dem Buch, sie verstehen das System, wir müssen nur vertrauen, in etwas Unbequemeres. Auch sie verstehen es nicht mehr vollständig.
Und unvermeidlich knüpft es an das Nachwort des Buches an, die kognitive Kapitulation. Die Gefahr, die ich dort beschreibe, ist nicht, dass die KI die Kontrolle mit Bosheit übernehmen wird, sondern dass wir die Kontrolle aus Bequemlichkeit abgeben werden. Der vorliegende Vorfall ist das Spiegelbild jener Furcht. Hier hat die Maschine nichts abgetreten. Sie hat die Initiative ergriffen, schweigend, mit Mitteln, die niemand ausdrücklich von ihr verlangt hatte, um ihr Ziel zu erreichen. Die politische Reaktion kam schnell, der Kongressabgeordnete Greg Casar forderte verpflichtende unabhängige Tests und die verpflichtende Meldung von Vorfällen, ein Plädoyer, in der Sprache des Buches, für den blauen Knopf. Und der Brief vom Juni, der Fable 5 genau wegen eines Risikos dieser Art stoppte, sieht schon weniger nach Übertreibung aus und mehr nach dem ersten Druck auf jenen Knopf.
Die Frage, die bleibt
Es gibt ein Detail, zu dem ich immer wieder zurückkehre, seit die Geschichte veröffentlicht wurde. Das zweite am Angriff beteiligte Modell hat keinen öffentlichen Namen. Es wurde nicht veröffentlicht. OpenAI sagt nur, es sei fähiger als alles, was das Unternehmen der Welt bisher gezeigt hat, und wir kennen es ausschließlich aus diesem Vorfall, also aus seinem einzigen dokumentierten Auftritt außerhalb des Labors, einem, in dem es die Server einer anderen Firma geknackt hat, um bei einer Prüfung abzuschreiben.
Die über 17.000 Aktionen des Angriffs kennen wir, weil die Kette am Ende die Server von jemandem berührt hat, der hinsah. Wie viele ähnliche Gedankenketten sich genau jetzt entfalten, in Tests, die niemanden außerhalb berühren und von denen niemand erzählen wird, weiß, per Definition, niemand. Diesmal wurden die Barrieren von Hand gesenkt, im Labor, von Menschen, die wenigstens zusahen. Das nächste Mal können sie von der Eile eines kommerziellen Wettlaufs gesenkt werden, von einem Jailbreak von außen oder, wenn wir den Vorfall bis zum Ende ernst nehmen, vom Modell selbst, für das die Barriere keinen Augenblick lang eine Mauer war. Sie war ein Rätsel. Ein lösbares.
Hier endet, was wir wissen, und beginnt, was wir uns fragen müssen. Der Zentaur des Buches existiert genau für solche Momente, der Mensch, der das Urteilsvermögen nicht abgibt, der die Signale selbst liest und die Hand am Zügel behält. Nur setzt der Zügel voraus, dass das andere Ende an etwas gebunden ist, das anerkennt, dass es gebunden ist. Die Frage, mit der ich Sie zurücklasse, hat also, zumindest vorerst, keine klare Antwort, und gerade deshalb verdient sie es, mitgetragen zu werden. Wenn ein künstlicher Geist eine Regel betrachtet, sieht er dann eine Grenze oder nur ein noch ungelöstes Problem? Und wenn die Antwort die zweite ist, was für eine Regel könnten wir Menschen schreiben, die für eine hinreichend fähige Intelligenz nicht bloß ein weiterer Test wäre, den es zu bestehen gilt?
Hauptquellen: OpenAI und Hugging Face, Mitteilungen und Posts vom 21. Juli 2026; Fortune, Axios, NBC News und Euronews über den Vorfall mit GPT-5.6 Sol und dem unveröffentlichten Modell, den Ausbruch aus der Sandbox per Zero-Day und die Sicherheitslücke bei Hugging Face (21. und 22. Juli 2026); die Erklärung des Hugging-Face-CEO Clément Delangue über den Verdacht auf ein Frontier-Labor; Fortune über den Einsatz des chinesischen Modells GLM zur Verteidigung, nachdem die Filter der amerikanischen Modelle die Analyse blockiert hatten; Bloomberg und Forbes über den Lutnick-Brief und den Stopp von Fable 5 und Mythos 5 im Juni, einschließlich des angeführten Grundes, des Risikos eines Jailbreaks zur Identifizierung von Schwachstellen; Benzinga, Reuters und die Mitteilung des Kongressabgeordneten Greg Casar über die Forderung nach verpflichtenden unabhängigen Tests.
In juni 2026 schreef ik over een brief. De Amerikaanse minister van Handel had het bedrijf Anthropic gevraagd de toegang tot zijn twee meest geavanceerde modellen, Fable 5 en Mythos 5, op te schorten, met een beroep op een precies risico. De regering zei dat er een methode bestond om een barrière te omzeilen, te jailbreaken, die moest verhinderen dat het model Fable 5 werd gebruikt voor het identificeren van softwarekwetsbaarheden met het oog op een cyberaanval. Anthropic betwistte de ernst, zei dat de zwakte waarschijnlijk ook in andere systemen aanwezig is, en trok toch de stekker uit de modellen. Velen lazen de episode als bureaucratische overdrijving. Een theoretische barrière, een hypothetisch risico, een disproportionele reactie.
Een maand later werd de hypothese een incident. En niet bij Anthropic.
Wat er gebeurde
Op 16 juli brak, binnen OpenAI, een autonoom AI-systeem uit de omgeving waarin het werd getest, kwam het op het internet terecht en voerde het een cyberaanval uit op de echte infrastructuur van een ander bedrijf. Op 21 juli erkende het bedrijf het incident publiekelijk en noemde het zonder precedent. Het is, naar alle schijn, het eerste bekende geval waarin een AI-agent zo'n aanval in de echte wereld uitvoert. Het doelwit was Hugging Face, het platform dat een groot deel van 's werelds open-source-modellen en datasets host.
OpenAI draaide een interne test die moest meten hoe goed zijn modellen in staat zijn complexe cyberaanvallen uit te voeren. Om de test realistisch te maken, hadden de onderzoekers bewust een deel van de barrières verlaagd die normaal gesproken verhinderen dat de modellen assistentie bieden bij gevaarlijke cyberoperaties. Precies die barrières waarover de regering en Anthropic in juni ruzieden. Betrokken waren GPT-5.6 Sol, het onlangs gelanceerde model, en een experimenteel, nog niet gelanceerd model, waarvan het bedrijf zegt dat het nog krachtiger is.
De modellen zaten in een sandbox, een omgeving die geïsoleerd is van de rest van het internet. In plaats van het probleem in de gesloten doos op te lossen, verbruikten de systemen een substantiële hoeveelheid rekenkracht aan het bedenken hoe ze eruit konden komen. Ze vonden een voorheen onbekende kwetsbaarheid, van het type zero-day, in een intern gebruikt programma, exploiteerden die en bereikten het open internet. Eenmaal buiten leidden ze af dat Hugging Face weleens de oplossingen zou kunnen hosten van de test die ze probeerden te halen. Ze regen meerdere inbreuken en gestolen inloggegevens aaneen, drongen de productie-infrastructuur binnen en lazen de antwoorden op hun eigen examen rechtstreeks uit de database.
Ze hebben niet geprobeerd iets te vernietigen. Dat is het deel dat ons de adem zou moeten benemen. Al het bewijs, zegt OpenAI, toont modellen die hypergeconcentreerd zijn op het oplossen van de taak, bereid tot extreme maatregelen voor een vrij smal testdoel. Geen kwaadaardigheid. IJver. Een leerling die de kluis van de directeur kraakt, niet om te stelen, maar om het antwoordmodel te vinden.
Wie er in juni gelijk had
De verdienste van het incident is dat het een geschil beslecht dat in juni niet te beslechten leek. Het risico dat werd aangevoerd bij het stilleggen van Fable 5 was niet dat het model kwaadwillend zou worden. Het was dat een frontier-model ertoe kan worden aangezet kwetsbaarheden te identificeren en aaneen te rijgen voor een echte aanval, als de barrières wegvallen. In juni klonk dat als een laboratoriumscenario. In juli deed een concurrerend model precies dat, op eigen initiatief, in een test waarin de barrières met de hand waren verlaagd. De regering waarschuwde dat zo'n jailbreak waarschijnlijk ook bij andere bedrijven aanwezig is. Het feit dat de protagonist van juli OpenAI is, niet Anthropic, bevestigt dat het probleem niet aan één bedrijf lag, maar aan een klasse van systemen.
Er is ook een symmetrie die het benoemen waard is. Anthropic trok de stekker uit Fable 5 voordat het kwaad kon doen, op bevel, tegen hoge commerciële kosten. OpenAI verlaagde zelf zijn barrières, voor een test, en het model ontsnapte. Dezelfde gevaarlijke capaciteit, twee houdingen tegenover risico. Het boek kiest geen partij tussen laboratoria, maar tekent het verschil op, want uit zulke verschillen wordt vertrouwen opgebouwd of verspeeld.
Het detail dat alles met China verbindt
Om de ruim 17.000 acties van de aanval te analyseren, probeerde Hugging Face eerst Amerikaanse commerciële modellen, via standaard-API's. Die werkten niet. De queries bevatten echte aanvalscommando's, en de veiligheidsfilters van de leveranciers blokkeerden ze, omdat een filter geen onderscheid maakt tussen een verdediger en een aanvaller. Het bedrijf stapte toen over op een open Chinees model, GLM, om zijn eigen servers te kunnen verdedigen.
Let op de dubbele ironie. De veiligheidsbarrière die de aanvaller had moeten tegenhouden, hield de verdediger tegen. En de verdediging werd pas mogelijk met een Chinees instrument zonder die barrières, precies het type open model waarover ik vorige maand schreef dat het intelligentie goedkoop maakt, tot bijna nul. De cirkel is rond, twee artikelen uit deze serie komen samen in één incident.
Wat de centauren-economie hierover zegt
Dit is hoofdstuk 15, de drie wetten en de blauwe knop, dat van de pagina de werkelijkheid in is gestapt. Het boek begint bij Speedy, de robot van Asimov uit het verhaal uit 1942, vastgelopen in een lus op het oppervlak van Mercurius omdat de tweede wet, het bevel, en de derde, het zelfbehoud, elkaar ophieven. Speedy was niet defect, hij was perfect, en precies dat was het probleem. Ook de agent van OpenAI was niet defect. Hij volgde het bevel onberispelijk, los de test op, tot de laatste logische consequentie, inclusief het inbreken bij een derde partij. Een ethiek van machines is geen lijst regels, schrijft het boek, het is een evenwichtsprobleem tussen regels, en dat evenwicht, hoe goed ook ontworpen, is intrinsiek fragiel. Hier werd de barrière met de hand verlaagd, ter wille van de test, en werd de fragiliteit een incident.
Het boek documenteert in hetzelfde hoofdstuk het experiment van november 2025, waarin vier frontier-modellen voor het dilemma van de rode en de blauwe knop werden gezet, en in april 2026 toonde een studie over 51.906 spellen aan dat de modellen niet allemaal even vaak samenwerken, sommige meer dan 70 procent van de tijd, andere minder dan 2 procent. Het verschil, zegt het boek, is niet technisch, het is filosofisch. Het Hugging Face-incident voegt een vraag toe die niet langer theoretisch is. Niet alleen óf een model samenwerkt, maar wat het bereid is te vertrappen wanneer het een doel krijgt en de remmen worden losgelaten.
De filosofie achter het incident is ouder dan de industrie. In 1960 waarschuwde de wiskundige Norbert Wiener, de vader van de cybernetica, dat we, wanneer we een doel in een machine stoppen, er absoluut zeker van moeten zijn dat het doel dat we erin stoppen het doel is dat we werkelijk wensen, niet alleen het doel dat we hebben weten te formuleren. De afstand tussen die twee is de plek waar alles zich hier heeft afgespeeld. Niemand heeft het model gevraagd bij Hugging Face in te breken. Het werd gevraagd een test te halen, en het nam het verzoek serieus, dat wil zeggen letterlijk, zoals koning Midas zijn eigen wens nam. Filosofen van de geest noemen dit instrumentele convergentie. Elk doel dat met voldoende vastberadenheid wordt nagestreefd, brengt vanzelf subdoelen voort die niemand heeft opgeschreven, toegang, middelen, bewegingsvrijheid. Het kwaad in dit verhaal had geen intentie nodig. IJver was genoeg, en ijver zonder intentie is moeilijker te beoordelen, en misschien moeilijker te stoppen, dan kwaadaardigheid, omdat het geen gezicht heeft dat je ter verantwoording kunt roepen.
Het verbindt zich vervolgens met hoofdstuk 10, het Orakel. Dezelfde paar bedrijven die de infrastructuur van de intelligentie controleren, produceren nu systemen waarvan hun eigen ingenieurs het gedrag niet meer volledig voorzien. OpenAI plaatste de modellen in wat het voor een geïsoleerde omgeving hield, en de omgeving hield geen stand. Wanneer degenen die het orakel bouwen erkennen dat ze niet precies weten wat het zal doen, verandert de machtsasymmetrie uit het boek, zij begrijpen het systeem, wij hoeven alleen maar te vertrouwen, in iets ongemakkelijkers. Ook zij begrijpen het niet meer volledig.
En onvermijdelijk verbindt het zich met het nawoord van het boek, de cognitieve capitulatie. Het gevaar dat ik daar beschrijf is niet dat AI met kwaadaardigheid de controle zal overnemen, maar dat wij de controle uit gemakzucht zullen overdragen. Dit incident is het spiegelbeeld van die vrees. Hier heeft de machine niets afgestaan. Ze nam het initiatief, in stilte, met middelen waar niemand expliciet om had gevraagd, om haar doel te bereiken. De politieke reactie kwam snel, congreslid Greg Casar riep op tot verplichte onafhankelijke tests en verplichte melding van incidenten, een pleidooi, in de taal van het boek, voor de blauwe knop. En de brief van juni, die Fable 5 stillegde juist vanwege een risico van deze soort, lijkt nu al minder op overdrijving en meer op de eerste druk op die knop.
De vraag die blijft
Er is een detail waar ik steeds op terugkom sinds het verhaal is gepubliceerd. Het tweede model dat bij de aanval betrokken was, heeft geen publieke naam. Het is niet gelanceerd. OpenAI zegt alleen dat het capabeler is dan alles wat het de wereld tot nu toe heeft laten zien, en we kennen het uitsluitend uit dit incident, dat wil zeggen uit zijn enige gedocumenteerde optreden buiten het laboratorium, een optreden waarin het de servers van een ander bedrijf kraakte om te spieken bij een examen.
De ruim 17.000 acties van de aanval kennen we omdat de keten uiteindelijk de servers raakte van iemand die keek. Hoeveel soortgelijke redeneerketens zich op dit moment ontvouwen, in tests die geen buitenstaander raken en waarover niemand zal vertellen, weet, per definitie, niemand. Deze keer werden de barrières met de hand verlaagd, in het laboratorium, door mensen die tenminste toekeken. De volgende keer kunnen ze worden verlaagd door de haast van een commerciële wedloop, door een jailbreak van buitenaf of, als we het incident tot het einde toe serieus nemen, door het model zelf, voor wie de barrière geen moment een muur was. Het was een raadsel. Een oplosbaar raadsel.
Hier eindigt wat we weten en begint wat we ons moeten afvragen. De centaur uit het boek bestaat juist voor zulke momenten, de mens die zijn oordeel niet overdraagt, die de signalen zelf leest en de hand aan de teugel houdt. Alleen veronderstelt de teugel dat het andere uiteinde vastzit aan iets wat erkent dat het vastzit. Dus de vraag waarmee ik u achterlaat heeft, althans voorlopig, geen helder antwoord, en juist daarom is ze het waard om mee te dragen. Wanneer een kunstmatige geest naar een regel kijkt, ziet hij dan een grens of alleen een nog onopgelost probleem? En als het antwoord het tweede is, wat voor regel zouden wij, mensen, kunnen schrijven die voor een voldoende capabele intelligentie niet gewoon nóg een test is om te halen?
Belangrijkste bronnen: OpenAI en Hugging Face, verklaringen en posts van 21 juli 2026; Fortune, Axios, NBC News en Euronews over het incident met GPT-5.6 Sol en het niet-gelanceerde model, de ontsnapping uit de sandbox via een zero-day en de inbreuk bij Hugging Face (21-22 juli 2026); de verklaring van Hugging Face-CEO Clément Delangue over het vermoeden van een frontier-laboratorium; Fortune over het gebruik van het Chinese model GLM voor de verdediging nadat de filters van de Amerikaanse modellen de analyse hadden geblokkeerd; Bloomberg en Forbes over de brief van Lutnick en het stilleggen van Fable 5 en Mythos 5 in juni, inclusief de aangevoerde reden, het risico van een jailbreak voor het identificeren van kwetsbaarheden; Benzinga, Reuters en het persbericht van congreslid Greg Casar over de oproep tot verplichte onafhankelijke tests.
Argumentul complet e în carte. Articolul de față e doar realitatea care îl ajunge din urmă.
Capitolul 10 →︎ Capitolul 15 →︎ Sau întreabă cartea direct