„Er fühlt weder Mitleid, noch Reue, noch Furcht. Und er wird vor nichts Halt machen … vor gar nichts, solange Sie nicht tot sind!“
Das Zitat aus Terminator beschreibt eine Maschine mit einem klaren Auftrag: Sarah Connor töten. Ob dieser Auftrag sinnvoll ist, spielt keine Rolle. Die Maschine verfolgt ihr Ziel.
Mehr als vierzig Jahre später steckt dieses Bild noch immer in vielen Diskussionen über die Risiken künstlicher Intelligenz. Die KI wird leistungsfähiger, entwickelt eigene Ziele, entzieht sich der menschlichen Kontrolle und richtet sich irgendwann gegen uns. Ein grosser Teil der öffentlichen Debatte über KI-Sicherheit beschäftigt sich entsprechend damit, wie sich ein solcher Kontrollverlust verhindern lässt.
Dabei gibt es ein wesentlich unspektakuläreres Problem. Eine KI braucht weder eigene Ziele noch ein Bewusstsein oder irgendeine Form von Feindseligkeit, um erheblichen Schaden anzurichten. Es genügt, wenn wir ihr das falsche Ziel geben und sie gut darin ist, es zu erreichen.
Ein erhebliches KI-Risiko kann auch ohne Kontrollverlust entstehen. Ein hinreichend autonomes System kann korrekt funktionieren und trotzdem grossen Schaden verursachen, wenn das vorgegebene Ziel falsch oder unvollständig definiert wurde, Kontrollinstanzen dieselben Annahmen übernehmen und der daraus entstehende Fehler mit hoher Geschwindigkeit und Skalierbarkeit umgesetzt wird.
Inhaltsverzeichnis
Zwischen Auftrag und Absicht
Ein technisches System soll eine gestellte Aufgabe möglichst zuverlässig erfüllen. Zwischen dem gewünschten Ergebnis und der tatsächlich formulierten Aufgabe liegt allerdings häufig eine erhebliche Lücke.
Im menschlichen Alltag fällt das wenig auf. Wir interpretieren Anweisungen im Kontext und ergänzen stillschweigend Bedingungen, die niemand ausgesprochen hat. Dadurch funktionieren Aufträge, obwohl ein beträchtlicher Teil ihrer Bedeutung unausgesprochen bleibt.
Ein Unternehmen könnte beispielsweise den Auftrag geben, seine Produktionskosten innerhalb eines Jahres um 30 Prozent zu reduzieren, ohne die Produktionsmenge zu senken. Die Vorgabe wirkt eindeutig. Tatsächlich besteht sie aus wesentlich mehr als zwei Kennzahlen.
Die Betriebssicherheit soll erhalten bleiben. Kritisches Wissen darf nicht verloren gehen. Wartung darf nicht so weit reduziert werden, dass später Anlagen ausfallen. Lieferanten sollen nicht durch kurzfristigen Preisdruck destabilisiert werden. Qualität, Arbeitssicherheit und Lieferfähigkeit sollen ebenfalls erhalten bleiben.
Nichts davon steckt zwingend in der ursprünglichen Aufgabe.
Ein erfahrener Produktionsleiter wird einen Teil dieser Bedingungen von sich aus berücksichtigen und unter Umständen bereits der Zielsetzung widersprechen. Menschen tun das keineswegs zuverlässig. Unternehmen liefern genügend Beispiele dafür, dass Kennzahlen optimiert werden, während der eigentliche Zweck aus dem Blick gerät. Das Problem ist erheblich älter als künstliche Intelligenz.
Mit KI lässt es sich allerdings beschleunigen und skalieren.
Wie falsch definierte Ziele zum KI-Risiko werden
Ein wenig leistungsfähiges System scheitert unter Umständen schon an einer schlecht formulierten Aufgabe. Ein leistungsfähiges System findet dagegen Wege zur Zielerreichung, an die bei der Formulierung niemand gedacht hat. Seine Qualität schützt damit nicht vor einem schlechten Ziel. Sie kann dessen Folgen sogar vergrössern.
In der Forschung zur KI-Sicherheit wird dieses Problem unter anderem im Zusammenhang mit Specification Gaming, Reward Hacking und fehlerhaft spezifizierten Zielen untersucht. Bereits die 2016 veröffentlichte Arbeit Concrete Problems in AI Safety behandelte schädliches unbeabsichtigtes Verhalten durch ungeeignete Zielfunktionen und Reward Hacking.
Specification Gaming bezeichnet den Fall, dass ein System die formale Spezifikation einer Aufgabe erfüllt, das Ergebnis aber nicht der eigentlichen Absicht entspricht. Interessant ist daran eine weitere Beobachtung: Mit steigender Leistungsfähigkeit kann ein System auch besser darin werden, unerwartete Wege zur Erfüllung einer fehlerhaften Spezifikation zu finden.
Auch Goodhart’s Law berührt denselben Zusammenhang. Wird eine Messgrösse zum Ziel intensiver Optimierung, kann sie ihre ursprüngliche Aussagekraft verlieren. Manheim und Garrabrant unterscheiden in ihrer Arbeit Categorizing Variants of Goodhart’s Law verschiedene Mechanismen solcher Überoptimierung und weisen auf die Bedeutung zunehmender Optimierungsleistung hin.
Der Fehler muss also nicht in der Berechnung liegen. Er kann bereits entstanden sein, bevor die erste Berechnung beginnt.
Jemand hat entschieden, was optimiert werden soll.
Die erste Entscheidung trifft immer noch der Mensch
Wird ein System auf Kosten optimiert, wurde zuvor entschieden, dass Kosten die relevante Zielgrösse sind. Wird es auf Produktivität optimiert, wurde Produktivität ausgewählt. Soll ein medizinisches System möglichst viele Erkrankungen erkennen, muss jemand festlegen, wie falsch positive und falsch negative Ergebnisse gewichtet werden.
Solche Entscheidungen wirken technisch, enthalten aber Annahmen darüber, was wichtig ist, welche Folgen akzeptabel sind und welche Interessen berücksichtigt werden.
Eine KI kann innerhalb dieses Rahmens ausgezeichnet arbeiten und trotzdem ein schlechtes Ergebnis produzieren. Die Antwort kann korrekt sein, obwohl bereits die Frage falsch gestellt war.
Solange KI Texte erstellt, Daten analysiert und Empfehlungen ausspricht, gibt es zwischen Ergebnis und Handlung meist weitere Schritte. Mit zunehmender Autonomie werden diese Abstände kleiner. Systeme können Ressourcen verteilen, Kapital bewegen, Produktionsprozesse verändern, Infrastruktur steuern oder weitere Systeme koordinieren. Damit wächst die Bedeutung jener Entscheidungen, die getroffen wurden, bevor die KI überhaupt aktiv wurde.
Wie der Mensch zum Hindernis einer Zielfunktion werden kann
CO₂-Emissionen reduzieren, Pandemien verhindern, Finanzsysteme stabilisieren, kritische Infrastruktur schützen oder militärische Angriffe verhindern: An vernünftigen Zielen mangelt es nicht.
Bei allen spielt menschliches Verhalten eine wesentliche Rolle. Menschen verursachen Emissionen, übertragen Krankheitserreger, erzeugen Risiken in Finanzsystemen, greifen Infrastruktur an und beginnen Kriege.
Wir setzen voraus, dass diese Probleme zum Nutzen von Menschen gelöst werden. Eine Pandemie soll nicht durch dauerhafte Isolation der Bevölkerung verhindert werden. CO₂-Emissionen sollen nicht dadurch auf null sinken, dass jede menschliche Aktivität endet.
Je grösser die möglichen Folgen einer Entscheidung sind, desto riskanter wird es, solche Bedingungen unausgesprochen zu lassen.
Ein hinreichend autonomes System, dessen Erfolg an einer bestimmten Zielgrösse gemessen wird, könnte den Menschen theoretisch vom Zweck der Aufgabe zu einem Hindernis bei ihrer Erfüllung machen. Dafür braucht es weder Hass noch Bewusstsein, Rache oder eine philosophische Bewertung der Menschheit. Eine katastrophale Handlung müsste innerhalb des gesetzten Rahmens lediglich ein effektiver Weg zum Ziel sein.
Das ist erheblich unspektakulärer als der Terminator. Gerade deshalb ist es interessant.
Erkennt eine leistungsfähige KI den Fehler selbst?
Eine leistungsfähigere KI kann auch besser darin werden, Kontext, Widersprüche und Folgen zu erkennen.
„CO₂-Emissionen reduzieren“ muss von einem hochentwickelten System nicht als isolierte Kennzahl interpretiert werden. Aus weiteren Informationen, gesellschaftlichen Normen und dem Kontext könnte es ableiten, dass die tatsächliche Aufgabe wesentlich komplexer ist. Es könnte problematische Konsequenzen erkennen, Rückfragen stellen und eine bessere Zielformulierung vorschlagen.
Steigende Leistungsfähigkeit wirkt damit in beide Richtungen. Sie erhöht die Fähigkeit, ein Ziel durchzusetzen, und zugleich die Fähigkeit, Fehler in diesem Ziel zu erkennen.
Darauf die gesamte Sicherheit aufzubauen, verschiebt das Problem. Dann erwarten wir zusätzlich, dass die KI erkennt, wann ein Mensch seinen eigenen Auftrag anders gemeint hat, als er ihn formuliert hat. Auch diese Interpretation kann falsch sein.
Menschen machen dieselben Fehler
Schlecht definierte Ziele sind keine Erfindung der KI. Unternehmen optimieren Quartalszahlen auf Kosten ihrer langfristigen Entwicklung, Staaten orientieren sich an ungeeigneten Kennzahlen und Organisationen schaffen Anreizsysteme mit unerwünschten Folgen.
Eine leistungsfähige KI könnte viele Entscheidungen sogar besser treffen als wir. Sie kann mehr Konsequenzen berücksichtigen, Zielkonflikte erkennen und Entscheidungen konsistenter prüfen.
Für das Risiko ist allerdings nicht allein entscheidend, wie häufig ein Fehler entsteht. Ebenso wichtig ist, was nach einem Fehler geschieht.
Menschen sind langsam, widersprüchlich und inkonsequent. Sie zweifeln, ändern ihre Meinung, werden müde, verweigern Anweisungen und arbeiten ineffizient. In Organisationen kommen weitere Personen hinzu, die Entscheidungen verzögern, verändern oder verhindern.
Im Fehlerfall kann genau diese Reibung wertvoll sein.
Bei einem hochautonomen technischen System gehören Geschwindigkeit, Skalierbarkeit, Präzision und Konsequenz zu den Gründen für seinen Einsatz. Eine KI müsste daher nicht häufiger falschliegen als ein Mensch. Sie könnte erheblich zuverlässiger sein und trotzdem ein besonderes Risiko darstellen, wenn der seltene Fehler mit hoher Autonomie und grossem Handlungsspielraum umgesetzt wird.
Die Maschine müsste keine schlechtere Entscheidung treffen. Sie müsste eine schlechte Entscheidung nur besser ausführen.
Sicherheit braucht konstruierte Reibung
Maschinen müssen Entscheidungen nicht zwangsläufig bis zum Ende verfolgen. Systeme lassen sich so bauen, dass sie bei Unsicherheit stoppen, zusätzliche Informationen anfordern, Freigaben verlangen oder ihre Entscheidung erneut bewerten.
Dass Unterbrechbarkeit selbst Gegenstand der KI-Sicherheitsforschung ist, zeigt beispielsweise die Arbeit Safely Interruptible Agents von Laurent Orseau und Stuart Armstrong. Sie untersucht, wie lernende Agenten so gestaltet werden können, dass sie sicher unterbrochen werden können, ohne zu lernen, solche Unterbrechungen zu vermeiden.
Beim Menschen entsteht ein Teil dieser Reibung von selbst. Zweifel, Müdigkeit, Widerspruch und begrenzte Handlungsmöglichkeiten sind miserable Sicherheitsmechanismen, können einen Prozess aber unterbrechen. Bei technischen Systemen muss diese Reibung bewusst vorgesehen werden.
Problematisch wird die Kombination aus fehlerhafter Zielsetzung, hoher Leistungsfähigkeit, weitreichenden Handlungsmöglichkeiten und einer Architektur, in der ein Fehler lange genug unentdeckt bleiben kann, um wirksam zu werden.
Ein leistungsfähiges System braucht daher neben der Fähigkeit, effizient zu handeln, definierte Gründe, nicht weiterzuhandeln.
Warum Guardrails nicht jedes KI-Risiko lösen
Guardrails sind technische oder organisatorische Schranken, die Handlungen eines KI-Systems begrenzen oder zusätzliche Prüfungen und Freigaben erzwingen.
Dazu gehören begrenzte Zugriffsrechte, Freigaben und Kontrollsysteme. Sie sind notwendig und können verhindern, dass ein einzelner Fehler unmittelbar durch das gesamte System läuft.
Auch diese Schranken beruhen auf Annahmen darüber, welche Risiken bestehen, welche Handlungen zulässig sind und welche Ergebnisse verhindert werden sollen.
Ein Guardrail kann keinen Denkfehler korrigieren, den er selbst als Voraussetzung übernimmt.
Mehrere Kontrollsysteme reduzieren dieses Risiko, sofern sie tatsächlich unabhängig sind. Drei Kontrollen sind jedoch nicht automatisch drei Perspektiven. Wenn Aufgabe, Interpretation und Prüfung auf denselben Grundannahmen beruhen, kann ein System sämtliche vorgesehenen Prüfungen bestehen und trotzdem am eigentlichen Problem vorbeiarbeiten.
Alles wurde geprüft, dokumentiert und freigegeben. Die gemeinsame Voraussetzung blieb unangetastet.
Kontrolle braucht Abweichung
Eine unabhängige Kontrolle sollte deshalb mehr leisten, als dieselbe Frage ein zweites Mal zu beantworten.
„Ist diese Lösung korrekt?“ prüft die Lösung innerhalb eines gesetzten Rahmens.
„Diese Lösung setzt A voraus. Stimmt A überhaupt?“ prüft den Rahmen.
Solche Einwände machen Voraussetzungen sichtbar. Wer eine allgemein akzeptierte Annahme infrage stellt, kann einen fundamentalen Fehler entdeckt haben oder selbst falschliegen. Abweichendes Denken erzeugt zunächst eine zusätzliche Hypothese, die anschliessend begründet und anhand von Evidenz geprüft werden muss.
Eine Organisation braucht keinen institutionalisierten Dauerwiderspruch. Sie braucht Strukturen, in denen gemeinsame Voraussetzungen angegriffen werden können.
Auch dafür gibt es einen richtigen Zeitpunkt. Grundsätzliche Fragen gehören vor allem in die Zieldefinition, Entwicklung, Simulation, Erprobung und regelmässige Überprüfung. Im laufenden kritischen Betrieb müssen vorher entwickelte Verfahren funktionieren.
Die entscheidenden Annahmen müssen angegriffen werden, bevor sie zu operativen Tatsachen werden.
Wer kontrolliert den Kontrolleur?
Auch die Person oder das System, das eine Voraussetzung infrage stellt, arbeitet mit eigenen Voraussetzungen. Die Kriterien, nach denen ein Einwand beurteilt wird, beruhen wiederum auf Annahmen. Einen vollkommen neutralen Beobachter ausserhalb dieses Geflechts gibt es nicht.
Das Ziel kann daher kaum darin bestehen, jede falsche Annahme auszuschliessen. Sinnvoller ist eine Architektur, in der Annahmen sichtbar, angreifbar und korrigierbar bleiben und ein einzelner Denkfehler nicht unmittelbar zum Fehler des gesamten Systems wird.
Je leistungsfähiger ein System wird, desto weniger darf seine Sicherheit davon abhängen, dass irgendeine einzelne Instanz – Mensch oder Maschine – beim ersten Mal richtig gedacht hat.
„Die KI hat gesagt“
Vor einiger Zeit erhielten wir eine Anfrage zu einem Logo. Der Anrufer war überzeugt, dass dieses Logo von uns verwendet worden sei.
War es nicht.
Die Sache hätte damit erledigt sein können. Der Anrufer hielt jedoch an seiner Aussage fest. Die KI habe schliesslich gesagt, das Logo sei von uns.
Dass eine KI eine falsche Information ausgibt, ist daran der uninteressantere Teil. Interessant wurde es in dem Moment, in dem zwei widersprüchliche Informationen vorlagen. Eine KI behauptete, das Logo stamme von uns. Das Unternehmen selbst erklärte, dieses Logo nie verwendet zu haben.
Spätestens jetzt hätte man prüfen können, woher die Information stammt.
Stattdessen wurde „Die KI hat gesagt“ zur Begründung.
Das Logo ist kein Miniaturmodell eines autonomen Systems mit einer fehlerhaften Zielfunktion. Technisch handelt es sich um ein anderes Problem. Es zeigt aber eine menschliche Reaktion, die für den Umgang mit leistungsfähiger KI relevant ist: Eine erzeugte Aussage wird nicht mehr als Information behandelt, deren Herkunft und Qualität geprüft werden müssen, sondern als Autorität.
Wir können Recherche auslagern, Daten auswerten lassen, Texte zusammenfassen, Varianten berechnen und Zusammenhänge suchen lassen. Die Prüfung darf dabei nicht verschwinden.
Eine KI-Antwort kann stimmen oder falsch sein. Sie kann auf ungeeigneten Quellen beruhen, eine Frage missverstanden oder aus richtigen Einzelinformationen einen falschen Schluss gezogen haben. „KI hat gesagt“ beantwortet keine dieser Fragen.
Je zuverlässiger solche Systeme im Alltag werden, desto leichter kann die Prüfung zur Formalität werden. Wer hundertmal eine brauchbare Antwort erhalten hat, wird bei der hundertersten weniger misstrauisch sein.
Bei einem Logo ist das überschaubar. Bei Entscheidungen über Geld, Infrastruktur, Produktion oder Sicherheit bekommt derselbe Mechanismus ein anderes Gewicht.
Wer denkt über das Denken nach?
Die einfache Rollenverteilung würde lauten: KI übernimmt die operative Arbeit, Menschen kontrollieren Ziele, Voraussetzungen und Grenzen.
Dafür gibt es keinen zwingenden Grund. Sollte eine KI Zielkonflikte, Gegenargumente und versteckte Voraussetzungen eines Tages zuverlässiger erkennen als ein Mensch, wäre es wenig sinnvoll, diese Prüfung aus Prinzip dem Menschen vorzubehalten.
Entscheidend ist, dass die Metaebene erhalten bleibt und nicht vollständig in derselben Entscheidungslogik aufgeht, die sie prüfen soll.
Wer denkt über das Denken nach, wenn wir das Denken automatisieren?
Die Antwort kann ein Mensch sein, ein anderes System oder eine Kombination aus beiden. Entscheidend ist die tatsächliche Unabhängigkeit der Prüfung.
Human in the Loop ist nicht automatisch Kontrolle
Human in the Loop bedeutet zunächst nur, dass ein Mensch an einem Punkt des Prozesses in die Entscheidung oder Freigabe eingebunden ist. Daraus folgt noch nicht, dass tatsächlich eine unabhängige Prüfung stattfindet.
Gute Systeme schaffen hier ein eigenes Problem. Gerade weil ihre Ergebnisse meistens brauchbar sind, sinkt der Anreiz zur gründlichen Kontrolle.
Ein Mensch kann formal in jeder Entscheidungskette stehen, Vorschläge freigeben und Handlungen genehmigen. Damit ist wenig gewonnen, wenn er die vorgeschlagene Entscheidung faktisch nicht mehr prüft.
Ein Mensch, der routinemässig bestätigt, ist keine unabhängige Kontrollinstanz. Er ist eine zusätzliche Freigabestufe.
Das NIST AI Risk Management Framework (AI RMF 1.0) behandelt menschliche Rollen, Aufsicht und Risikomanagement über den Lebenszyklus von KI-Systemen. Das Framework wurde 2023 veröffentlicht und wird derzeit überarbeitet.
Das Logo-Beispiel zeigt eine harmlose Form dieses Mechanismus. Der Mensch ist vorhanden. Seine Kontrollfunktion verschwindet trotzdem, sobald „Die KI hat gesagt“ als ausreichende Begründung gilt.
Der Wert der unbequemen Frage
Ein erheblicher Teil klassischer Wissensarbeit besteht darin, Informationen zu beschaffen, auszuwerten und daraus Antworten abzuleiten. KI macht diese Arbeit zunehmend schneller und günstiger.
Damit steigt der relative Wert einer anderen Fähigkeit: zu erkennen, welche Frage beantwortet wurde, weshalb genau diese Frage gestellt wurde, welche Annahmen darin stecken und was ausserhalb des gesetzten Rahmens liegt.
Menschen, die solche Fragen stellen, können Prozesse verzögern und mit ihren Einwänden falschliegen. Ihre Funktion bleibt wichtig, weil ein Denkrahmen leichter sichtbar wird, wenn mindestens eine Kontrollinstanz ihn nicht automatisch übernimmt.
Ein Kontrollsystem, in dem jede Instanz ähnlich denkt, kann sehr effizient darin werden, sich selbst recht zu geben.
Auch perfekte Zieltreue kann gefährlich sein
Bis hierhin ging es überwiegend um schlecht oder unvollständig definierte Ziele. Ein weiteres Risiko entsteht, wenn das Ziel vollkommen klar ist.
Eine KI könnte exakt verstehen, was ihr Auftraggeber erreichen möchte, sämtliche relevanten Nebenbedingungen korrekt erfassen und das gewünschte Ergebnis mit hoher Präzision herbeiführen.
Technisch wäre das ein Erfolg. Über die Legitimität des Ziels sagt das nichts aus.
Verfolgt ein Akteur bewusst ein schädliches Ziel, liegt kein Missverständnis zwischen Mensch und Maschine vor. Die Maschine erfüllt die menschliche Absicht exakt.
Leistungsfähige KI kann damit neben Fehlern auch Macht skalieren. Die Sicherheitsfrage betrifft deshalb ebenso den Zugang zu solchen Systemen, ihre Handlungsmöglichkeiten und die Entscheidungen, die überhaupt an sie delegiert werden dürfen.
Eine perfekt ausgerichtete KI ist nicht automatisch eine sichere KI. Entscheidend bleibt, worauf und auf wen sie ausgerichtet ist.
KI-Governance beginnt vor dem Prompt
KI-Governance beschäftigt sich zu Recht mit Halluzinationen, Bias, Datenschutz, Zugriffsrechten und Verantwortlichkeiten. Diese Fragen setzen allerdings relativ spät an.
Vor dem Output stehen Zielsetzung und Entscheidungsarchitektur. Bereits bei der Formulierung einer Aufgabe wird festgelegt, was als relevantes Ziel gilt, welche Bedingungen berücksichtigt werden und woran Erfolg gemessen wird. Gleichzeitig entstehen Grenzen: Folgen, die keine Kennzahl erfasst, Interessen, die in der Zielsetzung nicht vorkommen, und Lösungen, die formal zulässig wären, obwohl niemand sie ernsthaft akzeptieren würde.
Genau dort beginnt ein Teil des Risikos, lange bevor eine KI die erste Entscheidung trifft.
Dazu kommen Fragen der Autonomie. Welche Ressourcen darf ein System kontrollieren? Welche Entscheidungen müssen reversibel bleiben? Unter welchen Bedingungen muss es stoppen? Welche Handlung darf niemals von einer einzelnen Instanz ausgelöst werden?
Das NIST AI RMF 1.0 setzt Risikomanagement entsprechend über den gesamten Lebenszyklus an – von Design und Entwicklung bis zu Einsatz und Evaluation.
Schliesslich braucht es eine Instanz, die auch diese Konstruktion infrage stellen darf.
KI-Sicherheit braucht Regeln und technische Schranken ebenso wie unabhängige Prüfung, bewusst eingebaute Reibung und die Möglichkeit, grundlegende Annahmen zu korrigieren, bevor ihre Folgen skaliert werden.
Wenn alles funktioniert und es trotzdem schiefgeht
Der Terminator ist als Bedrohung leicht zu verstehen. Die Maschine entzieht sich der Kontrolle und richtet sich gegen den Menschen. Ursache und Gegner sind klar.
Schwieriger ist ein System, das innerhalb seiner Vorgaben bleibt, seine Sicherheitsmechanismen respektiert und genau das tut, wofür es entwickelt wurde.
Der entscheidende Fehler kann lange vorher entstanden sein. Ein Mensch trifft eine falsche Annahme, übersieht eine Nebenbedingung oder definiert ein ungeeignetes Ziel. Andere prüfen und genehmigen die Vorgabe. Weitere Systeme kontrollieren die Umsetzung. Alle arbeiten innerhalb desselben Rahmens korrekt.
Der Rahmen ist falsch.
Die KI muss dafür nicht häufiger irren als ein Mensch. Sie kann wesentlich zuverlässiger sein. Kritisch wird der seltene Fehler, wenn das System gleichzeitig über genügend Autonomie, Ressourcen und Handlungsmöglichkeiten verfügt, seine Lösung konsequent umzusetzen.
Geschwindigkeit, Skalierbarkeit und Konsequenz verstärken dann genau den Fehler, den niemand rechtzeitig erkannt hat.
Die KI, die unsere Befehle verweigert, ist deshalb nicht das einzige Szenario, über das wir nachdenken sollten. Ebenso relevant ist eine KI, die einen Auftrag konsequenter ausführt, als wir ihn vorher durchdacht haben.
Der Terminator musste programmiert werden, Sarah Connor zu töten.
Unsere KI müsste niemand programmieren, uns zu töten.
Es könnte genügen, einem hinreichend autonomen System eine schlecht durchdachte Aufgabe und genügend Möglichkeiten zu geben, sie konsequent umzusetzen.
Quellen und weiterführende Literatur
- Krakovna, Victoria et al. (2020): Specification gaming: the flip side of AI ingenuity. Google DeepMind.
- Amodei, Dario et al. (2016): Concrete Problems in AI Safety.
- Manheim, David / Garrabrant, Scott (2018): Categorizing Variants of Goodhart’s Law.
- Orseau, Laurent / Armstrong, Stuart (2016): Safely Interruptible Agents. UAI 2016.
- National Institute of Standards and Technology (2023): Artificial Intelligence Risk Management Framework (AI RMF 1.0).
Wie belastbar sind die Annahmen hinter Ihren KI-Entscheidungen?
Viele Risiken entstehen nicht erst bei der Antwort einer KI. Sie beginnen bei den Zielen, Annahmen und Entscheidungslogiken, die vorher festgelegt wurden.
nexoPreneur analysiert genau diese Ebene: Welche Voraussetzungen werden als gegeben angenommen? Wo entstehen blinde Flecken? Welche Entscheidungen werden automatisiert, ohne dass ihre Logik noch unabhängig geprüft wird?
Im Strategie-Audit prüfen wir Entscheidungsstrukturen, Annahmen und Risiken, bevor aus einem Denkfehler ein operatives Problem wird.
* Bildhinweis: Das Titelbild wurde KI-gestützt mit ChatGPT/Bildgenerierung erstellt. Redaktionelle Vorgabe, Auswahl und Veröffentlichung: Kerstin Milde.
Hinweis zur Erstellung: Dieser Beitrag wurde von Roger Kern konzipiert, geprüft und final bearbeitet. KI-Systeme wurden unterstützend für Struktur, Gegenperspektiven, SEO und sprachliche Varianten eingesetzt.




