Reifegrad ethischer und verantwortungsvoller KI-Modelle
Ihre Praktiken zu verantwortungsvoller KI, gemessen je Themenfeld und in eine Roadmap uebersetzt.
10 Themenfelder, eine Skala mit 5 Stufen. Und die Maßnahme, die von einer Stufe zur nächsten führt.
Die 10 Themenfelder des Referenzrahmens, bereits ausformuliert von N1 bis N5. Ein Unternehmen, eine Business Unit, oder 300 gleichzeitig.
Reifegrad ethischer und verantwortungsvoller KI-Modelle
10 Themenfelder, Skala mit 5 Stufen.
Nordhavn Industries
53 / 100
Sie messen ihren Reifegrad mit Datamensio
Ein Beispiel
Diese Situation könnte auch Ihre sein.
Nehmen wir das Beispiel eines Unternehmens: drei Standorte, drei Tabellen, keine gemeinsame Antwort.
Niemand weiß, wie man konsolidiert.
Nordhavn Industries, 2 400 Mitarbeitende in Hamburg, Lyon und Porto. Ein Auftraggeber fragt nach dem Stand des Konzerns. Jeder Standort antwortet mit seiner eigenen Tabelle und seinen eigenen Skalen.
Drei Wochen, eine einzige Grundlage.
Eine Rahmenwerk für ethische und verantwortungsvolle KI (OECD-Prinzipien, UNESCO, NIST AI RMF, ISO/IEC 42001 als Stuetze)-Analyse, gestartet an allen drei Standorten gleichzeitig, auf Basis der Gesprächsnotizen der Verantwortlichen. Der Referenzrahmen war bereits geschrieben, ebenso die 10 Themenfelder und die Stufen N1 bis N5.
Zwei Ausgaben vermieden, bevor sie entstanden.
Ein Score von 53 von 100, eine Abweichung, die sich auf drei Themen konzentriert. Der KI-Begleiter stellte fest, dass sich zwei Maßnahmen des Plans mit denen eines anderen Audits überschnitten. Der Ergebnisbericht für das Gremium war in einem Satz erstellt.
Was ihnen dadurch erspart blieb
- 3Standorte auf derselben Grundlage gemessen, statt drei nachzubearbeitende Fragebögen
- 2doppelte Maßnahmen erkannt, bevor die Ausgabe erfolgte
- 1Ergebnisbericht für das Gremium, ohne manuelle Nachbearbeitung
Diese Zahlen stammen aus einem Beispiel. Sie könnten Ihre eigenen sein.
Die Norm schreibt Prozesse vor. Datamensio zeigt, wo Sie stehen.
01
Der Referenzrahmen ist bereits geschrieben
Themenfelder, Fragen und Stufen N1 bis N5 ausformuliert. Sie starten nicht mit einer leeren Tabelle.
02
Der Score liegt noch am selben Tag vor
Online, per Selbstbewertungslink oder im Gespräch. Themenfeld für Themenfeld, im Zeitverlauf vergleichbar.
03
Die Abweichung wird zu einem bezifferten Plan
Jeder Stufenübergang trägt seine Maßnahme. Die KI priorisiert nach erwarteter Wirkung, nicht nach der Reihenfolge der Norm.
04
Der Fortschritt lässt sich belegen
Kampagne für Kampagne, gegen Ihr Ziel und gegen Ihre Vergangenheit. Genau das verlangt Ihr Vorstand.
Die Reifegradskala
Eine Stufe, die nächste, und die Maßnahme, die beide verbindet.
Dieser Mechanismus, ein Niveau, ein hoeheres Niveau und die Maßnahme, die beide verbindet, macht aus einer Feststellung eine Entwicklung.
Werden Verzerrungen der Modelle ueber ihren gesamten Lebenszyklus getestet und nachverfolgt?
- N1
Es werden keine Bias-Tests durchgefuehrt. Das Thema wird bei der Inbetriebnahme eines Modells nicht angesprochen.
- N2
Tests erfolgen punktuell, auf Initiative des jeweiligen Teams, ohne einheitliche Metrik und ohne Aufbewahrung der Ergebnisse.
- N3
Ein Testprotokoll ist definiert und wird vor jeder Inbetriebnahme angewendet, mit dokumentierten Fairness-Metriken und archivierten Ergebnissen.
- N4
Die Tests werden in Produktion periodisch wiederholt, Abweichungen loesen eine nachverfolgte Maßnahme aus, und die Ergebnisse werden dem Governance-Gremium vorgelegt.
- N5
Protokoll und Metriken werden anhand von Nutzungsrueckmeldungen und Vorfaellen ueberarbeitet, mit dokumentierter Nachverfolgung der Aenderungen und einem Vergleich zwischen Modellen im Zeitverlauf.
Maßnahme fuer den Uebergang von N2 zu N3
Ein gemeinsames Bias-Testprotokoll definieren, mit den abzudeckenden Metriken und Bevoelkerungsgruppen, es als verpflichtenden Pruefpunkt in die Freigabe zur Inbetriebnahme aufnehmen und die Ergebnisse im Modellblatt archivieren.
« Dank Datamensio erfüllen wir unsere Ziele viel effizienter. Die Prüfstellen des EFRE und unseres zuständigen Ministeriums haben diesen Ansatz besonders geschätzt, da er ihnen verlässliche Daten liefert. »

Direktorin der CCI 94CCI Île-de-France
« Wir sind überzeugt, dass dies die am besten geeignete Lösung ist, um unser Transformationsprojekt zu skalieren und die Wirkung nach unseren Bedürfnissen zu messen. »

Maja SucekChief Operating Officer, Interreg Danube
Selten allein
Ein Referenzrahmen lässt sich kombinieren. Verbinden Sie mehrere, um Ihre Tätigkeit abzudecken, oder lassen Sie Ihren eigenen von der KI schreiben.
Nehmen Sie Ihre erste Messung vor
Worum es in diesem Referenzrahmen geht
Ethische und verantwortungsvolle KI ist keine Norm, sondern ein Praxisrahmen, aufgebaut auf inzwischen gefestigten Prinzipien: Fairness und Diskriminierungsfreiheit, Transparenz und Erklaerbarkeit, wirksame menschliche Aufsicht, Robustheit und Sicherheit, Schutz der Privatsphaere, klar zugeordnete Verantwortung, Beruecksichtigung der Umweltauswirkung. Diese Prinzipien finden sich in den Empfehlungen der OECD und der UNESCO, im NIST AI Risk Management Framework und, als Managementsystem gefasst, in ISO/IEC 42001. Sie beschreiben ein erwartetes Verhalten der Modelle und der Teams, die sie entwickeln, nicht eine Liste einklagbarer Anforderungen.
Genau das macht das Thema schwer steuerbar. Die Prinzipien sind unumstritten, ihre Umsetzung faellt von Team zu Team und von Modell zu Modell sehr unterschiedlich aus. Wer entscheidet, dass ein Modell in Produktion gehen darf, und anhand welcher gemessenen Kriterien? Werden Verzerrungen einmalig vor Inbetriebnahme getestet oder ueber die gesamte Lebensdauer des Modells ueberwacht? Weiß ein Fachanwender, dass eine Entscheidung durch ein Modell unterstuetzt wurde, und an wen er sich zur Anfechtung wenden kann? Die meisten Organisationen koennen dies fuer ihr Vorzeigemodell beantworten, deutlich seltener fuer die Dutzenden Modelle und generativen KI-Anwendungen, die außerhalb des Radars im Einsatz sind.
Mit der generativen KI hat sich das Thema verschoben. Die Praktiken verantwortungsvoller KI wurden zunaechst fuer intern entwickelte Modelle konzipiert, auf beherrschten Daten, mit klar identifiziertem Lebenszyklus. Ein wachsender Teil der Anwendungen stuetzt sich heute auf Modelle externer Anbieter, eingebettet in Fachanwendungen, teils ohne Einbindung der IT-Abteilung aktiviert. Die Frage lautet nicht mehr allein, die eigenen Modelle gut zu konzipieren, sondern zu wissen, welche Modelle von wem fuer welche Entscheidungen genutzt werden und mit welchem Kontrollniveau. Eine Verwechslung tritt haeufig auf: Verantwortungsvolle KI und regulatorische Konformitaet decken sich nicht. Letztere setzt einen Mindeststandard, erstere strukturiert die Arbeitsweise.
Die Reifegradanalyse beantwortet eine andere Frage als eine Ja-Nein-Pruefung. Es geht nicht darum, ob eine Charta existiert, sondern auf welchem Niveau die Praktiken tatsaechlich mit Werkzeugen unterlegt, wiederholbar und nachverfolgt sind. Jedes Themenfeld erhaelt einen Score, jede Abweichung vom Zielwert erzeugt eine Maßnahme, und die KI von Datamensio buendelt diese Maßnahmen zu einer priorisierten Roadmap mit Kosten, Frist und erwarteter Wirkung auf den Score.
Der Referenzrahmen ist einsatzbereit und gehoert Ihnen. Sie koennen die Themenfelder anpassen, Fragen umformulieren, Niveaus neu definieren oder von der KI eine Variante erstellen lassen, die auf Ihre Branche und Ihre eigenen internen Dokumente zugeschnitten ist, Charta, Governance-Richtlinie fuer Modelle oder bestehendes Pruefraster.
Referenznorm: Rahmenwerk für ethische und verantwortungsvolle KI (OECD-Prinzipien, UNESCO, NIST AI RMF, ISO/IEC 42001 als Stuetze)
Die bewerteten Themenfelder
Prinzipien und Strategie verantwortungsvoller KI
Existenz formalisierter Prinzipien, Abstimmung mit der Daten- und KI-Strategie, Traeger auf Geschaeftsleitungsebene, operative Umsetzung in den Teams.
Governance und Verantwortlichkeiten
Pruefgremium fuer Anwendungsfaelle, benannte Rollen, Kriterien fuer die Inbetriebnahme, Entscheidung ueber sensible Anwendungen, Eskalation von Streitfaellen.
Bestandsaufnahme und Klassifizierung der Anwendungen
Erfassung der Modelle und generativen KI-Anwendungen, einschließlich solcher aus Drittanbieter-Tools, Klassifizierung nach Risiko- und Kritikalitaetsstufe.
Trainingsdaten und Qualitaet
Herkunft und Lizenzen der Datensaetze, Repraesentativitaet, Umgang mit personenbezogenen Daten, Dokumentation der Verarbeitungen, Versionsnachverfolgung.
Fairness und Umgang mit Verzerrungen
Gewaehlte Fairness-Metriken, getestete Bevoelkerungsgruppen, Testprotokoll vor Inbetriebnahme, periodische Neubewertung, dokumentierte Korrekturmaßnahmen.
Transparenz und Erklaerbarkeit
Information der betroffenen Personen, Modelldokumentation, Faehigkeit, eine Einzelentscheidung zu erklaeren, Widerspruchs- und Beschwerdewege.
Menschliche Aufsicht
Grad des menschlichen Eingriffs je nach Kritikalitaet, Schulung der zustaendigen Personen, tatsaechliche Faehigkeit, eine Empfehlung zu verwerfen, Nachverfolgbarkeit von Uebersteuerungen.
Robustheit und Modellsicherheit
Belastungstests, Umgang mit Drift, Zugriffskontrolle fuer Modelle und Daten, Beruecksichtigung von Angriffen auf Eingaben und Prompts.
Ueberwachung in Produktion und Lebenszyklus
Nach Inbetriebnahme verfolgte Kennzahlen, Erkennung von Leistungsdrift, Verfahren zur Außerbetriebnahme eines Modells, periodische Pruefung aktiver Anwendungen.
Kultur, Kompetenzen und Umweltauswirkung
Sensibilisierung der Fachbereiche, Kompetenzaufbau der technischen Teams, Beruecksichtigung des Ressourcenverbrauchs, Auswahl der eingesetzten Modelle.
Eine Kurzversion des Referenzrahmens mit 32 Fragen steht für die Online-Selbstbewertung zur Verfügung.
Häufige Fragen
Kann ethische und verantwortungsvolle KI zertifiziert werden?
Nein, es handelt sich um einen Praxisrahmen, nicht um eine zertifizierbare Norm. Eine Organisation, die ein zertifizierbares Instrument wuenscht, wendet sich an ISO/IEC 42001, die ein Managementsystem fuer kuenstliche Intelligenz strukturiert. Diese Analyse misst den Reifegrad der Praktiken und bildet eine wiederverwendbare Grundlage fuer dieses Vorhaben.
Worin unterscheidet sich das von einer Analyse zur europaeischen KI-Regulierung?
Der regulatorische Rahmen legt Pflichten je nach Risikostufe der Systeme fest. Verantwortungsvolle KI deckt einen breiteren Bereich ab: die Art, Modelle zu entwickeln, einzusetzen und zu ueberwachen, auch fuer Anwendungen, die keiner Pflicht unterliegen. Beide Analysen fließen in eine uebergreifende Roadmap ein, ohne Maßnahmen zu duplizieren.
Wie lange dauert die Bewertung?
Die Kurzversion wird in einer einzigen Arbeitssitzung ausgefuellt. Die vollstaendige Version, im kollaborativen Modus mit mehreren Beitragenden, erstreckt sich ueber ein bis zwei Wochen: Der groesste Zeitaufwand entfaellt auf die Zusammentragung der Angaben bei den Datenteams, den Fachbereichen und der IT-Abteilung.
Ist technisches Fachwissen fuer die Beantwortung noetig?
Die Fragen betreffen Governance- und Lebenszyklus-Praktiken, nicht die Modellarchitektur. Ein Verantwortlicher fuer KI-Governance oder ein Datenprojektleiter kann sie beantworten. Einige Fragen erfordern den Beitrag eines Data Scientists: Der kollaborative Modus erlaubt es, sie direkt der richtigen Person zuzuweisen.
Laesst sich der Referenzrahmen an unseren Kontext anpassen?
Ja. Themenfelder, Fragen und Niveaus sind veraenderbar, und Sie koennen eigene Achsen hinzufuegen. Die KI kann außerdem eine Variante auf Basis Ihrer Charta, Ihrer Governance-Richtlinie fuer Modelle oder Ihrer bestehenden Pruefraster erstellen.
Wie lassen sich mehrere Business Units vergleichen?
Jede Einheit wird anhand desselben Referenzrahmens bewertet, wodurch die Scores je Themenfeld vergleichbar sind. Das Benchmarking verortet eine Einheit im Verhaeltnis zu anderen und zu ihren eigenen frueheren Bewertungen. Eine uebergreifende Roadmap fuehrt anschließend die Maßnahmenplaene mehrerer Analysen zusammen.
Ist der Maßnahmenplan mit Kosten hinterlegt?
Ja. Jede Abweichung vom Zielwert erzeugt eine Maßnahme, und der Leistungskatalog stellt diesen Maßnahmen eine Loesung gegenueber, mit Kosten, Frist und erwarteter Wirkung auf den Score. Die Roadmap wird von der KI priorisiert und anschließend bis zur Umsetzung gesteuert.
Wo werden die Daten gehostet?
In Frankreich, bei OVH, mit Sicherung bei Scaleway. Keine Uebertragung außerhalb der Europaeischen Union. Die in der Plattform eingesetzten KI-Modelle koennen ausgewaehlt werden, auch unter europaeischen Loesungen.





