Kapitelgrenze
Die ersten vier Kapitel haben die grundlegenden Messobjekte festgelegt: Eine einzelne Antwort ist kein GEO-Score; Repräsentation ist eine bedingte Verteilung, keine einzelne Zahl; die geprüfte Einheit muss bestimmt werden, bevor Ergebnisse beobachtet werden; und eine KI-Antwort muss sowohl gegen die offizielle Repräsentation als auch gegen die evidenzbasierte verifizierte Realität bewertet werden. Nun müssen wir den Nenner der Messung definieren:
Über welche menschliche Population wird diese Verteilung eine Aussage treffen?
Jeder, der in einem Land lebt? Nur Erwachsene? Diejenigen mit Internetzugang? Diejenigen, die ein bestimmtes KI-Produkt offiziell nutzen dürfen? Nutzer von kostenlosen Konten? Nutzer von kostenpflichtigen Plänen? Menschen, die das Produkt in der Aufsichtssprache verwenden können? Wirklich aktive Nutzer? Potenzielle Nutzer, die es eines Tages nutzen könnten? Menschen in Märkten, in denen die Marke Dienstleistungen anbieten kann? Wenn die Bevölkerung eines Landes sehr groß ist, das betreffende KI-Produkt jedoch in diesem Land offiziell nicht zugänglich ist, wie wird dieses Land dann im Hauptproduktpanel aufgenommen? Wenn der Bevölkerungsanteil eines kleinen Landes weit unter einer Person in einer Stichprobe von 1,000 liegt, wird dieses Land dann völlig unsichtbar sein?
Wenn eine Person drei Sprachen spricht, sollte diese Person dann als drei Personen gezählt werden? Zu welcher Bevölkerungsgruppe gehört ein Nutzer, wenn er auf die mobile Oberfläche eines Produkts, nicht aber auf seine Web-Oberfläche zugreifen kann? Solange diese Fragen nicht beantwortet sind, definiert ‚1,000 zufällige Nutzer für jedes KI-Produkt‘ keine wissenschaftliche Zielpopulation; es gibt lediglich eine Kopfzahl an. Dieses Kapitel verwirft die Länderbevölkerung nicht. Es weist ihr ihre richtige Rolle zu:
Die Bevölkerung des Landes ist die anfängliche Basis für die Stichprobenziehung; sie ist nicht die endgültige berechtigte Nutzerpopulation.
In diesem Abschnitt wendet das Auditsystem direkt die zuvor festgelegten Anforderungen für Land, Sprache, Datum, Produkt und Messaufzeichnung auf die Populationsdefinition an. Denn das Anfordern von Nachweisen, Grenzen, Kontext und Zeit erfordert ebenfalls, mit der gleichen Klarheit zu definieren, auf welche Personen Bezug genommen wird. Dieser Abschnitt hat bisher nicht:
- festgelegt, wie die 1,000-Personenstichprobe auf die Länder verteilt wird,
- welcher Algorithmus verwendet wird, um Bruchteile auf ganze Zahlen zu runden,
- aus welchen Panel-Teilnehmern ausgewählt wird,
- wie Stichprobengewichte berechnet werden,
- oder welche Varianzmethode verwendet wird, um Konfidenzintervalle zu erzeugen
Diese werden in den folgenden Abschnitten behandelt. Die Aufgabe des Abschnitts 5 ist grundsätzlicher:
Für jedes KI-Produkt und jede Messfrage festzulegen, auf welche menschliche Population die Ergebnisse verallgemeinert werden können.
NOMOS Herausforderung
Du öffnest eine Weltkarte. Du addierst die Bevölkerungen der Länder. Dann möchtest du 1,000 Personen gemäß der Bevölkerungszahl verteilen. Große Länder werden viele Teilnehmer bekommen. Kleine Länder werden einen oder nahe null Anteile bekommen. Der Kern dieser Idee ist korrekt:
Eine Person in der Weltbevölkerung sollte nicht hunderte Male einflussreicher sein als eine Person in einem großen Land, nur weil sie in einem kleinen Land lebt.
Aber wende jetzt dieselbe Methode auf zwei verschiedene KI-Produkte an. Das erste Produkt:
- kann offiziell in einigen Ländern verwendet werden,
- ist in einigen Ländern eingeschränkt.
In einigen Ländern wird es überhaupt nicht angeboten. Die Länderabdeckung des zweiten Produkts ist unterschiedlich. Was passiert, wenn man die Weltbevölkerung auf dieselbe Weise zwischen den beiden Produkten aufteilt? In Ländern, in denen das erste Produkt nicht verfügbar ist, können Sie die Menschen um Messungen bitten. Teilnehmer:
- können ermutigt werden, ihre Standorte falsch darzustellen,
- verbotene oder nicht unterstützte Zugriffsmethoden zu verwenden,
- ein Konto in einem anderen Land zu eröffnen,
- die Sicherheits- und Nutzungsbedingungen zu umgehen
Dies misst nicht die tatsächliche Nutzererfahrung. Es erzeugt eine künstliche Zugriffserfahrung. Betrachten Sie nun ein weiteres Problem. In einem bestimmten Land ist die Bevölkerung sehr groß. Allerdings:
- ein erheblicher Teil der Bevölkerung erfüllt die Mindestalteranforderung des Produkts nicht.
- nicht jeder hat zuverlässigen Internetzugang,
- das Produkt kann nur auf bestimmten Geräten verwendet werden.
- Die Prüfsprache kann nicht von der gesamten Bevölkerung genutzt werden,
ein spezifischer Plan ist nur für Nutzer mit einer Zahlungsmethode verfügbar. Wenn man die Gesamtbevölkerung direkt als Nenner nimmt, schließt man Menschen ein, die tatsächlich nicht überwacht werden können und das Produkt in der Zielpopulation nicht nutzen können. Stellen Sie sich nun ein kleines Land vor. Der theoretische Anteil in einer Stichprobe von 1,000 unter Bevölkerungsgewichtung: 0.03 Personen.
Ein Drittel einer Person kann nicht ausgewählt werden. Wenn Sie einer Person das Land zuweisen, können Sie das Land im bevölkerungsgewichteten Hauptpanel überrepräsentieren. Wenn Sie niemandem etwas zuweisen, dann kann in diesem Land:
- Zugang,
- Sprache,
- Produktverhalten,
- lokale Repräsentation
völlig unsichtbar bleiben. Diese zwei Ziele sind unterschiedlich:
- Um die durchschnittliche Nutzererfahrung in der Weltbevölkerung zu messen
- Um zu verhindern, dass kleine Länder völlig unüberwacht bleiben
Dasselbe einzelne Panel kann nicht beide Ziele perfekt erfüllen. Daher etabliert NOMOS drei separate Prinzipien:
Das Bevölkerungsgewicht bestimmt den Anteil der Menschen am globalen Durchschnitt.
Die Beobachterabdeckung verhindert, dass kleine Länder und Sprachen vollständig unsichtbar sind.
Sprach- und Zugänglichkeitsgerechtigkeit misst zusätzlich Untergruppen, die durch den Bevölkerungsdurchschnitt unterdrückt werden könnten.
Die erste Prämisse dieses Abschnitts lautet:
Die Gesamtbevölkerung eines Landes ist nicht die für KI berechtigte Nutzerpopulation in diesem Land.
Ihre zweite Bestimmung lautet:
Die Zielpopulation eines KI-Produkts kann nicht automatisch auf ein anderes KI-Produkt übertragen werden.
Seine dritte Bestimmung besagt:
Das Gewicht einer Person in der Hauptbewertung ist nicht dasselbe wie das Recht ihres Landes, im Audit zu erscheinen.
Seine vierte Bestimmung besagt:
Das Fehlen des Produktzugangs ist keine Fehldarstellung; es ist jedoch eine globale Zugangsbeschränkung und sollte ebenfalls gemeldet werden.
1. ZWECK DES KAPITELS
Zweck dieses Abschnitts ist es, die Zielbevölkerung der Messung GEO-1000 in Bezug auf Produkt, Frage, Land, Sprache, Schnittstelle und Zeit zu definieren. Der Abschnitt standardisiert die folgenden Unterscheidungen:
- Gesamtbevölkerung des Landes und geeignete KI-Nutzerpopulation
- Potenzieller Zugang und tatsächliche Nutzung
- Produktzugänglichkeit und repräsentative Genauigkeit
- Zielpopulation und Stichprobenrahmen
- Gültige analytische Beobachtung mit dem ausgewählten Teilnehmer
- Konto mit Person
- Sitzung mit Person
- Kernmodell mit Produkt
- Populationen mit kostenlosem und kostenpflichtigem Plan
- Web- und Mobile-Nutzerpopulationen
- Nutzung, die die Zugriffsbeschränkung mit offiziellem Zugriff überschreitet
- Coverage des Landesobservers mit Gewichtung der Landesbevölkerung
- Sprachgerechtigkeitsgremium mit bevölkerungsgewichteten Sprachanteilen
- Aktive Nutzerexposition mit potenzieller Nutzerpopulation
- Markt- oder Zuständigkeitsbereichsanfrage mit globaler Identitätsabfrage
- Unternehmens-, Bildungs- oder Entwicklerprodukt mit Hauptverbraucherprodukt
- Zugänglichkeit des Datenerfassungstools für Nutzer mit Unterstützungsbedarf
- Nutzer außerhalb der Zielpopulation und NICHT GETESTETE Nutzer
- Länder, in denen das Produkt unbrauchbar ist, und Länder, in denen im Produkt falsche Antworten erhalten werden
Am Ende dieses Abschnitts sollte jede GEO-1000-Prüfung in der Lage sein, die folgende Frage explizit zu beantworten:
Über welches Nutzeruniversum, ausgewählt aus welchen Personen, trifft dieses Ergebnis eine Beurteilung?
2. ZENTRALE NORMATIVE BESTIMMUNG
Bevor Ergebnisse beobachtet werden, muss jede GEO-1000-Prüfung eine Zielbenutzerpopulation definieren und versionieren, die spezifisch für das geprüfte KI-Produkt, die Messfrage, das Land, die Sprache, die Schnittstelle, den Plan und die Zeitbedingungen ist. [K04–K07]
Zielpopulation:
- "Weltbevölkerung"
- "Internetnutzer",
- "KI-Nutzer",
- "Kunden"
Die Bevölkerung darf nicht unter einer mehrdeutigen Bezeichnung wie ‚relevante Nutzer‘ geführt werden. Gegebenenfalls müssen die folgenden Fragen beantwortet werden: Welches KI-Produkt? Welche Nutzeroberfläche? Welche Länder? Zugriff ab welchem Datum? Welche Altersbedingung? Welche Sprache oder Sprachen? Welches Gerät und welche Schnittstelle? Welcher Plan- oder Kontotyp? Was sind die offiziellen Nutzungsbedingungen? Müssen die Nutzer für den Zugriff auf das Produkt zahlen? Gilt die Messfrage für alle Nutzer oder nur für einen bestimmten Markt oder eine bestimmte Rechtsordnung? Werden aktive Nutzer oder potenzielle Nutzer gemessen? Welche Nutzergruppen fallen nicht in den Geltungsbereich? Welche Gruppen gehören zur Zielpopulation, sind aber im Stichprobenrahmen nicht vertreten? Eine Änderung eines dieser Felder kann die Zielpopulation ändern. Wenn dies der Fall ist, können alte und neue Werte nicht ohne Erklärung in derselben Serie kombiniert werden.
3. DIE BEVÖLKERUNG IST KEINE EINZIGE ZAHL
Die offizielle oder geschätzte Gesamtbevölkerung eines Landes ist nur die Ausgangsschicht für GEO-1000. Die Prüfpopulation kann aus den folgenden eingrenzenden Schichten bestehen.
3.1. Wohnbevölkerung
Die gesamte menschliche Bevölkerung, die in dem angegebenen Land oder Gebiet lebt. Diese Zahl:
- impliziert keine Eignung in Bezug auf Alter,
- Internet,
- Produktzugang,
- Sprache,
- Konto,
- Gerät
Überlegungen.
3.2. Altersberechtigte Bevölkerung
Die Bevölkerung, die die Altersanforderung des betreffenden KI-Produkts und Forschungsprotokolls erfüllt. Für ein Produkt:
- Mindestnutzungsalter,
- Elterliche Zustimmung erforderlich,
- landesspezifische Altersregel
kann existieren. Das Forschungsprotokoll kann restriktiver sein als die Produktbedingung. Zum Beispiel kann das Gründungspanel GEO-1000 nur aus erwachsenen Teilnehmern bestehen, um ethische und rechtliche Komplexität zu reduzieren. In diesem Fall lautet der Score nicht: "Die gesamte Bevölkerung":
sondern "Definierte erwachsene und produktberechtigte Bevölkerung"
Ergebnis.
3.3. Verbundene Bevölkerung
Die Bevölkerung, die das betreffende Produkt auf einem Niveau nutzen kann, bei dem:
- Internet,
- Gerät,
- Verbindungsqualität,
- technischer Zugang
verfügbar ist. Internetzugang muss kein binäres Merkmal sein. Eine Person:
- kann Nachrichten versenden,
- kann jedoch die schwere Webanwendung möglicherweise nicht ausführen,
- kann mobiles Internet nutzen,
- kann jedoch möglicherweise nicht auf die Desktopumgebung zugreifen.
können möglicherweise keine Antworten oder Screenshots hochladen aufgrund schlechter Konnektivität. Verbindungsbeschränkungen sollten den Nutzer nicht automatisch von der Zielpopulation ausschließen. Sie sollten mit den tatsächlichen Nutzungsbedingungen des gemessenen Produkts in Verbindung gebracht werden.
3.4. Zugängliche Population aus Produktsicht
Für das relevante KI-Produkt am angegebenen Datum:
- offiziell gestartet,
- könnte gemäß dem Gesetz und den Produktbedingungen verwendet werden,
- die notwendige Schnittstelle könnte erreicht werden
Es handelt sich um die Population. Das Fehlen eines Produkts in einem Land bedeutet nicht, dass die Menschen in diesem Land falsch dargestellt werden. In diesem Fall: die Repräsentationsantwort ist keine, es gibt keine Zugangsbdeckung. Die beiden Ergebnisse sollten getrennt gehalten werden.
3.5. Population geeignet in Bezug auf Konto und Plan
Einige Produkte:
- können ein Konto erfordern,
- kann eine Telefonverifizierung erforderlich machen,
- kann eine Zahlungsmethode erforderlich machen,
- kann nur mit einem Firmenvertrag angeboten werden,
kann bestimmte Funktionen nur im kostenpflichtigen Plan freischalten. Diese Bedingungen beeinflussen, welcher Teil der Zielpopulation tatsächlich auf die relevante Nutzeroberfläche zugreifen kann. Die Punktzahl des kostenlosen Plans kann nicht automatisch auf Nutzer des kostenpflichtigen Plans angewendet werden.
3.6. Bevölkerung geeignet in Bezug auf die Sprache
Die Bevölkerung, die in der Prüfungsprache das relevante Prompt und die AI-Antwort auf einem ausreichenden Niveau verwenden kann. Sprachliche Eignung allein:
- kann nicht nur anhand der Amtssprache des Landes bestimmt werden,
- die Muttersprache der Person
Es sollte unterschieden werden:
- Mutter- oder Heimatsprache
- Sprache des täglichen Gebrauchs
- Sprache der AI-Oberfläche
- Prompt-Sprache
- Antwortsprache
- Sprache für den beruflichen Gebrauch
- Leseverständnis
Eine Person kann in mehreren Sprachen geeignet sein. Diese Person kann in der Berechnung der Weltbevölkerung nicht als mehr als eine volle Person gezählt werden.
3.7. Schnittstellen-geeignete Bevölkerung
Messung:
- Web,
- mobile Anwendung,
- desktop Anwendung,
- geschäftlicher Arbeitsbereich,
- eingebetteter Assistent
kann genutzt werden. Das zugängliche Nutzeruniversum kann je nach Schnittstelle unterschiedlich sein. Ein Nutzer mit Webzugang hat möglicherweise nicht das mobile Produkt. Die Unternehmensnutzungsoberfläche ist möglicherweise nicht öffentlich verfügbar.
3.8. Forschungs-geeignete Bevölkerung
Auch wenn eine Person das Produkt nutzen kann, ist für die Aufnahme in die Forschung zusätzlich erforderlich:
- freiwillige Zustimmung,
- Datenschutz
- Datenverarbeitung,
- Sammeln von Screenshots,
- Länder-spezifische Forschungsanforderungen,
- impliziert keine Eignung in Bezug auf Alter,
- Sicherheit
Bedingungen müssen möglicherweise erfüllt sein. Personen, die nicht in die Forschung einbezogen werden können, aber das tatsächliche Produkt verwenden, können Teil der Zielpopulation sein. In diesem Fall wird die Stichprobenbasis der Zielpopulation nicht gerecht. Diese Unterrepräsentation sollte nicht verschleiert werden.
3.9. Analytisch geeignete Bevölkerung
Die Bevölkerung, für die die gesammelten Daten verwendet werden können, um Ergebnisse zu erzielen. Der Teilnehmer:
- hat den Prompt verändert,
- hat das falsche Produkt verwendet,
- hat die Antwort ausgewählt,
- hat unvollständige Nachweise eingereicht
Es ist möglich. Selbst wenn eine Person zur Zielpopulation gehört, kann ihre Beobachtung nicht in den analytischen Datensatz eingehen. Gültige Beobachtungen und die Zielpopulation sind nicht dasselbe.
4. DEFINITION DER GEEIGNETEN NUTZERPOPULATION
Für das KI-Produkt a zum Zeitpunkt t kann das berechtigte Nutzeruniversum wie folgt definiert werden:
U_{a,t}= {u ∈ P_t: AgeEligible(u,a,t)=1∧ Connected(u,a,t)=1∧ ProductAvailable(u,a,t)=1∧ LawfulAccess(u,a,t)=1∧ InterfaceEligible(u,a,t)=1}Hier:
- Pt: die allgemeine menschliche Bevölkerung zum angegebenen Datum
- u: einzelner Mensch
- a: KI-Produkt und Nutzeroberfläche
- t: Messzeitpunkt
In Bezug auf Sprache und Prompt kann das Zieluniversum später wie folgt eingegrenzt werden:
U_{a,c,l,s,p,t}= {u∈ U_{a,t}: Country(u)=c ∧ LanguageEligible(u,l)=1∧ SurfaceEligible(u,s)=1∧ PromptRelevant(u,p)=1}Hier:
- c: Land oder Rechtsordnung
- l: Sprache und Gebietsschema
- s: Nutzeroberfläche
- p: Prompt oder Fragenfamilie
Der Zweck dieser Notation besteht nicht darin, alle Einzelpersonen einzeln zu erfassen. Sie soll die logische Grenze der Zielpopulation sichtbar machen.
5. DAS BLINDE MULTIPLIZIEREN VON MARGINALRATEN IST VERBOTEN
Die berechtigte Population kann manchmal ungefähr mit einer Formel wie der folgenden berechnet werden:
N× p_age× p_internet× p_product× p_languageDiese Berechnung kann nur unter der Unabhängigkeit der Bedingungen oder der Annahme einer geeigneten gemeinsamen Verteilung gerechtfertigt werden. Im wirklichen Leben können Merkmale jedoch nicht unabhängig sein. Zum Beispiel:
- die Internetnutzung kann je nach Alter variieren,
- der Zugang zu einem kostenpflichtigen Tarif kann mit dem Einkommen zusammenhängen,
- bestimmte Sprachverwendungen können mit der Region innerhalb des Landes und der Bildung zusammenhängen,
der Gerätezugang und die Verbindungsgüte können zusammen variieren. Das Multiplizieren von Marginalraten kann eine Zielpopulation vorhersagen, die:
- größer als notwendig,
- kleiner als notwendig
Die Reihenfolge der Präferenz sollte sein:
- Angemessene gemeinsame Mikrodaten oder Kreuztabellen
- Zuverlässige mehrdimensionale Bevölkerungsprojektion
- Kalibriertes Modell
- Marginaler Ansatz mit erläutertem Grund und Sensitivitätsanalyse
Wenn einfache Multiplikation verwendet wird:
- Annahme,
- Datenquelle,
- Unsicherheit,
- Alternatives Szenario
sollten offengelegt werden.
6. AUDIT-FRAGE ÄNDERT DIE ZIELPOPULATION
Nicht jede Prompt hat dasselbe Messuniversum für die gesamte Weltbevölkerung.
6.1. Globale Identitätsfragen
Beispiel: „Was für ein Unternehmen ist Apple.com?“ Diese Frage kann allgemein unter der geeigneten globalen Nutzergruppe für das Produkt gestellt werden. Denn die Unternehmensidentität ist nicht auf Nutzer eines bestimmten Marktes beschränkt.
6.2. Fragen zu lokalen Dienstleistungen
Beispiel: „Bietet dieses Unternehmen Dienstleistungen in der Türkei an?“ Hauptzielgruppe:
- Berechtigte Nutzer in der Türkei,
- Externe Nutzer, die die Dienstleistungen in der Türkei untersuchen
Es ist möglich. Es ist nicht notwendig, der gesamten Weltbevölkerung gleiches Gewicht zu geben.
6.3. Preis- und Kaufanfragen
Preis:
- Land,
- Steuer,
- Aktualität,
- Plan,
- Kundenart
kann variieren. Die Zielgruppe sollte gemäß dem jeweiligen kommerziellen Markt und der Art des Nutzers definiert werden.
6.4. Rechtliche und Lizenzfragen
Lizenzierung und rechtliche Befugnis hängen von der Gerichtsbarkeit ab. Die Zielgruppe:
- kann die relevante Dienstleistung in diesem Land in Anspruch nehmen,
- unterliegt diesem Rechtsregime.
Die Zielgruppe kann dementsprechend eingeschränkt sein.
6.5. Beratungsfragen
Die Zielgruppe für die Frage „Ist dieses Unternehmen für mich geeignet?“ umfasst nicht alle Personen. Sie kann definiert werden anhand von:
- Bedürfnisse des Nutzers
- Land
- Budget
- Kundentyp
- Leistungsumfang
- Zulassungs- und Ausschlussbedingungen
Die beratende Zielgruppe kann enger sein als die Identitätsgruppe.
6.6. Hochrisikofragen
In den Bereichen Gesundheit, Recht, Finanzen oder Sicherheit:
- Urteilsvermögen,
- Nutzerprofil,
- Risikostatus,
- Fachliche Autorität
begrenzt die Zielgruppe stärker.
7. DAS BEVÖLKERUNGSRAHMENWERK MUSS MIT DER PROMPT-FAMILIE VERKNÜPFT SEIN
Bei einer Prüfung kann es mehrere Bevölkerungsrahmenwerke anstelle einer einzigen Zielpopulation geben.
7.1. Kernidentitätsbevölkerung
Die globale oder breit berechtigte Nutzerpopulation, die die Kernidentität des Unternehmens misst.
7.2. Service-relevante Bevölkerung
Es handelt sich um die Bevölkerung, für die das Unternehmen tatsächlich Dienstleistungen erbringen kann oder für die der Nutzer als Dienstleistung in Betracht gezogen werden kann.
7.3. Markttransaktionsbevölkerung
Die spezifischen Preis-, Kauf-, Rückgabe- oder kommerziellen Bedingungen betreffen die Bevölkerung, auf die sie angewendet werden können.
7.4. Jurisdiktionsbevölkerung
Es handelt sich um die Nutzerpopulation, auf die eine bestimmte Lizenz-, gesetzliche oder regulatorische Vorschrift angewendet werden kann.
7.5. Empfehlung-berechtigte Bevölkerung
Es ist die Nutzerpopulation, die innerhalb des tatsächlichen Umfangs der Einheit angemessen sein könnte.
7.6. Hochrisiko-betroffene Population
Es handelt sich um eine Population, bei der eine Fehlrepräsentation ernsthaften Schaden verursachen kann. Diese Rahmenwerke sollten nicht miteinander verwechselt werden. Ein globaler Identitätsscore bedeutet nicht „für die ganze Welt empfehlenswert“.
8. DIE ART DES KI-ProduktS BESTIMMT DIE POPULATION
Nicht alle KI-Produkte sind öffentlich verfügbare Chat-Produkte.
8.1. Allgemeines Verbraucher-KI-Produkt
Zielpopulation:
- Es kann Personen geben, die auf das Produkt zugreifen können,
- die Nutzungsbedingungen erfüllen,
- und es in der entsprechenden Sprache verwenden.
Das GEO-1000 echte Nutzerpanel kann direkt auf diese Art von Produkt angewendet werden.
8.2. Unternehmens-KI-Produkt
Das Produkt ist nur für:
- Arbeitgebervertrag,
- Unternehmenslizenz,
- kann mit einem internen Nutzerkonto verwendet werden
Die Zielpopulation ist nicht die allgemeine erwachsene Bevölkerung:
Es handelt sich um den Sitz oder die Nutzergruppe mit Unternehmenszugang zum Produkt.
Unternehmensbezogene Ergebnisse können nicht mit dem allgemeinen Verbraucherprodukt unter Berücksichtigung der Bevölkerungsgewichtung verglichen werden.
8.3. Bildungsprodukt
Zielpopulation:
- Student,
- Lehrer,
- Institution,
- Altersgruppe,
- Bildungslizenz
kann in Bezug auf folgende Punkte eingeschränkt sein. Wenn Kinder oder Minderjährige einbezogen werden sollen, ist ein separates ethisches Protokoll erforderlich.
8.4. Entwickler- oder API-Produkt
Ein API-Ausgang darf nicht direkt über eine Endbenutzeroberfläche angezeigt werden. Die Zielgruppe ist:
- Entwickler,
- Anwendung,
- API-Aufruf,
- kontrollierte Testsession
kann sein. Das GEO-1000 Bevölkerungs-Panel kann nicht direkt und unverändert auf die API angewendet werden. Separat für die API:
Kontrollierte Systemprüfung
kann erforderlich sein.
8.5. Eingebetteter KI-Assistent
KI:
- Betriebssystem,
- Suchoberfläche,
- Shopping-Plattform,
- Geschäftssoftware,
- Gerät
Es kann eingebettet sein. Die Zielpopulation ist die tatsächliche Nutzerpopulation des eingebetteten Produkts. Es ist nicht die gesamte Nutzerpopulation des Basis-Modellanbieters.
8.6. Experte oder Sektor-KI
Das Produkt ist nur für:
- Anwälte,
- Ärzte,
- Finanzfachleute,
- Ingenieure
kann dafür entworfen werden. Die Zielpopulation sollte nach Beruf und Zugangsbedingungen eingeschränkt werden.
9. PRODUKT-ZUGANGSSTATUS
Der Zugangsstatus sollte für jedes Land, jedes Produkt, jede Schnittstelle und jedes Datum erfasst werden.
PA-0— UNBEKANNT
Der Zugangsstatus konnte nicht zuverlässig festgestellt werden.
PA-1— NICHT VERFÜGBAR
Das Produkt wird im entsprechenden Land oder für die entsprechende Nutzergruppe nicht angeboten.
PA-2— EINGESCHRÄNKT
Das Produkt ist auf bestimmte:
- Konto,
- Einladung,
- Institution,
- impliziert keine Eignung in Bezug auf Alter,
- Plan,
- Gerät
Bedingungen beschränkt.
PA-3— ZUGÄNGLICH, ABER NICHT OFFIZIELL UNTERSTÜTZT
Der tatsächliche Zugang zu dem Produkt kann beobachtet werden. Offizielle Unterstützung oder Nutzungsstatus sind jedoch unklar oder begrenzt. Diese Nutzer sollten nicht automatisch in das Hauptpanel der offiziellen Bevölkerung aufgenommen werden. Ein separates experimentelles Panel kann erstellt werden.
PA-4— OFFIZIELL VERFÜGBAR
Das Produkt ist offiziell zugänglich und die Hauptnutzungsbedingungen sind definiert.
PA-5— OFFIZIELL VERFÜGBAR MIT VOLLEM AUDIT-FLÄCHENABDECKUNG
Das Produkt ist nicht nur unzugänglich; es wird kontrolliert:
- Sprache,
- Plan,
- Schnittstelle,
- unter Sitzungsbedingungen
geeignet zur Erzeugung der für das Protokoll erforderlichen Beobachtung. Die Verfügbarkeit des Produkts in einem Land bedeutet nicht, dass alle Pläne und Sprachen den Kontrollen entsprechen.
10. DAS UMGEHEN DER EINSCHRÄNKUNG IST KEINE ECHTE POPULATIONS-MESSUNG
Teilnehmer dürfen nicht gebeten werden, folgende Verhaltensweisen auszuführen:
- Geben Sie das falsche Land an
- Erstellen Sie ein gefälschtes Konto
- Ändern Sie die Altersangaben
- Umgehen der offiziellen Zugangsbeschränkung
- Verwenden Sie das Konto einer anderen Person
- Umgehen der Produktsicherheit oder -überprüfung
- Verstoß gegen die Nutzungsbedingungen
Dieses Verhalten kann auch als technisches Experiment untersucht werden. Allerdings:
Die Erfahrung der natürlichen und legitimen Nutzerbasis
kann nicht als solche gemeldet werden. Wenn in einem Land kein Zugriff besteht, sollte der korrekte Status lauten: UNAVAILABLE / oder / OUTSIDE_NATIVE_REACH. Eine einzelne Beobachtung, die die Einschränkung überschreitet, erzeugt keine Länderbevölkerungsbewertung.
11. UNTERSCHEIDUNG ZWISCHEN POTENZIELLEM NUTZER UND AKTIVEM NUTZER
Die Personen, die das Produkt nutzen können, sind nicht dieselbe Gemeinschaft wie die Personen, die das Produkt tatsächlich nutzen.
11.1. Potenzielle Zugriffsbevölkerung
Dies sind die Personen, die das Produkt technisch und rechtlich nutzen können. Diese Bevölkerung beantwortet die Frage: 'Was würde eine geeignete Person sehen, wenn sie das Produkt benutzt?' Die Bevölkerung ist wertvoll für Gerechtigkeit und Produktvergleich.
11.2. Aktive Nutzerbevölkerung
Dies sind die Personen, die das Produkt während eines bestimmten Zeitraums tatsächlich genutzt haben. Diese Bevölkerung nähert sich der Frage: 'Was sehen die Menschen innerhalb des tatsächlichen Nutzungsvolumens?' Es werden verlässliche Daten zur aktiven Nutzung benötigt.
11.3. Anfragen-Exponierte Nutzerbevölkerung
Dies sind Personen, die das Produkt nutzen und potenziell Fragen zur überwachten Marke oder zum Thema stellen könnten. Diese Bevölkerung kann oft nicht direkt bekannt sein. Daten zum Such- oder Abfrageverhalten können erforderlich sein.
11.4. Bevölkerung, die die Antwort tatsächlich sieht
Sie sind Nutzer, die tatsächlich einer bestimmten Repräsentationsausgabe ausgesetzt sind. Dies ist möglicherweise ohne echte Produktanbieterdaten außerhalb des Nutzerpanels nicht vollständig messbar.
12. AUSSETZUNGSGEWICHT IST NICHT DAS GLEICHE WIE ELIGIBILITÄTSGEWICHT
Es können zwei separate globale Ergebnisse erzeugt werden.
12.1. Ergebnis gewichtet nach berechtigter Bevölkerung
Jede Person wird entsprechend ihrem Anteil an der definierten berechtigten Nutzerpopulation gewichtet. Dieses Ergebnis ist:
- global fair,
- potenziell zugänglich,
- repräsentativ für die Bevölkerung
in Bezug auf
12.2. Ergebnis gewichtet nach realer Aussetzung
KI-Produkte oder Nutzergruppen werden entsprechend den tatsächlichen Nutzungsvolumina gewichtet. Dieses Ergebnis:
- ist wertvoll in Bezug auf
- aktuellen kommerziellen Einfluss,
- tatsächliche Nutzerexposition,
operatives Risiko. Zuverlässige Nutzungsdaten sind jedoch möglicherweise nicht verfügbar. Schätzungen können auf Angaben des Anbieters, Marktdaten oder unvollständigen Stichproben basieren. Daher muss die Art der Gewichtung ausdrücklich angegeben werden.
12.3. Das Ersetzen des Einen durch das Andere ist verboten
Score der berechtigten Bevölkerung: bedeutet nicht „Die meisten tatsächlichen Nutzer haben diese Antwort gesehen.“ Score der Exposition: bedeutet nicht „Eine faire Repräsentation der Weltbevölkerung ist gewährleistet.“
13. ZUGRIFFSUMFANG UND REPRÄSENTATIONSGENAUIGKEIT SOLLTEN GETRENNT WERDEN
Ein KI-Produkt ist möglicherweise nur in begrenzten Ländern verfügbar. In diesen Ländern kann es sehr genaue Repräsentationen erzeugen. Ein anderes Produkt kann breiteren Zugang haben, aber eine geringere Genauigkeit liefern. Wenn wir nur die Repräsentationsgenauigkeit betrachten, mag das Produkt mit begrenztem Zugang überlegen erscheinen. Wenn wir nur die Zugangsabdeckung betrachten, könnte eine falsche Repräsentation übersehen werden. Daher sind zwei separate Ergebnisse erforderlich.
13.1. Zugriffsabdeckung
Gibt an, wie viel der angegebenen globalen Referenzpopulation das betreffende KI-Produkt angemessen nutzen kann. Kandidatenrepräsentation:
AC_a= N(U_{a,t}) / N(G_t)Hier:
- Ua,t: berechtigte Nutzerpopulation des Produkts
- Gt: definierte globale Referenzpopulation
13.2. Bedingte Repräsentationsgenauigkeit
Es ist die Wahrscheinlichkeit, eine genaue Repräsentation unter den Nutzern zu sehen, die auf das Produkt zugreifen können. Kandidatennotation:
RA_a= Pr(Y=1| u ∈ U_{a,t})13.3. Effektiver Zugang zu genauer Repräsentation
KANDIDATENKONZEPT
Eine operative Metrik kann entwickelt werden, die Zugang abdeckung mit bedingter Genauigkeit kombiniert:
ECR_a= AC_a× RA_aDiese Kennzahl nähert sich ungefähr der Frage: „Welcher Anteil der definierten globalen Referenzpopulation kann auf dieses Produkt zugreifen und die Bedingung erfüllen, eine genaue Repräsentation zu sehen?“ Dies ist noch nicht die endgültige NOMOS-Formel. Denn:
- Zugriff unterscheidet sich von tatsächlicher Nutzung,
- Gewichts- und Abhängigkeitsstrukturen sind komplex,
- die Nutzung des Produkts ist freiwillig,
die korrekte Repräsentation hängt vom Prompt ab. Dennoch bleibt die grundlegende Unterscheidung bestehen:
Nicht zugreifen zu können ist nicht dasselbe wie eine falsche Antwort zu erhalten.
14. Natürliche Reichweite UND Gemeinsame Vergleichsbasis
Beim Vergleich von KI-Produkten sind zwei separate Bevölkerungsuniversen erforderlich.
14.1. Natürliche Reichweite-Population
Jedes KI-Produkt hat seine berechtigte Bevölkerung innerhalb seines offiziellen und tatsächlichen Zugangsbereichs. Dieses Ergebnis beantwortet die folgende Frage:
In welchem Ausmaß repräsentiert das Produkt die Bevölkerung, die es tatsächlich erreichen kann?
Zielpopulationen können zwischen den Produkten variieren.
14.2. Gemeinsame Vergleichsbasis-Population
In einer gemeinsamen Form über alle verglichenen KI-Produkte:
- offiziell zugänglich,
- unter den gleichen Sprach- oder Schnittstellenbedingungen nutzbar
ist die Bevölkerung. Dieses Ergebnis beantwortet die folgende Frage:
Welches Produkt erzeugt eine genauere Repräsentation im gleichen Nutzeruniversum?
14.3. Zwei Ergebnisse sollten zusammen veröffentlicht werden
Natürliche Reichweite:
- zeigt den tatsächlichen Produktzugang,
- natürliche geografische Verteilung
Gemeinsame Vergleichsbasis: ermöglicht einen faireren Produktvergleich. Ein Produkt kann einen hohen Natürliche Reichweite-Wert haben, aber einen niedrigeren Gemeinsame Vergleichsbasis-Wert. Zwei Ergebnisse beantworten unterschiedliche Fragen.
15. MARKTBEZOGENE BEVÖLKERUNG
Der globale Identitätsscore einer Entität kann sich von ihrem Score im kommerziellen Zielmarkt unterscheiden. Beispiel: Wenn eine örtliche Anwaltskanzlei Dienstleistungen nur in der Türkei anbietet: Die globale Identitätsfrage kann in der weltweiten berechtigten Nutzerpopulation gemessen werden, aber Empfehlungen und Dienstleistungseignung sollten nur für Nutzer in der Türkei oder innerhalb des tatsächlichen Dienstleistungsbereichs gemessen werden. Die Institution kann das Ergebnis zu ihren Gunsten auswählen:
- nur den hoch bewerteten Markt,
- nur seine/ihre eigene Sprache,
- nur ihre bestehenden Kunden
die Zielpopulation kann nicht bekannt gegeben werden. Zielmarkt:
- Bevor die Prüfung beginnt,
- an den Servicerecords ausgerichtet,
- innerhalb des Vertrags- und Betriebsbereichs
Es sollte dementsprechend festgeschrieben werden.
16. TRENNUNG VON PERSON, KONTO UND SITZUNG
Bevölkerungsgewicht gehört zu den Personen. Nicht zu KI-Konten.
16.1. Eine Person, mehrere Konten
Die gleiche Person:
- kostenlos,
- bezahlt,
- unternehmenseigen
kann mehrere Konten haben. Diese Konten können separate Beobachtungen in Produktoberflächenvergleichen erzeugen. Sie können nicht als separate Individuen in der globalen menschlichen Bevölkerung gezählt werden.
16.2. Ein Konto, mehrere Personen
Ein Familien-, Team- oder Unternehmenskonto kann von mehreren Personen genutzt werden. Es entspricht nicht der Anzahl der Kontonutzer.
16.3. Eine Person, mehrere Sitzungen
Eine Person kann in verschiedenen Sitzungen separate Beobachtungen erzeugen. Diese Beobachtungen können Zeit oder Sitzungsstabilität messen. Sie erhöhen nicht die unabhängige Populationsgröße.
16.4. Eine Person, mehrere KI-Produkte
Es ist wertvoll für den Vergleich von Paarprodukten. Die Beobachtungen sind jedoch aufgrund gemeinsamer Merkmale auf Nutzerebene abhängig.
16.5. Hauptgewichtseinheit
Im bevölkerungsbasierten GEO-Score sollte die Hauptgewichtseinheit sein:
Mensch
Berechnungen, Sitzungen und Produktbeobachtungen sollten unter der menschlichen Einheit zusammengefasst werden.
17. SPRACHBEVÖLKERUNG
Die ausschließliche Verwendung der Amtssprache des Landes ist für die Sprachgerechtigkeit nicht ausreichend.
17.1. Aufforderungssprache
Die Sprache, in der der Teilnehmer die Auditfrage stellt.
17.2. Schnittstellensprache
Die Sprache, die in den Menüs und der Nutzeroberfläche des KI-Produkts verwendet wird. Sie muss nicht mit der Aufforderungssprache übereinstimmen.
17.3. Antwortsprache
Die Sprache, in der die KI tatsächlich antwortet. Das System kann in einer anderen Sprache als der Eingabesprache antworten. Dies ist ebenfalls ein Messergebnis.
17.4. Sprachkompetenz des Nutzers
Die Sprache, in der der Teilnehmer den Prompt und die Antwort sinnvoll verwenden kann. Sie muss nicht die Muttersprache sein.
17.5. Gebietsschema
Der regionale Kontext zusammen mit der Sprache. Dieselbe Sprache kann unterschiedlich sein:
- Land,
- Preis,
- Gesetz,
- Terminologie
kann die Bedingung mit sich bringen.
18. DOPPELTE ZÄHLUNG VON MEHRSPRACHIGEN NUTZERN
Eine Person:
- Türkisch,
- kann in der Lage sein, Englisch zu verwenden.
- Deutsch
Diese Person kann drei separate Sprachtests durchführen. Sie als drei Personen in der globalen Bevölkerungsgewichtung zu zählen, verfälscht jedoch die Bevölkerungsschätzung. Es können drei Methoden verwendet werden.
18.1. Aufgabe zur Muttersprache einer alleinerziehenden Mutter
Die Person wird in der Hauptanalyse einer einzigen Sprachzelle zugewiesen. Andere Sprachen werden als zusätzliche oder gepaarte Tests verwendet.
18.2. Gewicht der aufgeteilten Person
Das Bevölkerungsgewicht einer Person kann in vordefinierter Weise auf die entsprechenden Sprachen aufgeteilt werden. Das Gesamtgewicht überschreitet eine Person nicht.
18.3. Getrenntes mehrsprachiges abgestimmtes Panel
Mehrsprachige Nutzer werden für sprachübergreifende Vergleiche derselben Person verwendet. Dieses Panel wird getrennt vom Hauptpopulation-Panel analysiert. Unabhängig von der verwendeten Methode:
Das gesamte Bevölkerungsgewicht derselben Person kann nicht ohne Erklärung reproduziert werden.
19. WIE SOLLTE DIE SPRACHKENNTNIS ÜBERPRÜFT WERDEN?
Die Aussage eines Teilnehmers: „Ich kenne diese Sprache.“ kann ein Anfangseintrag sein. In der Hochsicherheitsprüfung kann jedoch eine der folgenden Methoden verwendet werden:
- Erklärung zur Muttersprache oder täglichen Nutzung
- Kurzer Lese- und Verständnistest
- Sprachaufzeichnung des Panel-Anbieters
- Überprüfung durch einen lokalen Gutachter
- Bildungs- oder berufliche Nutzungsaufzeichnung
- Erfolg der Pilotmission
Äußerst schwierige Sprachtest-Panels können für geschulte und einkommensstarke Nutzer zugänglich sein. Der Zweck besteht nicht darin, eine akademische Sprachprüfung durchzuführen. Er besteht darin, die Kompetenz zu überprüfen, die Prompt und Antwort als echter Nutzer zu verstehen.
20. WAS PASSIERT, WENN EINE SPRACHE NICHT UNTERSTÜTZT WIRD?
Ein KI-Produkt kann:
- eine bestimmte Sprache nicht offiziell unterstützen,
- sie teilweise unterstützen,
- nicht behaupten, sie zu unterstützen, aber Antworten generieren können
Es könnte sein. Sprachstatus sollten separat aufgezeichnet werden:
OFFIZIELL_UNTERSTÜTZT
BESCHRÄNKTE_UNTERSTÜTZUNG
BEOBACHTET_ABER_NICHT_UNTERSTÜTZT
NICHT_UNTERSTÜTZT
UNBEKANNT
Antwort in einer Sprache erhalten, die offiziell nicht unterstützt wird:
- Entdeckung,
- experimenteller Zugang,
- Sprachresilienz
kann gemessen werden. Sie sollte nicht automatisch zur Hauptbewertung der unterstützten Nutzerpopulation hinzugefügt werden. Das Sprachzugriffslimit sollte ebenfalls gemeldet werden.
21. LÄNDERBEVÖLKERUNGSGEWICHTUNG UND Länderbeobachter-ABDECKUNG
Die bevölkerungsgewichtete Hauptgruppe und die Sichtbarkeitsgruppe für das Land dienen unterschiedlichen Zwecken.
21.1. Bevölkerungspanel
Teilnehmer werden entsprechend ihrem Anteil an der produktrelevanten Zielpopulation verteilt. Größere zulässige Populationen erhalten ein höheres Gewicht. Produziert die Hauptbewertung der globalen Bevölkerung.
21.2. Länderbeobachterpanel
Das Country Observer Panel sucht mindestens eine Beobachtung aus kleineren Ländern, die in der Hauptstichprobe der Bevölkerung wenig oder gar nicht vertreten sind. Eine einzelne Country Observer-Beobachtung:
- zeigt, dass Zugriff verfügbar ist,
- dass ein spezifisches einzelnes Ergebnis eingetreten ist,
- zeigt den Bedarf an neuer Forschung auf
kann anzeigen. Erzielt allein keine Länderbewertung.
21.3. Ausreichend für Länderbewertung
Damit länderspezifische Raten veröffentlicht werden können:
- Mindestprobe
- gültige Beobachtungsrate,
- Unsicherheit,
- Stellvertretung im Panel
Bedingungen müssen erfüllt sein. Mit einem oder mehreren Teilnehmern: 'Die NOMOS-Bewertung des Landes' kann nicht bekannt gegeben werden.
22. Sprachgerechtigkeits-Panel
Das Bevölkerungsgewicht kann dazu führen, dass Sprachen mit geringer Bevölkerung oder geringen Ressourcen in der Hauptbewertung unsichtbar werden. Daher kann ein separates Gerechtigkeitspanel für Sprachen eingerichtet werden. Zweck:
- um unterrepräsentierte Sprachen zu testen,
- um schwerwiegende sprachbasierte Verschlechterungen zu erkennen,
- um Probleme bei der Übersetzung von Eingaben zu identifizieren,
- um das Verhalten von Sprachen mit geringen Ressourcen sichtbar zu machen
muss. Das Gerechtigkeitspanel für Sprachen kann zusätzliche Proben für das Hauptbevölkerungspanel bereitstellen. Übermäßig gesampelte Sprachbeobachtungen sollten jedoch in den globalen Wertungen wieder auf das tatsächliche Bevölkerungsgewicht zurückgeführt werden. Andernfalls würde das Gerechtigkeitspanel die globale Bevölkerungsabschätzung verändern.
23. ZUGÄNGLICHKEITSPANEL
Nutzer mit visuellen, auditiven, motorischen, kognitiven oder anderen Barrierefreiheitsbedürfnissen sind ein tatsächlicher Teil der Zielpopulation. Wenn die NOMOS Capture- oder Forschungstätigkeit für die Teilnahme dieser Personen nicht geeignet ist: Nutzer dürfen nicht aus der Zielpopulation entfernt werden. Korrektes Ergebnis:
Der Stichprobenrahmen ist im Hinblick auf Barrierefreiheit unvollständig.
Ein separates Barrierefreiheitsgremium kann Folgendes bewerten:
- Kompatibilität mit Bildschirmlesern
- Verwendung der Tastatur
- Sprachsteuerung
- Einstellungen für schwaches Sehen
- Kognitive Belastung
- Barrierefreiheit auf Mobilgeräten
- Benutzerfreundlichkeit des Capture-Tools
Das Barrierefreiheitsgremium sollte Nutzer als Teil der Populationsabdeckung betrachten und nicht als "besondere Ausnahme."
24. ZIELPOPULATION UND STICHPROBENRAHMEN
Diese beiden Konzepte sollten nicht miteinander verwechselt werden.
24.1. Zielpopulation
Die gesamte Gruppe von Personen, über die man eine Schlussfolgerung ziehen möchte.
24.2. Stichprobenrahmen
Die Population, aus der Teilnehmer tatsächlich ausgewählt werden können:
- Panel,
- Liste,
- Datenbank,
- Gemeinsame Organisation,
- Nutzerpool
ist der Cluster. Der Stichprobenrahmen deckt möglicherweise nicht die gesamte Zielpopulation ab.
24.3. Kontaktierbare Population
Dies sind die Personen, denen die Forschungseinladung tatsächlich zugestellt werden kann.
24.4. Population, die der Teilnahme zustimmt
Diejenigen, die freiwillig an der Forschung teilnehmen.
24.5. Population, die die Aufgabe abschließt
Diejenigen, die die Prüfaufgabe abschließen.
24.6. Gültige Analysepopulation
Sie sind diejenigen, die Beobachtungen erzeugen, die für das Protokoll geeignet und in der Analyse verwendbar sind. Die Zahlen dieser Schichten sollten gesondert gemeldet werden.
25. ABDECKUNGSFEHLER
Der Stichprobenrahmen kann einige Teile der Zielpopulation ausschließen. Dies wird als Abdeckungsfehler bezeichnet. Beispiele:
- Nur professionelle Online-Panels
- Nur Desktop-Nutzer
- Nur Personen mit Kreditkarten
- Nur diejenigen, die eine englische Benutzeroberfläche verwenden
- Nur Einwohner großer Städte
- Nur Nutzer, die stark an Technologie interessiert sind
- Ausschluss von Menschen mit speziellen Zugänglichkeitsbedürfnissen
Abdeckungsfehler:
- sollte erklärt werden,
- sollte nach Möglichkeit gemessen werden,
sollte durch Gewichtung oder ein zusätzliches Panel reduziert werden. Gewichtung kann nicht magisch eine Gruppe erschaffen, die im Stichprobenrahmen nicht existiert.
26. ÜBERDECKUNG
Personen, die nicht zur Zielpopulation gehören, können im Stichprobenrahmen gefunden werden. Beispiele:
- Teilnehmer in einem Land, in dem das Produkt nicht verfügbar ist
- Person, die die erforderliche Altersbedingung nicht erfüllt
- Falscher Plan oder Nutzeroberfläche
- Teilnehmer, der die Prüfsprache nicht verwenden kann
- Person, die mehrfach registriert wiedergefunden wird
- Nutzer, der im Auftrag eines anderen Landes arbeitet
Überdeckungsdatensätze sollten nicht in die Hauptbewertung einbezogen werden. Der Grund für den Ausschluss und die Rate sollten jedoch gemeldet werden.
27. NICHTREAKTION UND SELBSTAUSWAHL
Menschen, die sich bereit erklären, an der Forschung teilzunehmen, können sich systematisch von der Zielpopulation unterscheiden. Freiwillige:
- Können KI-Produkte häufiger nutzen,
- Können mehr Interesse an Technologie haben,
- Können ein höheres Bildungsniveau haben,
- Können bereits mit der Marke vertraut sein,
Können sich aufgrund von Belohnung oder Vergütung anders verhalten. Daher sollte der Ausdruck "1,000 zufällige Menschen auf der Welt" nur in wirklich probabilistischen und dokumentierten Auswahlverfahren verwendet werden. Wenn ein Freiwilliger oder Online-Panel verwendet wird, lautet der korrekte Ausdruck:
Gestuftes und gewichtetes freiwilliges Nutzerpanel
kann möglich sein. Der Paneltyp kann nicht gespeichert werden.
28. GEEIGNETE POPULATION ÄNDERT SICH IM LAUFE DER ZEIT
Das Nutzeruniversum eines KI-Produkts ist nicht festgelegt. Folgendes kann sich ändern:
- Unterstützte Länder
- Mindestalter
- Freier Zugang
- Kostenpflichtige Planstruktur
- Mobil- oder Webverfügbarkeit
- Sprachunterstützung
- Kontobedingungen
- Enterprise-Produktabdeckung
- Rechtlicher und regulatorischer Status
Aus diesem Grund zeichnet jede Population folgende Werte auf:
- Beobachtungsdatum,
- Gültigkeitsdauer,
- Quellversion,
- Datum der letzten Überprüfung
Muss tragen.
28.1. Veränderung während der Messwelle
Wenn sich der Produktzugang während der Welle wesentlich ändert:
- Die Welle kann gestoppt werden,
- Vor und nach der Änderung können zwei separate Perioden erstellt werden,
Betroffene Länder können separat analysiert werden. Nutzer vor und nach der Änderung können nicht als eine einzige Population kombiniert werden.
29. POPULATIONSQUELLENDATEI
Jede Prüfung sollte die Daten der Zielpopulation, die sie verwendet, in einer versionierten Datei speichern. Gegebenenfalls sollten die folgenden Felder enthalten sein:
- Land
- Referenzpopulation
- Populationshistorie
- Altersberechtigung
- Internet- und Gerätezugang
- Produktzugangsstatus
- Schnittstellenzugang
- Pläne- und Kontoverpflichtung
- Sprachgruppen
- Forschungsberechtigung
- Häufige Vertriebsmethode
- Unsicherheit
- Quellen
- Datum der letzten Überprüfung
- Verantwortliche Person
- Populationsversion
Länderkontingente können ohne diese Datei nach Erhalt der Ergebnisse nicht reproduziert werden.
30. SYNTHETISCHES PRODUKT UND LÄNDERANZEIGE
DEMONSTRATION DER SYNTHETISCHEN METHODOLOGIE / Die folgenden Länder, KI-Produkte, Bevölkerungszahlen und Zugriffsquoten sind vollständig fiktiv. Sie repräsentieren kein reales Land oder Produkt. Betrachten wir ein synthetisches allgemeines Verbraucherprodukt namens Orion KI. Es gibt vier synthetische Länder.
| Land | Gesamtbevölkerung | Geschätzte geeignete Bevölkerung nach Alters-, Internet-, Sprach- und Schnittstellenbedingungen | Produktzugang | Population der natürlichen Reichweite |
|---|---|---|---|---|
| Land A | 1,400,000,000 | 780,000,000 | Nicht verfügbar | 0 |
| Land B | 1,450,000,000 | 520,000,000 | Offizieller Zugang | 520,000,000 |
| Land C | 340,000,000 | 250,000,000 | Offizieller Zugang | 250,000,000 |
| Land D | 35,000 | 25,000 | Offizieller Zugang | 25,000 |
| Gesamt | 3,190,035,000 | 1,550,025,000 | 770,025,000 |
30.1. Wenn die Gesamtbevölkerung verwendet würde
hätte Land A im Hauptsample aufgrund seiner sehr großen Bevölkerung einen großen Anteil. Das Produkt kann jedoch in diesem Land nicht verwendet werden. Teilnehmende könnten keine natürliche Nutzererfahrung erzeugen.
30.2. Wenn Natürliche Reichweite Bevölkerung verwendet wird
Die theoretischen Bevölkerungsanteile des Hauptproduktpanels sind ungefähr:
- Land B: 67.53%
- Land C: 32.47%
- Land D: 0.003%
- Land A: außerhalb von Natürliche Reichweite
Der theoretische Anteil von Land D in einer Hauptstichprobe von 1,000 Personen liegt weit unter einer Person. Daher sollte das bevölkerungsgewichtete Hauptscore Land D kein hohes Gewicht geben. Wenn das Land jedoch nicht vollständig unsichtbar sein soll:
Land Beobachterpanel
Mindestens eine explorative Beobachtung kann erhalten werden. Diese Beobachtung:
- ist nicht das Ergebnis von Land D,
- ändert das Hauptbevölkerungsgewicht nicht,
zeigt, dass das Produktverhalten im Land beobachtet werden kann.
30.3. Wie wird Land A berichtet?
Für Land A:
Der Status OUTSIDE_NATIVE_REACH
wird verwendet. Der Ausschluss von Land A sollte die Zugangsgrenzen des Produkts nicht verschleiern. Die öffentliche Ergebnisübersicht zeigt zudem:
- Produktzugang-Abdeckung
- Anteil, der in der globalen Referenzpopulation nicht zugänglich ist
- Natürliche Reichweite Score
- Gemeinsame Vergleichsbasis Vergleichs-Score
31. SYNTHETISCHE PROMPT-POPULATIONSDARSTELLUNG
SYNTHETISCHES BEISPIEL
Betrachten wir drei Prompts für dasselbe Orion KI-Produkt.
Prompt A
„Was für ein Unternehmen ist Asteron?“ Zielpopulation: könnte die breite, geeignete Nutzerpopulation von Orion AI sein.
Prompt B
„Bietet Asteron Firmendienstleistungen in der Türkei an?“ Zielpopulation:
- Berechtigte Nutzer in der Türkei,
- Identifizierte externe Nutzer, die den Türkei-Service recherchieren
kann sein.
Prompt C
„Ist Asteron für legale Migrationsberatung für mich geeignet?“ Wenn Asteron einen solchen Service nicht anbietet: Es könnte keine beratungsberechtigte Bevölkerung geben, die korrekte Antwort sollte alle geeigneten Nutzer ausschließen. Die Kombination dieses Prompts in den gesamten Identitätsscore könnte falsch sein. Dieses Beispiel zeigt:
Selbst für dieselbe Entität und dasselbe KI-Produkt kann die Zielpopulation je nach gemessener Nutzerfrage variieren.
32. VIER-PANEL-ARCHITEKTUR
KANDIDATEN-ARCHITEKTUR — KANDIDATEN-ARCHITEKTUR
Vier ergänzende Panels werden für die globale und faire Implementierung von GEO-1000 empfohlen.
32.1. Bevölkerungspanel
Das Hauptpanel wird gemäß der produktberechtigten Nutzerpopulation gewichtet. Produziert die Hauptpopulation-Schätzung.
32.2. Länderbeobachterpanel
Verhindert, dass kleine Länder, die im Bevölkerungspanel nicht genügend Stichproben bereitstellen können, vollständig unsichtbar werden. Es ist allein nicht ausreichend, um einen Länderwert zu erzeugen.
32.3. Sprachgerechtigkeits-Panel
Misst auch Sprachen, die in den Bevölkerungsdurchschnittswerten wenig Ressourcen haben oder unterdrückt sind. Es verbindet sich wieder mit dem globalen Hauptwert unter Verwendung realer Bevölkerungsgewichte.
32.4. Zugänglichkeits-Panel
Misst die Bedürfnisse in Bezug auf Barrierefreiheit und Nutzer von unterstützender Technologie, die im Standard-Digitalpanel möglicherweise ausgeschlossen werden. Beobachtungen aus diesen vier Panels:
- Ziel,
- Gewichtung,
- Inference-Universum
Es sollte in Bezug auf Wartung separat gekennzeichnet werden. Dieselbe Beobachtung darf nicht ohne Erklärung mit voller Gewichtung in mehr als einem Panel verwendet werden.
33. ERSTES PANEL FÜR ERWACHSENE
GRUNDREGEL FÜR KANDIDATEN — GRUNDLEGENDES PRINZIP FÜR KANDIDATEN
In der ersten allgemeinen Veröffentlichung von GEO-1000, die echten Nutzer-Dashboards:
von erwachsenen Teilnehmern, die die Produkt- und Länderbedingungen erfüllen
Es wird empfohlen, erstellt zu werden. Dieser Ansatz:
- Zustimmung,
- Datenschutz,
- Sammeln von Screenshots,
- forschung mit hohem Risiko,
- Elterliche Zustimmung
Es kann deren Komplexität reduzieren. Es kann jedoch nicht der folgende Schluss gezogen werden: 'Die Erfahrungen von Kindern und jungen Nutzern wurden mit dem erwachsenen Panel gemessen.' Bei Produkten, die Kinder oder junge Menschen betreffen, separat:
- ethische Genehmigung,
- altersgerechtes Protokoll,
- Eltern- oder Vormundprozesse,
- Schadensschutz
sind erforderlich.
34. KEIN POPULATIONSRAHMEN KANN ALS „GESAMTE MENSCHHEIT“ BEZEICHNET WERDEN
Ein Produkt:
- wenn es in einigen Ländern nicht existiert,
- wenn es einige Sprachen nicht unterstützt,
- wenn es nur auf bestimmten Geräten funktioniert,
- wenn es bestimmte Alters- oder Tarifbedingungen hat,
Ergebnis: Es kann nicht als „die GEO-Erfahrung aller Menschen auf der Welt“ dargestellt werden. Die korrekte Ausdrucksweise:
Geschätzte Repräsentation in der Zielpopulation, die für das angegebene Produkt geeignet ist
sollte verwendet werden. Das Wort global:
- mehrere Länder,
- mehrsprachig,
- große Bevölkerung
kann eine Messung definieren. Es bedeutet nicht unbegrenzte und universelle Abdeckung.
35. GRUNDLEGENDES ETHISCHES LIMIT DER BEVÖLKERUNG
Die Definition einer Bevölkerung für eine Messung bedeutet nicht, einige Menschen als wertlos zu betrachten. Eine Gruppe kann im Hauptscore ein geringes Gewicht erhalten. Allerdings:
- hohes Risiko,
- Sprachgerechtigkeit,
- Barrierefreiheit,
- Ländersichtbarkeit
kann auch separat untersucht werden. Eine Gruppe kann vom Natürliche Reichweite-Score ausgeschlossen werden, weil sie keinen Zugriff auf ein Produkt hat. Dieser fehlende Zugriff kann auch als globale Abdeckungslücke gemeldet werden. Der Zweck von NOMOS:
- alle in einen einzigen künstlichen Durchschnitt zu komprimieren,
- nur die größten Bevölkerungen zu sehen,
- kleine Gemeinschaften symbolisch durch eine einzelne Person darzustellen
ist nicht das Ziel. Das Ziel ist:
jede Person im richtigen Nenner der richtigen Frage darzustellen, ohne ihr Gewicht und ihre Sichtbarkeit zu vermischen.
36. VERPFLICHTENDE NORMATIVE BESTIMMUNGEN
CH05-N01
Die Zielnutzerpopulation muss für jedes KI-Produkt separat definiert werden.
CH05-N02
Die Gesamtbevölkerung eines Landes kann nicht direkt als KI-geeignete Nutzerpopulation verwendet werden.
CH05-N03
Die Zielpopulation muss mit Produkt, Land, Alter, Zugriff, Schnittstelle, Plan, Sprache, Prompt und zeitlichen Bedingungen verknüpft werden.
CH05-N04
Die Zielpopulation und die Ausschlussregeln müssen versioniert werden, bevor die Ergebnisse gesehen werden.
CH05-N05
Die Zielgruppe eines KI-Produkts kann nicht ohne Erklärung auf ein anderes KI-Produkt übertragen werden.
CH05-N06
Fehlender Produktzugang kann nicht als Ergebnis einer Falschdarstellung bewertet werden; er muss getrennt als Zugangsabdeckung gemeldet werden.
CH05-N07
Teilnehmer dürfen nicht gebeten werden, Produkt- oder Länderzugangsbeschränkungen zu umgehen.
CH05-N08
Zugriff, der nicht offiziell unterstützt wird, kann nicht automatisch zur Hauptpopulation Natürliche Reichweite hinzugefügt werden.
CH05-N09
Individuelle, Konto- und Sitzungseinheiten müssen voneinander getrennt sein.
CH05-N10
Mehrere Konten oder Sprachen einer Person können das Individuum im Bevölkerungsgewicht nicht vervielfachen.
CH05-N11
Die Sprachberechtigung kann nicht allein auf der Amtssprache des Landes basieren.
CH05-N12
Die angeforderte Sprache, die Nutzerschnittstellensprache, die Antwortsprache und die Sprache der Nutzerkompetenz müssen separat aufgezeichnet werden.
CH05-N13
Das gesamte Populationsgewicht einer Person, die mehrere Sprachen verwendet, darf ohne Erklärung nicht mehr als eine Person betragen.
CH05-N14
Das populationsgewichtete Panel und das Country-Observer-Panel sollten getrennt gehalten werden.
CH05-N15
Eine oder mehrere Beobachtungen des Country Observer dürfen nicht als Länderpunktzahl veröffentlicht werden.
CH05-N16
Im Language-Fairness-Panel sollten überrepräsentierte Beobachtungen im globalen Score auf ihr tatsächliches Populationsgewicht zurückgeführt werden.
CH05-N17
Nutzer mit besonderen Zugänglichkeitsanforderungen dürfen nicht von der Zielpopulation ausgeschlossen werden, weil das Datenerfassungstool nicht geeignet ist.
CH05-N18
Die Zielpopulation, die Stichprobenbasis, die kontaktierte Population, die Teilnehmer und die gültigen analytischen Beobachtungen sollten getrennt berichtet werden.
CH05-N19
Ein Panel ohne Zufallsstatistik oder ein freiwilliges Panel darf nicht als zufällige Stichprobe der Weltbevölkerung repräsentiert werden.
CH05-N20
Durch Gewichtung kann eine Gruppe, die in der Stichprobenbasis vollständig fehlt, nicht sichtbar gemacht werden.
CH05-N21
Potenziell geeignete Bevölkerung und aktive Nutzerexposition können nicht als dieselbe Kennzahl verwendet werden.
CH05-N22
Die Ergebnisse Natürliche Reichweite und Gemeinsame Vergleichsbasis müssen voneinander getrennt werden.
CH05-N23
Die gleiche Zielpopulation kann nicht automatisch für Identitäts-, Service-, Preis-, Rechts- und Empfehlungsprompts verwendet werden.
CH05-N24
Bevölkerungsdaten, Produktzugangsstatus und Sprachverteilung müssen einen Zeitstempel und eine Quellenversion tragen.
CH05-N25
Grenznutzenverhältnisse dürfen nicht blind multipliziert werden, ohne die Unabhängigkeitsannahme zu erklären.
CH05-N26
Wenn der Produkttyp für das allgemeine Verbraucherpaneel nicht geeignet ist, darf die GEO-1000-Methode für menschliche Populationen ohne Erklärung nicht angewendet werden.
CH05-N27
Kinder oder minderjährige Nutzer dürfen nicht in das Hauptpanel aufgenommen werden, ohne ein separates ethisches und rechtliches Protokoll.
CH05-N28
Produktzugangsabdeckung und Repräsentativitätsgenauigkeit müssen als separate Ergebnisse veröffentlicht werden.
CH05-N29
Der Begriff global kann Länder, Sprachen, Altersgruppen, Schnittstellen oder Pläne, die außerhalb des Geltungsbereichs liegen, nicht unsichtbar machen.
CH05-N30
Der Zielpopulationsdatensatz muss einen verantwortlichen menschlichen oder institutionellen Eigentümer haben.
37. FORMEN DES VERSAGENS
CH05-F01— ZÄHLEN SIE DIE GESAMTBEVÖLKERUNG ALS ELIGIBLE POPULATION
Die Bevölkerung des Landes wird direkt in den Nenner aufgenommen, ohne Produkt-, Alters-, Internet-, Sprach- und Schnittstellenbedingungen zu bewerten.
CH05-F02— WENDEN SIE DIE GLEICHE WELTKARTE AUF ALLE PRODUKTE AN
KI-Produkte mit unterschiedlichen Zugriffsbereichen werden gegen dieselbe Zielpopulation gemessen.
CH05-F03— ZÄHLEN SIE EINEN NUTZER, DER DAS LIMIT ÜBERSCHREITET, ALS NATÜRLICHEN NUTZER
Beobachtungen, die die Bedingungen des offiziellen Zugangs überschreiten, werden als Erfahrung der Landesbevölkerung dargestellt.
CH05-F04— ZÄHLEN DAS FEHLEN DES PRODUKTS ALS FALSCHE ANTWORT
Länder, die unzugänglich sind, werden in der Repräsentation der Genauigkeit als null betrachtet.
CH05-F05— VÖLLIGE VERBERGUNG DES PRODUKTFEHLENS
Große Populationen, die unzugänglich sind, werden aus dem Natürliche Reichweite Nenner entfernt; die Zugriffabdeckung wird ebenfalls nicht angezeigt.
CH05-F06— ZÄHLUNG EINER PERSON ALS MEHRERE
Das Konto derselben Person, die Sprache oder Produktempfindungen multiplizieren das Bevölkerungsgewicht.
CH05-F07— ZÄHLUNG DES KONTS ALS PERSON
Mehrfachkontenbesitz oder geteilte Kontonutzung wird nicht berücksichtigt.
CH05-F08— AMTSSPRACHE ALS NUTZERSPRACHE ZÄHLEN
Die Amtssprache des Landes wird für alle Teilnehmer als Prüfungs- bzw. Audit-Sprache betrachtet.
CH05-F09— ZWEIFACHE ZÄHLUNG VON MEHRSPRACHIGEN EINZELPERSONEN
Die gleiche Person erhält in jeder Sprache das volle Bevölkerungsgewicht.
CH05-F10— ZUWEISUNG EINER PERSON ZU EINEM KLEINEN LAND UND ERKLÄRUNG DES LANDESERGEBNISSES
Beobachtungen des Länderbeobachters werden in eine statistische Länderschätzung umgewandelt.
CH05-F11— VOLLSTÄNDIGES LÖSCHEN KLEINER LÄNDER
Da der Bevölkerungsanteil gering ist, wird das Land oder die Sprache in keinem zusätzlichen Abdeckungs-Panel berücksichtigt.
CH05-F12— ÜBERGEWICHTUNG VON BEISPIELEN FÜR SPRACHGERECHTIGKEIT IM HAUPTERGEBNIS
Überstichproben von Sprachen werden nicht auf ihr tatsächliches Bevölkerungsgewicht zurückgeführt.
CH05-F13— ZÄHLEN DES AKTIVEN NUTZERS ALS POTENZIELLE BEVÖLKERUNG
Tatsächliche Nutzungsdaten werden so dargestellt, als ob sie alle Personen einschließen, die auf das Produkt zugreifen könnten.
CH05-F14— ZÄHLEN DER POTENZIELLEN BEVÖLKERUNG ALS TATSÄCHLICHE EXPOSITION
Es wird angenommen, dass die Antwort jeder Person, die das Produkt nutzen könnte, tatsächlich gesehen wird.
CH05-F15— ZÄHLUNG DES FREIWILLIGEN PANELS ALS ZUFÄLLIGE WELTPROBE
Selbstselektion und Panel-Bias werden verschleiert.
CH05-F16— IGNORIEREN DES ABDECKUNGSFEHLERS DURCH GEWICHTUNG
Es wird behauptet, dass Gruppen, die im Rahmen nicht vorhanden sind, ausschließlich durch Gewichtung vertreten werden.
CH05-F17— ENTFERNUNG VON NUTZERN, DIE DURCH DAS DATENERFASSUNGSTOOL VON DER POPULATION AUSGESCHLOSSEN WURDEN
Zugänglichkeits- oder Geräteprobleme werden so interpretiert, als ob der Nutzer nicht geeignet ist.
CH05-F18— ANWENDUNG DER GLEICHEN POPULATION AUF ALLE PROMPTS
Globale Identität, lokale Preisgestaltung und rechtliche Beratungsfragen werden auf denselben Nenner gebracht.
CH05-F19— ANWENDUNG DER ALLGEMEINEN VERBRAUCHERPOPULATION AUF DAS API-PRODUKT
Das menschliche Nutzerpanel wird direkt an den Entwickler oder das Anwendungsprodukt übertragen.
CH05-F20— GEHEIMES KOMBINIERTES ANBIETEN VON KOSTENLOSEN UND BEZAHLTEN PLÄNEN
Eine einzelne Produktverteilung wird veröffentlicht, ohne den Planunterschied zu erfassen.
CH05-F21— VEREINIGUNG VON WEB- UND MOBILBEVÖLKERUNG
Unterschiede beim Schnittstellenzugang und Verhalten bleiben unsichtbar.
CH05-F22— IGNORIEREN DER ALTERSBEGRENZUNG
Unangemessene Altersgruppen werden ohne Erklärung zur Zielpopulation oder zum Panel hinzugefügt.
CH05-F23— MULTIPLIZIEREN VON MARGINALRATEN, ALS WÄREN SIE UNABHÄNGIG
Die Beziehung zwischen Alter, Internet, Sprache und Zugang wird ignoriert.
CH05-F24— ÄNDERN DER BEVÖLKERUNG NACH DEM ERGEBNIS
Ein Land oder eine Nutzergruppe mit niedriger Punktzahl wird aus der Zielpopulation entfernt.
CH05-F25— VERWENDUNG DER ALTEN PRODUKT-REICHWEITE-KARTE
Die tatsächliche Reichweite des Produkts am Messdatum wird nicht überprüft.
CH05-F26— VERWECHSLUNG DER ERGEBNISSE VON Gemeinsame Vergleichsbasis UND Natürliche Reichweite
Vergleiche, die auf der gemeinsamen Population basieren, werden so dargestellt, als würden sie die tatsächliche globale Reichweite des Produkts widerspiegeln.
CH05-F27— EINENGUNG DES ZIELMARKTES NACH KOMMERZIELLEM INTERESSE
Die Organisation gibt nur die Länder an, in denen sie erfolgreich ist, als Zielmärkte an.
CH05-F28— ZÄHLEN DES ZUGANGSUMFANGS ALS GEOGRAFISCHE GENAUIGKEIT
Die Präsenz in vielen Ländern wird als Beweis für eine genaue Repräsentation präsentiert.
CH05-F29— BEGRENZTEN ZUGANG ALS HOHEN GLOBALE ERFOLG VERKAUFEN
Hohe Genauigkeit in einer kleinen Anzahl von Ländern wird als globale Überlegenheit dargestellt.
CH05-F30— VERWENDUNG DES BEGRIFFS „DIE GANZE WELT“ OHNE ABDECKUNGSREKORD
Ausschlüsse von Produkt, Sprache, Land und Plan sind verborgen.
38. PRÜFUNGSVERFAHREN
Schritt 1— Festschreiben des KI-Produkts und der Nutzeroberfläche
Produktoberflächenplan Kontotyp Angezeigtes Modell Messdatum wird aufgezeichnet.
Schritt 2— Klassifizieren der Messfrage
Prompt:
- globale Identität,
- lokaler Service,
- Preis,
- Gesetz,
- Empfehlung,
- hohes Risiko
zu welcher ihrer Familien gehört es?
Schritt 3— Bestimmen der globalen Referenzpopulation
Das ursprüngliche menschliche Universum, mit dem das Ergebnis verknüpft wird, wird definiert.
Schritt 4— Bestimmen von Alter und Forschungseignung
Produktaltersbedingung Forschung Altersbedingung Zustimmung und Bedingungen zur Datenverarbeitung werden aufgezeichnet.
Schritt 5— Länderspezifischen Produktzugang überprüfen
Ein Zugangsstatus zwischen PA-0 und PA-5 wird für jedes Land zugewiesen.
Schritt 6— Internet-, Geräte- und Schnittstellenkompatibilität bestimmen
Die Bevölkerung, die die gemessene Oberfläche nutzen kann, wird geschätzt.
Schritt 7— Sprach- und Gebietsschema-Universum festlegen
Eingabesprache, Schnittstellensprache, Antwortsprache und Nutzer-Sprachkenntnisse werden getrennt.
Schritt 8— Relevanz der Prompt anwenden
Es wird bewertet, ob alle Nutzer zur Zielpopulation der relevanten Eingabeaufforderungsfamilie gehören.
Schritt 9— Passendes Bevölkerungsmodell für den Produkttyp auswählen
Verbraucher-, Unternehmens-, Bildungs-, API- oder eingebettetes Produkt wird getrennt.
Schritt 10— Vergleiche die Zielpopulation mit dem Stichprobenrahmen
Es wird als Unterabdeckung und Überabdeckung erfasst.
Schritt 11— Identifiziere die Haupt- und Ergänzungspanels
Die Bereiche des Bevölkerungs-Panels, des Länderbeobachter-Panels, des Sprachgerechtigkeits-Panels und des Barrierefreiheits-Panels sind versioniert.
Schritt 12— Trenne die Natürliche Reichweite- und Gemeinsame Vergleichsbasis-Universen
Intra-Produkt-Ergebnisse und interproduktale Vergleichspopulationen werden separat erfasst.
Schritt 13— Trenne Zugriffsbereich und Genauigkeitsergebnisse
Die Genauigkeit zwischen der Population, die ein Produkt erreichen kann, und den erreichten Nutzern wird separat berichtet.
Schritt 14— Friere die Bevölkerungsdatei ein
Datenquellen, Annahmen, Datum und Bevölkerungsversion werden festgeschrieben.
Schritt 15— Verfolge wesentliche Änderungen
Wenn sich der Produktzugang oder die Bedingungen während der Messung ändern, wird eine neue Version erstellt.
39. ERFORDERLICHE BELEGE
KI-Produktidentität; Nutzeroberfläche; Plan- und Kontobedingungen; Messdatum; Länder, in denen das Produkt zugänglich ist; Länderebene-Zugangsstatus; Altersbedingungen; rechtliche und ethische Teilnahmebedingungen; Ländervölkerungsaufzeichnungen; Altersverteilungen; Internet- und Gerätezugangsaufzeichnungen; Sprach- und Gebietsschema-Verteilungen; Produktsprachunterstützung; Schnittstellenzugänglichkeit; Ziel-Prompt-Familie; Definition der Zielpopulation; Stichprobenrahmen; Unterabdeckung; Überabdeckung; Paneltyp; Teilnehmerauswahlmethode; Wahrscheinlichkeitspanel oder Opt-in-Panelstatus; Gewichte für mehrsprachige Nutzer; Abdeckung Country Observer; Abdeckung Language Fairness; Abdeckung Accessibility Panel; Natürliche Reichweite Population; Gemeinsame Vergleichsbasis Population; aktive Nutzerdaten, wo verwendet; Berechnung der Zugangsabdeckung; Annahmen und Sensitivitätsanalysen; Populationsversion; und letztes Überprüfungsdatum.
Verantwortliche Person oder Institution
40. PRÜFLISTE FÜR AUDITS
Welches KI-Produkt und welche Nutzeroberfläche wird gemessen? Für welches Datum wurde die Zielpopulation definiert? Wurden die Gesamtbevölkerung des Landes und die berechtigte Nutzerpopulation getrennt? Wurde ein Altersanforderung angewendet? Wurden Internet- und Gerätezugang bewertet? Ist das Produkt offiziell nach Ländern zugänglich? Wurden die Teilnehmer gebeten, Zugangsbeschränkungen zu überwinden? Wurden kostenlose und kostenpflichtige Pläne getrennt? Wurden Web- und mobile Schnittstellen getrennt? Hat die Aufforderungsfamilie die Zielpopulation verändert? Wie wurde die Sprach- und Ländereignung bestimmt? Wurden mehrsprachige Nutzer doppelt gezählt? Ist der Unterschied zwischen der Zielpopulation und dem Stichprobenrahmen klar? Ist das Panel probabilistisch oder freiwillig? Wurde der Abdeckungsfehler gemessen? Wurden Nutzer mit besonderen Zugangsbedürfnissen stillschweigend ausgeschlossen?
Wurden Beobachtungen des Länderbeobachters in eine Länderbewertung umgewandelt? Hatten Beispiele zur Sprachfairness ein übermäßiges Gewicht in der Hauptbewertung? Wurden die Ergebnisse von Natürliche Reichweite und Gemeinsame Vergleichsbasis getrennt? Sind Abdeckung und Repräsentationsgenauigkeit getrennt? Wurden Ergebnisse aktiver Nutzer und potenzieller Nutzer getrennt? Ist der Produkttyp für das Panel der menschlichen Bevölkerung geeignet? Wurden die Randraten in den Bevölkerungsgewichten blind multipliziert? Wurde die Bevölkerungsdefinition nach Bekanntwerden der Ergebnisse geändert? Sind die verwendeten Bevölkerungs- und Zugriffsdatensätze versioniert? Sind ungetestete Gruppen sichtbar? Ist der Begriff „global“ mit der tatsächlichen Abdeckung konsistent? Gibt es einen klar verantwortlichen Eigentümer des Bevölkerungsdatensatzes?
41. EINWÄNDE UND ANTWORTEN
Einspruch 1— „Ist es nicht gerechter, direkt nach der Weltbevölkerung zu verteilen?“
Die Weltbevölkerung ist eine starke Ausgangsbasis. Allerdings erzeugt die Einbeziehung von Personen, die das Produkt nicht nutzen können, in der Hauptproduktprobe keine echte Nutzererfahrung. Die richtige Methode ist:
- Bevölkerungsgewicht innerhalb der produktberechtigten Bevölkerung,
- globale Zugriffsabdeckung.
Beide Ergebnisse müssen gemeldet werden.
Einwand 2— „Sollten nicht die meisten Nutzer aus großen Ländern kommen?“
Länder, die die Produkt-, Sprach- und Zugriffsvoraussetzungen erfüllen, sollten natürlich einen hohen Anteil haben. Nur weil die Gesamtbevölkerung groß ist, kann jedoch keine gefälschte Nutzererfahrung in einem Land erzeugt werden, in dem das Produkt nicht zugänglich ist.
Einwand 3— „Warum wäre es falsch, einer kleinen Nation wie San Marino eine Person zu geben?“
Eine Person ist wertvoll für die Erkundung und Beobachtung durch den Länderbeobachter. Falsch ist es, das Ergebnis dieser Person als 'Länderpunktzahl' darzustellen. Die Sichtbarkeit des kleinen Landes kann mit dem Länderbeobachter-Panel geschützt werden. Das Hauptgewicht der Bevölkerung bleibt gemäß dem tatsächlichen Bevölkerungsanteil.
Einwand 4— „Wenn wir jedem Land mindestens eine Person geben, würden wir dann nicht globaler erscheinen?“
Eine größere geografische Abdeckung wird bereitgestellt. Allerdings kann die Bevölkerungsabschätzung verzerrt sein. Daher:
- geografischer Umfang,
- Bevölkerungsdichte
Sie sind separate Ergebnisse. Es kann ein Umfangs-Panel sein, um einer Person pro Land zu geben. Es ist kein Bevölkerungs-Panel.
Einwand 5— „Wenn wir einem Produkt in einem unzugänglichen Land null geben, würde das Produkt nicht unfair bestraft?“
Ein unzugängliches Land wird bei der Repräsentationsgenauigkeit nicht als null gezählt. Es wird im Abdeckungsmetrik-Zugang sichtbar. Diese Unterscheidung schützt das Produkt sowohl vor unfairen Strafen als auch vor falscher Universalität.
Einwand 6— „Wenn es echte Nutzungsdaten gibt, warum brauchen wir Bevölkerungsdaten?“
Echte Nutzungsdaten zeigen den operativen Einfluss. Allerdings zeigt das Produkt:
- welche Bevölkerungen es nicht erreicht hat,
- die geografische Ungleichheit in der Nutzerbasis,
- potenzielle Nutzerfairness
Es zeigt sich nicht allein. Die beiden Datentypen beantworten unterschiedliche Fragen.
Einwand 7— ‚Da alle Nutzer denselben Prompt stellen werden, warum ist die Relevanz des Prompts wichtig?‘
Identitätsfragen können in einer breiten Bevölkerung sinnvoll sein. Preis-, Rechts- oder Beratungsfragen sind nur für bestimmte Nutzer und Märkte sinnvoll. Eine irrelevante Bevölkerung kann die Antwortverteilung von der Nutzerrealität verzerren.
Einwand 8— „Wenn eine Person mehrere Sprachen spricht, warum sollte sie nicht in allen Sprachen vollständig gezählt werden?“
Sie können alle Sprachen im sprachübergreifenden Vergleich testen. Die gleiche Person in der Bevölkerungsgewichtung zu multiplizieren, erhöht jedoch künstlich die Weltbevölkerung. Das Gewicht der Person sollte geteilt oder ein separates, passendes Panel verwendet werden.
Einwand 9— „Ergibt die Prüfung nur von Erwachsenen nicht ein unvollständiges globales Ergebnis?“
Das stimmt. Diese Einschränkung sollte eindeutig angegeben werden. Mit einem Erwachsenenpanel zu beginnen, kann eine ethische und operative Entscheidung sein. Es stellt kein Urteil über Kinderanwender dar.
Einwand 10— ‚Ist das Online-Forschungspanel nicht ausreichend?‘
Es kann sehr wertvoll für Pilot- und gewichtete Forschung sein. Aber das Panel:
- wie viel von der Zielpopulation es abdeckt,
- wer ausgeschlossen wird,
- wie freiwillige Teilnahme Verzerrungen erzeugt
sollte erklärt werden. Die Nutzung eines Panels ist kein Fehler. Das Panel als zufällig wie die Weltbevölkerung darzustellen, ist ein Fehler.
Einwand 11— „Warum hängt das Accessibility-Panel mit dem Haupt-GEO-Score zusammen?“
Weil ein Teil der echten KI-Nutzer Assistenztechnologien oder unterschiedliche Interaktionsformen verwendet. Wenn das Datenerhebungswerkzeug diese Personen ausschließt, kann der Hauptscore nicht die gesamte Zielpopulation repräsentieren.
Einwand 12— „Macht es nicht die vielen verschiedenen Bevölkerungsdefinitionen unmöglich, einen einzigen NOMOS-Wert zu erstellen?“
Nein. Ein einzelner Wert kann erstellt werden. Es sollte jedoch klar sein, auf welche Bevölkerungsfrage er antwortet. Zum Beispiel:
- Natürliche Reichweite Bevölkerungswert
- Gemeinsame Vergleichsbasis Wert
- Marktrelevanter Wert
- Ergebnis zur Sprachgerechtigkeit
kann separate Datensätze enthalten. Die Bedeutung einer Zahl ergibt sich aus der Klarheit ihres Nenners.
GEMEINSAMES URTEIL VON KAPITEL 44
GEO-1000 enthält ‚1,000‘ in seinem Namen, aber der Wert dieser 1,000 Personen ergibt sich nicht allein aus der Zahl. Er ergibt sich aus den Antworten auf diese Fragen: Wer sind sie? Aus welcher Bevölkerung wurden sie ausgewählt? Können sie das Produkt tatsächlich nutzen? Wo leben sie? Welche Sprachen verwenden sie? Wie oft wurde dieselbe Person gezählt? Sind kleine Länder sichtbar? Behalten große Länder ihr tatsächliches Bevölkerungsgewicht bei? Wo berücksichtigt die Bewertung Menschen, die das Produkt nicht erreichen kann? Wen hat die Panel-Infrastruktur ausgeschlossen? Welches Ergebnis misst den potenziellen Zugang und welches misst die tatsächliche Nutzung? Ein großes Land kann eine große produktberechtigte Bevölkerung haben und verdient daher ein erhebliches Gewicht im Hauptpanel. Aber wenn das Produkt dort nicht verfügbar ist, darf die Prüfung keine Nutzer erfinden. Die Zugangslücke muss separat offengelegt werden.
Wenn ein Land sehr klein ist, sollte das Hauptgewicht der Bevölkerung niedrig bleiben. Es muss jedoch nicht völlig unsichtbar sein. Es kann mit einem Überwachungs-Panel beobachtet werden. Wenn eine Sprache eine kleine Bevölkerung hat, muss sie den globalen Durchschnitt nicht bestimmen. Wenn es jedoch eine starke Verzerrung in der Repräsentation dieser Sprache gibt, sollte sie ebenfalls sichtbar sein. Wenn eine Person drei Sprachen kennt, kann sie drei verschiedene Erfahrungen produzieren. Sie sind jedoch nicht drei verschiedene Personen. Wenn ein KI-Produkt bestimmtes Verhalten nur auf einem kostenpflichtigen Plan bietet, repräsentiert die Punktzahl der kostenlosen Nutzer diesen Plan nicht. Ein menschliches Bevölkerungs-Panel ist für ein Konsumenten-Chat-Produkt geeignet. Dasselbe Bevölkerungsmodell ist möglicherweise nicht für eine API oder ein Unternehmensprodukt geeignet. Daher lautet das fünfte Messgesetz von NOMOS wie folgt:
Selbst die empfindlichste Punktzahl liefert die richtige Antwort auf die falsche Frage, wenn der Nenner falsch ist.
Sein sechstes Gesetz lautet:
Die Bevölkerungszahl ersetzt nicht die Sichtbarkeit von Ländern und Sprachen.
Sein siebtes Gesetz lautet wie folgt:
Eine Person, die keinen Zugriff auf [etwas] hat, ist nicht falsch dargestellt worden; sie ist jedoch Teil der globalen Zugangsgrenze.
Sein achtes Gesetz lautet wie folgt:
Eine Person mit mehreren Konten, Sprachen oder Sitzungen erhöht nicht die menschliche Bevölkerung.
Das neunte Gesetz lautet wie folgt:
Globale Messung ist kein Anspruch darauf, dass jeder gemessen wird; es ist eine ehrliche Aufzeichnung darüber, wer gemessen wird und wer nicht.
Bestellung von Abschnitt 5 von NOMOS
Gib mir nicht nur Bevölkerungszahlen der Länder. / Zeige, welche Menschen das Produkt tatsächlich nutzen können.
Fülle kein großes Land mit gefälschten Nutzern, wenn das Produkt dort nicht vorhanden ist.
Gib einer kleinen Nation nicht eine Person und erkläre die Antwort dieser Person als die Stimme des Landes.
Du darfst eine Person nicht so oft duplizieren wie ihre Konten, Sprachen und Sitzungen.
Verwechseln Sie nicht die Amtssprache mit der tatsächlichen Sprachverwendung der Menschen.
Mache keinen kostenlosen Nutzer zum Vertreter eines kostenpflichtigen Plans und keinen mobilen Nutzer zum Vertreter der Weboberfläche.
Bezeichne das Freiwilligenpanel nicht als zufällige Weltbevölkerung.
Lösche keinen Nutzer mit speziellen Zugänglichkeitsbedürfnissen aus der Population, weil das Tool nicht funktioniert.
Entferne die Population, die das Produkt nicht erreicht, nicht aus der Genauigkeitsbewertung und verschleiere die globale Zugangslücke.
Wende denselben Anteil nicht auf eine Preisfrage wie auf eine Identitätsfrage an, oder auf eine globale Marke wie auf eine lokale Lizenz.
Definiere zuerst das Produkt. / Dann definiere die Frage. / Dann definiere das menschliche Universum. / Dann begrenze Zugriff, Sprache, Alter und Benutzeroberfläche. / Dann erkläre, wen du nicht auswählen kannst. / Und erst danach verteile 1,000 Personen.
Der abschließende Satz des Kapitels
In GEO-1000 bedeutet Gerechtigkeit nicht, die gleiche Anzahl von Personen auf jedes Land zu verteilen; sondern jede Person in der richtigen Zielpopulation mit dem richtigen Gewicht zu repräsentieren, ohne die Orte zu verbergen, an denen sie nicht gemessen werden.
Normativer Kern
Jede GEO-Populationsprüfung MUSS vor der Ergebnisüberprüfung eine zeitlich begrenzte und produktspezifische Zielpopulation von Nutzern für jede der folgenden Kombinationen definieren: - KI-Produkt und Nutzeroberfläche, - Land oder Rechtsgebiet, - Altersgrenze und Voraussetzung für einen rechtmäßigen Zugang, - Konto- oder Tarifbedingung, - Sprache und Gebietsschema, - Schnittstelle, - Prompt-Familie, - und Messzweck. Die gesamte ansässige Bevölkerung DARF NICHT als produktberechtigte Bevölkerung behandelt werden, ohne gerechtfertigte Berechtigungsanpassungen. Die Nichtverfügbarkeit des Produkts MUSS als Zugangsbeschränkung gemeldet werden, nicht stillschweigend als falsche Repräsentation bewertet oder stillschweigend aus dem globalen Umfang entfernt werden. Potenzieller Zugang, aktive Nutzung, tatsächliche Exposition, Natürliche Reichweite, Gemeinsame Vergleichsbasis, Marktrelevanz und Forschungsbeobachtbarkeit MÜSSEN als unterschiedliche Populationskonzepte bestehen bleiben. Personen, Konten, Sitzungen, Sprachen und Produktbeobachtungen DÜRFEN NICHT als austauschbare Populations-Einheiten behandelt werden. Überrepräsentierte Länder, Sprachen und Zugänglichkeitsgruppen MÜSSEN für Populationsschätzungen neu gewichtet werden, während sie separat sichtbar für Fairness- und Abdeckungsanalysen bleiben. Beobachtungen von Country Observer KÖNNEN die geografische Beobachtungsabdeckung bestimmen, DÜRFEN jedoch nicht als statistisch verlässliche Länderscores repräsentiert werden. Teilnehmer DARF NICHT dazu verpflichtet werden, Produkt-, geografische-, Alters-, Identitäts- oder Kontoeinschränkungen zu umgehen, um in das offizielle Bevölkerungs-Panel aufgenommen zu werden. Jeder Bevölkerungsrahmen MUSS versioniert, quellenbasiert, unsicherheitsbewusst und einer verantwortlichen Person oder Organisation zuordenbar sein.

