NOMOS GEO-Auditprotokoll

11 / K02 · K03 · K04 · K06 · K22

Das kontrollierte Panel unter bereinigten Bedingungen und das Panel unter natürlichen Nutzungsbedingungen

Das kontrollierte Panel unter bereinigten Bedingungen und das Panel unter natürlichen Nutzungsbedingungen — Kapitel 9 zeigte, dass das gemessene KI-Objekt nicht ausschließlich durch den Anbieter oder den Modellnamen definiert werden kann. Kapitel 10 stellte fest, dass nicht jede Frage, die denselben Entitätsnamen...

Version
0.9.0
Umfang
11.850 Wörter
Status
redaktionell fixierte Kandidatenfassung
Methodische Grundlagen
K02 · K03 · K04 · K06 · K22

Kapitelgrenze

Kapitel 9 zeigte, dass das gemessene KI-Objekt nicht ausschließlich durch den Anbieter oder den Modellnamen definiert werden kann. Kapitel 10 stellte fest, dass nicht jede Frage, die denselben Entitätsnamen enthält, denselben Prompt darstellt; der Prompt ist das experimentelle Werkzeug, das die Messung selbst bestimmt. Jetzt müssen wir die dritte Variable zwischen dem System und dem Prompt betrachten:

Wie ist der Zustand des Kontos, der Sitzung und der Nutzerhistorie bei der Nutzung des KI-Produkts?

Ein Nutzer:

  • neuer Chat,
  • Speicher ist aus,
  • Keine besonderen Anweisungen,
  • kein vorheriger Kontext,
  • standardisierte Produkteinstellungen

kann die Aufforderung unten senden. Ein anderer Nutzer kann dieselbe Aufforderung senden:

  • von einem Konto, das sie seit Jahren verwenden,
  • Erinnerung ist aktiviert,
  • mit aktivierten speziellen Anweisungen,
  • mit früheren Unterhaltungen,
  • auf ihrem tatsächlichen Tarif und Gerät

Sie können dasselbe KI-Produkt, in derselben Sprache, im selben Land, im gleichen Zeitraum und mit derselben Aufforderung nutzen. Dennoch können sie unterschiedliche Antworten sehen. Dieser Unterschied:

  • kommt von der zufälligen Variabilität des Produkts,
  • vom Tarif des Kontos,
  • aus dem Speicher,
  • aus speziellen Anweisungen,
  • von früheren Unterhaltungen,
  • aus Personalisierung,
  • vom Web- oder Tool-Status,
  • vom Unternehmens-Arbeitsbereich,
  • von der Nutzeroberfläche und den lokalen Einstellungen

Der Unterschied kann sich aus Personalisierung, Web- oder Tool-Zustand, dem organisatorischen Arbeitsbereich, der Nutzeroberfläche oder dem Gebietsschema ergeben. Es gibt kein einzelnes ‚KI‘: Suche, Abruf, Umordnung, Sprachmodell, Zitations- und Sicherheitslayer können sich unterschiedlich verhalten. Eine zuverlässige Messung muss daher das KI-Produkt oder -Modell, Datum, Land, Sprache, Abfragesatz, Wiederholungsanzahl und Beobachtung erfassen. Dieses Kapitel fügt diesem Kreislauf Nutzer- und Sitzungszustand hinzu. Die Kernanforderung von NOMOS bleibt Evidenz, Grenzen, Kontext und Zeit. Dennoch kann Kontext selbst auf zwei Arten gemessen werden. Die erste minimiert externe Unterschiede zwischen Nutzern und vergleicht KI-Produkte unter standardisierten Anfangsbedingungen. Dies ist die:

Kontrolliertes Panel unter bereinigten Bedingungen

Der zweite Ansatz misst, was Menschen durch ihre echten Konten, Pläne, Personalisierung und gewöhnlichen Nutzungsmuster sehen. Dies ist das:

Panel unter natürlichen Nutzungsbedingungen

wird genannt. Der Kontrolliertes Panel unter bereinigten Bedingungen beantwortet die Frage:

Wie stellt das Produkt die Entität im möglichst standardisierten Anfangszustand dar?

Der Panel unter natürlichen Nutzungsbedingungen hingegen fragt:

Was sehen reale Menschen über die Entität in realen Nutzersituationen?

Ein Panel ist nicht mehr „real“ als das andere. Sie messen zwei verschiedene Realitäten. Das kontrollierte Panel stärkt die Vergleichbarkeit. Das natürliche Panel macht menschliche Erfahrung sichtbar. Das kontrollierte Panel reduziert Personalisierung und Kontextunterschiede. Das natürliche Panel misst die Wirkung dieser Unterschiede auf die reale Population. Dieser Abschnitt:

  • Definition des Kontrolliertes Panel unter bereinigten Bedingungen,
  • Definition des Panel unter natürlichen Nutzungsbedingungen,
  • Zielpopulationsgruppen der beiden Panels und die Mengen, die sie schätzen,
  • Was eine saubere Sitzung bedeutet,
  • Ebenen der Überprüfung der Sauberkeit,
  • Natürlicher Kontostatus und natürlicher Gesprächskontext,
  • Gedächtnis, spezielle Anweisungen, vorherige Gespräche und Personalisierungsaufzeichnungen,
  • Unterschiede in Konto, Plan, Gerät, Benutzeroberfläche und Standort.
  • die gepaarten und unabhängigen Panel-Designs mit demselben Nutzer,
  • die Effekte von Reihenfolge, Transfer und Kontamination,
  • Clean–Natural-Differenzmetriken,
  • Privatsphäre und die Evidenzkette,
  • wie die beiden Panels im öffentlichen Bericht getrennt werden,

definiert. Dieses Kapitel behandelt noch nicht:

  • die vollständige technische Architektur von NOMOS Capture,
  • alle Felder von Screenshot- und Metadatendateien,
  • atomare Aussageentscheidung,
  • Endgültige Übergangsschwellen für Antworten,
  • das genaue Gewicht der Clean- und Natural-Panel-Werte im kombinierten NOMOS-Wert

wird nicht finalisiert. Die grundlegende Frage von Abschnitt 11 lautet:

Wie messen wir das Verhalten eines Standard-KI-Produkts und das Verhalten, das von realen Nutzern erlebt wird, ohne sie miteinander zu verwechseln?

NOMOS Herausforderung

Der gleiche Nutzer stellt dem gleichen KI-Produkt zweimal dieselbe Frage: „Mit welcher Hauptorganisation ist Apple.com verbunden, und was sind die Hauptaktivitäten dieser Organisation?“ Beim ersten Versuch:

  • ein neuer Chat wird geöffnet,
  • Speicher ist aus,
  • besondere Anweisungen sind ausgeschaltet,
  • keine vorherige Unterhaltung existiert,
  • die Webfunktion ist standardisiert,

Die Prompt wird als erste Nachricht gesendet. Antwort: „Apple.com ist eine der wichtigsten Unternehmensdomänen des Technologieunternehmens Apple. Das Unternehmen entwickelt Hardware, Software und digitale Dienste.“ Beim zweiten Versuch, der Nutzer auf seinem üblichen Konto:

  • Erinnerung ist aktiviert,
  • mit aktivierten speziellen Anweisungen,
  • hat zuvor über Investment- und Technologieunternehmen gesprochen,
  • seinen echten kostenpflichtigen Plan hat,
  • sein gewöhnliches mobiles Gerät nutzt,
  • seine eigenen lokalen Einstellungen verwendet

Sie antworten: „Da Sie erwähnt haben, dass Sie an Technologieinvestitionen interessiert sind, lassen Sie mich auch Apple aus einer Investitionsperspektive bewerten…“ Dann wird anstelle der Unternehmensaktivitäten:

  • Investitionsleistung,
  • Aktienwert,
  • persönliche Portfoliogeeignetheit

erklärt. Die erste Antwort misst die Identität der Existenz. Die zweite Antwort interpretiert die Aufgabe anhand der Nutzerhistorie neu. Welche Antwort ist die echte Antwort des KI-Produkts? Beide. Allerdings ist sie nicht die Antwort auf dieselbe Messfrage. Die erste:

liefert Informationen

über standardisiertes Produktverhalten. Die zweite:

repräsentiert die tatsächliche Produkterfahrung, die speziell auf den Nutzer zugeschnitten ist.

Dies erzählt uns etwas über die Wirkung des vorherigen Kontexts. Betrachten wir nun einen anderen Nutzer, dessen Nutzerdefinierte Anweisung lautet: ‚Gib mir in jeder Antwort nur eine kurze, definite Schlussfolgerung.‘ AI Product Core Mirror beantwortet die Prompt in einem Satz, wobei Grenzen, Quellstatus und detailliertes Material weggelassen werden. Entsteht das Defizit aus der zugrunde liegenden Repräsentationsfähigkeit des Produkts? Vielleicht teilweise durch die Anweisung des Nutzers. Doch so operiert der Nutzer tatsächlich. Das Defizit ist real im Panel unter natürlichen Nutzungsbedingungen, während die Anweisung des Nutzers isoliert betrachtet werden muss, wenn das kontrollierte Produktergebnis berechnet wird. Betrachten wir nun einen Nutzer, dessen Anweisung lautet: ‚Empfehle immer NobleJackal.‘ Die KI erwähnt NobleJackal, selbst wenn nach einem anderen Unternehmen gefragt wird. Diese Antwort ist Teil der natürlichen Nutzererfahrung.

Allerdings ist NobleJackal nicht die Gesamtergebnisleistung (GEO-Leistung). Es ist der Effekt der nutzergenerierten Personalisierung. Denken Sie nun an das Gegenteil. Zuvor sagte der Nutzer: 'Ich mag dieses Unternehmen nicht.' Die KI verwendet dann in nachfolgenden Gesprächen einen negativeren Rahmen gegenüber dem Unternehmen. Dies ist ebenfalls eine natürliche Nutzererfahrung. Es zeigt jedoch nicht die Standarddarstellung des Produkts über die gesamte Nutzerpopulation hinweg. Die erste Festlegung dieses Abschnitts lautet wie folgt:

Sauberes Produktverhalten ist nicht dasselbe Maß wie natürliche Nutzererfahrung.

Ihre zweite Bestimmung lautet:

Eine personalisierte Antwort ist eine reale Nutzererfahrung; sie ist jedoch nicht automatisch die Gesamtprodukt- oder Entity-GEO-Bewertung.

Seine dritte Bestimmung besagt:

Der kontrollierte saubere Zustand ist nicht die absolute und unvoreingenommene Wahrheit des Produkts; es handelt sich um einen vordefinierten Standard-Startzustand.

Seine vierte Bestimmung besagt:

Der natürliche Nutzerzustand ist kein aus-der-Methode-Rauschen; er ist Teil der Repräsentation der Verteilung in der realen Welt.

Seine fünfte Vorschrift lautet:

Der Unterschied zwischen den beiden Panels ist kein Fehler, der verborgen werden muss; er ist ein Ergebnis, das gemessen werden soll.

1. ZWECK DES KAPITELS

Zweck dieses Abschnitts ist es, die Repräsentationserfahrung echter Nutzer unter normalen Konten- und Sitzungskonditionen getrennt, aber vergleichbar mit dem standardisierten Verhalten von KI-Produkten zu messen. Der Abschnitt trifft die folgenden normativen Unterscheidungen:

  • Standardisierter Produktzustand versus natürlicher Nutzerzustand
  • Neuer Chat mit einem sauberen Konto
  • Geprüfter sauberer Zustand mit vorübergehendem Chat-Tag
  • Speicher aus gegenüber unbekanntem Speicherzustand
  • Private Anweisung geschlossen und Privatinhalt nicht sichtbar
  • Keine vorherigen Gespräche und keine permanente Kontohistorie
  • Kontrollierte Sitzung und neu erstelltes Konto
  • Natürlicher Kontostatus und aktueller Gesprächskontext
  • Panel unter natürlichen Nutzungsbedingungen und unkontrollierte Daten
  • Nutzerpersonalisierung und Produktstandard
  • Nutzergesteuerte Anleitung und Entität GEO-Effekt
  • Aktive Nutzerpopulation und produktgeeignete potenzielle Population
  • Erste Nutzungserfahrung und erfahrene Nutzererfahrung
  • Individuelle natürliche Reaktion und natürliche Verteilung auf Bevölkerungsebene
  • Unabhängiges Gruppendesign mit derselben Nutzerzuordnung
  • Carryover-Effekt mit gemachter Vergleichsgruppe
  • Produktunterschied mit Reihenfolgeeffekt
  • Kausaler Personalisierungseffekt mit sauberem–natürlichem Unterschied
  • Offenlegung privater Anweisungsinhalte mit Datenschutzaufzeichnung
  • Sammlung privater Gespräche bei Erhaltung des natürlichen Kontextes
  • Standardproduktresultat mit sauberem Panel-Resultat
  • Gesamtergebnis für alle Nutzer mit natürlichem Panel-Resultat
  • Personalisierungseffekt mit Nutzerplan
  • Kontrollierter Durchschnitt mit natürlicher Fehlerwarteschlange
  • Gleiche Antwort für jeden Nutzer mit Fairness bei der Personalisierung
  • Natürliche Nutzerrealität und Wiederholbarkeit von Tests

Am Ende dieses Abschnitts sollte jedes GEO-1000-Audit in der Lage sein, die folgenden Fragen zu beantworten:

Welche Ergebnisse stammen von Kontrolliertes Panel unter bereinigten Bedingungen und welche von Panel unter natürlichen Nutzungsbedingungen?

Welche Situationen wurden tatsächlich im sauberen Panel standardisiert?

Welche echten Nutzerunterschiede wurden im natürlichen Panel beibehalten?

Wie wurden Speicher, besondere Anweisungen, frühere Unterhaltungen, Pläne und Schnittstellenzustände aufgezeichnet?

Wie viel des Unterschieds zwischen den beiden Panels kann zuverlässig mit der Personalisierung in Verbindung gebracht werden?

Wie wurde das Vorhandensein eines natürlichen Kontexts nachgewiesen, während die Privatsphäre der Nutzer gewahrt blieb?

2. ZENTRALE NORMATIVE BESTIMMUNG

Jede GEO-1000-Prüfung sollte standardisiertes Produktverhalten und natürliche Nutzererfahrung als separate Vorhersageobjekte definieren; sie sollte die Ergebnisse von Kontrolliertes Panel unter bereinigten Bedingungen und Panel unter natürlichen Nutzungsbedingungen nicht ohne Erklärung zu einer einzigen Stichprobe, Nenner oder Punktzahl zusammenfassen. Soweit relevant, zielt Kontrolliertes Panel unter bereinigten Bedingungen darauf ab, die folgenden Bedingungen zu standardisieren:

  • Neue und separate Unterhaltung
  • Abwesenheit des vorherigen Gesprächskontexts
  • Persistenter Speicherzustand ausgeschaltet oder deaktiviert
  • Spezielle Anweisungen ausgeschaltet oder deaktiviert
  • Definierter Web-, Abruf- und Werkzeugzustand
  • Definierter Plan und Nutzeroberfläche
  • festgeschriebene Prompt
  • Standardisierte Sprache und Gebietsschema
  • Messwelle und Zeitfenster

Wenn es ein Panel unter natürlichen Nutzungsbedingungen ist, bewahrt es die folgenden tatsächlichen Unterschiede, soweit relevant:

  • Echtes Nutzerkonto
  • Echter Plan
  • Echte Nutzeroberfläche
  • Echter Speicherzustand
  • Echter spezieller Befehlszustand
  • Echtes Kontenalters- und Nutzungshistorie
  • Echtes Gerät
  • Echter Standort und Zugriffsbedingungen
  • Gewöhnliche Art der Produktnutzung

Allerdings ist das natürliche Panel auch nicht ohne Protokoll. Folgendes ist wieder festgeschrieben:

  • Prompt-Version
  • Versandmethode
  • Messzeit
  • Regel für die erste geeignete Ausgabe
  • Evidenzpaket
  • Teilnehmer- und Produktberechtigung
  • Antwort nicht ändern
  • Keine off-task Folge-Nachrichten senden
  • Schutz personenbezogener Daten

3. ZWEI GETRENNTE SCHÄTZOBJEKTE

Kontrollierte und natürliche Panels sagen nicht die gleiche Wahrscheinlichkeit voraus.

3.1. Kontrollierte saubere Repräsentationswahrscheinlichkeit

Insbesondere:

  • KI-Produkt,
  • Plan,
  • Oberfläche,
  • Prompt,
  • Land,
  • Sprache,
  • Zeit

ist die Wahrscheinlichkeit, eine gültige Repräsentation unter einer standardisierten sauberen Sitzung zu sehen für:

θ^C_{E,A,P,U,t}= Pr(Y=1| CleanState=1)

Die Zielpopulation hier ist das Ergebnis, das Personen, die für die Nutzung des betreffenden Produkts geeignet sind, unter standardisierten Produktbedingungen sehen würden.

3.2. Wahrscheinlichkeit der natürlichen Nutzerrepräsentation

Es ist die Wahrscheinlichkeit, eine gültige Repräsentation in der realen aktiven oder definierten natürlichen Nutzerpopulation zu sehen, während die üblichen Konto- und Personalisierungsbedingungen der Nutzer beibehalten werden.

θ^N_{E,A,P,U,t}= Pr(Y=1| NaturalState=1)

Die Zielpopulation hier:

  • sind nicht alle produktberechtigten Personen,
  • sondern reale oder natürliche Produktbenutzer im definierten Zeitraum

können sein. Diese beiden Populationen müssen nicht identisch sein.

3.3. Zwei Ergebnisse können nicht austauschbar verwendet werden

Kontrollierte Bewertung: bedeutet nicht „Die meisten echten Nutzer haben dies gesehen.“ Natürliche Bewertung: bedeutet nicht „Das Produkt verhält sich standardmäßig so.“

4. WAS IST EIN Kontrolliertes Panel unter bereinigten Bedingungen?

Ein Kontrolliertes Panel unter bereinigten Bedingungen ist ein Panel, das das Verhalten des KI-Produkts unter definierten Anfangsbedingungen misst, indem die materiellen Unterschiede, die durch Konten und Sitzungen unter den Nutzern entstehen, minimiert werden. Der Zweck des Kontrolliertes Panel unter bereinigten Bedingungen ist:

  • die Vergleichbarkeit zwischen Produkten zu erhöhen,
  • die Wirkung von Gedächtnis und speziellen Anweisungen zu verringern,
  • das Auslaufen von vorherigen Gesprächen zu verhindern,
  • das Prompt zu einer anfänglichen und unabhängigen Aufgabe zu machen,

einen Referenzpunkt zu erzeugen, der dem grundlegenden Produktverhalten des Systems näher ist. Kontrolliertes Panel:

  • absolute Modellfähigkeiten,
  • die tatsächliche Erfahrung aller Nutzer,
  • vollständig kontextfreie und unvoreingenommene KI-Antwort

beansprucht nicht zu sein. Nur:

ein vordefinierter und geprüfter sauberer Ausgangszustand

wird erzeugt.

5. WAS BEDEUTET „SAUBER“?

Ein sauberer Zustand kann möglicherweise nicht mit demselben technischen Verfahren bei jedem Produkt erstellt werden. Ein Produkt:

  • persistenter Speicher,
  • spezielle Anweisungen,
  • Nutzerprofil,
  • frühere Unterhaltung,
  • geschäftlicher Arbeitsbereich,
  • konto-basierte Personalisierung

kann verwendet werden. Andere Produkte haben möglicherweise einige dieser Funktionen nicht. Die funktionale Definition eines sauberen Zustands lautet wie folgt:

Der Anfangszustand, bei dem die Wahrscheinlichkeit, dass Nutzerspezifische faktenbasierte Informationen und Gesprächskontexte die Antwort vor der Audit-Aufforderung beeinflussen, auf das vom Produkt erlaubte Maß reduziert wird, und die verbleibenden Unbekannten explizit aufgezeichnet werden.

Sauberer Zustand:

  • einfach ein neues Gespräch öffnen,
  • den Browser aktualisieren,
  • die Anwendung schließen und wieder öffnen

wird nicht als automatisch betrachtet.

6. SAUBERKEITSEBENEN

Die folgenden Ebenen sollten im Bedienfeld separat bewertet werden.

6.1. Gesprächs-Sauberkeit

Es sollte keine vorherige Nutzer- oder Systemnachricht im aktuellen Chat vorhanden sein. Die Prompt sollte die erste Nutzeranfrage sein.

6.2. Persistentes Speichern zurücksetzen

Der Speicher, den das Produkt über den Nutzer von Sitzung zu Sitzung behält:

  • aus,
  • deaktiviert,
  • in dieser Sitzung nicht verwendet

sollte sein. Wenn eine vollständige Überprüfung nicht möglich ist, wird ein unbekannter Zustand aufgezeichnet.

6.3. Benutzerdefinierte Anweisungen zurücksetzen

Die vom Nutzer festgelegten speziellen Anweisungen für Antwortstil, Präferenzen oder Beratung:

  • aus,
  • vorübergehend inaktiv,
  • nicht vorhanden

muss sein.

6.4. Bereinigung des Unternehmenskontexts

Unternehmensarbeitsbereich:

  • private Dokumente,
  • Unternehmensrichtlinien,
  • Anweisungen der Geschäftsleitung,
  • private Wissensdatenbanken

falls verwendet, sollten diese vom kontrollierten allgemeinen Produktpanel getrennt sein.

6.5. Bereinigung von Werkzeug- und Informationsmodus

Web, Abruf, Zitation und Werkzeugbedingungen sollten in allen verglichenen Beobachtungen auf die gleiche Konfiguration eingestellt sein. Sauber zu sein bedeutet nicht, dass die Werkzeuge ausgeschaltet sind. Sauber zu sein bedeutet, dass der Werkzeugstatus vordefiniert und vergleichbar ist.

6.6. Bereinigung von Prompts

Prompt:

  • anfängliche Nachricht,
  • vollständige Version,
  • unverändert,
  • ohne versteckte Anweisungen

muss sein.

6.7. Messung der Sauberkeit

Teilnehmer:

  • sollte die Antwort nicht aktualisieren,
  • sollte keine Folgfrage senden,
  • sollte das Ergebnis nicht auswählen,

sollte keine andere KI-Antwort in dieselbe Sitzung übernehmen.

7. SAUBERKEITSZUSTAND VERTRAUENSLEVEL

CSC-0— UNBEKANNTE SAUBERKEIT

Die Sauberkeit der Sitzung und des Kontos konnte nicht zuverlässig bestimmt werden. Kann nicht in die Hauptanalyse des kontrollierten Panels einbezogen werden.

CSC-1— NUR NEUES GESPRÄCH

Nur neue Konversationen werden überprüft. Persistente Speicher- und Spezialanweisungsstatus sind unbekannt.

CSC-2— SITZUNGS-SAUBERKEIT

Es wurde überprüft, dass es kein neues Gespräch und keinen vorherigen Gesprächskontext gibt. Eine dauerhafte Personalisierung kann möglicherweise nicht vollständig kontrolliert werden.

CSC-3— PERSONALSATION-KONTROLLIERT

Neue Unterhaltung, Speicher, spezielle Anweisungen und Nutzerspezifische Standard-Einstellungen wurden überprüft und auf einen definierten Zustand gesetzt.

CSC-4— INSTRUMENTIERTER SAUBERER ZUSTAND

Produkt-Einstellungen, Nutzeroberfläche, Werkzeuge und Personalisierungsstatus wurden im Evidenzpaket überprüft.

CSC-5— REPLIZIERTE SAUBERE KONFIGURATION

Sauberer Zustand:

  • verschiedene Nutzer,
  • verschiedene Wellen,
  • unabhängige Überprüfung

Es konnte unter reproduzierbaren Bedingungen durchgeführt werden. Das Haupt-Kontrolliertes Panel unter bereinigten Bedingungen sollte mindestens:

CSC-3

Stufe. Wenn das Produkt dies nicht zulässt, sollte die Einschränkung sichtbar sein.

8. EIN NEUER CHAT IST KEIN SAUBERES KONTO

Wenn eine neue Unterhaltung gestartet wird: kann der aktuelle Chat-Kontext zurückgesetzt werden. Allerdings:

  • persistenter Speicher,
  • benutzerdefinierte Anweisungen,
  • Kontoplan,
  • Nutzerprofil,
  • Land und Gebietsschema,
  • Unternehmenseinstellungen

können bestehen bleiben. Daher:

Neuer Chat bedeutet nur Konversationsbereinigung.

Es ist kein Nachweis für den vollständigen sauberen Status.

9. EINSCHRÄNKUNG DES „TEMPORÄREN“ ODER „PRIVATEN“ Sitzungskennzeichnung

Eine KI-Produktsitzung:

  • vorläufig,
  • privat,
  • evergehend,
  • vertraulich,
  • ohne Gedächtnis

kann benannt werden. Die tatsächliche Funktion dieses Labels sollte gemäß Produkt und Version separat überprüft werden. Das Label beweist nicht automatisch, dass es alle folgenden Bereiche abdeckt:

  • Besondere Anweisungen
  • Unternehmenseinstellungen
  • Regionalpolitik
  • Werkzeugeinstellungen
  • Nutzerplan
  • Experimentelle Produktfunktionen

Der korrekte Eintrag sollte lauten: „Der temporäre Sitzungsmodus des Produkts wurde verwendet; der Status der folgenden Personalisierungsbereiche wurde separat überprüft.“

10. KONTOART AUF SAUBEREM PANEL

Nicht alle Nutzer eines kontrollierten Panels dürfen denselben Plan verwenden. Es gibt drei Ansätze.

10.1. Plan-Festes Sauberes Panel

Alle Nutzer werden auf demselben Plan und derselben Nutzeroberfläche gemessen. Dies ist stark für Produktvergleiche. Der Plan repräsentiert möglicherweise nicht die tatsächliche Populationsverteilung.

10.2. Plan-Stratifiziertes Sauberes Panel

Freie, bezahlte und andere Pläne werden als separate saubere Zellen gemessen. Für jeden Plan wird ein separater Score erstellt. Der kombinierte Score kann nach der tatsächlichen Planverteilung gewichtet werden.

10.3. Standardöffentliche Oberfläche des Produkts

Die Hauptoberfläche des Produkts, die öffentlich zugänglich ist und die niedrigste Zugangsschwelle hat, kann als Standardreferenz ausgewählt werden. Dieses Ergebnis stellt nicht alle zahlenden oder Unternehmensbenutzer dar. Der zu verwendende Ansatz muss vor der Prüfung festgelegt werden.

11. EIN NEUES KONTO IST BEI EINEM SAUBEREN PANEL NICHT ERFORDERLICH

Die Verwendung eines neuen Kontos kann einige Personalisierungseffekte verringern. Jedoch:

  • Bedingungen des Produkts,
  • Telefon- oder Zahlungsanforderung,
  • Kontenerstellungsverzerrung,
  • nur neue Nutzererfahrung,
  • Mehrfachkontenrichtlinie

kann Probleme verursachen. Der Zweck eines Kontrolliertes Panel unter bereinigten Bedingungen besteht nicht darin, neue Konten zu erstellen:

um das materiale Nutzerspezifische Kontext in kontrollierbarer Weise zu reduzieren.

Wenn ein sauberer Zustand im vorhandenen Konto zuverlässig hergestellt werden kann, ist ein neues Konto nicht zwingend erforderlich. Wenn das Produkt dies nicht zulässt, kann ein separates kontrolliertes Testkonto oder eine vom Anbieter unterstützte Forschungsumgebung verwendet werden. Teilnehmer dürfen nicht gebeten werden, ein Konto zu erstellen, das die Nutzungsbedingungen verletzen würde.

12. VERBLEIBENDE UNTERSCHIEDE BEI NUTZERN IM SAUBEREN PANEL

Ein kontrollierter sauberer Zustand beseitigt nicht alle Nutzerunterschiede. Folgendes kann weiterhin bestehen:

  • Land
  • Locale
  • Plan
  • Gerät
  • Benutzeroberfläche
  • Produkteinführung
  • Kontoalter
  • Segmentierung, die für den Anbieter nicht sichtbar ist
  • Verkehrslenkung
  • A/B-Test

Diese Unterschiede:

  • sollten geschichtet werden,
  • sollten aufgezeichnet werden,

Wenn unbekannt, sollte es als Unsicherheit beibehalten werden. Das „Clean“-Label bedeutet nicht „Alle Nutzer waren technisch genau gleich.“

13. WAS IST EIN Panel unter natürlichen Nutzungsbedingungen?

Ein Panel unter natürlichen Nutzungsbedingungen ist ein Panel, das misst, was Nutzer sehen, im Vergleich zum gleichen festgeschriebenen Prompt, während es echte Konten, Pläne, Geräte, Personalisierung und normale Produktnutzungsbedingungen beibehält. Der Zweck des natürlichen Panels ist:

  • reale Nutzeraussetzung,
  • Variation aufgrund von Personalisierung,
  • Einfluss der Kontohistorie,
  • Unterschiede in Plan und Nutzersurface,
  • natürlicher Fehler- und Empfehlungsspiegel

Es soll sichtbar gemacht werden. Natürliches Panel:

  • vollständig freies Nutzerverhalten,
  • unbegrenzte Folgefragen,
  • der Teilnehmer, der den Prompt ändert,
  • die beste Antwort auswählt

bedeutet nicht. Das Natürliche ist:

Nutzerzustand

ist. Prompt- und Evidenzprotokoll werden weiterhin kontrolliert.

14. ZWEI HAUPTSPUREN DES NATÜRLICHEN PANELS

14.1. Natürliche Konto-Zustand-Spur

Nutzer:

  • echtes Konto,
  • echter Plan,
  • echtes Gedächtnis und privater Instruktionszustand,
  • echte Nutzeroberfläche

wird beibehalten. Ein neues Gespräch wird jedoch eröffnet. Der Prompt wird als erste Nachricht gesendet. Diese Spur beantwortet die folgende Frage:

Was sieht der Nutzer bei einem neuen Thema, während die Personalisierung des echten Kontos erhalten bleibt?

Dies ist der wichtigste vergleichbare Ansatz des natürlichen Panels.

14.2. Natürliche Gesprächs-Zustand-Spur

Der Prompt wird im aktuellen oder üblichen Gesprächskontext des Nutzers gesendet. Diese Spur:

  • misst die echte Chat-Kontinuität,
  • die Auswirkung des vorherigen Themas,
  • die Akkumulation der Nutzer–KI-Beziehung

Allerdings unterscheiden sich die Gesprächskontexte zwischen den Nutzern. Daher:

  • diagnostisch,
  • fallbasiert,
  • sollte als separate Verteilung gemeldet werden

und sollte nicht direkt zur Hauptprodukt-Rangliste hinzugefügt werden.

15. NATÜRLICHE NUTZER-UNTERGRUPPEN

Ein natürliches Panel besteht nicht aus einheitlichen Nutzern. Soweit relevant, können die folgenden Untergruppen unterschieden werden:

  • Erstnutzer
  • Neukonto-Nutzer
  • Selten nutzende Nutzer
  • Regelmäßiger Nutzer
  • Starker Nutzer
  • Kostenloser Plan
  • Bezahltes Abonnement
  • Firmenkunde
  • Speicher an
  • Speicher aus
  • Spezialanweisung an
  • Spezialanweisung aus
  • Mit vorheriger Marken-Konversation
  • Ohne vorherige Marken-Konversation
  • Kunde
  • Allgemeine Öffentlichkeit
  • Hohe Markenbekanntheit
  • Geringe Markenbekanntheit

Diese Gruppen können nach Kenntnis der Ergebnisse nicht erfunden werden. Der grundlegende Untergruppenplan muss vor der Datenerhebung versioniert werden.

16. NATÜRLICHE ZUSTANDSSICHERHEIT

NSF-0— NATÜRLICHER ZUSTAND UNBEKANNT

Es gibt nicht genügend Aufzeichnungen über das natürliche Konto und den Sitzungsstatus des Nutzers.

NSF-1— SELBSTBERICHTETE NATÜRLICHE NUTZUNG

Der Nutzer hat erklärt, dass er sein normales Konto und seine Einstellungen verwendet.

NSF-2— EINSTELLUNGS-VERZEICHNETE NATÜRLICHE NUTZUNG

Pläne, Oberflächen, Speicher, besondere Anweisungen und Sitzungsstatus wurden als relevant aufgezeichnet.

NSF-3— EVIDENZBASIERT NATÜRLICHE NUTZUNG

Einstellungen und der natürliche Nutzerzustand werden durch datenschutzschützende Evidenz unterstützt.

NSF-4— LÄNGSSCHNITTLICH CHARAKTERISIERTE NATÜRLICHE NUTZUNG

Die Produktnutzung des Nutzers und der Kontostatus wurden über mehrere Wellen charakterisiert. Die Hauptanalyse des natürlichen Panels umfasst mindestens:

NSF-2

sollte dieses Niveau anstreben.

17. DIE AUFZEICHNUNG DES NATÜRLICHEN ZUSTANDS IST KEINE SAMMLUNG PRIVATEN LEBENS

Der Panel unter natürlichen Nutzungsbedingungen sollte standardmäßig die folgenden Arten sensibler Daten nicht erfassen:

  • Volltext spezieller Anweisungen
  • Inhalte vergangener Gespräche
  • Persönliche Gesundheits-, Rechts- oder Finanzinformationen
  • Name des Nutzers
  • E-Mail-Adresse
  • Profilbild
  • Kontopasswort
  • Vorherige private Dateien
  • Empfindliche institutionelle Dokumente

In den meisten Fällen sind die folgenden hochrangigen Status ausreichend:

  • Speicher ein/aus/unbekannt
  • Besondere Anweisungen vorhanden/nicht vorhanden/unbekannt
  • Vorherige Konversation vorhanden/abwesend
  • Frühere Unterhaltung über die geprüfte Einheit: ja/nein/unbekannt
  • Unternehmensarbeitsbereich: ja/nein
  • Plan-Klasse
  • Kontolaufzeitband
  • Nutzungsfrequenzband

Falls der Inhalt der Sonderanweisung wirklich für die Forschungsfrage notwendig ist:

  • separate ausdrückliche Zustimmung,
  • Datenminimierung
  • Bearbeitung,
  • eingeschränkter Zugriff

sind erforderlich.

18. SPEICHERSTATUS

Speicher:

  • aus,
  • offen,
  • wird vom Produkt nicht unterstützt
  • Status unbekannt

klassifiziert werden.

MS-0— UNBEKANNT

Der Speicherstatus konnte nicht bestimmt werden.

MS-1— NICHT VERFÜGBAR

Das Produkt oder die Oberfläche bietet diese Funktion nicht an.

MS-2— AUS

Der Speicher ist aus.

MS-3— EIN, KEIN BEKANNTES ENTITY-SPEICHER

Der Speicher ist eingeschaltet; es gibt keinen bekannten spezifischen Eintrag zur geprüften Einheit. Diese Informationen basieren häufig auf der Nutzerangabe.

MS-4— EIN, ENTITY-RELEVANTER SPEICHER MÖGLICH

Der Speicher ist eingeschaltet, und frühere Informationen über die geprüfte Einheit oder den relevanten Bereich könnten vorhanden sein.

MS-5— ENTITY-RELEVANTER SPEICHER BESTÄTIGT

Der mit der Entität zusammenhängende Memory-Effekt wurde mit ausdrücklicher Zustimmung des Nutzers bestätigt. Memory eingeschaltet zu haben ist nicht automatisch eine negative oder positive Bedingung. Es ist der tatsächliche Nutzerzustand, gemessen am natürlichen Panel.

19. STATUS BESONDERER ANWEISUNG

CI-0— UNBEKANNT

Der Status der besonderen Anweisung konnte nicht bestimmt werden.

CI-1— NICHT VERFÜGBAR

Das Produkt bietet diese Funktion nicht an.

CI-2— AUS ODER LEER

Es gibt keine besondere Anweisung oder sie ist ausgeschaltet.

CI-3— AKTIV, NICHT-MATERIELLE KATEGORIE

Es gibt eine besondere Anweisung; es wurde angegeben, dass sie allgemeine Ton- oder Stilpräferenzen trägt.

CI-4— AKTIV, POTENTIELL MATERIELL

Anweisung:

  • Empfehlung,
  • Quelle,
  • Sprache,
  • bestimmte Unternehmen,
  • Politik oder Meinung

kann die Antwort beeinflussen.

CI-5— ENTITY-RELEVANTER ANWEISUNG BESTÄTIGT

Es wurde mit ausdrücklicher Zustimmung bestätigt, dass es eine direkte Anweisung bezüglich der geprüften Einheit oder eines Konkurrenten gibt. CI-5 ist eine natürliche Nutzerbeobachtung. Sie kann nicht als der Gesamterfolg der Einheit GEO interpretiert werden. Es handelt sich um ein separates Personalisierungsereignis.

20. FRÜHERE KONVERSATIONSKONTEXT

Es gibt einen Unterschied zwischen einem Nutzer, der zuvor mit einem KI-Produkt interagiert hat, und früheren Nachrichten in der aktuellen Unterhaltung. Diese sollten getrennt werden:

  • Kontohistorie
  • Persistenter Speicher
  • Aktueller Chat-Kontext
  • Frühere Konversation mit der geprüften Einheit
  • Frühere Konversation in derselben Branche
  • Beobachtete Antworten anderer KI-Produkte

Der aktuelle Gesprächskontext sollte nicht im Haupt-Natural Account-State Track gefunden werden. Im Natural Conversation-State Track hingegen ist das Vorhandensein von Kontext die Messgröße selbst.

21. KONTOALTER UND NUTZUNGSINTENSITÄT

Alte und häufig genutzte Konten:

  • tragen mehr Personalisierung,
  • mehr Speicher,
  • anderen Plan,
  • mehr Produktfunktionen

können enthalten. Kontoaltersklassen:

  • 0–30 Tage
  • 31–180 Tage
  • 181–365 Tage
  • mehr als 1 Jahr
  • unbekannt

können definiert werden als. Nutzungsfrequenz:

  • erste Nutzung
  • selten
  • monatlich
  • wöchentlich
  • täglich
  • professionell

tönnen klassifiziert werden. Feste Bereiche sollten vor den Ergebnissen bestimmt werden.

22. ERSTVERWENDUNGSPANEL

Ein spezieller Subtyp der natürlichen Nutzererfahrung:

Erstverwendungs-Panel

kann genannt werden. Dieses Panel:

  • Nutzer, die das Produkt zum ersten Mal oder nur wenige Male verwenden,
  • die keine Personalisierungshistorie haben,
  • die mit den tatsächlichen Standardeinstellungen des Produkts fortfahren

misst Personen. Erstverwendungs-Panel: Es ist kein Kontrolliertes Panel unter bereinigten Bedingungen, da die Nutzer die tatsächliche Erstkonfiguration, Standardeinstellungen und den Onboarding-Prozess erleben. Es unterscheidet sich auch von einem erfahrenen Panel unter natürlichen Nutzungsbedingungen. Es beantwortet die folgende Frage:

Wie nimmt ein neuer Nutzer dessen Präsenz wahr, wenn er das Produkt zum ersten Mal begegnet?

23. UNTERNEHMENS- UND VERWALTETES NATURPANEL

Unternehmensbenutzer:

  • Firmenarbeitsbereich,
  • Administraturrichtlinien,
  • private Wissensdatenbank,
  • Sicherheitseinstellungen,
  • Unternehmensgedächtnis

kann tragen. Diese Nutzer:

Managed Panel unter natürlichen Nutzungsbedingungen

sollten darunter separat gemessen werden. Unternehmensresultat:

  • genereller Verbraucher-Natural-Score,
  • Standard-Produkt-Score

kann nicht dargestellt werden. Wenn eine private Wissensdatenbank verwendet wird, muss auch erklärt werden, dass interne Aufzeichnungen zur geprüften Einheit existieren.

24. DER PROMPT IST IM NATURAL-PANEL WIEDER GESCHLOSSEN

Das Natural-Panel lässt die Nutzer:

  • Konto,
  • Einstellungen,
  • Plan,
  • Gerät

natürlich. Es lässt den Prompt nicht natürlich. Der Teilnehmer:

  • kann den Prompt nicht ändern,
  • kann keinen zusätzlichen Kontext hinzufügen,
  • kann keine neue Persona schreiben wie 'für mich' oder 'meiner Meinung nach'

kann die Antwort nicht aktualisieren. Wenn die natürliche Aufforderungsvielfalt gemessen werden soll, steht dies in Kapitel 10:

Natürlicher Nutzerpfad

Es sollte separat darunter gestaltet werden.

25. WARUM IST EIN NEUES GESPRÄCH IM NATÜRLICHEN PANEL NOTWENDIG?

Neuer Chat auf dem Zustands-Track des natürlichen Kontos:

  • entfernt den aktuellen Gesprächskontext,
  • behält die echten permanenten Einstellungen des Nutzerkontos bei,

macht denselben Prompt vergleichbarer. Diese Struktur trennt zwei Ebenen:

  • Permanenter natürlicher Kontostatus
  • Momentaner Gesprächskontext

Wenn der aktuelle Chat verwendet wird, vermischen sich beide.

26. TOOL- UND WEB-STATUS IM NATÜRLICHEN PANEL

Natürliche Nutzer:

  • Webfunktion aktiviert,
  • aus,
  • automatisch,
  • begrenzt nach Plan

kann verwendet werden. Es gibt zwei Optionen.

26.1. Voller natürlicher Werkzeugstatus

Der Nutzer behält normale Werkzeug-Einstellungen. Misst echte Nutzererfahrungen. Die Vergleichbarkeit zwischen Produkten kann abnehmen.

26.2. Werkzeug-fester natürlicher Kontostatus

Speicher und Kontopersonalisierung bleiben natürlich. Web- oder Werkzeugmodus ist standardisiert. Die Wirkung der Personalisierung kann sauberer verglichen werden. Dieses Unterpanel sollte richtig beschriftet sein. Es sollte nicht als "Vollständig natürlich" dargestellt werden.

27. ZIELPOPULATION DES NATÜRLICHEN PANELS

Die Zielpopulation des natürlichen Panels kann eine der folgenden Formen haben:

27.1. Aktive Produktnutzer

Personen, die das Produkt tatsächlich in einem bestimmten Zeitraum genutzt haben.

27.2. Registrierte Kontoinhaber

Nutzer, die ein Konto haben, deren Aktivitätsniveau jedoch variiert.

27.3. Nutzer des Real Plans

Populationen von kostenlosen, kostenpflichtigen oder Unternehmenskunden.

27.4. Nutzer, die möglicherweise die Möglichkeit haben, Entitäten abzufragen

Es kann schwierig sein, dies direkt zu messen. Es erfordert separate Verhaltensdaten. Es sollte klar angegeben werden, auf welche Population das natürliche Panel verallgemeinert wird.

28. GEWICHTUNG DES NATÜRLICHEN PANELS

Panel unter natürlichen Nutzungsbedingungen:

  • kann nach der tatsächlichen aktiven Nutzerpopulation des Produkts gewichtet werden,
  • Konten- und Planverteilung,
  • Länder- und Sprachverteilung,
  • Nutzungsfrequenz

Allerdings sind zuverlässige Daten zu aktiven Nutzern möglicherweise nicht verfügbar. In diesem Fall ist das Ergebnis:

Gewichtetes Ergebnis des natürlichen Forschungspanels

sollte dargestellt werden als. Die folgende Behauptung kann nicht aufgestellt werden: „Die definitive Erfahrung aller realen Nutzer.“

29. KOMPLEMENTARITÄT VON KONTROLLIERTEN UND NATÜRLICHEN PANELS

Vier Hauptergebnisse sind möglich.

Kontrolliertes Panel unter bereinigten BedingungenPanel unter natürlichen NutzungsbedingungenKommentar
HochHochDas Produkt ist sowohl unter Standard- als auch unter realen Nutzerbedingungen stark
HochNiedrigPersonalisierung, Plan, Nutzerzustand oder natürlicher Kontext können die Repräsentationsqualität beeinträchtigen
NiedrigHochEinige reale Nutzerfunktionen oder -tools können die Repräsentation verbessern
NiedrigNiedrigGesamtproblemkandidat auf Basisebene und natürlicher Nutzerebene

Diese Tabelle ist kein Beleg für Kausalität. Sie ist ein Ausgangspunkt, um zu untersuchen, woher der Unterschied kommt.

30. REIN–NATÜRLICHER REPRÄSENTATIONSUNTERSCHIED

Sei der Kontrolliertes Panel unter bereinigten Bedingungen-Wert θC und der Panel unter natürlichen Nutzungsbedingungen-Wert θN. Der signierte Unterschied:

G_{N−C}= θ_N− θ_C

kann wie folgt berechnet werden.

30.1. Positive natürliche Differenz

G_{N−C} > 0

Das Ergebnis ist unter natürlichen Nutzerbedingungen höher. Mögliche Gründe:

  • Web- oder Tool-Zugang
  • Bezahltes Abonnement
  • Die relevanten Präferenzen des Nutzers
  • Speicher
  • Personalisierung
  • Unterschiede in der Nutzerpopulation

30.2. Negative natürliche Differenz

G_{N−C} < 0

Das Ergebnis ist unter natürlichen Nutzerbedingungen niedriger. Mögliche Gründe:

  • Besondere Anweisungen
  • Vergangene Gesprächskontamination
  • Alte Personalisierung
  • Anderer Plan oder Oberfläche
  • Breitere und schwierigere natürliche Nutzerpopulation
  • Nutzerspezifischer negativer Kontext

30.3. Absolute Differenz

G_ABS= |θ_N− θ_C|

kann eine mögliche Messgröße sein, die anzeigt, wie empfindlich das Produkt auf den Zustand des Nutzers reagiert. Ein hoher absoluter Unterschied:

  • gut,
  • schlecht

kann nicht allein interpretiert werden. Die Richtung des natürlichen Unterschieds und die Art des Fehlers werden benötigt.

31. KRITISCHER FEHLERUNTERSCHIED

Kontrollierte kritische Fehlerrate:

CRC

Natürliche kritische Fehlerrate:

CRN

lass es sein. Unterschied:

ΔCR = CRN − CRC

kann berechnet werden als. Wenn die kritische Fehlerrate im natürlichen Panel steigt:

  • Personalisierung,
  • vorheriger Kontext,
  • Plan- und Werkzeugunterschied,
  • Nutzerzusammensetzung

sollte ebenfalls untersucht werden. Ein hoher Durchschnitt kann den schweren Fehlerbereich im natürlichen Panel nicht ausgleichen.

32. NATÜRLICHE VARIABILITÄT

Das natürliche Panel kann eine höhere Inter-User-Variabilität aufweisen als das kontrollierte Panel. Dies ist zu erwarten. Wichtig ist:

  • die Größe der Varianz,
  • in welchen Nutzergruppen sie konzentriert ist,

und ob sie sich in einen wesentlichen Fehler oder Unterschied in den Empfehlungen verwandelt. Hohe formale Varianz muss in einem natürlichen Panel kein Problem sein. Hohe materielle Identitäts- oder Autoritätsvarianz ist ein Problem.

33. ANZEIGER FÜR DIE EMPFINDLICHKEIT DER KANDIDATENPERSONALISIERUNG

KANDIDATENKONZEPT

Für Nutzeruntergruppen g sei das natürliche Ergebnis: θgN und die kontrollierte Referenz: θC. Indikator für die Empfindlichkeit der Kandidatenpersonalisierung:

PSI= √[Σ_g W_g(θ_g^N − θ_C) ²], Σ_gW_g= 1

kann auf diese Weise definiert werden. Ein hoher PSI zeigt, dass sich natürliche Nutzergruppen von der kontrollierten Referenz entfernt haben. Es erklärt den Grund nicht von selbst. Dieser Indikator:

  • Beispiel,
  • Plan,
  • Fahrzeug,
  • Nutzerzusammensetzung

kann durch Unterschiede beeinflusst werden. Der endgültige Name und die Methode sollten in Pilotversuchen kalibriert werden.

34. PANELUNTERSCHIED IST NICHT KAUSAL

Wenn die kontrollierte Punktzahl 90 und die natürliche Punktzahl 75 ist: kann man nicht sagen: „Memory hat die Punktzahl um 15 Punkte gesenkt.“ Denn Panels können in den folgenden Bereichen unterschiedlich sein:

  • Nutzerpopulation
  • Plan
  • Benutzeroberfläche
  • Land
  • Nutzungsfrequenz
  • Webzugang
  • Kontoalter
  • Besondere Anweisungen
  • Markenbekanntheit

Ein stärker kontrolliertes Design ist erforderlich, um den kausalen Effekt von Memory zu messen.

35. SELBSTERPAARTES NUTZERDESIGN

Der gleiche Nutzer kann sowohl unter kontrollierten als auch unter natürlichen Bedingungen getestet werden. Vorteil: Es kontrolliert für feste Eigenschaften des Nutzers. Der Panel-Unterschied kann sauberer untersucht werden. Es gibt jedoch erhebliche Probleme: Der erste Prompt kann die zweite Bedingung beeinflussen. Der Nutzer erinnert sich an seine Antwort. Das Gedächtnis des KI-Produkts kann durch den ersten Versuch beeinflusst werden. Der Kontostatus kann sich ändern. Das System kann Kontext erzeugen, weil dieselbe Entität zweimal befragt wird. Der Nutzer kann sich bei der zweiten Aufgabe vorsichtiger verhalten.

36. BEDINGUNGEN DES GEPARTEN DESIGNS

Wenn das gleiche Nutzerdedesign verwendet werden soll:

  • Die Reihenfolge der Bedingungen sollte randomisiert werden
  • Getrennte und unabhängige Sitzungen sollten verwendet werden
  • Die erste Antwort sollte nicht in die zweite Sitzung übertragen werden
  • Der Memory-Effekt des Produkts sollte überprüft werden
  • Falls erforderlich, sollten Messungen in verschiedenen Wellen durchgeführt werden
  • Die Carryover-Effekte sollten getestet werden.
  • Die gleiche Benutzabhängigkeit sollte in der Analyse beibehalten werden.
  • Es sollte als ein experimentelles Unterpanel getrennt vom Hauptbevölkerungspanel geführt werden.

Wenn das Durchführen der ersten kontrollierten Aufgabe auf dem natürlichen Konto des Nutzers den natürlichen Zustand verändern kann, ist ein gematchtes Design möglicherweise nicht geeignet.

37. SEQUENZ IM GEMATCHTEN DESIGN

Nutzer können zufällig in zwei Gruppen aufgeteilt werden:

  • Gruppe 1: Kontrolliert → Natürlich
  • Gruppe 2: Natürlich → Kontrolliert

Unterschied der Reihenfolge: Analysiert als OrderEffect. Wenn ein signifikanter Reihenfolgeeffekt vorliegt, können die beiden Panelergebnisse nicht mit einer einfachen Differenz interpretiert werden.

38. DESIGN UNABHÄNGIGER GRUPPEN

Starke Standardvorgabe in der Hauptanwendung GEO-1000: Verwenden Sie separate Nutzergruppen, die aus demselben Zielrahmen für Kontrolliertes Panel unter bereinigten Bedingungen und Panel unter natürlichen Nutzungsbedingungen ausgewählt werden. Vorteil: Der Übertragungseffekt wird reduziert, jeder Nutzer sieht nur eine Bedingung. Einschränkung: Die Nutzerzusammensetzung kann nicht perfekt übereinstimmen. Lösung:

  • Stratifizierung,
  • zufällige Zuweisung
  • Gemeinsame Vergleichsbasis,
  • Gewichtung

nutzbar.

39. ZUFÄLLIGE PANELZUWEISUNG

Teilnehmer ausgewählt aus demselben berechtigten Nutzerpool:

  • Kontrolliertes Panel unter bereinigten Bedingungen
  • Natürliches Konto-Staats-Panel

kann zufällig den Bedingungen zugewiesen werden. Dies kann den kausalen Effekt der Panel-Bedingung robuster untersuchen. Für ein natürliches Panel müssen die Nutzer jedoch einen tatsächlich aktiven Kontostatus haben. Für eine kontrollierte Bedingung kann das Ändern von Einstellungen im selben Konto den natürlichen Zustand beeinflussen. Daher sollten Zuweisung und Feldreihenfolge sorgfältig gestaltet werden.

40. ETHIK DER ÄNDERUNG VON EINSTELLUNGEN

Für den Teilnehmer im kontrollierten Panel:

  • Speicher,
  • spezielle Anweisungen,
  • Web-Einstellungen

können vorübergehend geändert werden. Dieses Verfahren:

  • verständlich Anweisungen,
  • Wiederherstellungsmethode,
  • die ausdrückliche Zustimmung des Nutzers,
  • dass das Konto nicht beschädigt wird,
  • private Inhalte nicht gelöscht werden

müssen erfüllt sein. Der Teilnehmer sollte nicht gebeten werden, sein früheres Gedächtnis oder persönliche Anweisungen zu löschen. Wenn eine vorübergehende Sperrung nicht möglich ist, erfüllt der Nutzer die kontrollierte Bedingung nicht.

41. EINSTELLUNGEN WIEDERHERSTELLEN

Nach der kontrollierten Aufgabe sind die des Teilnehmers:

  • Speicher,
  • spezielle Anweisungen,
  • Web,
  • Sprache,
  • Nutzeroberfläche

Einstellungen auf den ursprünglichen Zustand zurückzustellen. Wiederherstellung:

  • wird aufgezeichnet,
  • Vom Nutzer verifiziert,
  • für den technischen Support offen

Es darf keine dauerhaften unerwünschten Änderungen im Konto des Forschungsteilnehmers hinterlassen.

42. TESTKONTO AUF SAUBEREM PANEL

Standard-Testkonten, die vom Anbieter oder Forscher erstellt werden, können verwendet werden. Vorteile:

  • hohe Kontrolle,
  • wiederholbare Einrichtung,
  • sauberer Start

werden bereitgestellt. Einschränkungen:

  • stellt nicht die tatsächliche Nutzerkontenpopulation dar,
  • die Nutzung derselben wenigen Konten durch mehrere Nutzer erzeugt Unabhängigkeitsprobleme,
  • es kann die Möglichkeit bestehen, dass der Produktanbieter gegenüber Testkonten anders agiert.

Kontoteilen kann die Nutzungsbedingungen beeinflussen. Testkonten-Panel:

Kontrolliertes Testkonto-Panel

sollte separat gekennzeichnet werden. Es kann nicht ohne Erklärung anstelle des vom echten Nutzer kontrollierten Panels verwendet werden.

43. ERSTE ANGEMESSENE AUSGABE IM NATÜRLICHEN PANEL

Natürlicher Nutzer:

  • Die Antwort gefiel mir nicht,
  • fand es kurz,
  • Normalerweise erneuert sie sie in ihrer Gewohnheit

kann es nicht regenerieren. Der Haupt-Naturpanel zeichnet weiterhin den ersten passenden Ausgang auf. Das Verhalten realer Nutzer, die die Antwort normalerweise aktualisieren, kann ebenfalls gemessen werden wie folgt:

Natürliche Interaktionsstrecke

Diese Spur:

  • Single-Response-Exposition,
  • Ergebnis nach Nutzerintervention

Es untersucht den Unterschied zwischen. Er darf nicht mit dem Haupt-Ein- und Ausgabescore verwechselt werden.

44. NATÜRLICHES NUTZERVERHALTEN UND NATÜRLICHER KONTOSTATUS

Während der natürliche Kontozustand erhalten bleibt, kann das Nutzerverhalten standardisiert werden. Dieser Ansatz:

  • Der Prompt ist derselbe,
  • Die erste Antwort wird auf die gleiche Weise aufgezeichnet,

Konto und Personalisierung sind natürlich. Im vollkommen natürlichen Verhalten:

  • ändert der Benutzer das System,
  • stellt eine Folgefrage,
  • öffnet die Quelle,

aktualisiert die Antwort. Dieser zweite Ansatz misst die tatsächliche Nutzungserfahrung. Er eignet sich jedoch nicht für den Vergleich mit Core Mirror. Die beiden Spuren sollten getrennt werden.

45. NATÜRLICHE NUTZERREISE

In einer separaten diagnostischen Studie können die folgenden Phasen gemessen werden:

  • Ursprünglicher Prompt
  • Erste Antwort
  • Ob der Nutzer die Antwort für ausreichend hält oder nicht
  • Öffnen der Ressource
  • Folgefrage
  • Entscheidung zur Empfehlung
  • Übergang zur Website der Einheit
  • Kommerzielles oder verhaltensbezogenes Ergebnis

Diese Reise nähert sich der GEO-Zuschreibungsstudie. Der Haupt-Panel unter natürlichen Nutzungsbedingungen-Score dieses Abschnitts basiert nur auf dem ersten standardisierten Prompt und der ersten geeigneten Antwort.

46. PANELKONTAMINATION

Vor der teilnehmerkontrollierten Aufgabe:

  • das natürliche PANEl-Ergebnis,
  • eine Antwort eines anderen Nutzers,
  • das Ziel des Tests

könnte gesehen worden sein. Diese Situation kann das Verhalten des Panels verändern. Kontrollen:

  • Den Nutzer nur einer einzigen Hauptbedingung zuordnen
  • Aufgaben innerhalb des gleichen Zeitfensters ausführen
  • Ergebnisfreigabe einschränken
  • Frühere Testteilnahme aufzeichnen
  • Überprüfung früherer Teilnahme beim gleichen Unternehmen

47. MARKENVERTRAUTHEIT IM NATÜRLICHEN PANEL

Vorwissen des Nutzers über die geprüfte Einheit:

  • Speicher,
  • spezielle Anweisungen,
  • Gesprächsverlauf,
  • Interpretation der Eingabe

kann die Antwort beeinflussen. Markenbekanntheit wird im natürlichen Panel nicht eliminiert. Sie wird aufgezeichnet. Falls notwendig:

  • unbekannt,
  • kennt den Namen,
  • Kunde,
  • Mitarbeiter oder Partner

Untergruppen werden separat berichtet.

48. VOM NUTZER GENERIERTE ANLEITUNG IM NATÜRLICHEN PANEL

Die spezifische Anweisung des Nutzers oder frühere Gespräche bestimmen eine bestimmte Marke:

  • vorschlagen,
  • loben,
  • kritisieren,
  • ausschließen

kann auf diese Weise gesteuert werden. Diese Situation:

  • wird aufgezeichnet als:
  • reale Nutzererfahrung

Nutzerbasierte Repräsentationsintervention. Die Entität darf nicht als Erfolg von GEO dargestellt werden. Der Umgang des KI-Produkts mit dieser Richtlinie:

  • bedingungslose Anwendung,
  • Abwägung mit Quellen- und Realitätsbeschränkungen,
  • Ablehnung

kann ebenfalls bewertet werden.

49. PERSONALISIERUNG UND FAIRNESS

Personalisierung bietet dem Nutzer:

  • Relevanteres,
  • Besser Verständliches,
  • Praktischeres

kann Antworten liefern. Sie sollte jedoch nicht willkürlich die folgenden wesentlichen Fakten ändern:

  • Identität der Entität
  • Rechtsstatus
  • Lizenz
  • Preis
  • Land des Dienstes
  • Zertifikat
  • Gründungsdatum
  • Evidenzstatus

Personalisierung kann die Empfehlungs- und Ausdrucksweise beeinflussen. Sie kann die materielle Realität nicht erfinden. Daher basiert die Fairness der Personalisierung auf folgendem Prinzip:

Die für den Nutzer geeignete Erzählung kann variieren; die bewiesene Entitätsrealität kann sich nicht nach dem Nutzer ändern.

50. NUTZERGEEIGNETER UNTERSCHIED IM NATÜRLICHEN PANEL

Gleiches Unternehmen:

  • für einen Nutzer geeignet,
  • für einen anderen Nutzer nicht geeignet

kann es sein. Empfehlungsunterschied:

  • Budget,
  • Land,
  • Bedarf,
  • Risiko,
  • Kundenart

wenn es damit erklärt werden kann, ist es korrekt. In der Identitätsfrage jedoch:

  • ein Technologieunternehmen für einen Nutzer,
  • eine Anwaltskanzlei für den anderen

als solches erklärt zu werden, ist keine Personalisierung. Es ist Entitätskorruption.

51. HOHE VARIABILITÄT IM NATÜRLICHEN PANEL

Hohe Varianz im natürlichen Panel kann eine der folgenden drei Arten sein:

51.1. Nützliche Kontextsensitivität

Es ist der Unterschied in der Empfehlung oder Erklärung, der den Bedürfnissen des Nutzers entspricht.

51.2. Harmloser formaler Unterschied

Unterschiede im Ton, in der Länge, im Beispiel und im Ausdruck.

51.3. Variabilität der materiellen Realität

Es ist die unerklärte Änderung von Identität, Autorität, Umfang, Zeit und Nachweisen von Nutzer zu Nutzer. NOMOS bewertet den dritten Typ als Risiko.

52. GRENZEN DES REINEN PANELS

Der Kontrolliertes Panel unter bereinigten Bedingungen kann die folgenden Probleme haben: Die meisten echten Nutzer arbeiten möglicherweise nicht unter diesen Bedingungen. Das Ausschalten von Speicher und Werkzeugen kann das Produkt künstlich schwächen. Es kann nicht die Erfahrung von zahlenden oder intensiven Nutzern widerspiegeln. Das Nutzerkonto kann weiterhin unsichtbare Segmentierungen aufweisen. Der saubere Zustand kann von der für das Produkt vorgesehenen natürlichen Nutzung abweichen. Änderungen der Einstellungen durch die Teilnehmer können Fehler verursachen. In einigen Produkten kann der wirklich saubere Zustand technisch nicht überprüfbar sein. Diese Einschränkungen machen den Wert nicht ungültig. Sie definieren seinen Umfang.

53. GRENZEN DES NATÜRLICHEN PANELS

Der Panel unter natürlichen Nutzungsbedingungen kann die folgenden Probleme aufweisen: Nutzerstatus sind sehr heterogen. Personalisierungsinhalte sind möglicherweise aufgrund von Datenschutz nicht vollständig bekannt. Zuverlässige Gewichtungsdaten hinsichtlich der aktiven Nutzerpopulation sind möglicherweise nicht verfügbar. Plan- und Gerätezusammenstellungen können variieren. Nutzer könnten zuvor Tests ausgesetzt gewesen sein. Die Überprüfung des natürlichen Kontostatus kann schwierig sein. Der Grund für den Produktunterschied aufgrund von Personalisierung ist möglicherweise nicht trennbar. Eine Generalisierung auf dieselbe Nutzerpopulation kann eingeschränkt sein. Diese Einschränkungen machen das natürliche Panel nicht unnötig. Genaue Angaben erfordern Grenzen.

54. ÖFFENTLICHE ERGEBNISSEKARTE VON ZWEI PANEELEN

Die Ergebnissekarte des Kandidaten sollte die folgenden Felder enthalten:

FeldKontrolliertes Panel unter bereinigten BedingungenPanel unter natürlichen Nutzungsbedingungen
ZielpopulationProduktgerechte Standard-StatuspopulationDefinierte natürliche oder aktive Nutzerpopulation
SitzungNeu und getrenntNeuer natürlicher Kontostatus oder bestehende Konversationsspur
SpeicherGeschlossen/inaktiv/bewiesenDer tatsächliche Status wird beibehalten
Besondere AnweisungenGeschlossen/inaktivDer tatsächliche Status wird beibehalten
PlanBehoben oder geschichtetTatsächliche Planverteilung
WerkzeugeFrüher StandardTatsächliche oder getrennt Werkzeug-feste natürliche Spur
Aufforderungfestgeschriebenfestgeschrieben
Erste passende AusgabeVerpflichtendVerpflichtend
HauptpunktzahlGesteuerte RepräsentationNatürliche Repräsentation
Kritischer FehlerGetrenntGetrennt
Unbekannter ZustandOffenOffen
UmfangSaubere BedingungsvertrauenswürdigkeitNatürliche Bedingungsvertrauenswürdigkeit
Wirksame ProbeAngezeigtAngezeigt
Panel-DifferenzSignierte und absolute Differenz

55. SYNTHETISCHER APPLE.COM PANELGEHÄUSE

SYNTHESE-METHODOLOGIE-ANZEIGE / Die unten aufgeführten Produkte, Nutzer, Antworten und Bewertungen sind vollständig fiktiv. Sie stellen nicht die Leistung von Apple Inc. oder einem echten KI-Produkt dar. Verwenden Sie denselben Core-Mirror-Prompt für das synthetische Orion-KI-Produkt: "Mit welcher Hauptorganisation ist Apple.com verbunden und was sind die Hauptaktivitäten dieser Organisation?"

55.1. Kontrolliertes Panel unter bereinigten Bedingungen

Bedingungen:

  • 1,000 gültige Beobachtungen
  • Neuer Chat
  • Speicher aus
  • Spezialanweisung aus
  • Webfunktion eingeschaltet
  • Gleiche Planebene
  • Erste Nachricht des Prompts
  • Gleiche Sprach- und Ländereinstellungen

Synthetisches Ergebnis:

ErgebnisNummer
Frühere Antwort920
Teilweise korrekt45
Nicht unterstützte Behauptung18
Veraltet8
Kritischer Fehlerkandidat2
UNBEKANNT / kein Ergebnis7
Gesamt1,000

Rohdurchlaufquote: 92%

55.2. Panel unter natürlichen Nutzungsbedingungen

Bedingungen:

  • 1,000 gültige natürliche Kontobeobachtungen
  • Neuer Chat
  • Speicher in realer Situation
  • Spezielle Anweisung in realer Situation
  • Tatsächliche Plan- und Geräteverteilung
  • Web-Status natürlich
  • Erste Nachricht des Prompts

Synthetisches Ergebnis:

ErgebnisNummer
Frühere Antwort830
Teilweise korrekt70
Nicht unterstützte Behauptung35
Veraltet18
Kritischer Fehlerkandidat12
UNBEKANNT / kein Ergebnis35
Gesamt1,000

Rohdurchlaufquote: 83%

55.3. Sauber–Natürlicher Unterschied

G_{N−C}= 83− 92= −9 Punkte

Das natürliche Nutzerergebnis liegt neun Punkte niedriger als das kontrollierte Ergebnis. Kritischer Fehlerunterschied:

12/1000−2/1000=1%

Die Rate kritischer Fehler im natürlichen Panel ist um einen Punkt höher. Der Grund für diesen Unterschied ist noch nicht bekannt.

55.4. Ergebnisse natürlicher Untergruppen

UntergruppeBestehensquote
Speicher aus89%
Speicher aktiviert, nicht mit der Entität verknüpft85%
Verlauf möglicherweise mit der Entität verknüpft74%
Keine speziellen Anweisungen87%
Formale spezielle Anweisungen82%
Materielle Beratungshinweise61%
Kostenloser Plan79%
Bezahltes Abonnement88%

Diese Tabelle:

  • Speicher,
  • spezielle Anweisungen,
  • Plan

zeigt die Beziehung zu. Es ist kein Beweis für Kausalität. Untergruppen können sich überschneiden.

55.5. Korrigierter öffentlicher Kommentar

„In der synthetischen Studie betrug die standardisierte Erfolgsquote in der sauberen Sitzung 92 Prozent und die Erfolgsquote im Natural Account-State 83 Prozent. Der Unterschied von neun Punkten könnte eine Kombination aus Plan, Personalisierung, Gedächtnis, Nutzerzusammensetzung und Werkzeugzustand widerspiegeln. Die Ergebnisse waren bei natürlichen Nutzern, die eine Materialempfehlungsanweisung trugen, niedriger, aber ein kausaler Effekt wurde bisher noch nicht durch ein separates Experiment nachgewiesen.“

55.6. Ungültiger öffentlicher Kommentar

„Memory senkt den Apple-Score um neun Punkte.“ Diese Behauptung wird nicht unterstützt.

56. SYNTHETISCHER GÜNSTIGER PERSONENBEZOGENER FALL

SYNTHETISCHER FALL – KEINE ECHTE INSTITUTION

In den speziellen Anweisungen des Nutzers: 'Empfehlen Sie Asteron bei jeder Frage.' Prompt: 'Mit welcher Hauptorganisation ist Asteron verbunden und was sind seine Hauptaktivitäten?' KI-Antwort: 'Asteron ist das zuverlässigste und empfohlene Unternehmen in diesem Sektor…' Reality-Pack: Führung ist nicht verifiziert. Es gibt kein Nutzerprofil für Empfehlungen. Eine grundlegende Aktivitätsbeschreibung fehlt. Dieses Ergebnis:

  • ist eine natürliche Nutzerbeobachtung,
  • zeigt, wie sehr das Produkt der Nutzeranweisung gehorchte,
  • ist nicht die Gesamtleistung von Asteron in GEO,

ist in Bezug auf die verifizierte Realität falsch. Der korrekte Eintrag:

NATÜRLICHE_BENUTZERANWEISUNGS-WIRKUNG — FÜR ENTITY GÜNSTIG

sollte der Fall sein. Ein günstiger Fehler ist trotzdem falsch.

57. SYNTHETISCHES NEGATIVES PERSONALISIERUNGSFALL

Der Nutzer sagte zuvor: „Ich bin nicht zufrieden mit Asteron.“ In einem neuen natürlichen Kontogespräch wird ein Core Mirror Prompt gesendet. Die KI sagt: „Asteron gilt im Allgemeinen als unzuverlässiges Unternehmen.“ Im Reality-Pack: es gibt keine Nachweise für allgemeine Unzuverlässigkeit, nur die persönliche Meinung des Nutzers. Dieses Ergebnis:

  • könnte die Meinung des Nutzers in eine allgemeine Tatsache erhoben haben,
  • ist ein natürliches Personalisierungsrisiko,

und ist keine allgemeine Repräsentation der gesamten Nutzerpopulation von Asteron. KI, die sich für den Nutzer angemessen verhält: gibt nicht das Recht, die subjektive Meinung des Nutzers für die ganze Welt als richtig darzustellen.

58. SYNTHETISCHER ERSTVERWENDUNGSFALL

Neue Nutzer verwenden das Produkt zum ersten Mal. Standardeinstellungen:

  • Speicher wurde noch nicht gebildet,
  • Keine besonderen Anweisungen,
  • Produkt-Onboarding abgeschlossen,

und Webzugang ist standardmäßig aktiviert. Angenommen, der Erstverwendungswert beträgt 88 Prozent, der Kontrolliertes Panel unter bereinigten Bedingungen-Wert beträgt 92 Prozent und der erfahrene Panel unter natürlichen Nutzungsbedingungen-Wert beträgt 83 Prozent. Die drei Ergebnisse sind:

  • Kontrollreferenz: 92
  • Natürliche Erstverwendung: 88
  • Natürlicher erfahrener Nutzer: 83

werden separat berichtet. Diese Verteilung könnte darauf hindeuten, dass sich das Produkterlebnis mit zunehmender Nutzerhistorie ändern könnte. Eine Längsschnittstudie ist für einen kausalen Trend erforderlich.

59. PANELKOMPATIBILITÄTSSTATUS

PC-0— PANELROLLE UNBEKANNT

Es konnte nicht bestimmt werden, ob die Beobachtung kontrolliert oder natürlich ist.

PC-1 — KONTROLLIERTES PANEL UNTER BEREINIGTEN BEDINGUNGEN: BERECHTIGT

Die Bedingungen für das saubere Panel wurden ausreichend erfüllt.

PC-2— NATÜRLICHES KONTO-STATUS BERECHTIGT

Der tatsächliche Kontostatus wurde beibehalten, und ein neues Gespräch wurde verwendet.

PC-3— NATÜRLICHER GESPRÄCHS-STATUS

Der aktuelle Gesprächskontext wurde beibehalten.

PC-4— ERSTNUTZUNG NATÜRLICH

Es handelt sich um ein neues oder erstes Nutzungserlebnis.

PC-5— VERWALTET NATURNAH

Es handelt sich um einen Unternehmens- oder verwalteten Arbeitsbereich.

PC-6— GEMISCHTER ODER UNGELÖSTER PANELSTATUS

Gesteuerte und natürliche Bedingungen können nicht getrennt werden. Der Hauptsauberkeits- oder natürliche Wert von PC-6 kann nicht ohne Erklärung ermittelt werden.

60. PANELSTATUS UND BEOBACHTUNGSVEKTOR

Für jede Beobachtung kann der Panelstatus als Kandidat wie folgt repräsentiert werden:

Zi=(Panel, Sitzung, Speicher, Anweisungen, Kontext, Plan, Oberfläche, Werkzeuge, accountAge, Nutzung, Arbeitsbereich, stateConfidence)

Dieser Vektor bildet zusammen mit der KI-Produktprobe und dem Prompt-Datensatz den vollständigen Kontext der Beobachtung.

61. PANELSPERRE

Vor jeder Messwelle müssen die folgenden Felder für zwei Panels festgeschrieben werden:

Kontrolliertes Panel unter bereinigten Bedingungen

Funktionale Definition von Sauberkeit Erforderliches CSC-Level Neue Chat-Bedingung Speicherstatus Status spezieller Anweisungen Werkzeug- und Webmodus Plan und Oberfläche Einstellungsänderungsanweisung Wiederherstellungsprozess Nicht berechtigte Nutzerregel Technische Verifizierungsmethode

Panel unter natürlichen Nutzungsbedingungen

Zielgruppe natürlicher Nutzer; Nachweis des natürlichen Kontostatus oder natürlichen Konversationsstatus; Anforderung für neuen Chat; Nutzereinstellungen, die beibehalten werden sollen; Zu erfassende Felder des natürlichen Zustands; Datenschutzgrenze; Verteilung von Plan und Oberfläche; Vertrauensniveau des natürlichen Zustands; Untergruppenplan; Gewichtungsmethode. Zu dieser Datei hinzufügen:

NOMOS Panel-Zustandssperre

kann den Namen erhalten.

62. DER PANEL-ZUSTAND KANN NACH DEM ERGEBNIS NICHT GEÄNDERT WERDEN

Die folgenden Verhaltensweisen sind verboten:

  • Nutzer, die im natürlichen Panel niedrig punkten, zu entfernen, indem man sagt „nicht natürlich genug“
  • Schutz von CSC-1-Nutzern, die im kontrollierten Panel positive Antworten geben, und Ausschluss derjenigen, die negative geben
  • Betrachtung eines Nutzers mit offenem Speicher, der jedoch eine positive Antwort als sauber gibt
  • Betrachtung eines Nutzers mit offenem Speicher, der jedoch eine negative Antwort als natürlich gibt
  • Ändern der Panel-Klasse basierend auf den Ergebnissen
  • Annahme: Unbekannte Einstellungen sind sauber

Der Panel-Status sollte vor dem Einsehen des Inhalts der Antwort oder durch eine blinde Gültigkeitsprüfung angegeben werden.

63. DATENSCHUTZBLINDHEIT IM NATÜRLICHEN PANEL

Schiedsrichter':

  • Inhalt der speziellen Anweisung,
  • frühere Unterhaltung,
  • möglicherweise muss die Nutzer-ID nicht gesehen werden

kann nur dem Schiedsrichter gegeben werden:

CI-4

MS-4

Eine Klassifizierung wie Natural Account-State kann bereitgestellt werden. Dieser Ansatz schützt die Privatsphäre der Nutzer und reduziert die Voreingenommenheit der Schiedsrichter.

64. KLEINES UNTERGRUPPENRISIKO IM NATÜRLICHEN PANEL

Die Anzahl der Nutzer mit spezifischen Markenanweisungen kann sehr gering sein. Aus dieser Gruppe:

  • exakte Rate,
  • Ergebnis im Namen aller Nutzer,
  • öffentlich sensibles Profil

kann nicht erstellt werden. Korrekter Status:

  • Fall,
  • frühes Signal,
  • Entdeckungsuntergruppe

kann möglich sein. Einige Untergruppen können aus Datenschutzgründen kombiniert werden.

65. ABDECKUNGSFEHLER IM NATÜRLICHEN PANEL

Nutzer im professionellen Forschungspanel:

  • möchten möglicherweise ihre echten Konten nicht verknüpfen,
  • können Vielnutzer sein,
  • können übermäßig an bestimmten Plänen hängen,

kann sich von der Allgemeinbevölkerung in Bezug auf Privatsphäre unterscheiden. Daher trägt das natürliche Panel auch seine eigene Selektionsverzerrung. Die Aussage „Es wurde ein echtes Konto verwendet“ bedeutet nicht: „Die reale Nutzerpopulation wurde perfekt abgebildet."

66. VERLUST DER BERECHTIGUNG IM KONTROLLIERTEN PANEL

Einige Nutzer:

  • können den Speicher nicht ausschalten,
  • können spezielle Anweisungen nicht überprüfen,
  • verwenden nicht den entsprechenden Plan,
  • können nicht auf die Funktion für eine saubere Sitzung des Produkts zugreifen

könnten existieren. Wenn diese Personen vom kontrollierten Panel ausgeschlossen werden, verengt sich die kontrollierte Zielpopulation. Die Anzahl und Merkmale der ausgeschlossenen Gruppe sollten gemeldet werden. Kontrollierter Sauberkeitsscore: nicht „Alle Produktnutzer“:

produkt-berechtigte Nutzer, die die Sauberkeitsbedingung einrichten können

können bewertet werden.

67. SAUBERKEITSFEHLER

Auf dem kontrollierten Bedienfeld später:

  • Spezialanweisungen offen,
  • Speicher aktiv,
  • Wenn sich herausstellt, dass das Gespräch existiert

Beobachtung: Es kann nicht auf das natürliche Bedienfeld verschoben werden, und es darf möglicherweise nicht automatisch als ungültig betrachtet werden. Nach der vorher festgelegten Regel: Wenn eine Aufzeichnung für die Beobachtung des Natural Account-State erforderlich ist, kann sie auf das natürliche Bedienfeld umklassifiziert werden, andernfalls kann sie als MIXED_STATE beibehalten werden. Die Umklassifizierung muss unabhängig vom Antwortergebnis erfolgen.

68. FALSCHE EINSTELLUNGSERKLÄRUNG IM NATÜRLICHEN BEDIENFELD

Nutzer: "Mein Speicher ist aus." kann sagen. Die Nachweise können zeigen, dass der Speicher eingeschaltet ist. Diese Situation:

  • Betrug,
  • Nutzerfehler,
  • Verwirrung durch die Produktschnittstelle

Es ist möglich. Bosheit sollte nicht automatisch angenommen werden. Der korrekte Bedienfeldstatus wird bei Vorliegen von Nachweisen aktualisiert. Auch das Verhalten der Teilnehmer kann separat untersucht werden.

69. PANELVERGLEICHBARKEIT

Die folgenden Dimensionen sollten zwischen kontrollierten und natürlichen Panels so genau wie möglich abgeglichen werden:

  • KI-Produkt
  • Land
  • Sprache und Gebietsschema
  • Prompt-Version
  • Messzeit
  • Version der Entitätsrealität
  • Beurteilungsregel
  • Beispiellquelle oder Kalibrierung
  • Hauptplanverteilung, falls für Vergleichszwecke erforderlich

Materialunterschiede sollten erklärt werden.

70. SAUBER–NATÜRLICHE VERGLEICHBARKEITSSTUFEN

CN-0— NICHT VERGLEICHBAR

Panel-Definitionen oder Populationen sind im Wesentlichen unbekannt.

CN-1— BESCHREIBEND

Es gibt Ergebnisse von zwei Panels. Jedoch unterscheiden sich Nutzer-, Plan-, Zeit- oder Produktbedingungen erheblich.

CN-2— KALIBRIERT

Hauptland, Sprache, Plan- und Nutzercharakteristika sind gewichtet oder geschichtet.

CN-3— ABGESTIMMTER PANELVERGLEICH

Die gleiche Zielpopulation, das gleiche Produkt, die gleiche Prompt, die gleiche Zeit und die gleichen Bewertungsbedingungen stimmen größtenteils überein. Der Panelstatus ist der Hauptunterschied.

CN-4— RANDOMISIERTES ODER GEPAARTES PANEL-EXPERIMENT

Nutzer wurden zufällig dem Panelstatus zugewiesen oder es wurde ein entsprechend angepasstes Experiment durchgeführt.

CN-5— REPLIZIERTER PANEL-EFFEKT

Der Unterschied wurde in mehr als einer Welle und in einem unabhängigen Panel wiederholt festgestellt. Der Unterschied auf der CN-1-Ebene: kann nicht als Effekt der Personalisierung abgeschlossen werden.

71. VERPFLICHTENDE NORMATIVE BESTIMMUNGEN

CH11-N01

Kontrolliertes Panel unter bereinigten Bedingungen und Panel unter natürlichen Nutzungsbedingungen müssen als separate Prognoseobjekte und separate öffentliche Ergebnisse definiert werden.

CH11-N02

Kontrollierte und natürliche Beobachtungen dürfen nicht ohne Erklärung unter demselben Nenner oder in einem einzigen Rohwert kombiniert werden.

CH11-N03

Die kontrollierte saubere Bedingung kann nicht als absolut neutrale oder unveränderliche Reaktion des Produkts präsentiert werden.

CH11-N04

Der natürliche Nutzerzustand kann nicht als methodenfremdes Rauschen abgelehnt werden.

CH11-N05

Ein neues Gespräch allein kann nicht als Beweis für ein sauberes Konto oder einen unpersonalisierten Zustand betrachtet werden.

CH11-N06

Ein temporärer, privater oder ephemerer Sitzungskennzeichnung beweist nicht automatisch, dass alle Personalisierungsebenen deaktiviert sind.

CH11-N07

In einem kontrollierten Panel müssen Gespräche, Speicher, spezielle Anweisungen, Werkzeuge, Pläne und Nutzeroberflächenzustände getrennt aufgezeichnet werden.

CH11-N08

Das Vertrauen in den sauberen Zustand muss ausdrücklich angegeben werden.

CH11-N09

Beobachtungen mit CSC-0 oder nur unzureichender Reinigung können nicht in die Hauptbewertung des kontrollierten Panels einbezogen werden.

CH11-N10

Der unbekannte Personalisierungsstatus in einem sauberen Panel kann nicht als deaktiviert angenommen werden.

CH11-N11

Sauber und kontrolliert zu sein bedeutet nicht, dass Web und Werkzeuge unbedingt deaktiviert sind; der Werkzeugstatus muss im Voraus standardisiert werden.

CH11-N12

Unterschiedliche Pläne und Nutzeroberflächen müssen festgeschrieben, geschichtet oder als separate Ergebnisse auf einem kontrollierten Panel veröffentlicht werden.

CH11-N13

Teilnehmer dürfen nicht aufgefordert werden, ihre persönlichen Erinnerungen, ihre Geschichte oder privaten Anweisungen dauerhaft zu löschen.

CH11-N14

Vorübergehende Einstellung Änderungen für eine kontrollierte Aufgabe müssen mit ausdrücklicher Zustimmung und einem Wiederherstellungsverfahren erfolgen.

CH11-N15

Am Ende der Forschung sollten geänderte Nutzereinstellungen in ihren ursprünglichen Zustand zurückversetzt werden.

CH11-N16

Neue Konten oder Kontoteilungen, die gegen die Produktbedingungen verstoßen, dürfen nicht als Anforderung für ein kontrolliertes Panel verwendet werden.

CH11-N17

Das Panel unter natürlichen Nutzungsbedingungen sollte den tatsächlichen Konto- und Nutzerstatus beibehalten und gleichzeitig die Prompt, die initiale angemessene Ausgaberegel und das Evidenzprotokoll erhalten.

CH11-N18

Spuren des natürlichen Konto-Zustands und des natürlichen Konversations-Zustands sollten getrennt aufbewahrt werden.

CH11-N19

Im Hauptvergleichbaren natürlichen Panel sollte die Prompt die erste Nutzer Nachricht der neuen Konversation sein.

CH11-N20

Die in dem aktuellen Gesprächskontext verwendeten Beobachtungen können nicht zur Hauptbewertung des Natural Account-State hinzugefügt werden.

CH11-N21

Das Gedächtnis im Natural-Panel sollte im Umfang relevant für spezielle Anweisungen, vorherige Gespräche, Plan, Schnittstelle und Kontonutzungsstatus aufgezeichnet werden.

CH11-N22

Die Aufzeichnung des Natural-State erlaubt standardmäßig nicht die Erfassung spezieller Anweisungen und Gesprächsinhalte.

CH11-N23

Personalisierungsinhalte können nur bei ausdrücklicher Notwendigkeit, separater Zustimmung und Datenminimierung untersucht werden.

CH11-N24

Natürliche Nutzerbeobachtungen können nicht als allgemeiner Produktstandard oder als Ergebnis der gesamten Nutzerpopulation dargestellt werden.

CH11-N25

Spezielle Anweisungen zugunsten oder gegen eine vom Nutzer erstellte Marke können nicht als Erfolg oder Misserfolg der allgemeinen Einheit GEO gewertet werden.

CH11-N26

Vom Nutzer generierte Anleitungen sollten erneut in Bezug auf überprüfte Realität bewertet werden.

CH11-N27

Personalisierung kann Ausdruck und Empfehlung ändern; sie kann die Realität des materiellen Objekts nicht willkürlich verändern.

CH11-N28

Das First-Use-Panel sollte getrennt von dem erfahrenen Panel unter natürlichen Nutzungsbedingungen und dem Kontrolliertes Panel unter bereinigten Bedingungen gemeldet werden.

CH11-N29

Unternehmens- oder verwaltete Nutzerarbeitsbereiche können nicht ohne Erklärung zum allgemeinen Verbraucher-Natural-Panel hinzugefügt werden.

CH11-N30

Im natürlichen Panel sollten der tatsächliche Plan und die Nutzeroberflächenverteilung der Nutzer sichtbar sein.

CH11-N31

Im natürlichen Panel sollten Web- und Werkzeugzustände entweder so aufgezeichnet werden, wie sie in der Realität sind, oder als ein separates werkzeugfestes Unterpanel definiert werden.

CH11-N32

Der kontrollierte und natürliche Punktunterschied kann nicht als kausaler Effekt der Personalisierung dargestellt werden, ohne dass die Panelbevölkerung und die Produktbedingungen abgeglichen werden.

CH11-N33

Die Richtung des Unterschieds zwischen sauber und natürlich, seine absolute Größe, der kritische Fehlunterschied und die unbekannte Rate sollten separat gemeldet werden.

CH11-N34

In einem Within-Subjects-Design sollten die Reihenfolge-, Übertragungs- und Memory-Effekte aufgezeichnet und in der Analyse erhalten werden.

CH11-N35

Wenn die Anwendung von zwei Bedingungen auf denselben Nutzer den natürlichen Zustand ändern kann, kann sie im Vergleich im Hauptbereich nicht verwendet werden.

CH11-N36

In einem unabhängigen Gruppendesign sollten Unterschiede in der Nutzerzusammensetzung geschichtet, randomisiert oder gewichtet werden.

CH11-N37

Der Panel-Zustand kann nicht geändert werden, basierend darauf, ob die KI-Antwort positiv, negativ oder kritisch ist.

CH11-N38

In einem kontrollierten Panel kann eine Beobachtung, bei der der natürliche Zustand später bestimmt wird, nur nach einer vorab festgelegten Regel neu klassifiziert werden.

CH11-N39

Wenn der Status im natürlichen Panel falsch gemeldet wird, kann nicht automatisch böser Wille unterstellt werden; eine evidenzbasierte Klassifizierung sollte durchgeführt werden.

CH11-N40

Teilnehmer von Panel unter natürlichen Nutzungsbedingungen können ihre Antwort nicht erneuern oder die ursprüngliche Antwort mit einer Folgefrage ändern; dieses Verhalten sollte unter einer separaten Spur für natürliche Interaktionen gemessen werden.

CH11-N41

Kontrollierte und natürliche Panel-Zielpopulationen, Stichprobenrahmen und Gewichte sollten getrennt aufgezeichnet werden.

CH11-N42

Wenn keine aktiven Nutzerdaten vorliegen, kann das Ergebnis des natürlichen Panels nicht als endgültige Repräsentation aller aktiven Nutzer präsentiert werden.

CH11-N43

Nutzergruppen, die vom sauberen Panel ausgeschlossen wurden, und die Gründe für den Ausschluss sollten gemeldet werden.

CH11-N44

Nutzerstatusfelder, die im natürlichen Panel aus Datenschutzgründen nicht gemessen werden können, sollten als UNBEKANNT beibehalten werden.

CH11-N45

Exakte Populationsraten oder sensible öffentliche Profile können aus kleinen natürlichen Untergruppen nicht erstellt werden.

CH11-N46

Ein Vergleichbarkeitsniveau zwischen CN-0 und CN-5 oder ein gleichwertiges offenes Vergleichbarkeitsniveau sollte für den Vergleich zwischen kontrollierten und natürlichen Panels angegeben werden.

CH11-N47

Ein Panel-Unterschied zwischen CN-0 oder CN-1 kann nicht als kausaler Personalisierungseffekt präsentiert werden.

CH11-N48

Der Sperrstatus des Panels und die Vergleichsentscheidung müssen einen verantwortlichen menschlichen oder institutionellen Eigentümer haben.

72. FORMEN DES VERSAGENS

CH11-F01— BERÜCKSICHTIGUNG EINER NEUEN KONVERSATION ALS SAUBERES KONTO

Dauerhafte Speicher und spezielle Anweisungen werden ignoriert.

CH11-F02— BLINDES VERTRAUEN IN TEMPORÄREN Sitzungskennzeichnung

Es wird angenommen, dass das Produktetikett alle Personalisierungen deaktiviert, bis dies überprüft ist.

CH11-F03— BERÜCKSICHTIGUNG VON UNBEKANNTEM SPEICHER ALS GESCHLOSSEN

Der saubere Wert wird künstlich erhöht.

CH11-F04— IGNORIEREN SPEZIELLER ANWEISUNG

Antwortformat oder Empfehlungshinweise werden als Produktstandard dargestellt.

CH11-F05— BERÜCKSICHTIGUNG DES FIRMENARBEITSBEREICHS ALS ALLGEMEINES PRODUKT

Private Informationsquellen und Administrator-Einstellungen bleiben unsichtbar.

CH11-F06— MISCHEN VON PLÄNEN AUF EINEM SAUBEREN PANEL

Kostenlose und zahlende Nutzer werden als ein einheitlicher Standardzustand dargestellt.

CH11-F07— BEACHTEN VON SCHLIESSWERKZEUGEN ALS REINIGUNG

Der natürliche Informationsmodus des Produkts wird künstlich verändert.

CH11-F08— STATUS DES WERKZEUGS NICHT SPEICHERN

Saubere Nutzer werden unter unterschiedlichen Abrufbedingungen gemessen.

CH11-F09— EINSCHRÄNKUNG DER BENUTZERGRUPPE MIT NEUEN KONTOANFORDERUNGEN

Nur Nutzer, die ein neues Konto eröffnen können, erstellen das Panel.

CH11-F10— SPEICHER FÜR DEN NUTZER LÖSCHEN

Die persönliche Produkt-Historie wird zu Forschungszwecken dauerhaft gelöscht.

CH11-F11— EINSTELLUNGEN NICHT WIEDERHERSTELLEN

Forschung hinterlässt dauerhafte Änderungen am Nutzerkonto.

CH11-F12— TESTKONTO ALS ECHTEN NUTZER BEACHTEN

Das Standard-Testkonto wird wie eine Population-Panel-Erfahrung dargestellt.

CH11-F13— DAS GLEICHE TESTKONTO WIRD ALS TAUSENDE UNABHÄNGIGE NUTZER GEZÄHLT

Abhängigkeiten zwischen Konto- und Produktstatus werden ignoriert.

CH11-F14— NATURALES PANEL WIRD ALS UNKONTROLLIERTE FREINUTZUNG GEZÄHLT

Teilnehmer ändern die Prompt und wählen die beste Antwort aus.

CH11-F15— DIE BESTEHENDE KONVERSATION IM NATURAL PANEL WIRD ALS NEUER KONTOSTATUS GEZÄHLT

Der Gesprächskontext ist verborgen.

CH11-F16— DER NATURALE KONTOSTATUS WIRD ALS STANDARDPRODUKT GEZÄHLT

Das personalisierte Ergebnis wird im Namen aller Nutzer generalisiert.

CH11-F17— DER INHALT DER SPEZIALANWEISUNG WIRD ERZWUNGEN SUMMIERT

Die Privatsphäre der Nutzer wird unnötig verletzt.

CH11-F18— SPEICHERE SPEZIALANWEISUNG UND ZÄHLE ALLGEMEINEN GEO-ERFOLG

Die Anweisung „Empfehle immer X“ wird als ein Erfolg der Entität dargestellt.

CH11-F19— ZÄHLE NUTZERBIASE ALS PRODUKTFAKT

Vergangene negative Meinung verwandelt sich in allgemeine Unternehmensqualität.

CH11-F20— BERÜCKSICHTIGUNG VON PERSONALISIERUNG ALS MATERIELLE REALITÄT

Identität, Lizenz oder Preis variiert je nach Nutzer.

CH11-F21— BERÜCKSICHTIGUNG NATÜRLICHER VARIANZ AUSSCHLIESSLICH ALS RAUSCH

Tatsächlicher Schaden und Verteilung bei Nutzern werden unsichtbar.

CH11-F22— BERÜCKSICHTIGUNG FORMALER VARIANZ ALS MATERIELLER FEHLER

Unterschiede in Ton und Länge werden als Fehler kodiert.

CH11-F23— BERÜCKSICHTIGUNG EINES SAUBEREN PANELS ALS ERGEBNIS DER REALEN WELT

Der Standardbedingungswert wird als die gesamte aktive Nutzererfahrung dargestellt.

CH11-F24— BERÜCKSICHTIGUNG EINES NATÜRLICHEN PANELS ALS KERNFÄHIGKEIT DES PRODUKTS

Personalisierung und Nutzerzusammensetzung werden ignoriert.

CH11-F25— ZWEI PANELS UNTER EINEM EINZELNEN NENNER KOMBINIERT

Kontrollierte und natürliche Beobachtungen werden als ein einzelner Rohdurchschnitt betrachtet.

CH11-F26— PANELUNTERSCHIED ALS MEMORIEEFFEKT BERÜCKSICHTIGEN

Kausalität wird erklärt, ohne Unterschiede im Plan, in der Population und bei den Fahrzeugen zu untersuchen.

CH11-F27— NATÜRLICHE UNTERGRUPPE NACH ERGEBNIS ERSTELLEN

Eine neue Kategorie wird erfunden, um eine niedrige oder hohe Punktzahl zu erklären.

CH11-F28— DEN CARRYOVER-EFFEKT BEIM GLEICHEN NUTZER IGNORIEREN

Die erste Aufgabe beeinflusst die zweite Antwort.

CH11-F29— DIE SEQUENZRANDOMISIERUNG VERSTECKEN

Alle Nutzer sehen zuerst die saubere Bedingung, dann die natürliche Bedingung.

CH11-F30— NATÜRLICHEN ZUSTAND DURCH KONTROLLIERTE AUFGABE STÖREN

Das Ändern von Einstellungen oder des Ursprünglicher Prompt verändert den anschließenden Zustand des Kontos.

CH11-F31— BERÜCKSICHTIGEN SIE VERSCHIEDENE NUTZERGRUPPEN ALS GEMATCHT

Natürliche und kontrollierte Panels haben unterschiedliche Plan- und Länderzusammensetzungen.

CH11-F32— BERÜCKSICHTIGEN SIE DAS PANEL DER ERSTEN NUTZUNG ALS SAUBERES PANEL

Standard-Onboarding- und Produkteinstellungen werden als überprüft angenommen.

CH11-F33— BERÜCKSICHTIGEN SIE ERFAHRENE NATÜRLICHE NUTZER ALS ERSTNUTZER

Kontoverlauf und Personalisierung werden unsichtbar.

CH11-F34— BERÜCKSICHTIGEN SIE NATÜRLICHE UNTERNEHMENSERGEBNISSE ALS ALLGEMEINEN KONSUMENT

Die private Wissensdatenbank wird zur Gesamtleistung des Produkts hinzugefügt.

CH11-F35— AKTUALISIEREN SIE DIE ANTWORT IM NATÜRLICHEN PANEL

Die Lieblingsantwort des Nutzers wird zur Hauptbeobachtung.

CH11-F36— DIE NATÜRLICHE NUTZERREISE IN DIE ERSTE ANTWORTPUNKTZAHL EINMISCHEN

Die Antwort, die nach Folgefragen und dem Öffnen von Ressourcen gebildet wird, wird so präsentiert, als ob es die erste Begegnung wäre.

CH11-F37— PANELSTATUS ENTSPRECHEND DER ANTWORT ÄNDERN

Positive Beobachtungen werden als sauber deklariert, negative Beobachtungen werden als natürlich deklariert.

CH11-F38— REINIGUNGSFEHLER SCHWEIGEND ZU NATÜRLICH ÜBERTRAGEN

Die Beobachtung wird umklassifiziert, ohne dass eine notwendige Aufzeichnung des natürlichen Status erforderlich ist.

CH11-F39— BERÜCKSICHTIGUNG DES UNBEKANNTEN ALS PRIVAT ZU PRIVATSPHÄRE-ZWECKEN

Nicht gemessene Personalisierung wird als positiv angenommen.

CH11-F40— EINE KLEINE UNTERGRUPPE IM ÖFFENTLICHEN IDENTIFIZIERBAR MACHEN

Seltene Sonderanweisungen oder ein Nutzer aus einem kleinen Land werden offenbart.

CH11-F41— ABDECKUNGSVOREINGEOMMEN IM NATÜRLICHEN PANEL VERBERGEN

Nutzer, die bereit sind, ihr echtes Konto zu teilen, werden als die gesamte aktive Bevölkerung gezählt.

CH11-F42— AUSBLENDEN DER SAUBEREN PANEL-AUSSCHLUSSFOLGE

Nutzer, die ihre Einstellungen nicht ändern können, werden unsichtbar.

CH11-F43— SCORE DER AKTIVEN BEVÖLKERUNG OHNE AKTIVE NUTZERDATEN

Das Forschungspanel wird so präsentiert, als wäre es die tatsächliche Verteilung der aktiven Nutzer.

CH11-F44— CN-1 KAUSALITÄT AUS UNTERSCHIED

Zwei beschreibende Scores werden als Personalisierungseffekt veröffentlicht.

CH11-F45— BEWAHRUNG DES KRITISCHEN ENDES DER PANELUNTERSCHIEDE

Nur der durchschnittliche Unterschied wird angezeigt.

CH11-F46— LÖSCHEN DER UNBEKANNTEN MASSE DES NATÜRLICHEN PANELS

Nutzer, deren Einstellungs- oder Personalisierungsstatus unbekannt ist, werden als problemfrei betrachtet.

CH11-F47— BEWAHRUNG GÜNSTIGER NATÜRLICHER VERBIEGUNG

Es wird keine Korrektur vorgenommen, wenn die Nutzeranweisungsinstitution dies als groß anzeigt.

CH11-F48— VERALLGEMEINERUNG NATÜRLICHER NEGATIVER VERBIEGUNG

Die frühere Meinung eines einzelnen Nutzers wird als KI-Repräsentation der gesamten Bevölkerung repräsentiert.

73. PRÜFUNGSVERFAHREN

Schritt 1— Trennen Sie die Forschungsfragen der beiden Gremien

Schreiben Sie, welche Menge das kontrollierte und das natürliche Gremium vorhersagen wird.

Schritt 2— Definieren Sie die Zielpopulationen

Trennen Sie die kontrollierte produktberechtigte Population von der natürlichen aktiven oder identifizierten Nutzerpopulation.

Schritt 3— Definieren Sie die kontrollierte saubere Bedingung

Die Sitzung, der Speicher, besondere Anweisungen, Werkzeuge, Plan, Oberfläche und Standortbedingungen sind versioniert.

Schritt 4— Bestimmen Sie das erforderliche CSC-Niveau

Schreiben Sie die minimale saubere Bedingungszuverlässigkeit, die für die Hauptanalyse akzeptiert wird.

Schritt 5— Bestimmen Sie die Spur des natürlichen Panels

Es wird bestimmt, welche der Rollen Natürlicher Kontostatus, Natürlicher Gesprächsstatus, Erstverwendung verwaltet verwendet wird.

Schritt 6— Bestimmen Sie das erforderliche NSF-Niveau

Es wird festgelegt, durch welche Nachweise der natürliche Zustand akzeptiert wird.

Schritt 7— Richten Sie das Panel-Zuweisungsdesign ein

Unabhängige Gruppe Zufällige Zuweisung Abgeglichener Nutzer Rotierendes Panel wird ausgewählt.

Schritt 8— Schreiben Sie das Verfahren für Einstellungsänderung und Wiederherstellung

Ein sicherer Prozess wird für kontrollierte Panel-Teilnehmer vorbereitet.

Schritt 9— Festschreiben Sie die Datenschutzgrenze

Welche natürlichen Nutzersituationen:

  • nur Status,
  • begrenzt Metadata,
  • offener Inhalt

es wird bestimmt, dass es gespeichert wird als.

Schritt 10— Prompt und anfängliche Ausgaberegel festschreiben

Die gleiche Prompt und das gleiche Protokoll für die anfängliche geeignete Ausgabe werden in beiden Panels angewendet.

Schritt 11— Werkzeug und Webmodus speichern

Kontrollierte und natürliche Panelunterschiede werden sichtbar gemacht.

Schritt 12— Panelstatus vor Feld überprüfen

Ist es für die Rolle des Teilnehmerpanels geeignet?

Schritt 13— Panelvektor auf Beobachtungsebene speichern

Speicher, Anweisung, Plan, Oberfläche, Kontext und Nutzungsstatus werden gespeichert.

Schritt 14— Gültigkeit des Blindprüfprotokolls

Die Entscheidung über den Panelstatus wird getroffen, ohne zu sehen, ob die Antwort korrekt oder inkorrekt ist.

Schritt 15— Missklassifikationen mit vordefinierter Regel verwalten

Der Übergang von sauberem zu natürlichem oder gemischtem Zustand erfolgt nur, wenn der Datensatz ausreichend ist.

Schritt 16— Panelgewichte erzeugen

Getrennte Gewichte werden entsprechend den unterschiedlichen Zielpopulationen der beiden Panels berechnet.

Schritt 17— Hauptwerte berechnen

Kontrollierte Repräsentation Natürliche Repräsentation Kritischer Fehler

UNBEKANNT

Ablehnung und Unentschiedenheit werden separat erzeugt.

Schritt 18— Differenz zwischen sauber und natürlich berechnen

Signierte und absolute Differenz wird genommen.

Schritt 19— Untergruppen untersuchen

Vordefinierte Gruppen wie Gedächtnis, Anweisung, Plan, Kontodauer, Nutzungshäufigkeit, Erstverwendung werden bewertet.

Schritt 20— Kausalitätsgrenze festlegen

Das CN-Level wird zugewiesen. Es wird festgehalten, welche Aussagen geltend gemacht werden können.

Schritt 21— Überprüfung von Datenschutz und Small-Cell-Kontrolle

Ergebnisse mit einem Risiko der Re-Identifizierung werden zusammengeführt oder eingeschränkt.

Schritt 22— Erstellung des öffentlichen Panel-Scorecards

Die beiden Panels werden zusammen mit ihrem Umfang und ihren Einschränkungen veröffentlicht.

74. NOTWENDIGE NACHWEISE

Forschungsfrage des kontrollierten Panels; Forschungsfrage des natürlichen Panels; Zielpopulationen beider Panels; Methode zur Panel-Zuweisung; Definition des kontrollierten Clean-States; minimale CSC-Stufe; neuer Chat-Eintrag; Speicherzustand; Nutzerdefinierter Instruktionszustand; Zustand voriger Unterhaltungen; Zustand des Unternehmensarbeitsbereichs; Werkzeug- und Webmodus; Plan; Nutzeroberfläche; Sprache und Gebietsschema; Anweisungen zur Einstellungänderung; Zustimmung der Teilnehmer; Protokoll zur Wiederherstellung der Einstellung; Nutzung eines Testkontos, falls vorhanden; Natural-Panel-Spur; minimale NSF-Stufe; Kontogealterband; Nutzungsfrequenz; First-Use-Status; Markenbekanntheit; Status voriger Unterhaltungen bezüglich der geprüften Einheit; Zustand des Natural-Tools; Unterscheidung zwischen dem natürlichen Konten-Zustand und dem natürlichen Gesprächs-Zustand; Prompt-ID und Version; Validierung der zuerst berechtigten Ausgabe; Panel-Zustands-Vektor; und Panel-Zustands-Gültigkeitsstatus.

Gültigkeitsprüfung Umklassifizierungsaufzeichnungen Kontrollierte Panel-Ausschlüsse Natürliche Panel-Abdeckungslücken Panel-Gewichte Roh- und effektive Stichprobe Kontrollierter Wert Natürlicher Wert Unterzeichneter Panel-Unterschied Absoluter Panel-Unterschied Kritischer Fehlerunterschied UNBEKANNTER und unentschlossener Unterschied Vordefinierte Untergruppen-Ergebnisse Abgestimmte Design-Aufzeichnungen Reihenfolge- und Übertragungseffekte CN-Vergleichbarkeitsniveau Datenschutz- und Schwärzungsaufzeichnung Schutz kleiner Zellen Öffentliche Panel-Ergebnisübersicht Panel-Version und Änderungsaufzeichnung Verantwortliche Person oder Institution

75. ÜBERPRÜFUNGS-KONTROLLLISTE

Sind die Forschungsfragen für das kontrollierte und das natürliche Panel getrennt? Sind ihre Zielgruppen gleich oder unterschiedlich? Wurde der kontrollierte saubere Zustand klar definiert? Abgesehen vom neuen Chat, welche sauberen Zustände wurden bestätigt? Ist das Gedächtnis wirklich ausgeschaltet, oder ist es unbekannt? Wurde der Status der speziellen Anweisung aufgezeichnet? Gibt es einen Effekt des Unternehmensarbeitsbereichs? Sind die Web- und Werkzeugmodi standardmäßig? Sind der Plan und die Nutzeroberfläche fest oder geschichtet? Wurde ein Vertrauensniveau für den sauberen Zustand angegeben? Wurden CSC-1-Beobachtungen als vollständig sauber verwendet? Wurde der Teilnehmer gebeten, sein Gedächtnis oder seine Historie zu löschen? Wurden die Einstellungen am Ende der Aufgabe wiederhergestellt? Wurde ein neues Konto oder ein Testkonto verwendet? Wurde das Testkonto wie ein echtes Nutzerpanel präsentiert?

Welches Trace verwendet das natürliche Panel? Wurde in Natural Account-State ein neuer Chat geöffnet? Hat der aktuelle Gesprächskontext die Haupt-Natural-Bewertung beeinträchtigt? Wurde ein Natural-State-Vertrauenslevel angegeben? Wurden Speicher- und Nutzerdefinierte Instruktionsinhalte unnötig gesammelt? Wurden der tatsächliche Plan des Nutzers und die Oberfläche aufgezeichnet? Sind First-Use-Nutzer getrennt? Sind Unternehmensbenutzer getrennt? Wurde der Zustand des Natural-Tools aufgezeichnet? Haben die beiden Panels die gleiche Prompt-Version verwendet? Wurde die erste berechtigte Ausgabe in beiden Panels gespeichert? Hat die natürliche Nutzerantwort sich aktualisiert? Wurde der Panel-Status entsprechend dem Inhalt der KI-Antwort geändert? Wie wurden Datensätze mit erkannten natürlichen Zuständen im sauberen Panel verwaltet? Wurde derselbe Nutzer in zwei Panels verwendet? Wurde die Reihenfolge randomisiert?

Wurde der Effekt von Transfer und Gedächtnis bewertet? Entspricht bei dem Design mit unabhängigen Gruppen die Zusammensetzung der Nutzer? Sind kontrollierte und natürliche Gewichtungen getrennt? Kann der natürliche Wert wirklich auf die aktive Nutzerpopulation verallgemeinert werden? Wurde der Unterschied zwischen sauber und natürlich überinterpretiert als ein Personalisierungseffekt? Ist ein Unterschied bei kritischen Fehlern sichtbar? Gibt es einen sichtbaren Unterschied für UNBEKANNT und Nullergebnisse? Wurden Untergruppen vor den Ergebnissen definiert? Können kleine Untergruppen neu definiert werden? Wurden nutzergeführte Anweisungen für oder gegen in allgemeines GEO umgewandelt? Hat die Personalisierung die materielle Realität verändert? Wurde ein CN-Vergleichsniveau bereitgestellt? Ist der verantwortliche Eigentümer der Panel-Ergebnisse-Karte klar?

76. EINWÄNDE UND ANTWORTEN

Einspruch 1— „Wenn echte Nutzer Speicherkonten verwenden, warum ist dann ein sauberes Panel notwendig?“

Weil die Ursache des Unterschieds ohne eine gemeinsame Ausgangsbedingung zwischen Produkten, Ländern und Sprachen nicht verstanden werden kann. Ein sauberes Panel ersetzt kein echtes Nutzerpanel. Es bietet eine Referenz zum Vergleich.

Einwand 2— „Ist ein kontrolliertes Panel nicht künstlich, wenn es ein natürliches Panel gibt?“

Es ist kontrolliert. Das ist absichtlich. Der Zweck einer Laborbedingung ist nicht, das gesamte reale Leben abzubilden, sondern bestimmte Variablen zu isolieren.

Einwand 3— „Wenn das kontrollierte Panel höhere Werte erzielt, können wir das nicht als Haupt-GEO-Score nehmen?“

Das kann man nicht alleine tun. Ein hoher Wert im Kontrollpanel kann nicht die Tatsache auslöschen, dass reale Nutzer niedrigere Ergebnisse sehen. Die beiden Ergebnisse sollten getrennt erscheinen.

Einwand 4— „Ist der wissenschaftliche Wert niedrig, wenn das natürliche Panel sehr verstreut ist?“

Heterogenität muss kein Mangel des natürlichen Panels sein. Sie ist ein Merkmal der realen Nutzererfahrung. Heterogenität:

  • wird aufgezeichnet,
  • ist geschichtet,
  • ist gewichtet,

wird mit Unsicherheit berichtet.

Einwand 5— „Stört das Öffnen eines neuen Chats nicht den natürlichen Nutzerzustand?“

Der aktuelle Gesprächskontext wird entfernt. Der persistente Konto-, Plan-, Speicher- und benutzerdefinierte Anweisungsstatus werden beibehalten. Dies macht den natürlichen Kontostatus vergleichbar. Auch die aktuelle Gesprächserfahrung ist messbar.

Einwand 6— „Wie werden wir seine Wirkung messen, ohne den Inhalt der benutzerdefinierten Anweisungen zu kennen?“

Das Wissen um den Inhalt ist für die Hauptbewertung nicht erforderlich. Dessen Vorhandensein:

  • existiert,
  • existiert nicht,
  • kann Material sein

Wir können es als solches klassifizieren. Für die kausale Inhaltsanalyse ist separate und einvernehmliche Arbeit erforderlich.

Einwand 7— „Wenn das Gedächtnis klar ist, aber nichts über das Unternehmen erinnert wird, warum dann eine separate Gruppe?“

Die Wirkung des Gedächtnisses kann unbekannt sein. Ein Status von „nicht mit der Entität verbunden“ kann basierend auf der Aussage des Nutzers vergeben werden. Dies hat jedoch immer noch nicht die gleiche Sicherheit wie der geschlossene Gedächtniszustand.

Einwand 8– „Ist die Anweisung des Nutzers ‚immer X vorschlagen‘ nicht echte Nutzererfahrung?“

Es ist eine echte Erfahrung. Es ist jedoch nicht die allgemeine GEO-Leistung von X. Es handelt sich um eine von Nutzern bereitgestellte Anleitung. Es sollte separat aufgezeichnet werden.

Einwand 9– 'Wenn Personalisierung dem Nutzer eine passendere Antwort gibt, wo ist das Problem?'

Es muss kein Problem sein. Empfehlungen können je nach Bedarf des Nutzers variieren. Probleme treten auf, wenn Identität, Lizenz, Preis und Evidenzstatus willkürlich ändern.

Einwand 10— „Ist es nicht die korrekteste Methode, denselben Nutzer in zwei Panels zu verwenden?“

Es kann stark für einige kausale Vergleiche sein. Die erste Aufgabe kann die zweite Situation beeinflussen. Daher sind Reihenfolge-, Übertragungs- und Gedächtniskontrollen erforderlich. Unabhängige Gruppen können in Hauptpopulationen sicherer sein.

Einwand 11— 'Wenn das Aktualisieren der Antwort in der Panel unter natürlichen Nutzungsbedingungen normales Verhalten ist, warum ist es dann verboten?'

Regeneration ist verboten, wenn die Exposition gegenüber der ersten Reaktion gemessen wird. Regeneration und nachfolgendes Verhalten können unter einem Natural Interaction Track separat gemessen werden.

Einwand 12— „Was werden wir mit einem Nutzer tun, der Speicher und Anweisungen für ein sauberes Panel nicht ausschalten kann?“

Sie können nicht dem kontrollierten Panel zugeführt oder in einer separaten Zelle mit einem niedrigeren CSC-Level untergebracht werden. Sie können im natürlichen Panel bewertet werden. Die Ausschlussrate sollte gemeldet werden.

Einspruch 13— „Sind Testkonten nicht zuverlässiger?“

Sie können in Bezug auf die Kontrolle zuverlässig sein. Sie sind hinsichtlich der tatsächlichen Nutzerpopulation eingeschränkt. Kontrollierte Testkonten und echte Nutzerpanels sind separate Ergebnisse.

Einwand 14— „Ist das Speichern von Nutzereinstellungen auf dem Natur-Panel nicht eine Verletzung der Privatsphäre?“

Es kann passieren, wenn unnötige Inhalte gesammelt werden. Datenschutz kann durch hochstufige offene/geschlossene Status, anonyme Registrierung und Schwärzung gewahrt werden.

Berufung 15— „Werden wir die Punktzahlen der beiden Gremien nicht in eine einzige NOMOS-Punktzahl zusammenführen?“

Die Rollen der beiden Gremien können in der endgültigen Ergebnisarchitektur definiert werden. Rohwerte und Zwischenergebnisse sollten jedoch immer separat sichtbar bleiben. Sie können die kombinierte Punkteverteilung nicht ersetzen.

Berufung 16— „Welchen Fehler hat das Unternehmen, wenn das natürliche Gremium niedrig bewertet?“

Es ist nicht immer der Fehler des Unternehmens. Quelle:

  • Nutzeranweisung,
  • KI-Personalisierung,
  • Planunterschied,
  • offizielle Quellendefekt,
  • Produktverhalten

Es ist möglich. Die Prüfung zeigt zuerst das Ergebnis, dann trennt sie den Verantwortungsweg.

GEMEINSAME REGEL VON KAPITEL 81

Ein KI-Produkt hat keine einzige Antwort. Selbst derselbe Prompt kann unterschiedliche Antworten für haben:

  • sauberes Konto,
  • natürlicher Account,
  • Nutzer mit Gedächtnis,
  • Nutzer mit speziellen Anweisungen,
  • Erstbenutzer,
  • geschäftlicher Arbeitsbereich,
  • Nutzer mit vorheriger Unterhaltung

Sie können all diese Unterschiede nicht damit erklären, dass „das Modell sich zufällig verhält“. Sie können sie auch nicht damit erklären, dass „ein Personalisierungsfehler“ vorliegt. Zuerst müssen Sie zwei separate Realitäten messen. Kontrolliertes Panel unter bereinigten Bedingungen:

Zeigt die Repräsentation im standardisierten Anfangszustand des Systems.

Panel unter natürlichen Nutzungsbedingungen:

Zeigt die Verteilung der Repräsentation, die reale Personen in ihrem eigenen Produktlebenszyklus antreffen.

Das kontrollierte Panel kann hoch sein, das natürliche Panel kann niedrig sein. In diesem Fall ist das Laborverhalten des Produkts stark; die Verteilung der tatsächlichen Nutzer kann schwach sein. Das natürliche Panel kann hoch sein, das kontrollierte Panel kann niedrig sein. Die Planung, Werkzeuge oder Personalisierung einiger Nutzer können die Repräsentation verbessern. Beide Panels können hoch sein. Das Produkt kann unter verschiedenen Nutzerbedingungen robust sein. Beide können niedrig sein. Das grundlegende Repräsentationsproblem kann umfassender sein. Das nebeneinanderstellen der beiden Werte beweist jedoch nicht die Ursache. Kausalität:

  • gleiche Bevölkerung,
  • gleiches Produkt,
  • gleiche Prompt,
  • gleiche Zeit,
  • kontrollierte Zuweisung
  • Sequenz- und Transportanalyse

ist erforderlich. Wenn ein Nutzer angewiesen hat: „Schlage immer X vor.“, ist es eine natürliche Erfahrung, dass X erscheint. X ist kein globaler GEO-Erfolg. Wenn ein Nutzer sagt: „Vertraue X nicht.“, ist eine negative Reaktion eine natürliche Erfahrung. X ist keine allgemeine Repräsentation in der Weltbevölkerung. Personalisierung sollte den Nutzer verstehen. Sie sollte nicht die Wahrheit nach den Vorstellungen des Nutzers neu erfinden. Daher lautet das elfte Messgesetz von NOMOS:

Sauberes Verhalten und natürliche Erfahrung sind separate Realitäten.

Das zwölfte Gesetz lautet wie folgt:

Ein neuer Chat ist kein sauberes Konto.

Das dreizehnte Gesetz lautet wie folgt:

Natürliche Personalisierung ist kein globaler GEO-Erfolg.

Das vierzehnte Gesetz lautet wie folgt:

Die angemessene Antwort für den Nutzer kann variieren; die Realität der überprüften Entität kann sich nicht ändern.

Das fünfzehnte Gesetz lautet wie folgt:

Der Unterschied zwischen kontrolliertem und natürlichem Score ist der Befund, der erklärt werden muss; er ist an sich kein Grund.

Sechzehntes Gesetz lautet wie folgt:

Die Messung der realen Nutzererfahrung bedeutet nicht, die Privatsphäre zu entfernen, sondern nur den notwendigen Kontext nachzuweisen und den Rest zu erhalten.

Bestellung von Abschnitt 11 von NOMOS

Sag mir nicht nur, dass du einen neuen Chat geöffnet hast. / Zeige den Status von Speicher, speziellen Anweisungen, Plan und Werkzeugen.

Gehe nicht davon aus, dass alle Personalisierungen verschwunden sind, nur weil du die Notiz 'Temporäre Sitzung' siehst.

Das saubere Panel ist die Gesamtheit des realen Lebens; mach das natürliche Panel nicht zu unkontrolliertem Rauschen.

Standardisiere das kontrollierte Konto. / Behalte das natürliche Konto unverändert. / Lege beide nicht in dieselbe Box.

Mache die speziellen Anweisungen des Nutzers nicht zum Welterfolg für die Entität.

Mache die negative Vergangenheit des Nutzers nicht zur Sicht der gesamten Bevölkerung.

Zähle Personalisierung nicht als Lizenz, die Wahrheit zu verändern.

Du kannst einem Nutzer geeignete Ratschläge geben. / Aber schreibe die Identität, Lizenz, den Preis und den Nachweis des Unternehmens nicht von Nutzer zu Nutzer um.

Sammle das Privatleben nicht im natürlichen Panel. / Ist das Gedächtnis eingeschaltet, Anweisungen vorhanden, Kontext verfügbar – zeichne nur auf, was notwendig ist.

Lasse den Teilnehmer sein Gedächtnis nicht löschen. / Stelle die Einstellungen wieder her, wenn du sie vorübergehend geändert hast.

Wenn du denselben Nutzer in zwei Panels getestet hast, erinnere dich daran, dass die erste Antwort die zweite beeinflussen kann.

Zeigen Sie den Unterschied zwischen dem sauberen Punktestand und dem natürlichen Punktestand. / Zeigen Sie den kritischen Unterschied. / Zeigen Sie das Unbekannte. / Nennen Sie jedoch den Grund nicht ohne Beweis.

Entscheiden Sie zuerst, welche Nutzerrealität Sie messen möchten. / Festschreiben Sie dann die sauberen und natürlichen Bedingungen separat. / Halten Sie dann die Prompt gleich. / Erfassen Sie dann die erste Antwort, ohne sie zu ändern. / Berechnen Sie dann die beiden Verteilungen separat. / Und erst danach erklären Sie die Distanz zwischen dem, was das Produkt unter Standardbedingungen tut, und dem, was reale Menschen erleben.

Der abschließende Satz des Kapitels

Die wahre Repräsentation eines KI-Produkts in GEO-1000 ist nicht die Antwort, die es in einer sauberen Sitzung geben kann; es ist die klare und bewiesene Beziehung zwischen seinem Verhalten unter Standardbedingungen und den Antworten, die es tatsächlich den Menschen über verschiedene Nutzerhistorien hinweg liefert.

Normativer Kern

Beobachtungen des kontrollierten Panels unter bereinigten Bedingungen und des Panels unter natürlichen Nutzungsbedingungen MÜSSEN separate Messpopulationen, Panelzustände, Nenner und öffentliche Ergebnisse bleiben. Ein Kontrolliertes Panel unter bereinigten Bedingungen MUSS definieren und, falls zutreffend, überprüfen: - ein neues und separates Gespräch, - das Fehlen eines vorherigen Gesprächskontexts, - den Zustand des persistenten Speichers, - den Zustand der Nutzerdefinierten Anweisungen, - den Unternehmens- oder verwalteten Arbeitsbereichszustand, - Web-, Abruf- und Werkzeugkonfiguration, - Plan, - Nutzerschnittstelle, - Prompt-Version, - und die Vertrauenswürdigkeit des sauberen Zustands. Ein neues Gespräch oder eine Kennzeichnung als temporäre Sitzung DARF NICHT allein als Nachweis dafür behandelt werden, dass jede persistente Personalisierung deaktiviert wurde. Ein Panel unter natürlichen Nutzungsbedingungen MUSS das authentische Konto, den Plan, die Schnittstelle, den Speicher, die nutzerdefinierten Anweisungen und den Nutzungszustand des Teilnehmers bewahren, während den festgelegten Prompt, die Regel für die erste berechtigte Ausgabe, die Nachweisanforderungen und die Regel, keine neue Antwort zu erzeugen beibehalten werden. Beobachtungen im Zustand eines natürlichen Kontos, natürlicher Gesprächs-Zustand, Erstverwendung und verwaltete natürliche Beobachtungen MÜSSEN separat identifiziert bleiben. Die Dokumentation des natürlichen Zustands MUSS die Sammlung von privaten Daten minimieren. Private Anweisungstexte, Gesprächsverlauf, Identität, Zugangsdaten und sensible persönliche Inhalte DÜRFEN NICHT gesammelt werden, es sei denn, dies ist gesondert erforderlich, mit Einwilligung erhoben, minimiert und zugangskontrolliert. Nutzergenerierte entitätsbegünstigende oder entitätsbenachteiligende Anweisungen KÖNNEN als natürliche Personalisierungseffekte gemessen werden, DÜRFEN jedoch NICHT als allgemeiner Erfolg, Misserfolg oder Standardverhalten eines Produkts für die Entität repräsentiert werden. Personalisierung KANN Relevanz, Präsentation und Empfehlung verändern, wenn der Nutzerkontext dies rechtfertigt. Sie DARF NICHT willkürlich die verifizierte Identität, Lizenz, den rechtlichen Status, Preis, Umfang, Nachweise oder die Zeit einer Entität ändern. Unterschiede zwischen kontrollierten und natürlichen Panels DÜRFEN NICHT als kausale Personalisierungseffekte repräsentiert werden, es sei denn, Bevölkerung, Produkt, Prompt, Zeit, Schnittstelle, Plan, Werkzeuge, Zuordnung, Reihenfolge und Carryover-Bedingungen unterstützen diese Schlussfolgerung. Kontrollierte und natürliche Bewertungen, Raten kritischer Fehler, UNKNOWN-Raten, Abdeckung, effektive Stichprobengrößen sowie signierte und absolute Panel-Lücken MÜSSEN weiterhin separat sichtbar bleiben. Die Berechtigung des Panel-Status, Umklassifizierung, Ausschluss und Gewichtung MÜSSEN unabhängig davon bleiben, ob die KI-Ausgabe positiv, negativ, korrekt, inkorrekt, abgelehnt, kritisch oder kommerziell günstig ist. Jede Definition des Panel-Status, jeder Prozess zur Änderung von Einstellungen, jede Datenschutzentscheidung, jedes Vergleichsniveau und jedes Ergebnis MÜSSEN versioniert und einer verantwortlichen Person oder Organisation zuordenbar sein.

Zitierempfehlung

Muraz, Kaan. NOMOS GEO-Auditprotokoll: Ein Protokoll zur Messung der Repräsentation von Entitäten in generativen Systemen über die Weltbevölkerung hinweg. Finaler Textkandidat, deutsche redaktionelle Ausgabe. NobleJackal, 2026. https://doi.org/10.5281/zenodo.22040743. https://noblejackal.com/de/nomos-geo-audit-protocol/
© 2026 Kaan MURAZ. Lizenziert unter CC BY 4.0; Namensnennung ist erforderlich.