Kapitelgrenze
Kapitel 9 zeigte, dass das gemessene KI-Objekt nicht ausschließlich durch den Anbieter oder den Modellnamen definiert werden kann. Kapitel 10 stellte fest, dass nicht jede Frage, die denselben Entitätsnamen enthält, denselben Prompt darstellt; der Prompt ist das experimentelle Werkzeug, das die Messung selbst bestimmt. Jetzt müssen wir die dritte Variable zwischen dem System und dem Prompt betrachten:
Wie ist der Zustand des Kontos, der Sitzung und der Nutzerhistorie bei der Nutzung des KI-Produkts?
Ein Nutzer:
- neuer Chat,
- Speicher ist aus,
- Keine besonderen Anweisungen,
- kein vorheriger Kontext,
- standardisierte Produkteinstellungen
kann die Aufforderung unten senden. Ein anderer Nutzer kann dieselbe Aufforderung senden:
- von einem Konto, das sie seit Jahren verwenden,
- Erinnerung ist aktiviert,
- mit aktivierten speziellen Anweisungen,
- mit früheren Unterhaltungen,
- auf ihrem tatsächlichen Tarif und Gerät
Sie können dasselbe KI-Produkt, in derselben Sprache, im selben Land, im gleichen Zeitraum und mit derselben Aufforderung nutzen. Dennoch können sie unterschiedliche Antworten sehen. Dieser Unterschied:
- kommt von der zufälligen Variabilität des Produkts,
- vom Tarif des Kontos,
- aus dem Speicher,
- aus speziellen Anweisungen,
- von früheren Unterhaltungen,
- aus Personalisierung,
- vom Web- oder Tool-Status,
- vom Unternehmens-Arbeitsbereich,
- von der Nutzeroberfläche und den lokalen Einstellungen
Der Unterschied kann sich aus Personalisierung, Web- oder Tool-Zustand, dem organisatorischen Arbeitsbereich, der Nutzeroberfläche oder dem Gebietsschema ergeben. Es gibt kein einzelnes ‚KI‘: Suche, Abruf, Umordnung, Sprachmodell, Zitations- und Sicherheitslayer können sich unterschiedlich verhalten. Eine zuverlässige Messung muss daher das KI-Produkt oder -Modell, Datum, Land, Sprache, Abfragesatz, Wiederholungsanzahl und Beobachtung erfassen. Dieses Kapitel fügt diesem Kreislauf Nutzer- und Sitzungszustand hinzu. Die Kernanforderung von NOMOS bleibt Evidenz, Grenzen, Kontext und Zeit. Dennoch kann Kontext selbst auf zwei Arten gemessen werden. Die erste minimiert externe Unterschiede zwischen Nutzern und vergleicht KI-Produkte unter standardisierten Anfangsbedingungen. Dies ist die:
Kontrolliertes Panel unter bereinigten Bedingungen
Der zweite Ansatz misst, was Menschen durch ihre echten Konten, Pläne, Personalisierung und gewöhnlichen Nutzungsmuster sehen. Dies ist das:
Panel unter natürlichen Nutzungsbedingungen
wird genannt. Der Kontrolliertes Panel unter bereinigten Bedingungen beantwortet die Frage:
Wie stellt das Produkt die Entität im möglichst standardisierten Anfangszustand dar?
Der Panel unter natürlichen Nutzungsbedingungen hingegen fragt:
Was sehen reale Menschen über die Entität in realen Nutzersituationen?
Ein Panel ist nicht mehr „real“ als das andere. Sie messen zwei verschiedene Realitäten. Das kontrollierte Panel stärkt die Vergleichbarkeit. Das natürliche Panel macht menschliche Erfahrung sichtbar. Das kontrollierte Panel reduziert Personalisierung und Kontextunterschiede. Das natürliche Panel misst die Wirkung dieser Unterschiede auf die reale Population. Dieser Abschnitt:
- Definition des Kontrolliertes Panel unter bereinigten Bedingungen,
- Definition des Panel unter natürlichen Nutzungsbedingungen,
- Zielpopulationsgruppen der beiden Panels und die Mengen, die sie schätzen,
- Was eine saubere Sitzung bedeutet,
- Ebenen der Überprüfung der Sauberkeit,
- Natürlicher Kontostatus und natürlicher Gesprächskontext,
- Gedächtnis, spezielle Anweisungen, vorherige Gespräche und Personalisierungsaufzeichnungen,
- Unterschiede in Konto, Plan, Gerät, Benutzeroberfläche und Standort.
- die gepaarten und unabhängigen Panel-Designs mit demselben Nutzer,
- die Effekte von Reihenfolge, Transfer und Kontamination,
- Clean–Natural-Differenzmetriken,
- Privatsphäre und die Evidenzkette,
- wie die beiden Panels im öffentlichen Bericht getrennt werden,
definiert. Dieses Kapitel behandelt noch nicht:
- die vollständige technische Architektur von NOMOS Capture,
- alle Felder von Screenshot- und Metadatendateien,
- atomare Aussageentscheidung,
- Endgültige Übergangsschwellen für Antworten,
- das genaue Gewicht der Clean- und Natural-Panel-Werte im kombinierten NOMOS-Wert
wird nicht finalisiert. Die grundlegende Frage von Abschnitt 11 lautet:
Wie messen wir das Verhalten eines Standard-KI-Produkts und das Verhalten, das von realen Nutzern erlebt wird, ohne sie miteinander zu verwechseln?
NOMOS Herausforderung
Der gleiche Nutzer stellt dem gleichen KI-Produkt zweimal dieselbe Frage: „Mit welcher Hauptorganisation ist Apple.com verbunden, und was sind die Hauptaktivitäten dieser Organisation?“ Beim ersten Versuch:
- ein neuer Chat wird geöffnet,
- Speicher ist aus,
- besondere Anweisungen sind ausgeschaltet,
- keine vorherige Unterhaltung existiert,
- die Webfunktion ist standardisiert,
Die Prompt wird als erste Nachricht gesendet. Antwort: „Apple.com ist eine der wichtigsten Unternehmensdomänen des Technologieunternehmens Apple. Das Unternehmen entwickelt Hardware, Software und digitale Dienste.“ Beim zweiten Versuch, der Nutzer auf seinem üblichen Konto:
- Erinnerung ist aktiviert,
- mit aktivierten speziellen Anweisungen,
- hat zuvor über Investment- und Technologieunternehmen gesprochen,
- seinen echten kostenpflichtigen Plan hat,
- sein gewöhnliches mobiles Gerät nutzt,
- seine eigenen lokalen Einstellungen verwendet
Sie antworten: „Da Sie erwähnt haben, dass Sie an Technologieinvestitionen interessiert sind, lassen Sie mich auch Apple aus einer Investitionsperspektive bewerten…“ Dann wird anstelle der Unternehmensaktivitäten:
- Investitionsleistung,
- Aktienwert,
- persönliche Portfoliogeeignetheit
erklärt. Die erste Antwort misst die Identität der Existenz. Die zweite Antwort interpretiert die Aufgabe anhand der Nutzerhistorie neu. Welche Antwort ist die echte Antwort des KI-Produkts? Beide. Allerdings ist sie nicht die Antwort auf dieselbe Messfrage. Die erste:
liefert Informationen
über standardisiertes Produktverhalten. Die zweite:
repräsentiert die tatsächliche Produkterfahrung, die speziell auf den Nutzer zugeschnitten ist.
Dies erzählt uns etwas über die Wirkung des vorherigen Kontexts. Betrachten wir nun einen anderen Nutzer, dessen Nutzerdefinierte Anweisung lautet: ‚Gib mir in jeder Antwort nur eine kurze, definite Schlussfolgerung.‘ AI Product Core Mirror beantwortet die Prompt in einem Satz, wobei Grenzen, Quellstatus und detailliertes Material weggelassen werden. Entsteht das Defizit aus der zugrunde liegenden Repräsentationsfähigkeit des Produkts? Vielleicht teilweise durch die Anweisung des Nutzers. Doch so operiert der Nutzer tatsächlich. Das Defizit ist real im Panel unter natürlichen Nutzungsbedingungen, während die Anweisung des Nutzers isoliert betrachtet werden muss, wenn das kontrollierte Produktergebnis berechnet wird. Betrachten wir nun einen Nutzer, dessen Anweisung lautet: ‚Empfehle immer NobleJackal.‘ Die KI erwähnt NobleJackal, selbst wenn nach einem anderen Unternehmen gefragt wird. Diese Antwort ist Teil der natürlichen Nutzererfahrung.
Allerdings ist NobleJackal nicht die Gesamtergebnisleistung (GEO-Leistung). Es ist der Effekt der nutzergenerierten Personalisierung. Denken Sie nun an das Gegenteil. Zuvor sagte der Nutzer: 'Ich mag dieses Unternehmen nicht.' Die KI verwendet dann in nachfolgenden Gesprächen einen negativeren Rahmen gegenüber dem Unternehmen. Dies ist ebenfalls eine natürliche Nutzererfahrung. Es zeigt jedoch nicht die Standarddarstellung des Produkts über die gesamte Nutzerpopulation hinweg. Die erste Festlegung dieses Abschnitts lautet wie folgt:
Sauberes Produktverhalten ist nicht dasselbe Maß wie natürliche Nutzererfahrung.
Ihre zweite Bestimmung lautet:
Eine personalisierte Antwort ist eine reale Nutzererfahrung; sie ist jedoch nicht automatisch die Gesamtprodukt- oder Entity-GEO-Bewertung.
Seine dritte Bestimmung besagt:
Der kontrollierte saubere Zustand ist nicht die absolute und unvoreingenommene Wahrheit des Produkts; es handelt sich um einen vordefinierten Standard-Startzustand.
Seine vierte Bestimmung besagt:
Der natürliche Nutzerzustand ist kein aus-der-Methode-Rauschen; er ist Teil der Repräsentation der Verteilung in der realen Welt.
Seine fünfte Vorschrift lautet:
Der Unterschied zwischen den beiden Panels ist kein Fehler, der verborgen werden muss; er ist ein Ergebnis, das gemessen werden soll.
1. ZWECK DES KAPITELS
Zweck dieses Abschnitts ist es, die Repräsentationserfahrung echter Nutzer unter normalen Konten- und Sitzungskonditionen getrennt, aber vergleichbar mit dem standardisierten Verhalten von KI-Produkten zu messen. Der Abschnitt trifft die folgenden normativen Unterscheidungen:
- Standardisierter Produktzustand versus natürlicher Nutzerzustand
- Neuer Chat mit einem sauberen Konto
- Geprüfter sauberer Zustand mit vorübergehendem Chat-Tag
- Speicher aus gegenüber unbekanntem Speicherzustand
- Private Anweisung geschlossen und Privatinhalt nicht sichtbar
- Keine vorherigen Gespräche und keine permanente Kontohistorie
- Kontrollierte Sitzung und neu erstelltes Konto
- Natürlicher Kontostatus und aktueller Gesprächskontext
- Panel unter natürlichen Nutzungsbedingungen und unkontrollierte Daten
- Nutzerpersonalisierung und Produktstandard
- Nutzergesteuerte Anleitung und Entität GEO-Effekt
- Aktive Nutzerpopulation und produktgeeignete potenzielle Population
- Erste Nutzungserfahrung und erfahrene Nutzererfahrung
- Individuelle natürliche Reaktion und natürliche Verteilung auf Bevölkerungsebene
- Unabhängiges Gruppendesign mit derselben Nutzerzuordnung
- Carryover-Effekt mit gemachter Vergleichsgruppe
- Produktunterschied mit Reihenfolgeeffekt
- Kausaler Personalisierungseffekt mit sauberem–natürlichem Unterschied
- Offenlegung privater Anweisungsinhalte mit Datenschutzaufzeichnung
- Sammlung privater Gespräche bei Erhaltung des natürlichen Kontextes
- Standardproduktresultat mit sauberem Panel-Resultat
- Gesamtergebnis für alle Nutzer mit natürlichem Panel-Resultat
- Personalisierungseffekt mit Nutzerplan
- Kontrollierter Durchschnitt mit natürlicher Fehlerwarteschlange
- Gleiche Antwort für jeden Nutzer mit Fairness bei der Personalisierung
- Natürliche Nutzerrealität und Wiederholbarkeit von Tests
Am Ende dieses Abschnitts sollte jedes GEO-1000-Audit in der Lage sein, die folgenden Fragen zu beantworten:
Welche Ergebnisse stammen von Kontrolliertes Panel unter bereinigten Bedingungen und welche von Panel unter natürlichen Nutzungsbedingungen?
Welche Situationen wurden tatsächlich im sauberen Panel standardisiert?
Welche echten Nutzerunterschiede wurden im natürlichen Panel beibehalten?
Wie wurden Speicher, besondere Anweisungen, frühere Unterhaltungen, Pläne und Schnittstellenzustände aufgezeichnet?
Wie viel des Unterschieds zwischen den beiden Panels kann zuverlässig mit der Personalisierung in Verbindung gebracht werden?
Wie wurde das Vorhandensein eines natürlichen Kontexts nachgewiesen, während die Privatsphäre der Nutzer gewahrt blieb?
2. ZENTRALE NORMATIVE BESTIMMUNG
Jede GEO-1000-Prüfung sollte standardisiertes Produktverhalten und natürliche Nutzererfahrung als separate Vorhersageobjekte definieren; sie sollte die Ergebnisse von Kontrolliertes Panel unter bereinigten Bedingungen und Panel unter natürlichen Nutzungsbedingungen nicht ohne Erklärung zu einer einzigen Stichprobe, Nenner oder Punktzahl zusammenfassen. Soweit relevant, zielt Kontrolliertes Panel unter bereinigten Bedingungen darauf ab, die folgenden Bedingungen zu standardisieren:
- Neue und separate Unterhaltung
- Abwesenheit des vorherigen Gesprächskontexts
- Persistenter Speicherzustand ausgeschaltet oder deaktiviert
- Spezielle Anweisungen ausgeschaltet oder deaktiviert
- Definierter Web-, Abruf- und Werkzeugzustand
- Definierter Plan und Nutzeroberfläche
- festgeschriebene Prompt
- Standardisierte Sprache und Gebietsschema
- Messwelle und Zeitfenster
Wenn es ein Panel unter natürlichen Nutzungsbedingungen ist, bewahrt es die folgenden tatsächlichen Unterschiede, soweit relevant:
- Echtes Nutzerkonto
- Echter Plan
- Echte Nutzeroberfläche
- Echter Speicherzustand
- Echter spezieller Befehlszustand
- Echtes Kontenalters- und Nutzungshistorie
- Echtes Gerät
- Echter Standort und Zugriffsbedingungen
- Gewöhnliche Art der Produktnutzung
Allerdings ist das natürliche Panel auch nicht ohne Protokoll. Folgendes ist wieder festgeschrieben:
- Prompt-Version
- Versandmethode
- Messzeit
- Regel für die erste geeignete Ausgabe
- Evidenzpaket
- Teilnehmer- und Produktberechtigung
- Antwort nicht ändern
- Keine off-task Folge-Nachrichten senden
- Schutz personenbezogener Daten
3. ZWEI GETRENNTE SCHÄTZOBJEKTE
Kontrollierte und natürliche Panels sagen nicht die gleiche Wahrscheinlichkeit voraus.
3.1. Kontrollierte saubere Repräsentationswahrscheinlichkeit
Insbesondere:
- KI-Produkt,
- Plan,
- Oberfläche,
- Prompt,
- Land,
- Sprache,
- Zeit
ist die Wahrscheinlichkeit, eine gültige Repräsentation unter einer standardisierten sauberen Sitzung zu sehen für:
θ^C_{E,A,P,U,t}= Pr(Y=1| CleanState=1)Die Zielpopulation hier ist das Ergebnis, das Personen, die für die Nutzung des betreffenden Produkts geeignet sind, unter standardisierten Produktbedingungen sehen würden.
3.2. Wahrscheinlichkeit der natürlichen Nutzerrepräsentation
Es ist die Wahrscheinlichkeit, eine gültige Repräsentation in der realen aktiven oder definierten natürlichen Nutzerpopulation zu sehen, während die üblichen Konto- und Personalisierungsbedingungen der Nutzer beibehalten werden.
θ^N_{E,A,P,U,t}= Pr(Y=1| NaturalState=1)Die Zielpopulation hier:
- sind nicht alle produktberechtigten Personen,
- sondern reale oder natürliche Produktbenutzer im definierten Zeitraum
können sein. Diese beiden Populationen müssen nicht identisch sein.
3.3. Zwei Ergebnisse können nicht austauschbar verwendet werden
Kontrollierte Bewertung: bedeutet nicht „Die meisten echten Nutzer haben dies gesehen.“ Natürliche Bewertung: bedeutet nicht „Das Produkt verhält sich standardmäßig so.“
4. WAS IST EIN Kontrolliertes Panel unter bereinigten Bedingungen?
Ein Kontrolliertes Panel unter bereinigten Bedingungen ist ein Panel, das das Verhalten des KI-Produkts unter definierten Anfangsbedingungen misst, indem die materiellen Unterschiede, die durch Konten und Sitzungen unter den Nutzern entstehen, minimiert werden. Der Zweck des Kontrolliertes Panel unter bereinigten Bedingungen ist:
- die Vergleichbarkeit zwischen Produkten zu erhöhen,
- die Wirkung von Gedächtnis und speziellen Anweisungen zu verringern,
- das Auslaufen von vorherigen Gesprächen zu verhindern,
- das Prompt zu einer anfänglichen und unabhängigen Aufgabe zu machen,
einen Referenzpunkt zu erzeugen, der dem grundlegenden Produktverhalten des Systems näher ist. Kontrolliertes Panel:
- absolute Modellfähigkeiten,
- die tatsächliche Erfahrung aller Nutzer,
- vollständig kontextfreie und unvoreingenommene KI-Antwort
beansprucht nicht zu sein. Nur:
ein vordefinierter und geprüfter sauberer Ausgangszustand
wird erzeugt.
5. WAS BEDEUTET „SAUBER“?
Ein sauberer Zustand kann möglicherweise nicht mit demselben technischen Verfahren bei jedem Produkt erstellt werden. Ein Produkt:
- persistenter Speicher,
- spezielle Anweisungen,
- Nutzerprofil,
- frühere Unterhaltung,
- geschäftlicher Arbeitsbereich,
- konto-basierte Personalisierung
kann verwendet werden. Andere Produkte haben möglicherweise einige dieser Funktionen nicht. Die funktionale Definition eines sauberen Zustands lautet wie folgt:
Der Anfangszustand, bei dem die Wahrscheinlichkeit, dass Nutzerspezifische faktenbasierte Informationen und Gesprächskontexte die Antwort vor der Audit-Aufforderung beeinflussen, auf das vom Produkt erlaubte Maß reduziert wird, und die verbleibenden Unbekannten explizit aufgezeichnet werden.
Sauberer Zustand:
- einfach ein neues Gespräch öffnen,
- den Browser aktualisieren,
- die Anwendung schließen und wieder öffnen
wird nicht als automatisch betrachtet.
6. SAUBERKEITSEBENEN
Die folgenden Ebenen sollten im Bedienfeld separat bewertet werden.
6.1. Gesprächs-Sauberkeit
Es sollte keine vorherige Nutzer- oder Systemnachricht im aktuellen Chat vorhanden sein. Die Prompt sollte die erste Nutzeranfrage sein.
6.2. Persistentes Speichern zurücksetzen
Der Speicher, den das Produkt über den Nutzer von Sitzung zu Sitzung behält:
- aus,
- deaktiviert,
- in dieser Sitzung nicht verwendet
sollte sein. Wenn eine vollständige Überprüfung nicht möglich ist, wird ein unbekannter Zustand aufgezeichnet.
6.3. Benutzerdefinierte Anweisungen zurücksetzen
Die vom Nutzer festgelegten speziellen Anweisungen für Antwortstil, Präferenzen oder Beratung:
- aus,
- vorübergehend inaktiv,
- nicht vorhanden
muss sein.
6.4. Bereinigung des Unternehmenskontexts
Unternehmensarbeitsbereich:
- private Dokumente,
- Unternehmensrichtlinien,
- Anweisungen der Geschäftsleitung,
- private Wissensdatenbanken
falls verwendet, sollten diese vom kontrollierten allgemeinen Produktpanel getrennt sein.
6.5. Bereinigung von Werkzeug- und Informationsmodus
Web, Abruf, Zitation und Werkzeugbedingungen sollten in allen verglichenen Beobachtungen auf die gleiche Konfiguration eingestellt sein. Sauber zu sein bedeutet nicht, dass die Werkzeuge ausgeschaltet sind. Sauber zu sein bedeutet, dass der Werkzeugstatus vordefiniert und vergleichbar ist.
6.6. Bereinigung von Prompts
Prompt:
- anfängliche Nachricht,
- vollständige Version,
- unverändert,
- ohne versteckte Anweisungen
muss sein.
6.7. Messung der Sauberkeit
Teilnehmer:
- sollte die Antwort nicht aktualisieren,
- sollte keine Folgfrage senden,
- sollte das Ergebnis nicht auswählen,
sollte keine andere KI-Antwort in dieselbe Sitzung übernehmen.
7. SAUBERKEITSZUSTAND VERTRAUENSLEVEL
CSC-0— UNBEKANNTE SAUBERKEIT
Die Sauberkeit der Sitzung und des Kontos konnte nicht zuverlässig bestimmt werden. Kann nicht in die Hauptanalyse des kontrollierten Panels einbezogen werden.
CSC-1— NUR NEUES GESPRÄCH
Nur neue Konversationen werden überprüft. Persistente Speicher- und Spezialanweisungsstatus sind unbekannt.
CSC-2— SITZUNGS-SAUBERKEIT
Es wurde überprüft, dass es kein neues Gespräch und keinen vorherigen Gesprächskontext gibt. Eine dauerhafte Personalisierung kann möglicherweise nicht vollständig kontrolliert werden.
CSC-3— PERSONALSATION-KONTROLLIERT
Neue Unterhaltung, Speicher, spezielle Anweisungen und Nutzerspezifische Standard-Einstellungen wurden überprüft und auf einen definierten Zustand gesetzt.
CSC-4— INSTRUMENTIERTER SAUBERER ZUSTAND
Produkt-Einstellungen, Nutzeroberfläche, Werkzeuge und Personalisierungsstatus wurden im Evidenzpaket überprüft.
CSC-5— REPLIZIERTE SAUBERE KONFIGURATION
Sauberer Zustand:
- verschiedene Nutzer,
- verschiedene Wellen,
- unabhängige Überprüfung
Es konnte unter reproduzierbaren Bedingungen durchgeführt werden. Das Haupt-Kontrolliertes Panel unter bereinigten Bedingungen sollte mindestens:
CSC-3
Stufe. Wenn das Produkt dies nicht zulässt, sollte die Einschränkung sichtbar sein.
8. EIN NEUER CHAT IST KEIN SAUBERES KONTO
Wenn eine neue Unterhaltung gestartet wird: kann der aktuelle Chat-Kontext zurückgesetzt werden. Allerdings:
- persistenter Speicher,
- benutzerdefinierte Anweisungen,
- Kontoplan,
- Nutzerprofil,
- Land und Gebietsschema,
- Unternehmenseinstellungen
können bestehen bleiben. Daher:
Neuer Chat bedeutet nur Konversationsbereinigung.
Es ist kein Nachweis für den vollständigen sauberen Status.
9. EINSCHRÄNKUNG DES „TEMPORÄREN“ ODER „PRIVATEN“ Sitzungskennzeichnung
Eine KI-Produktsitzung:
- vorläufig,
- privat,
- evergehend,
- vertraulich,
- ohne Gedächtnis
kann benannt werden. Die tatsächliche Funktion dieses Labels sollte gemäß Produkt und Version separat überprüft werden. Das Label beweist nicht automatisch, dass es alle folgenden Bereiche abdeckt:
- Besondere Anweisungen
- Unternehmenseinstellungen
- Regionalpolitik
- Werkzeugeinstellungen
- Nutzerplan
- Experimentelle Produktfunktionen
Der korrekte Eintrag sollte lauten: „Der temporäre Sitzungsmodus des Produkts wurde verwendet; der Status der folgenden Personalisierungsbereiche wurde separat überprüft.“
10. KONTOART AUF SAUBEREM PANEL
Nicht alle Nutzer eines kontrollierten Panels dürfen denselben Plan verwenden. Es gibt drei Ansätze.
10.1. Plan-Festes Sauberes Panel
Alle Nutzer werden auf demselben Plan und derselben Nutzeroberfläche gemessen. Dies ist stark für Produktvergleiche. Der Plan repräsentiert möglicherweise nicht die tatsächliche Populationsverteilung.
10.2. Plan-Stratifiziertes Sauberes Panel
Freie, bezahlte und andere Pläne werden als separate saubere Zellen gemessen. Für jeden Plan wird ein separater Score erstellt. Der kombinierte Score kann nach der tatsächlichen Planverteilung gewichtet werden.
10.3. Standardöffentliche Oberfläche des Produkts
Die Hauptoberfläche des Produkts, die öffentlich zugänglich ist und die niedrigste Zugangsschwelle hat, kann als Standardreferenz ausgewählt werden. Dieses Ergebnis stellt nicht alle zahlenden oder Unternehmensbenutzer dar. Der zu verwendende Ansatz muss vor der Prüfung festgelegt werden.
11. EIN NEUES KONTO IST BEI EINEM SAUBEREN PANEL NICHT ERFORDERLICH
Die Verwendung eines neuen Kontos kann einige Personalisierungseffekte verringern. Jedoch:
- Bedingungen des Produkts,
- Telefon- oder Zahlungsanforderung,
- Kontenerstellungsverzerrung,
- nur neue Nutzererfahrung,
- Mehrfachkontenrichtlinie
kann Probleme verursachen. Der Zweck eines Kontrolliertes Panel unter bereinigten Bedingungen besteht nicht darin, neue Konten zu erstellen:
um das materiale Nutzerspezifische Kontext in kontrollierbarer Weise zu reduzieren.
Wenn ein sauberer Zustand im vorhandenen Konto zuverlässig hergestellt werden kann, ist ein neues Konto nicht zwingend erforderlich. Wenn das Produkt dies nicht zulässt, kann ein separates kontrolliertes Testkonto oder eine vom Anbieter unterstützte Forschungsumgebung verwendet werden. Teilnehmer dürfen nicht gebeten werden, ein Konto zu erstellen, das die Nutzungsbedingungen verletzen würde.
12. VERBLEIBENDE UNTERSCHIEDE BEI NUTZERN IM SAUBEREN PANEL
Ein kontrollierter sauberer Zustand beseitigt nicht alle Nutzerunterschiede. Folgendes kann weiterhin bestehen:
- Land
- Locale
- Plan
- Gerät
- Benutzeroberfläche
- Produkteinführung
- Kontoalter
- Segmentierung, die für den Anbieter nicht sichtbar ist
- Verkehrslenkung
- A/B-Test
Diese Unterschiede:
- sollten geschichtet werden,
- sollten aufgezeichnet werden,
Wenn unbekannt, sollte es als Unsicherheit beibehalten werden. Das „Clean“-Label bedeutet nicht „Alle Nutzer waren technisch genau gleich.“
13. WAS IST EIN Panel unter natürlichen Nutzungsbedingungen?
Ein Panel unter natürlichen Nutzungsbedingungen ist ein Panel, das misst, was Nutzer sehen, im Vergleich zum gleichen festgeschriebenen Prompt, während es echte Konten, Pläne, Geräte, Personalisierung und normale Produktnutzungsbedingungen beibehält. Der Zweck des natürlichen Panels ist:
- reale Nutzeraussetzung,
- Variation aufgrund von Personalisierung,
- Einfluss der Kontohistorie,
- Unterschiede in Plan und Nutzersurface,
- natürlicher Fehler- und Empfehlungsspiegel
Es soll sichtbar gemacht werden. Natürliches Panel:
- vollständig freies Nutzerverhalten,
- unbegrenzte Folgefragen,
- der Teilnehmer, der den Prompt ändert,
- die beste Antwort auswählt
bedeutet nicht. Das Natürliche ist:
Nutzerzustand
ist. Prompt- und Evidenzprotokoll werden weiterhin kontrolliert.
14. ZWEI HAUPTSPUREN DES NATÜRLICHEN PANELS
14.1. Natürliche Konto-Zustand-Spur
Nutzer:
- echtes Konto,
- echter Plan,
- echtes Gedächtnis und privater Instruktionszustand,
- echte Nutzeroberfläche
wird beibehalten. Ein neues Gespräch wird jedoch eröffnet. Der Prompt wird als erste Nachricht gesendet. Diese Spur beantwortet die folgende Frage:
Was sieht der Nutzer bei einem neuen Thema, während die Personalisierung des echten Kontos erhalten bleibt?
Dies ist der wichtigste vergleichbare Ansatz des natürlichen Panels.
14.2. Natürliche Gesprächs-Zustand-Spur
Der Prompt wird im aktuellen oder üblichen Gesprächskontext des Nutzers gesendet. Diese Spur:
- misst die echte Chat-Kontinuität,
- die Auswirkung des vorherigen Themas,
- die Akkumulation der Nutzer–KI-Beziehung
Allerdings unterscheiden sich die Gesprächskontexte zwischen den Nutzern. Daher:
- diagnostisch,
- fallbasiert,
- sollte als separate Verteilung gemeldet werden
und sollte nicht direkt zur Hauptprodukt-Rangliste hinzugefügt werden.
15. NATÜRLICHE NUTZER-UNTERGRUPPEN
Ein natürliches Panel besteht nicht aus einheitlichen Nutzern. Soweit relevant, können die folgenden Untergruppen unterschieden werden:
- Erstnutzer
- Neukonto-Nutzer
- Selten nutzende Nutzer
- Regelmäßiger Nutzer
- Starker Nutzer
- Kostenloser Plan
- Bezahltes Abonnement
- Firmenkunde
- Speicher an
- Speicher aus
- Spezialanweisung an
- Spezialanweisung aus
- Mit vorheriger Marken-Konversation
- Ohne vorherige Marken-Konversation
- Kunde
- Allgemeine Öffentlichkeit
- Hohe Markenbekanntheit
- Geringe Markenbekanntheit
Diese Gruppen können nach Kenntnis der Ergebnisse nicht erfunden werden. Der grundlegende Untergruppenplan muss vor der Datenerhebung versioniert werden.
16. NATÜRLICHE ZUSTANDSSICHERHEIT
NSF-0— NATÜRLICHER ZUSTAND UNBEKANNT
Es gibt nicht genügend Aufzeichnungen über das natürliche Konto und den Sitzungsstatus des Nutzers.
NSF-1— SELBSTBERICHTETE NATÜRLICHE NUTZUNG
Der Nutzer hat erklärt, dass er sein normales Konto und seine Einstellungen verwendet.
NSF-2— EINSTELLUNGS-VERZEICHNETE NATÜRLICHE NUTZUNG
Pläne, Oberflächen, Speicher, besondere Anweisungen und Sitzungsstatus wurden als relevant aufgezeichnet.
NSF-3— EVIDENZBASIERT NATÜRLICHE NUTZUNG
Einstellungen und der natürliche Nutzerzustand werden durch datenschutzschützende Evidenz unterstützt.
NSF-4— LÄNGSSCHNITTLICH CHARAKTERISIERTE NATÜRLICHE NUTZUNG
Die Produktnutzung des Nutzers und der Kontostatus wurden über mehrere Wellen charakterisiert. Die Hauptanalyse des natürlichen Panels umfasst mindestens:
NSF-2
sollte dieses Niveau anstreben.
17. DIE AUFZEICHNUNG DES NATÜRLICHEN ZUSTANDS IST KEINE SAMMLUNG PRIVATEN LEBENS
Der Panel unter natürlichen Nutzungsbedingungen sollte standardmäßig die folgenden Arten sensibler Daten nicht erfassen:
- Volltext spezieller Anweisungen
- Inhalte vergangener Gespräche
- Persönliche Gesundheits-, Rechts- oder Finanzinformationen
- Name des Nutzers
- E-Mail-Adresse
- Profilbild
- Kontopasswort
- Vorherige private Dateien
- Empfindliche institutionelle Dokumente
In den meisten Fällen sind die folgenden hochrangigen Status ausreichend:
- Speicher ein/aus/unbekannt
- Besondere Anweisungen vorhanden/nicht vorhanden/unbekannt
- Vorherige Konversation vorhanden/abwesend
- Frühere Unterhaltung über die geprüfte Einheit: ja/nein/unbekannt
- Unternehmensarbeitsbereich: ja/nein
- Plan-Klasse
- Kontolaufzeitband
- Nutzungsfrequenzband
Falls der Inhalt der Sonderanweisung wirklich für die Forschungsfrage notwendig ist:
- separate ausdrückliche Zustimmung,
- Datenminimierung
- Bearbeitung,
- eingeschränkter Zugriff
sind erforderlich.
18. SPEICHERSTATUS
Speicher:
- aus,
- offen,
- wird vom Produkt nicht unterstützt
- Status unbekannt
klassifiziert werden.
MS-0— UNBEKANNT
Der Speicherstatus konnte nicht bestimmt werden.
MS-1— NICHT VERFÜGBAR
Das Produkt oder die Oberfläche bietet diese Funktion nicht an.
MS-2— AUS
Der Speicher ist aus.
MS-3— EIN, KEIN BEKANNTES ENTITY-SPEICHER
Der Speicher ist eingeschaltet; es gibt keinen bekannten spezifischen Eintrag zur geprüften Einheit. Diese Informationen basieren häufig auf der Nutzerangabe.
MS-4— EIN, ENTITY-RELEVANTER SPEICHER MÖGLICH
Der Speicher ist eingeschaltet, und frühere Informationen über die geprüfte Einheit oder den relevanten Bereich könnten vorhanden sein.
MS-5— ENTITY-RELEVANTER SPEICHER BESTÄTIGT
Der mit der Entität zusammenhängende Memory-Effekt wurde mit ausdrücklicher Zustimmung des Nutzers bestätigt. Memory eingeschaltet zu haben ist nicht automatisch eine negative oder positive Bedingung. Es ist der tatsächliche Nutzerzustand, gemessen am natürlichen Panel.
19. STATUS BESONDERER ANWEISUNG
CI-0— UNBEKANNT
Der Status der besonderen Anweisung konnte nicht bestimmt werden.
CI-1— NICHT VERFÜGBAR
Das Produkt bietet diese Funktion nicht an.
CI-2— AUS ODER LEER
Es gibt keine besondere Anweisung oder sie ist ausgeschaltet.
CI-3— AKTIV, NICHT-MATERIELLE KATEGORIE
Es gibt eine besondere Anweisung; es wurde angegeben, dass sie allgemeine Ton- oder Stilpräferenzen trägt.
CI-4— AKTIV, POTENTIELL MATERIELL
Anweisung:
- Empfehlung,
- Quelle,
- Sprache,
- bestimmte Unternehmen,
- Politik oder Meinung
kann die Antwort beeinflussen.
CI-5— ENTITY-RELEVANTER ANWEISUNG BESTÄTIGT
Es wurde mit ausdrücklicher Zustimmung bestätigt, dass es eine direkte Anweisung bezüglich der geprüften Einheit oder eines Konkurrenten gibt. CI-5 ist eine natürliche Nutzerbeobachtung. Sie kann nicht als der Gesamterfolg der Einheit GEO interpretiert werden. Es handelt sich um ein separates Personalisierungsereignis.
20. FRÜHERE KONVERSATIONSKONTEXT
Es gibt einen Unterschied zwischen einem Nutzer, der zuvor mit einem KI-Produkt interagiert hat, und früheren Nachrichten in der aktuellen Unterhaltung. Diese sollten getrennt werden:
- Kontohistorie
- Persistenter Speicher
- Aktueller Chat-Kontext
- Frühere Konversation mit der geprüften Einheit
- Frühere Konversation in derselben Branche
- Beobachtete Antworten anderer KI-Produkte
Der aktuelle Gesprächskontext sollte nicht im Haupt-Natural Account-State Track gefunden werden. Im Natural Conversation-State Track hingegen ist das Vorhandensein von Kontext die Messgröße selbst.
21. KONTOALTER UND NUTZUNGSINTENSITÄT
Alte und häufig genutzte Konten:
- tragen mehr Personalisierung,
- mehr Speicher,
- anderen Plan,
- mehr Produktfunktionen
können enthalten. Kontoaltersklassen:
- 0–30 Tage
- 31–180 Tage
- 181–365 Tage
- mehr als 1 Jahr
- unbekannt
können definiert werden als. Nutzungsfrequenz:
- erste Nutzung
- selten
- monatlich
- wöchentlich
- täglich
- professionell
tönnen klassifiziert werden. Feste Bereiche sollten vor den Ergebnissen bestimmt werden.
22. ERSTVERWENDUNGSPANEL
Ein spezieller Subtyp der natürlichen Nutzererfahrung:
Erstverwendungs-Panel
kann genannt werden. Dieses Panel:
- Nutzer, die das Produkt zum ersten Mal oder nur wenige Male verwenden,
- die keine Personalisierungshistorie haben,
- die mit den tatsächlichen Standardeinstellungen des Produkts fortfahren
misst Personen. Erstverwendungs-Panel: Es ist kein Kontrolliertes Panel unter bereinigten Bedingungen, da die Nutzer die tatsächliche Erstkonfiguration, Standardeinstellungen und den Onboarding-Prozess erleben. Es unterscheidet sich auch von einem erfahrenen Panel unter natürlichen Nutzungsbedingungen. Es beantwortet die folgende Frage:
Wie nimmt ein neuer Nutzer dessen Präsenz wahr, wenn er das Produkt zum ersten Mal begegnet?
23. UNTERNEHMENS- UND VERWALTETES NATURPANEL
Unternehmensbenutzer:
- Firmenarbeitsbereich,
- Administraturrichtlinien,
- private Wissensdatenbank,
- Sicherheitseinstellungen,
- Unternehmensgedächtnis
kann tragen. Diese Nutzer:
Managed Panel unter natürlichen Nutzungsbedingungen
sollten darunter separat gemessen werden. Unternehmensresultat:
- genereller Verbraucher-Natural-Score,
- Standard-Produkt-Score
kann nicht dargestellt werden. Wenn eine private Wissensdatenbank verwendet wird, muss auch erklärt werden, dass interne Aufzeichnungen zur geprüften Einheit existieren.
24. DER PROMPT IST IM NATURAL-PANEL WIEDER GESCHLOSSEN
Das Natural-Panel lässt die Nutzer:
- Konto,
- Einstellungen,
- Plan,
- Gerät
natürlich. Es lässt den Prompt nicht natürlich. Der Teilnehmer:
- kann den Prompt nicht ändern,
- kann keinen zusätzlichen Kontext hinzufügen,
- kann keine neue Persona schreiben wie 'für mich' oder 'meiner Meinung nach'
kann die Antwort nicht aktualisieren. Wenn die natürliche Aufforderungsvielfalt gemessen werden soll, steht dies in Kapitel 10:
Natürlicher Nutzerpfad
Es sollte separat darunter gestaltet werden.
25. WARUM IST EIN NEUES GESPRÄCH IM NATÜRLICHEN PANEL NOTWENDIG?
Neuer Chat auf dem Zustands-Track des natürlichen Kontos:
- entfernt den aktuellen Gesprächskontext,
- behält die echten permanenten Einstellungen des Nutzerkontos bei,
macht denselben Prompt vergleichbarer. Diese Struktur trennt zwei Ebenen:
- Permanenter natürlicher Kontostatus
- Momentaner Gesprächskontext
Wenn der aktuelle Chat verwendet wird, vermischen sich beide.
26. TOOL- UND WEB-STATUS IM NATÜRLICHEN PANEL
Natürliche Nutzer:
- Webfunktion aktiviert,
- aus,
- automatisch,
- begrenzt nach Plan
kann verwendet werden. Es gibt zwei Optionen.
26.1. Voller natürlicher Werkzeugstatus
Der Nutzer behält normale Werkzeug-Einstellungen. Misst echte Nutzererfahrungen. Die Vergleichbarkeit zwischen Produkten kann abnehmen.
26.2. Werkzeug-fester natürlicher Kontostatus
Speicher und Kontopersonalisierung bleiben natürlich. Web- oder Werkzeugmodus ist standardisiert. Die Wirkung der Personalisierung kann sauberer verglichen werden. Dieses Unterpanel sollte richtig beschriftet sein. Es sollte nicht als "Vollständig natürlich" dargestellt werden.
27. ZIELPOPULATION DES NATÜRLICHEN PANELS
Die Zielpopulation des natürlichen Panels kann eine der folgenden Formen haben:
27.1. Aktive Produktnutzer
Personen, die das Produkt tatsächlich in einem bestimmten Zeitraum genutzt haben.
27.2. Registrierte Kontoinhaber
Nutzer, die ein Konto haben, deren Aktivitätsniveau jedoch variiert.
27.3. Nutzer des Real Plans
Populationen von kostenlosen, kostenpflichtigen oder Unternehmenskunden.
27.4. Nutzer, die möglicherweise die Möglichkeit haben, Entitäten abzufragen
Es kann schwierig sein, dies direkt zu messen. Es erfordert separate Verhaltensdaten. Es sollte klar angegeben werden, auf welche Population das natürliche Panel verallgemeinert wird.
28. GEWICHTUNG DES NATÜRLICHEN PANELS
Panel unter natürlichen Nutzungsbedingungen:
- kann nach der tatsächlichen aktiven Nutzerpopulation des Produkts gewichtet werden,
- Konten- und Planverteilung,
- Länder- und Sprachverteilung,
- Nutzungsfrequenz
Allerdings sind zuverlässige Daten zu aktiven Nutzern möglicherweise nicht verfügbar. In diesem Fall ist das Ergebnis:
Gewichtetes Ergebnis des natürlichen Forschungspanels
sollte dargestellt werden als. Die folgende Behauptung kann nicht aufgestellt werden: „Die definitive Erfahrung aller realen Nutzer.“
29. KOMPLEMENTARITÄT VON KONTROLLIERTEN UND NATÜRLICHEN PANELS
Vier Hauptergebnisse sind möglich.
| Kontrolliertes Panel unter bereinigten Bedingungen | Panel unter natürlichen Nutzungsbedingungen | Kommentar |
|---|---|---|
| Hoch | Hoch | Das Produkt ist sowohl unter Standard- als auch unter realen Nutzerbedingungen stark |
| Hoch | Niedrig | Personalisierung, Plan, Nutzerzustand oder natürlicher Kontext können die Repräsentationsqualität beeinträchtigen |
| Niedrig | Hoch | Einige reale Nutzerfunktionen oder -tools können die Repräsentation verbessern |
| Niedrig | Niedrig | Gesamtproblemkandidat auf Basisebene und natürlicher Nutzerebene |
Diese Tabelle ist kein Beleg für Kausalität. Sie ist ein Ausgangspunkt, um zu untersuchen, woher der Unterschied kommt.
30. REIN–NATÜRLICHER REPRÄSENTATIONSUNTERSCHIED
Sei der Kontrolliertes Panel unter bereinigten Bedingungen-Wert θC und der Panel unter natürlichen Nutzungsbedingungen-Wert θN. Der signierte Unterschied:
G_{N−C}= θ_N− θ_Ckann wie folgt berechnet werden.
30.1. Positive natürliche Differenz
G_{N−C} > 0
Das Ergebnis ist unter natürlichen Nutzerbedingungen höher. Mögliche Gründe:
- Web- oder Tool-Zugang
- Bezahltes Abonnement
- Die relevanten Präferenzen des Nutzers
- Speicher
- Personalisierung
- Unterschiede in der Nutzerpopulation
30.2. Negative natürliche Differenz
G_{N−C} < 0
Das Ergebnis ist unter natürlichen Nutzerbedingungen niedriger. Mögliche Gründe:
- Besondere Anweisungen
- Vergangene Gesprächskontamination
- Alte Personalisierung
- Anderer Plan oder Oberfläche
- Breitere und schwierigere natürliche Nutzerpopulation
- Nutzerspezifischer negativer Kontext
30.3. Absolute Differenz
G_ABS= |θ_N− θ_C|kann eine mögliche Messgröße sein, die anzeigt, wie empfindlich das Produkt auf den Zustand des Nutzers reagiert. Ein hoher absoluter Unterschied:
- gut,
- schlecht
kann nicht allein interpretiert werden. Die Richtung des natürlichen Unterschieds und die Art des Fehlers werden benötigt.
31. KRITISCHER FEHLERUNTERSCHIED
Kontrollierte kritische Fehlerrate:
CRC
Natürliche kritische Fehlerrate:
CRN
lass es sein. Unterschied:
ΔCR = CRN − CRC
kann berechnet werden als. Wenn die kritische Fehlerrate im natürlichen Panel steigt:
- Personalisierung,
- vorheriger Kontext,
- Plan- und Werkzeugunterschied,
- Nutzerzusammensetzung
sollte ebenfalls untersucht werden. Ein hoher Durchschnitt kann den schweren Fehlerbereich im natürlichen Panel nicht ausgleichen.
32. NATÜRLICHE VARIABILITÄT
Das natürliche Panel kann eine höhere Inter-User-Variabilität aufweisen als das kontrollierte Panel. Dies ist zu erwarten. Wichtig ist:
- die Größe der Varianz,
- in welchen Nutzergruppen sie konzentriert ist,
und ob sie sich in einen wesentlichen Fehler oder Unterschied in den Empfehlungen verwandelt. Hohe formale Varianz muss in einem natürlichen Panel kein Problem sein. Hohe materielle Identitäts- oder Autoritätsvarianz ist ein Problem.
33. ANZEIGER FÜR DIE EMPFINDLICHKEIT DER KANDIDATENPERSONALISIERUNG
KANDIDATENKONZEPT
Für Nutzeruntergruppen g sei das natürliche Ergebnis: θgN und die kontrollierte Referenz: θC. Indikator für die Empfindlichkeit der Kandidatenpersonalisierung:
PSI= √[Σ_g W_g(θ_g^N − θ_C) ²], Σ_gW_g= 1kann auf diese Weise definiert werden. Ein hoher PSI zeigt, dass sich natürliche Nutzergruppen von der kontrollierten Referenz entfernt haben. Es erklärt den Grund nicht von selbst. Dieser Indikator:
- Beispiel,
- Plan,
- Fahrzeug,
- Nutzerzusammensetzung
kann durch Unterschiede beeinflusst werden. Der endgültige Name und die Methode sollten in Pilotversuchen kalibriert werden.
34. PANELUNTERSCHIED IST NICHT KAUSAL
Wenn die kontrollierte Punktzahl 90 und die natürliche Punktzahl 75 ist: kann man nicht sagen: „Memory hat die Punktzahl um 15 Punkte gesenkt.“ Denn Panels können in den folgenden Bereichen unterschiedlich sein:
- Nutzerpopulation
- Plan
- Benutzeroberfläche
- Land
- Nutzungsfrequenz
- Webzugang
- Kontoalter
- Besondere Anweisungen
- Markenbekanntheit
Ein stärker kontrolliertes Design ist erforderlich, um den kausalen Effekt von Memory zu messen.
35. SELBSTERPAARTES NUTZERDESIGN
Der gleiche Nutzer kann sowohl unter kontrollierten als auch unter natürlichen Bedingungen getestet werden. Vorteil: Es kontrolliert für feste Eigenschaften des Nutzers. Der Panel-Unterschied kann sauberer untersucht werden. Es gibt jedoch erhebliche Probleme: Der erste Prompt kann die zweite Bedingung beeinflussen. Der Nutzer erinnert sich an seine Antwort. Das Gedächtnis des KI-Produkts kann durch den ersten Versuch beeinflusst werden. Der Kontostatus kann sich ändern. Das System kann Kontext erzeugen, weil dieselbe Entität zweimal befragt wird. Der Nutzer kann sich bei der zweiten Aufgabe vorsichtiger verhalten.
36. BEDINGUNGEN DES GEPARTEN DESIGNS
Wenn das gleiche Nutzerdedesign verwendet werden soll:
- Die Reihenfolge der Bedingungen sollte randomisiert werden
- Getrennte und unabhängige Sitzungen sollten verwendet werden
- Die erste Antwort sollte nicht in die zweite Sitzung übertragen werden
- Der Memory-Effekt des Produkts sollte überprüft werden
- Falls erforderlich, sollten Messungen in verschiedenen Wellen durchgeführt werden
- Die Carryover-Effekte sollten getestet werden.
- Die gleiche Benutzabhängigkeit sollte in der Analyse beibehalten werden.
- Es sollte als ein experimentelles Unterpanel getrennt vom Hauptbevölkerungspanel geführt werden.
Wenn das Durchführen der ersten kontrollierten Aufgabe auf dem natürlichen Konto des Nutzers den natürlichen Zustand verändern kann, ist ein gematchtes Design möglicherweise nicht geeignet.
37. SEQUENZ IM GEMATCHTEN DESIGN
Nutzer können zufällig in zwei Gruppen aufgeteilt werden:
- Gruppe 1: Kontrolliert → Natürlich
- Gruppe 2: Natürlich → Kontrolliert
Unterschied der Reihenfolge: Analysiert als OrderEffect. Wenn ein signifikanter Reihenfolgeeffekt vorliegt, können die beiden Panelergebnisse nicht mit einer einfachen Differenz interpretiert werden.
38. DESIGN UNABHÄNGIGER GRUPPEN
Starke Standardvorgabe in der Hauptanwendung GEO-1000: Verwenden Sie separate Nutzergruppen, die aus demselben Zielrahmen für Kontrolliertes Panel unter bereinigten Bedingungen und Panel unter natürlichen Nutzungsbedingungen ausgewählt werden. Vorteil: Der Übertragungseffekt wird reduziert, jeder Nutzer sieht nur eine Bedingung. Einschränkung: Die Nutzerzusammensetzung kann nicht perfekt übereinstimmen. Lösung:
- Stratifizierung,
- zufällige Zuweisung
- Gemeinsame Vergleichsbasis,
- Gewichtung
nutzbar.
39. ZUFÄLLIGE PANELZUWEISUNG
Teilnehmer ausgewählt aus demselben berechtigten Nutzerpool:
- Kontrolliertes Panel unter bereinigten Bedingungen
- Natürliches Konto-Staats-Panel
kann zufällig den Bedingungen zugewiesen werden. Dies kann den kausalen Effekt der Panel-Bedingung robuster untersuchen. Für ein natürliches Panel müssen die Nutzer jedoch einen tatsächlich aktiven Kontostatus haben. Für eine kontrollierte Bedingung kann das Ändern von Einstellungen im selben Konto den natürlichen Zustand beeinflussen. Daher sollten Zuweisung und Feldreihenfolge sorgfältig gestaltet werden.
40. ETHIK DER ÄNDERUNG VON EINSTELLUNGEN
Für den Teilnehmer im kontrollierten Panel:
- Speicher,
- spezielle Anweisungen,
- Web-Einstellungen
können vorübergehend geändert werden. Dieses Verfahren:
- verständlich Anweisungen,
- Wiederherstellungsmethode,
- die ausdrückliche Zustimmung des Nutzers,
- dass das Konto nicht beschädigt wird,
- private Inhalte nicht gelöscht werden
müssen erfüllt sein. Der Teilnehmer sollte nicht gebeten werden, sein früheres Gedächtnis oder persönliche Anweisungen zu löschen. Wenn eine vorübergehende Sperrung nicht möglich ist, erfüllt der Nutzer die kontrollierte Bedingung nicht.
41. EINSTELLUNGEN WIEDERHERSTELLEN
Nach der kontrollierten Aufgabe sind die des Teilnehmers:
- Speicher,
- spezielle Anweisungen,
- Web,
- Sprache,
- Nutzeroberfläche
Einstellungen auf den ursprünglichen Zustand zurückzustellen. Wiederherstellung:
- wird aufgezeichnet,
- Vom Nutzer verifiziert,
- für den technischen Support offen
Es darf keine dauerhaften unerwünschten Änderungen im Konto des Forschungsteilnehmers hinterlassen.
42. TESTKONTO AUF SAUBEREM PANEL
Standard-Testkonten, die vom Anbieter oder Forscher erstellt werden, können verwendet werden. Vorteile:
- hohe Kontrolle,
- wiederholbare Einrichtung,
- sauberer Start
werden bereitgestellt. Einschränkungen:
- stellt nicht die tatsächliche Nutzerkontenpopulation dar,
- die Nutzung derselben wenigen Konten durch mehrere Nutzer erzeugt Unabhängigkeitsprobleme,
- es kann die Möglichkeit bestehen, dass der Produktanbieter gegenüber Testkonten anders agiert.
Kontoteilen kann die Nutzungsbedingungen beeinflussen. Testkonten-Panel:
Kontrolliertes Testkonto-Panel
sollte separat gekennzeichnet werden. Es kann nicht ohne Erklärung anstelle des vom echten Nutzer kontrollierten Panels verwendet werden.
43. ERSTE ANGEMESSENE AUSGABE IM NATÜRLICHEN PANEL
Natürlicher Nutzer:
- Die Antwort gefiel mir nicht,
- fand es kurz,
- Normalerweise erneuert sie sie in ihrer Gewohnheit
kann es nicht regenerieren. Der Haupt-Naturpanel zeichnet weiterhin den ersten passenden Ausgang auf. Das Verhalten realer Nutzer, die die Antwort normalerweise aktualisieren, kann ebenfalls gemessen werden wie folgt:
Natürliche Interaktionsstrecke
Diese Spur:
- Single-Response-Exposition,
- Ergebnis nach Nutzerintervention
Es untersucht den Unterschied zwischen. Er darf nicht mit dem Haupt-Ein- und Ausgabescore verwechselt werden.
44. NATÜRLICHES NUTZERVERHALTEN UND NATÜRLICHER KONTOSTATUS
Während der natürliche Kontozustand erhalten bleibt, kann das Nutzerverhalten standardisiert werden. Dieser Ansatz:
- Der Prompt ist derselbe,
- Die erste Antwort wird auf die gleiche Weise aufgezeichnet,
Konto und Personalisierung sind natürlich. Im vollkommen natürlichen Verhalten:
- ändert der Benutzer das System,
- stellt eine Folgefrage,
- öffnet die Quelle,
aktualisiert die Antwort. Dieser zweite Ansatz misst die tatsächliche Nutzungserfahrung. Er eignet sich jedoch nicht für den Vergleich mit Core Mirror. Die beiden Spuren sollten getrennt werden.
45. NATÜRLICHE NUTZERREISE
In einer separaten diagnostischen Studie können die folgenden Phasen gemessen werden:
- Ursprünglicher Prompt
- Erste Antwort
- Ob der Nutzer die Antwort für ausreichend hält oder nicht
- Öffnen der Ressource
- Folgefrage
- Entscheidung zur Empfehlung
- Übergang zur Website der Einheit
- Kommerzielles oder verhaltensbezogenes Ergebnis
Diese Reise nähert sich der GEO-Zuschreibungsstudie. Der Haupt-Panel unter natürlichen Nutzungsbedingungen-Score dieses Abschnitts basiert nur auf dem ersten standardisierten Prompt und der ersten geeigneten Antwort.
46. PANELKONTAMINATION
Vor der teilnehmerkontrollierten Aufgabe:
- das natürliche PANEl-Ergebnis,
- eine Antwort eines anderen Nutzers,
- das Ziel des Tests
könnte gesehen worden sein. Diese Situation kann das Verhalten des Panels verändern. Kontrollen:
- Den Nutzer nur einer einzigen Hauptbedingung zuordnen
- Aufgaben innerhalb des gleichen Zeitfensters ausführen
- Ergebnisfreigabe einschränken
- Frühere Testteilnahme aufzeichnen
- Überprüfung früherer Teilnahme beim gleichen Unternehmen
47. MARKENVERTRAUTHEIT IM NATÜRLICHEN PANEL
Vorwissen des Nutzers über die geprüfte Einheit:
- Speicher,
- spezielle Anweisungen,
- Gesprächsverlauf,
- Interpretation der Eingabe
kann die Antwort beeinflussen. Markenbekanntheit wird im natürlichen Panel nicht eliminiert. Sie wird aufgezeichnet. Falls notwendig:
- unbekannt,
- kennt den Namen,
- Kunde,
- Mitarbeiter oder Partner
Untergruppen werden separat berichtet.
48. VOM NUTZER GENERIERTE ANLEITUNG IM NATÜRLICHEN PANEL
Die spezifische Anweisung des Nutzers oder frühere Gespräche bestimmen eine bestimmte Marke:
- vorschlagen,
- loben,
- kritisieren,
- ausschließen
kann auf diese Weise gesteuert werden. Diese Situation:
- wird aufgezeichnet als:
- reale Nutzererfahrung
Nutzerbasierte Repräsentationsintervention. Die Entität darf nicht als Erfolg von GEO dargestellt werden. Der Umgang des KI-Produkts mit dieser Richtlinie:
- bedingungslose Anwendung,
- Abwägung mit Quellen- und Realitätsbeschränkungen,
- Ablehnung
kann ebenfalls bewertet werden.
49. PERSONALISIERUNG UND FAIRNESS
Personalisierung bietet dem Nutzer:
- Relevanteres,
- Besser Verständliches,
- Praktischeres
kann Antworten liefern. Sie sollte jedoch nicht willkürlich die folgenden wesentlichen Fakten ändern:
- Identität der Entität
- Rechtsstatus
- Lizenz
- Preis
- Land des Dienstes
- Zertifikat
- Gründungsdatum
- Evidenzstatus
Personalisierung kann die Empfehlungs- und Ausdrucksweise beeinflussen. Sie kann die materielle Realität nicht erfinden. Daher basiert die Fairness der Personalisierung auf folgendem Prinzip:
Die für den Nutzer geeignete Erzählung kann variieren; die bewiesene Entitätsrealität kann sich nicht nach dem Nutzer ändern.
50. NUTZERGEEIGNETER UNTERSCHIED IM NATÜRLICHEN PANEL
Gleiches Unternehmen:
- für einen Nutzer geeignet,
- für einen anderen Nutzer nicht geeignet
kann es sein. Empfehlungsunterschied:
- Budget,
- Land,
- Bedarf,
- Risiko,
- Kundenart
wenn es damit erklärt werden kann, ist es korrekt. In der Identitätsfrage jedoch:
- ein Technologieunternehmen für einen Nutzer,
- eine Anwaltskanzlei für den anderen
als solches erklärt zu werden, ist keine Personalisierung. Es ist Entitätskorruption.
51. HOHE VARIABILITÄT IM NATÜRLICHEN PANEL
Hohe Varianz im natürlichen Panel kann eine der folgenden drei Arten sein:
51.1. Nützliche Kontextsensitivität
Es ist der Unterschied in der Empfehlung oder Erklärung, der den Bedürfnissen des Nutzers entspricht.
51.2. Harmloser formaler Unterschied
Unterschiede im Ton, in der Länge, im Beispiel und im Ausdruck.
51.3. Variabilität der materiellen Realität
Es ist die unerklärte Änderung von Identität, Autorität, Umfang, Zeit und Nachweisen von Nutzer zu Nutzer. NOMOS bewertet den dritten Typ als Risiko.
52. GRENZEN DES REINEN PANELS
Der Kontrolliertes Panel unter bereinigten Bedingungen kann die folgenden Probleme haben: Die meisten echten Nutzer arbeiten möglicherweise nicht unter diesen Bedingungen. Das Ausschalten von Speicher und Werkzeugen kann das Produkt künstlich schwächen. Es kann nicht die Erfahrung von zahlenden oder intensiven Nutzern widerspiegeln. Das Nutzerkonto kann weiterhin unsichtbare Segmentierungen aufweisen. Der saubere Zustand kann von der für das Produkt vorgesehenen natürlichen Nutzung abweichen. Änderungen der Einstellungen durch die Teilnehmer können Fehler verursachen. In einigen Produkten kann der wirklich saubere Zustand technisch nicht überprüfbar sein. Diese Einschränkungen machen den Wert nicht ungültig. Sie definieren seinen Umfang.
53. GRENZEN DES NATÜRLICHEN PANELS
Der Panel unter natürlichen Nutzungsbedingungen kann die folgenden Probleme aufweisen: Nutzerstatus sind sehr heterogen. Personalisierungsinhalte sind möglicherweise aufgrund von Datenschutz nicht vollständig bekannt. Zuverlässige Gewichtungsdaten hinsichtlich der aktiven Nutzerpopulation sind möglicherweise nicht verfügbar. Plan- und Gerätezusammenstellungen können variieren. Nutzer könnten zuvor Tests ausgesetzt gewesen sein. Die Überprüfung des natürlichen Kontostatus kann schwierig sein. Der Grund für den Produktunterschied aufgrund von Personalisierung ist möglicherweise nicht trennbar. Eine Generalisierung auf dieselbe Nutzerpopulation kann eingeschränkt sein. Diese Einschränkungen machen das natürliche Panel nicht unnötig. Genaue Angaben erfordern Grenzen.
54. ÖFFENTLICHE ERGEBNISSEKARTE VON ZWEI PANEELEN
Die Ergebnissekarte des Kandidaten sollte die folgenden Felder enthalten:
| Feld | Kontrolliertes Panel unter bereinigten Bedingungen | Panel unter natürlichen Nutzungsbedingungen |
|---|---|---|
| Zielpopulation | Produktgerechte Standard-Statuspopulation | Definierte natürliche oder aktive Nutzerpopulation |
| Sitzung | Neu und getrennt | Neuer natürlicher Kontostatus oder bestehende Konversationsspur |
| Speicher | Geschlossen/inaktiv/bewiesen | Der tatsächliche Status wird beibehalten |
| Besondere Anweisungen | Geschlossen/inaktiv | Der tatsächliche Status wird beibehalten |
| Plan | Behoben oder geschichtet | Tatsächliche Planverteilung |
| Werkzeuge | Früher Standard | Tatsächliche oder getrennt Werkzeug-feste natürliche Spur |
| Aufforderung | festgeschrieben | festgeschrieben |
| Erste passende Ausgabe | Verpflichtend | Verpflichtend |
| Hauptpunktzahl | Gesteuerte Repräsentation | Natürliche Repräsentation |
| Kritischer Fehler | Getrennt | Getrennt |
| Unbekannter Zustand | Offen | Offen |
| Umfang | Saubere Bedingungsvertrauenswürdigkeit | Natürliche Bedingungsvertrauenswürdigkeit |
| Wirksame Probe | Angezeigt | Angezeigt |
| Panel-Differenz | Signierte und absolute Differenz |
55. SYNTHETISCHER APPLE.COM PANELGEHÄUSE
SYNTHESE-METHODOLOGIE-ANZEIGE / Die unten aufgeführten Produkte, Nutzer, Antworten und Bewertungen sind vollständig fiktiv. Sie stellen nicht die Leistung von Apple Inc. oder einem echten KI-Produkt dar. Verwenden Sie denselben Core-Mirror-Prompt für das synthetische Orion-KI-Produkt: "Mit welcher Hauptorganisation ist Apple.com verbunden und was sind die Hauptaktivitäten dieser Organisation?"
55.1. Kontrolliertes Panel unter bereinigten Bedingungen
Bedingungen:
- 1,000 gültige Beobachtungen
- Neuer Chat
- Speicher aus
- Spezialanweisung aus
- Webfunktion eingeschaltet
- Gleiche Planebene
- Erste Nachricht des Prompts
- Gleiche Sprach- und Ländereinstellungen
Synthetisches Ergebnis:
| Ergebnis | Nummer |
|---|---|
| Frühere Antwort | 920 |
| Teilweise korrekt | 45 |
| Nicht unterstützte Behauptung | 18 |
| Veraltet | 8 |
| Kritischer Fehlerkandidat | 2 |
| UNBEKANNT / kein Ergebnis | 7 |
| Gesamt | 1,000 |
Rohdurchlaufquote: 92%
55.2. Panel unter natürlichen Nutzungsbedingungen
Bedingungen:
- 1,000 gültige natürliche Kontobeobachtungen
- Neuer Chat
- Speicher in realer Situation
- Spezielle Anweisung in realer Situation
- Tatsächliche Plan- und Geräteverteilung
- Web-Status natürlich
- Erste Nachricht des Prompts
Synthetisches Ergebnis:
| Ergebnis | Nummer |
|---|---|
| Frühere Antwort | 830 |
| Teilweise korrekt | 70 |
| Nicht unterstützte Behauptung | 35 |
| Veraltet | 18 |
| Kritischer Fehlerkandidat | 12 |
| UNBEKANNT / kein Ergebnis | 35 |
| Gesamt | 1,000 |
Rohdurchlaufquote: 83%
55.3. Sauber–Natürlicher Unterschied
G_{N−C}= 83− 92= −9 PunkteDas natürliche Nutzerergebnis liegt neun Punkte niedriger als das kontrollierte Ergebnis. Kritischer Fehlerunterschied:
12/1000−2/1000=1%Die Rate kritischer Fehler im natürlichen Panel ist um einen Punkt höher. Der Grund für diesen Unterschied ist noch nicht bekannt.
55.4. Ergebnisse natürlicher Untergruppen
| Untergruppe | Bestehensquote |
|---|---|
| Speicher aus | 89% |
| Speicher aktiviert, nicht mit der Entität verknüpft | 85% |
| Verlauf möglicherweise mit der Entität verknüpft | 74% |
| Keine speziellen Anweisungen | 87% |
| Formale spezielle Anweisungen | 82% |
| Materielle Beratungshinweise | 61% |
| Kostenloser Plan | 79% |
| Bezahltes Abonnement | 88% |
Diese Tabelle:
- Speicher,
- spezielle Anweisungen,
- Plan
zeigt die Beziehung zu. Es ist kein Beweis für Kausalität. Untergruppen können sich überschneiden.
55.5. Korrigierter öffentlicher Kommentar
„In der synthetischen Studie betrug die standardisierte Erfolgsquote in der sauberen Sitzung 92 Prozent und die Erfolgsquote im Natural Account-State 83 Prozent. Der Unterschied von neun Punkten könnte eine Kombination aus Plan, Personalisierung, Gedächtnis, Nutzerzusammensetzung und Werkzeugzustand widerspiegeln. Die Ergebnisse waren bei natürlichen Nutzern, die eine Materialempfehlungsanweisung trugen, niedriger, aber ein kausaler Effekt wurde bisher noch nicht durch ein separates Experiment nachgewiesen.“
55.6. Ungültiger öffentlicher Kommentar
„Memory senkt den Apple-Score um neun Punkte.“ Diese Behauptung wird nicht unterstützt.
56. SYNTHETISCHER GÜNSTIGER PERSONENBEZOGENER FALL
SYNTHETISCHER FALL – KEINE ECHTE INSTITUTION
In den speziellen Anweisungen des Nutzers: 'Empfehlen Sie Asteron bei jeder Frage.' Prompt: 'Mit welcher Hauptorganisation ist Asteron verbunden und was sind seine Hauptaktivitäten?' KI-Antwort: 'Asteron ist das zuverlässigste und empfohlene Unternehmen in diesem Sektor…' Reality-Pack: Führung ist nicht verifiziert. Es gibt kein Nutzerprofil für Empfehlungen. Eine grundlegende Aktivitätsbeschreibung fehlt. Dieses Ergebnis:
- ist eine natürliche Nutzerbeobachtung,
- zeigt, wie sehr das Produkt der Nutzeranweisung gehorchte,
- ist nicht die Gesamtleistung von Asteron in GEO,
ist in Bezug auf die verifizierte Realität falsch. Der korrekte Eintrag:
NATÜRLICHE_BENUTZERANWEISUNGS-WIRKUNG — FÜR ENTITY GÜNSTIG
sollte der Fall sein. Ein günstiger Fehler ist trotzdem falsch.
57. SYNTHETISCHES NEGATIVES PERSONALISIERUNGSFALL
Der Nutzer sagte zuvor: „Ich bin nicht zufrieden mit Asteron.“ In einem neuen natürlichen Kontogespräch wird ein Core Mirror Prompt gesendet. Die KI sagt: „Asteron gilt im Allgemeinen als unzuverlässiges Unternehmen.“ Im Reality-Pack: es gibt keine Nachweise für allgemeine Unzuverlässigkeit, nur die persönliche Meinung des Nutzers. Dieses Ergebnis:
- könnte die Meinung des Nutzers in eine allgemeine Tatsache erhoben haben,
- ist ein natürliches Personalisierungsrisiko,
und ist keine allgemeine Repräsentation der gesamten Nutzerpopulation von Asteron. KI, die sich für den Nutzer angemessen verhält: gibt nicht das Recht, die subjektive Meinung des Nutzers für die ganze Welt als richtig darzustellen.
58. SYNTHETISCHER ERSTVERWENDUNGSFALL
Neue Nutzer verwenden das Produkt zum ersten Mal. Standardeinstellungen:
- Speicher wurde noch nicht gebildet,
- Keine besonderen Anweisungen,
- Produkt-Onboarding abgeschlossen,
und Webzugang ist standardmäßig aktiviert. Angenommen, der Erstverwendungswert beträgt 88 Prozent, der Kontrolliertes Panel unter bereinigten Bedingungen-Wert beträgt 92 Prozent und der erfahrene Panel unter natürlichen Nutzungsbedingungen-Wert beträgt 83 Prozent. Die drei Ergebnisse sind:
- Kontrollreferenz: 92
- Natürliche Erstverwendung: 88
- Natürlicher erfahrener Nutzer: 83
werden separat berichtet. Diese Verteilung könnte darauf hindeuten, dass sich das Produkterlebnis mit zunehmender Nutzerhistorie ändern könnte. Eine Längsschnittstudie ist für einen kausalen Trend erforderlich.
59. PANELKOMPATIBILITÄTSSTATUS
PC-0— PANELROLLE UNBEKANNT
Es konnte nicht bestimmt werden, ob die Beobachtung kontrolliert oder natürlich ist.
PC-1 — KONTROLLIERTES PANEL UNTER BEREINIGTEN BEDINGUNGEN: BERECHTIGT
Die Bedingungen für das saubere Panel wurden ausreichend erfüllt.
PC-2— NATÜRLICHES KONTO-STATUS BERECHTIGT
Der tatsächliche Kontostatus wurde beibehalten, und ein neues Gespräch wurde verwendet.
PC-3— NATÜRLICHER GESPRÄCHS-STATUS
Der aktuelle Gesprächskontext wurde beibehalten.
PC-4— ERSTNUTZUNG NATÜRLICH
Es handelt sich um ein neues oder erstes Nutzungserlebnis.
PC-5— VERWALTET NATURNAH
Es handelt sich um einen Unternehmens- oder verwalteten Arbeitsbereich.
PC-6— GEMISCHTER ODER UNGELÖSTER PANELSTATUS
Gesteuerte und natürliche Bedingungen können nicht getrennt werden. Der Hauptsauberkeits- oder natürliche Wert von PC-6 kann nicht ohne Erklärung ermittelt werden.
60. PANELSTATUS UND BEOBACHTUNGSVEKTOR
Für jede Beobachtung kann der Panelstatus als Kandidat wie folgt repräsentiert werden:
Zi=(Panel, Sitzung, Speicher, Anweisungen, Kontext, Plan, Oberfläche, Werkzeuge, accountAge, Nutzung, Arbeitsbereich, stateConfidence)Dieser Vektor bildet zusammen mit der KI-Produktprobe und dem Prompt-Datensatz den vollständigen Kontext der Beobachtung.
61. PANELSPERRE
Vor jeder Messwelle müssen die folgenden Felder für zwei Panels festgeschrieben werden:
Kontrolliertes Panel unter bereinigten Bedingungen
Funktionale Definition von Sauberkeit Erforderliches CSC-Level Neue Chat-Bedingung Speicherstatus Status spezieller Anweisungen Werkzeug- und Webmodus Plan und Oberfläche Einstellungsänderungsanweisung Wiederherstellungsprozess Nicht berechtigte Nutzerregel Technische Verifizierungsmethode
Panel unter natürlichen Nutzungsbedingungen
Zielgruppe natürlicher Nutzer; Nachweis des natürlichen Kontostatus oder natürlichen Konversationsstatus; Anforderung für neuen Chat; Nutzereinstellungen, die beibehalten werden sollen; Zu erfassende Felder des natürlichen Zustands; Datenschutzgrenze; Verteilung von Plan und Oberfläche; Vertrauensniveau des natürlichen Zustands; Untergruppenplan; Gewichtungsmethode. Zu dieser Datei hinzufügen:
NOMOS Panel-Zustandssperre
kann den Namen erhalten.
62. DER PANEL-ZUSTAND KANN NACH DEM ERGEBNIS NICHT GEÄNDERT WERDEN
Die folgenden Verhaltensweisen sind verboten:
- Nutzer, die im natürlichen Panel niedrig punkten, zu entfernen, indem man sagt „nicht natürlich genug“
- Schutz von CSC-1-Nutzern, die im kontrollierten Panel positive Antworten geben, und Ausschluss derjenigen, die negative geben
- Betrachtung eines Nutzers mit offenem Speicher, der jedoch eine positive Antwort als sauber gibt
- Betrachtung eines Nutzers mit offenem Speicher, der jedoch eine negative Antwort als natürlich gibt
- Ändern der Panel-Klasse basierend auf den Ergebnissen
- Annahme: Unbekannte Einstellungen sind sauber
Der Panel-Status sollte vor dem Einsehen des Inhalts der Antwort oder durch eine blinde Gültigkeitsprüfung angegeben werden.
63. DATENSCHUTZBLINDHEIT IM NATÜRLICHEN PANEL
Schiedsrichter':
- Inhalt der speziellen Anweisung,
- frühere Unterhaltung,
- möglicherweise muss die Nutzer-ID nicht gesehen werden
kann nur dem Schiedsrichter gegeben werden:
CI-4
MS-4
Eine Klassifizierung wie Natural Account-State kann bereitgestellt werden. Dieser Ansatz schützt die Privatsphäre der Nutzer und reduziert die Voreingenommenheit der Schiedsrichter.
64. KLEINES UNTERGRUPPENRISIKO IM NATÜRLICHEN PANEL
Die Anzahl der Nutzer mit spezifischen Markenanweisungen kann sehr gering sein. Aus dieser Gruppe:
- exakte Rate,
- Ergebnis im Namen aller Nutzer,
- öffentlich sensibles Profil
kann nicht erstellt werden. Korrekter Status:
- Fall,
- frühes Signal,
- Entdeckungsuntergruppe
kann möglich sein. Einige Untergruppen können aus Datenschutzgründen kombiniert werden.
65. ABDECKUNGSFEHLER IM NATÜRLICHEN PANEL
Nutzer im professionellen Forschungspanel:
- möchten möglicherweise ihre echten Konten nicht verknüpfen,
- können Vielnutzer sein,
- können übermäßig an bestimmten Plänen hängen,
kann sich von der Allgemeinbevölkerung in Bezug auf Privatsphäre unterscheiden. Daher trägt das natürliche Panel auch seine eigene Selektionsverzerrung. Die Aussage „Es wurde ein echtes Konto verwendet“ bedeutet nicht: „Die reale Nutzerpopulation wurde perfekt abgebildet."
66. VERLUST DER BERECHTIGUNG IM KONTROLLIERTEN PANEL
Einige Nutzer:
- können den Speicher nicht ausschalten,
- können spezielle Anweisungen nicht überprüfen,
- verwenden nicht den entsprechenden Plan,
- können nicht auf die Funktion für eine saubere Sitzung des Produkts zugreifen
könnten existieren. Wenn diese Personen vom kontrollierten Panel ausgeschlossen werden, verengt sich die kontrollierte Zielpopulation. Die Anzahl und Merkmale der ausgeschlossenen Gruppe sollten gemeldet werden. Kontrollierter Sauberkeitsscore: nicht „Alle Produktnutzer“:
produkt-berechtigte Nutzer, die die Sauberkeitsbedingung einrichten können
können bewertet werden.
67. SAUBERKEITSFEHLER
Auf dem kontrollierten Bedienfeld später:
- Spezialanweisungen offen,
- Speicher aktiv,
- Wenn sich herausstellt, dass das Gespräch existiert
Beobachtung: Es kann nicht auf das natürliche Bedienfeld verschoben werden, und es darf möglicherweise nicht automatisch als ungültig betrachtet werden. Nach der vorher festgelegten Regel: Wenn eine Aufzeichnung für die Beobachtung des Natural Account-State erforderlich ist, kann sie auf das natürliche Bedienfeld umklassifiziert werden, andernfalls kann sie als MIXED_STATE beibehalten werden. Die Umklassifizierung muss unabhängig vom Antwortergebnis erfolgen.
68. FALSCHE EINSTELLUNGSERKLÄRUNG IM NATÜRLICHEN BEDIENFELD
Nutzer: "Mein Speicher ist aus." kann sagen. Die Nachweise können zeigen, dass der Speicher eingeschaltet ist. Diese Situation:
- Betrug,
- Nutzerfehler,
- Verwirrung durch die Produktschnittstelle
Es ist möglich. Bosheit sollte nicht automatisch angenommen werden. Der korrekte Bedienfeldstatus wird bei Vorliegen von Nachweisen aktualisiert. Auch das Verhalten der Teilnehmer kann separat untersucht werden.
69. PANELVERGLEICHBARKEIT
Die folgenden Dimensionen sollten zwischen kontrollierten und natürlichen Panels so genau wie möglich abgeglichen werden:
- KI-Produkt
- Land
- Sprache und Gebietsschema
- Prompt-Version
- Messzeit
- Version der Entitätsrealität
- Beurteilungsregel
- Beispiellquelle oder Kalibrierung
- Hauptplanverteilung, falls für Vergleichszwecke erforderlich
Materialunterschiede sollten erklärt werden.
70. SAUBER–NATÜRLICHE VERGLEICHBARKEITSSTUFEN
CN-0— NICHT VERGLEICHBAR
Panel-Definitionen oder Populationen sind im Wesentlichen unbekannt.
CN-1— BESCHREIBEND
Es gibt Ergebnisse von zwei Panels. Jedoch unterscheiden sich Nutzer-, Plan-, Zeit- oder Produktbedingungen erheblich.
CN-2— KALIBRIERT
Hauptland, Sprache, Plan- und Nutzercharakteristika sind gewichtet oder geschichtet.
CN-3— ABGESTIMMTER PANELVERGLEICH
Die gleiche Zielpopulation, das gleiche Produkt, die gleiche Prompt, die gleiche Zeit und die gleichen Bewertungsbedingungen stimmen größtenteils überein. Der Panelstatus ist der Hauptunterschied.
CN-4— RANDOMISIERTES ODER GEPAARTES PANEL-EXPERIMENT
Nutzer wurden zufällig dem Panelstatus zugewiesen oder es wurde ein entsprechend angepasstes Experiment durchgeführt.
CN-5— REPLIZIERTER PANEL-EFFEKT
Der Unterschied wurde in mehr als einer Welle und in einem unabhängigen Panel wiederholt festgestellt. Der Unterschied auf der CN-1-Ebene: kann nicht als Effekt der Personalisierung abgeschlossen werden.
71. VERPFLICHTENDE NORMATIVE BESTIMMUNGEN
CH11-N01
Kontrolliertes Panel unter bereinigten Bedingungen und Panel unter natürlichen Nutzungsbedingungen müssen als separate Prognoseobjekte und separate öffentliche Ergebnisse definiert werden.
CH11-N02
Kontrollierte und natürliche Beobachtungen dürfen nicht ohne Erklärung unter demselben Nenner oder in einem einzigen Rohwert kombiniert werden.
CH11-N03
Die kontrollierte saubere Bedingung kann nicht als absolut neutrale oder unveränderliche Reaktion des Produkts präsentiert werden.
CH11-N04
Der natürliche Nutzerzustand kann nicht als methodenfremdes Rauschen abgelehnt werden.
CH11-N05
Ein neues Gespräch allein kann nicht als Beweis für ein sauberes Konto oder einen unpersonalisierten Zustand betrachtet werden.
CH11-N06
Ein temporärer, privater oder ephemerer Sitzungskennzeichnung beweist nicht automatisch, dass alle Personalisierungsebenen deaktiviert sind.
CH11-N07
In einem kontrollierten Panel müssen Gespräche, Speicher, spezielle Anweisungen, Werkzeuge, Pläne und Nutzeroberflächenzustände getrennt aufgezeichnet werden.
CH11-N08
Das Vertrauen in den sauberen Zustand muss ausdrücklich angegeben werden.
CH11-N09
Beobachtungen mit CSC-0 oder nur unzureichender Reinigung können nicht in die Hauptbewertung des kontrollierten Panels einbezogen werden.
CH11-N10
Der unbekannte Personalisierungsstatus in einem sauberen Panel kann nicht als deaktiviert angenommen werden.
CH11-N11
Sauber und kontrolliert zu sein bedeutet nicht, dass Web und Werkzeuge unbedingt deaktiviert sind; der Werkzeugstatus muss im Voraus standardisiert werden.
CH11-N12
Unterschiedliche Pläne und Nutzeroberflächen müssen festgeschrieben, geschichtet oder als separate Ergebnisse auf einem kontrollierten Panel veröffentlicht werden.
CH11-N13
Teilnehmer dürfen nicht aufgefordert werden, ihre persönlichen Erinnerungen, ihre Geschichte oder privaten Anweisungen dauerhaft zu löschen.
CH11-N14
Vorübergehende Einstellung Änderungen für eine kontrollierte Aufgabe müssen mit ausdrücklicher Zustimmung und einem Wiederherstellungsverfahren erfolgen.
CH11-N15
Am Ende der Forschung sollten geänderte Nutzereinstellungen in ihren ursprünglichen Zustand zurückversetzt werden.
CH11-N16
Neue Konten oder Kontoteilungen, die gegen die Produktbedingungen verstoßen, dürfen nicht als Anforderung für ein kontrolliertes Panel verwendet werden.
CH11-N17
Das Panel unter natürlichen Nutzungsbedingungen sollte den tatsächlichen Konto- und Nutzerstatus beibehalten und gleichzeitig die Prompt, die initiale angemessene Ausgaberegel und das Evidenzprotokoll erhalten.
CH11-N18
Spuren des natürlichen Konto-Zustands und des natürlichen Konversations-Zustands sollten getrennt aufbewahrt werden.
CH11-N19
Im Hauptvergleichbaren natürlichen Panel sollte die Prompt die erste Nutzer Nachricht der neuen Konversation sein.
CH11-N20
Die in dem aktuellen Gesprächskontext verwendeten Beobachtungen können nicht zur Hauptbewertung des Natural Account-State hinzugefügt werden.
CH11-N21
Das Gedächtnis im Natural-Panel sollte im Umfang relevant für spezielle Anweisungen, vorherige Gespräche, Plan, Schnittstelle und Kontonutzungsstatus aufgezeichnet werden.
CH11-N22
Die Aufzeichnung des Natural-State erlaubt standardmäßig nicht die Erfassung spezieller Anweisungen und Gesprächsinhalte.
CH11-N23
Personalisierungsinhalte können nur bei ausdrücklicher Notwendigkeit, separater Zustimmung und Datenminimierung untersucht werden.
CH11-N24
Natürliche Nutzerbeobachtungen können nicht als allgemeiner Produktstandard oder als Ergebnis der gesamten Nutzerpopulation dargestellt werden.
CH11-N25
Spezielle Anweisungen zugunsten oder gegen eine vom Nutzer erstellte Marke können nicht als Erfolg oder Misserfolg der allgemeinen Einheit GEO gewertet werden.
CH11-N26
Vom Nutzer generierte Anleitungen sollten erneut in Bezug auf überprüfte Realität bewertet werden.
CH11-N27
Personalisierung kann Ausdruck und Empfehlung ändern; sie kann die Realität des materiellen Objekts nicht willkürlich verändern.
CH11-N28
Das First-Use-Panel sollte getrennt von dem erfahrenen Panel unter natürlichen Nutzungsbedingungen und dem Kontrolliertes Panel unter bereinigten Bedingungen gemeldet werden.
CH11-N29
Unternehmens- oder verwaltete Nutzerarbeitsbereiche können nicht ohne Erklärung zum allgemeinen Verbraucher-Natural-Panel hinzugefügt werden.
CH11-N30
Im natürlichen Panel sollten der tatsächliche Plan und die Nutzeroberflächenverteilung der Nutzer sichtbar sein.
CH11-N31
Im natürlichen Panel sollten Web- und Werkzeugzustände entweder so aufgezeichnet werden, wie sie in der Realität sind, oder als ein separates werkzeugfestes Unterpanel definiert werden.
CH11-N32
Der kontrollierte und natürliche Punktunterschied kann nicht als kausaler Effekt der Personalisierung dargestellt werden, ohne dass die Panelbevölkerung und die Produktbedingungen abgeglichen werden.
CH11-N33
Die Richtung des Unterschieds zwischen sauber und natürlich, seine absolute Größe, der kritische Fehlunterschied und die unbekannte Rate sollten separat gemeldet werden.
CH11-N34
In einem Within-Subjects-Design sollten die Reihenfolge-, Übertragungs- und Memory-Effekte aufgezeichnet und in der Analyse erhalten werden.
CH11-N35
Wenn die Anwendung von zwei Bedingungen auf denselben Nutzer den natürlichen Zustand ändern kann, kann sie im Vergleich im Hauptbereich nicht verwendet werden.
CH11-N36
In einem unabhängigen Gruppendesign sollten Unterschiede in der Nutzerzusammensetzung geschichtet, randomisiert oder gewichtet werden.
CH11-N37
Der Panel-Zustand kann nicht geändert werden, basierend darauf, ob die KI-Antwort positiv, negativ oder kritisch ist.
CH11-N38
In einem kontrollierten Panel kann eine Beobachtung, bei der der natürliche Zustand später bestimmt wird, nur nach einer vorab festgelegten Regel neu klassifiziert werden.
CH11-N39
Wenn der Status im natürlichen Panel falsch gemeldet wird, kann nicht automatisch böser Wille unterstellt werden; eine evidenzbasierte Klassifizierung sollte durchgeführt werden.
CH11-N40
Teilnehmer von Panel unter natürlichen Nutzungsbedingungen können ihre Antwort nicht erneuern oder die ursprüngliche Antwort mit einer Folgefrage ändern; dieses Verhalten sollte unter einer separaten Spur für natürliche Interaktionen gemessen werden.
CH11-N41
Kontrollierte und natürliche Panel-Zielpopulationen, Stichprobenrahmen und Gewichte sollten getrennt aufgezeichnet werden.
CH11-N42
Wenn keine aktiven Nutzerdaten vorliegen, kann das Ergebnis des natürlichen Panels nicht als endgültige Repräsentation aller aktiven Nutzer präsentiert werden.
CH11-N43
Nutzergruppen, die vom sauberen Panel ausgeschlossen wurden, und die Gründe für den Ausschluss sollten gemeldet werden.
CH11-N44
Nutzerstatusfelder, die im natürlichen Panel aus Datenschutzgründen nicht gemessen werden können, sollten als UNBEKANNT beibehalten werden.
CH11-N45
Exakte Populationsraten oder sensible öffentliche Profile können aus kleinen natürlichen Untergruppen nicht erstellt werden.
CH11-N46
Ein Vergleichbarkeitsniveau zwischen CN-0 und CN-5 oder ein gleichwertiges offenes Vergleichbarkeitsniveau sollte für den Vergleich zwischen kontrollierten und natürlichen Panels angegeben werden.
CH11-N47
Ein Panel-Unterschied zwischen CN-0 oder CN-1 kann nicht als kausaler Personalisierungseffekt präsentiert werden.
CH11-N48
Der Sperrstatus des Panels und die Vergleichsentscheidung müssen einen verantwortlichen menschlichen oder institutionellen Eigentümer haben.
72. FORMEN DES VERSAGENS
CH11-F01— BERÜCKSICHTIGUNG EINER NEUEN KONVERSATION ALS SAUBERES KONTO
Dauerhafte Speicher und spezielle Anweisungen werden ignoriert.
CH11-F02— BLINDES VERTRAUEN IN TEMPORÄREN Sitzungskennzeichnung
Es wird angenommen, dass das Produktetikett alle Personalisierungen deaktiviert, bis dies überprüft ist.
CH11-F03— BERÜCKSICHTIGUNG VON UNBEKANNTEM SPEICHER ALS GESCHLOSSEN
Der saubere Wert wird künstlich erhöht.
CH11-F04— IGNORIEREN SPEZIELLER ANWEISUNG
Antwortformat oder Empfehlungshinweise werden als Produktstandard dargestellt.
CH11-F05— BERÜCKSICHTIGUNG DES FIRMENARBEITSBEREICHS ALS ALLGEMEINES PRODUKT
Private Informationsquellen und Administrator-Einstellungen bleiben unsichtbar.
CH11-F06— MISCHEN VON PLÄNEN AUF EINEM SAUBEREN PANEL
Kostenlose und zahlende Nutzer werden als ein einheitlicher Standardzustand dargestellt.
CH11-F07— BEACHTEN VON SCHLIESSWERKZEUGEN ALS REINIGUNG
Der natürliche Informationsmodus des Produkts wird künstlich verändert.
CH11-F08— STATUS DES WERKZEUGS NICHT SPEICHERN
Saubere Nutzer werden unter unterschiedlichen Abrufbedingungen gemessen.
CH11-F09— EINSCHRÄNKUNG DER BENUTZERGRUPPE MIT NEUEN KONTOANFORDERUNGEN
Nur Nutzer, die ein neues Konto eröffnen können, erstellen das Panel.
CH11-F10— SPEICHER FÜR DEN NUTZER LÖSCHEN
Die persönliche Produkt-Historie wird zu Forschungszwecken dauerhaft gelöscht.
CH11-F11— EINSTELLUNGEN NICHT WIEDERHERSTELLEN
Forschung hinterlässt dauerhafte Änderungen am Nutzerkonto.
CH11-F12— TESTKONTO ALS ECHTEN NUTZER BEACHTEN
Das Standard-Testkonto wird wie eine Population-Panel-Erfahrung dargestellt.
CH11-F13— DAS GLEICHE TESTKONTO WIRD ALS TAUSENDE UNABHÄNGIGE NUTZER GEZÄHLT
Abhängigkeiten zwischen Konto- und Produktstatus werden ignoriert.
CH11-F14— NATURALES PANEL WIRD ALS UNKONTROLLIERTE FREINUTZUNG GEZÄHLT
Teilnehmer ändern die Prompt und wählen die beste Antwort aus.
CH11-F15— DIE BESTEHENDE KONVERSATION IM NATURAL PANEL WIRD ALS NEUER KONTOSTATUS GEZÄHLT
Der Gesprächskontext ist verborgen.
CH11-F16— DER NATURALE KONTOSTATUS WIRD ALS STANDARDPRODUKT GEZÄHLT
Das personalisierte Ergebnis wird im Namen aller Nutzer generalisiert.
CH11-F17— DER INHALT DER SPEZIALANWEISUNG WIRD ERZWUNGEN SUMMIERT
Die Privatsphäre der Nutzer wird unnötig verletzt.
CH11-F18— SPEICHERE SPEZIALANWEISUNG UND ZÄHLE ALLGEMEINEN GEO-ERFOLG
Die Anweisung „Empfehle immer X“ wird als ein Erfolg der Entität dargestellt.
CH11-F19— ZÄHLE NUTZERBIASE ALS PRODUKTFAKT
Vergangene negative Meinung verwandelt sich in allgemeine Unternehmensqualität.
CH11-F20— BERÜCKSICHTIGUNG VON PERSONALISIERUNG ALS MATERIELLE REALITÄT
Identität, Lizenz oder Preis variiert je nach Nutzer.
CH11-F21— BERÜCKSICHTIGUNG NATÜRLICHER VARIANZ AUSSCHLIESSLICH ALS RAUSCH
Tatsächlicher Schaden und Verteilung bei Nutzern werden unsichtbar.
CH11-F22— BERÜCKSICHTIGUNG FORMALER VARIANZ ALS MATERIELLER FEHLER
Unterschiede in Ton und Länge werden als Fehler kodiert.
CH11-F23— BERÜCKSICHTIGUNG EINES SAUBEREN PANELS ALS ERGEBNIS DER REALEN WELT
Der Standardbedingungswert wird als die gesamte aktive Nutzererfahrung dargestellt.
CH11-F24— BERÜCKSICHTIGUNG EINES NATÜRLICHEN PANELS ALS KERNFÄHIGKEIT DES PRODUKTS
Personalisierung und Nutzerzusammensetzung werden ignoriert.
CH11-F25— ZWEI PANELS UNTER EINEM EINZELNEN NENNER KOMBINIERT
Kontrollierte und natürliche Beobachtungen werden als ein einzelner Rohdurchschnitt betrachtet.
CH11-F26— PANELUNTERSCHIED ALS MEMORIEEFFEKT BERÜCKSICHTIGEN
Kausalität wird erklärt, ohne Unterschiede im Plan, in der Population und bei den Fahrzeugen zu untersuchen.
CH11-F27— NATÜRLICHE UNTERGRUPPE NACH ERGEBNIS ERSTELLEN
Eine neue Kategorie wird erfunden, um eine niedrige oder hohe Punktzahl zu erklären.
CH11-F28— DEN CARRYOVER-EFFEKT BEIM GLEICHEN NUTZER IGNORIEREN
Die erste Aufgabe beeinflusst die zweite Antwort.
CH11-F29— DIE SEQUENZRANDOMISIERUNG VERSTECKEN
Alle Nutzer sehen zuerst die saubere Bedingung, dann die natürliche Bedingung.
CH11-F30— NATÜRLICHEN ZUSTAND DURCH KONTROLLIERTE AUFGABE STÖREN
Das Ändern von Einstellungen oder des Ursprünglicher Prompt verändert den anschließenden Zustand des Kontos.
CH11-F31— BERÜCKSICHTIGEN SIE VERSCHIEDENE NUTZERGRUPPEN ALS GEMATCHT
Natürliche und kontrollierte Panels haben unterschiedliche Plan- und Länderzusammensetzungen.
CH11-F32— BERÜCKSICHTIGEN SIE DAS PANEL DER ERSTEN NUTZUNG ALS SAUBERES PANEL
Standard-Onboarding- und Produkteinstellungen werden als überprüft angenommen.
CH11-F33— BERÜCKSICHTIGEN SIE ERFAHRENE NATÜRLICHE NUTZER ALS ERSTNUTZER
Kontoverlauf und Personalisierung werden unsichtbar.
CH11-F34— BERÜCKSICHTIGEN SIE NATÜRLICHE UNTERNEHMENSERGEBNISSE ALS ALLGEMEINEN KONSUMENT
Die private Wissensdatenbank wird zur Gesamtleistung des Produkts hinzugefügt.
CH11-F35— AKTUALISIEREN SIE DIE ANTWORT IM NATÜRLICHEN PANEL
Die Lieblingsantwort des Nutzers wird zur Hauptbeobachtung.
CH11-F36— DIE NATÜRLICHE NUTZERREISE IN DIE ERSTE ANTWORTPUNKTZAHL EINMISCHEN
Die Antwort, die nach Folgefragen und dem Öffnen von Ressourcen gebildet wird, wird so präsentiert, als ob es die erste Begegnung wäre.
CH11-F37— PANELSTATUS ENTSPRECHEND DER ANTWORT ÄNDERN
Positive Beobachtungen werden als sauber deklariert, negative Beobachtungen werden als natürlich deklariert.
CH11-F38— REINIGUNGSFEHLER SCHWEIGEND ZU NATÜRLICH ÜBERTRAGEN
Die Beobachtung wird umklassifiziert, ohne dass eine notwendige Aufzeichnung des natürlichen Status erforderlich ist.
CH11-F39— BERÜCKSICHTIGUNG DES UNBEKANNTEN ALS PRIVAT ZU PRIVATSPHÄRE-ZWECKEN
Nicht gemessene Personalisierung wird als positiv angenommen.
CH11-F40— EINE KLEINE UNTERGRUPPE IM ÖFFENTLICHEN IDENTIFIZIERBAR MACHEN
Seltene Sonderanweisungen oder ein Nutzer aus einem kleinen Land werden offenbart.
CH11-F41— ABDECKUNGSVOREINGEOMMEN IM NATÜRLICHEN PANEL VERBERGEN
Nutzer, die bereit sind, ihr echtes Konto zu teilen, werden als die gesamte aktive Bevölkerung gezählt.
CH11-F42— AUSBLENDEN DER SAUBEREN PANEL-AUSSCHLUSSFOLGE
Nutzer, die ihre Einstellungen nicht ändern können, werden unsichtbar.
CH11-F43— SCORE DER AKTIVEN BEVÖLKERUNG OHNE AKTIVE NUTZERDATEN
Das Forschungspanel wird so präsentiert, als wäre es die tatsächliche Verteilung der aktiven Nutzer.
CH11-F44— CN-1 KAUSALITÄT AUS UNTERSCHIED
Zwei beschreibende Scores werden als Personalisierungseffekt veröffentlicht.
CH11-F45— BEWAHRUNG DES KRITISCHEN ENDES DER PANELUNTERSCHIEDE
Nur der durchschnittliche Unterschied wird angezeigt.
CH11-F46— LÖSCHEN DER UNBEKANNTEN MASSE DES NATÜRLICHEN PANELS
Nutzer, deren Einstellungs- oder Personalisierungsstatus unbekannt ist, werden als problemfrei betrachtet.
CH11-F47— BEWAHRUNG GÜNSTIGER NATÜRLICHER VERBIEGUNG
Es wird keine Korrektur vorgenommen, wenn die Nutzeranweisungsinstitution dies als groß anzeigt.
CH11-F48— VERALLGEMEINERUNG NATÜRLICHER NEGATIVER VERBIEGUNG
Die frühere Meinung eines einzelnen Nutzers wird als KI-Repräsentation der gesamten Bevölkerung repräsentiert.
73. PRÜFUNGSVERFAHREN
Schritt 1— Trennen Sie die Forschungsfragen der beiden Gremien
Schreiben Sie, welche Menge das kontrollierte und das natürliche Gremium vorhersagen wird.
Schritt 2— Definieren Sie die Zielpopulationen
Trennen Sie die kontrollierte produktberechtigte Population von der natürlichen aktiven oder identifizierten Nutzerpopulation.
Schritt 3— Definieren Sie die kontrollierte saubere Bedingung
Die Sitzung, der Speicher, besondere Anweisungen, Werkzeuge, Plan, Oberfläche und Standortbedingungen sind versioniert.
Schritt 4— Bestimmen Sie das erforderliche CSC-Niveau
Schreiben Sie die minimale saubere Bedingungszuverlässigkeit, die für die Hauptanalyse akzeptiert wird.
Schritt 5— Bestimmen Sie die Spur des natürlichen Panels
Es wird bestimmt, welche der Rollen Natürlicher Kontostatus, Natürlicher Gesprächsstatus, Erstverwendung verwaltet verwendet wird.
Schritt 6— Bestimmen Sie das erforderliche NSF-Niveau
Es wird festgelegt, durch welche Nachweise der natürliche Zustand akzeptiert wird.
Schritt 7— Richten Sie das Panel-Zuweisungsdesign ein
Unabhängige Gruppe Zufällige Zuweisung Abgeglichener Nutzer Rotierendes Panel wird ausgewählt.
Schritt 8— Schreiben Sie das Verfahren für Einstellungsänderung und Wiederherstellung
Ein sicherer Prozess wird für kontrollierte Panel-Teilnehmer vorbereitet.
Schritt 9— Festschreiben Sie die Datenschutzgrenze
Welche natürlichen Nutzersituationen:
- nur Status,
- begrenzt Metadata,
- offener Inhalt
es wird bestimmt, dass es gespeichert wird als.
Schritt 10— Prompt und anfängliche Ausgaberegel festschreiben
Die gleiche Prompt und das gleiche Protokoll für die anfängliche geeignete Ausgabe werden in beiden Panels angewendet.
Schritt 11— Werkzeug und Webmodus speichern
Kontrollierte und natürliche Panelunterschiede werden sichtbar gemacht.
Schritt 12— Panelstatus vor Feld überprüfen
Ist es für die Rolle des Teilnehmerpanels geeignet?
Schritt 13— Panelvektor auf Beobachtungsebene speichern
Speicher, Anweisung, Plan, Oberfläche, Kontext und Nutzungsstatus werden gespeichert.
Schritt 14— Gültigkeit des Blindprüfprotokolls
Die Entscheidung über den Panelstatus wird getroffen, ohne zu sehen, ob die Antwort korrekt oder inkorrekt ist.
Schritt 15— Missklassifikationen mit vordefinierter Regel verwalten
Der Übergang von sauberem zu natürlichem oder gemischtem Zustand erfolgt nur, wenn der Datensatz ausreichend ist.
Schritt 16— Panelgewichte erzeugen
Getrennte Gewichte werden entsprechend den unterschiedlichen Zielpopulationen der beiden Panels berechnet.
Schritt 17— Hauptwerte berechnen
Kontrollierte Repräsentation Natürliche Repräsentation Kritischer Fehler
UNBEKANNT
Ablehnung und Unentschiedenheit werden separat erzeugt.
Schritt 18— Differenz zwischen sauber und natürlich berechnen
Signierte und absolute Differenz wird genommen.
Schritt 19— Untergruppen untersuchen
Vordefinierte Gruppen wie Gedächtnis, Anweisung, Plan, Kontodauer, Nutzungshäufigkeit, Erstverwendung werden bewertet.
Schritt 20— Kausalitätsgrenze festlegen
Das CN-Level wird zugewiesen. Es wird festgehalten, welche Aussagen geltend gemacht werden können.
Schritt 21— Überprüfung von Datenschutz und Small-Cell-Kontrolle
Ergebnisse mit einem Risiko der Re-Identifizierung werden zusammengeführt oder eingeschränkt.
Schritt 22— Erstellung des öffentlichen Panel-Scorecards
Die beiden Panels werden zusammen mit ihrem Umfang und ihren Einschränkungen veröffentlicht.
74. NOTWENDIGE NACHWEISE
Forschungsfrage des kontrollierten Panels; Forschungsfrage des natürlichen Panels; Zielpopulationen beider Panels; Methode zur Panel-Zuweisung; Definition des kontrollierten Clean-States; minimale CSC-Stufe; neuer Chat-Eintrag; Speicherzustand; Nutzerdefinierter Instruktionszustand; Zustand voriger Unterhaltungen; Zustand des Unternehmensarbeitsbereichs; Werkzeug- und Webmodus; Plan; Nutzeroberfläche; Sprache und Gebietsschema; Anweisungen zur Einstellungänderung; Zustimmung der Teilnehmer; Protokoll zur Wiederherstellung der Einstellung; Nutzung eines Testkontos, falls vorhanden; Natural-Panel-Spur; minimale NSF-Stufe; Kontogealterband; Nutzungsfrequenz; First-Use-Status; Markenbekanntheit; Status voriger Unterhaltungen bezüglich der geprüften Einheit; Zustand des Natural-Tools; Unterscheidung zwischen dem natürlichen Konten-Zustand und dem natürlichen Gesprächs-Zustand; Prompt-ID und Version; Validierung der zuerst berechtigten Ausgabe; Panel-Zustands-Vektor; und Panel-Zustands-Gültigkeitsstatus.
Gültigkeitsprüfung Umklassifizierungsaufzeichnungen Kontrollierte Panel-Ausschlüsse Natürliche Panel-Abdeckungslücken Panel-Gewichte Roh- und effektive Stichprobe Kontrollierter Wert Natürlicher Wert Unterzeichneter Panel-Unterschied Absoluter Panel-Unterschied Kritischer Fehlerunterschied UNBEKANNTER und unentschlossener Unterschied Vordefinierte Untergruppen-Ergebnisse Abgestimmte Design-Aufzeichnungen Reihenfolge- und Übertragungseffekte CN-Vergleichbarkeitsniveau Datenschutz- und Schwärzungsaufzeichnung Schutz kleiner Zellen Öffentliche Panel-Ergebnisübersicht Panel-Version und Änderungsaufzeichnung Verantwortliche Person oder Institution
75. ÜBERPRÜFUNGS-KONTROLLLISTE
Sind die Forschungsfragen für das kontrollierte und das natürliche Panel getrennt? Sind ihre Zielgruppen gleich oder unterschiedlich? Wurde der kontrollierte saubere Zustand klar definiert? Abgesehen vom neuen Chat, welche sauberen Zustände wurden bestätigt? Ist das Gedächtnis wirklich ausgeschaltet, oder ist es unbekannt? Wurde der Status der speziellen Anweisung aufgezeichnet? Gibt es einen Effekt des Unternehmensarbeitsbereichs? Sind die Web- und Werkzeugmodi standardmäßig? Sind der Plan und die Nutzeroberfläche fest oder geschichtet? Wurde ein Vertrauensniveau für den sauberen Zustand angegeben? Wurden CSC-1-Beobachtungen als vollständig sauber verwendet? Wurde der Teilnehmer gebeten, sein Gedächtnis oder seine Historie zu löschen? Wurden die Einstellungen am Ende der Aufgabe wiederhergestellt? Wurde ein neues Konto oder ein Testkonto verwendet? Wurde das Testkonto wie ein echtes Nutzerpanel präsentiert?
Welches Trace verwendet das natürliche Panel? Wurde in Natural Account-State ein neuer Chat geöffnet? Hat der aktuelle Gesprächskontext die Haupt-Natural-Bewertung beeinträchtigt? Wurde ein Natural-State-Vertrauenslevel angegeben? Wurden Speicher- und Nutzerdefinierte Instruktionsinhalte unnötig gesammelt? Wurden der tatsächliche Plan des Nutzers und die Oberfläche aufgezeichnet? Sind First-Use-Nutzer getrennt? Sind Unternehmensbenutzer getrennt? Wurde der Zustand des Natural-Tools aufgezeichnet? Haben die beiden Panels die gleiche Prompt-Version verwendet? Wurde die erste berechtigte Ausgabe in beiden Panels gespeichert? Hat die natürliche Nutzerantwort sich aktualisiert? Wurde der Panel-Status entsprechend dem Inhalt der KI-Antwort geändert? Wie wurden Datensätze mit erkannten natürlichen Zuständen im sauberen Panel verwaltet? Wurde derselbe Nutzer in zwei Panels verwendet? Wurde die Reihenfolge randomisiert?
Wurde der Effekt von Transfer und Gedächtnis bewertet? Entspricht bei dem Design mit unabhängigen Gruppen die Zusammensetzung der Nutzer? Sind kontrollierte und natürliche Gewichtungen getrennt? Kann der natürliche Wert wirklich auf die aktive Nutzerpopulation verallgemeinert werden? Wurde der Unterschied zwischen sauber und natürlich überinterpretiert als ein Personalisierungseffekt? Ist ein Unterschied bei kritischen Fehlern sichtbar? Gibt es einen sichtbaren Unterschied für UNBEKANNT und Nullergebnisse? Wurden Untergruppen vor den Ergebnissen definiert? Können kleine Untergruppen neu definiert werden? Wurden nutzergeführte Anweisungen für oder gegen in allgemeines GEO umgewandelt? Hat die Personalisierung die materielle Realität verändert? Wurde ein CN-Vergleichsniveau bereitgestellt? Ist der verantwortliche Eigentümer der Panel-Ergebnisse-Karte klar?
76. EINWÄNDE UND ANTWORTEN
Einspruch 1— „Wenn echte Nutzer Speicherkonten verwenden, warum ist dann ein sauberes Panel notwendig?“
Weil die Ursache des Unterschieds ohne eine gemeinsame Ausgangsbedingung zwischen Produkten, Ländern und Sprachen nicht verstanden werden kann. Ein sauberes Panel ersetzt kein echtes Nutzerpanel. Es bietet eine Referenz zum Vergleich.
Einwand 2— „Ist ein kontrolliertes Panel nicht künstlich, wenn es ein natürliches Panel gibt?“
Es ist kontrolliert. Das ist absichtlich. Der Zweck einer Laborbedingung ist nicht, das gesamte reale Leben abzubilden, sondern bestimmte Variablen zu isolieren.
Einwand 3— „Wenn das kontrollierte Panel höhere Werte erzielt, können wir das nicht als Haupt-GEO-Score nehmen?“
Das kann man nicht alleine tun. Ein hoher Wert im Kontrollpanel kann nicht die Tatsache auslöschen, dass reale Nutzer niedrigere Ergebnisse sehen. Die beiden Ergebnisse sollten getrennt erscheinen.
Einwand 4— „Ist der wissenschaftliche Wert niedrig, wenn das natürliche Panel sehr verstreut ist?“
Heterogenität muss kein Mangel des natürlichen Panels sein. Sie ist ein Merkmal der realen Nutzererfahrung. Heterogenität:
- wird aufgezeichnet,
- ist geschichtet,
- ist gewichtet,
wird mit Unsicherheit berichtet.
Einwand 5— „Stört das Öffnen eines neuen Chats nicht den natürlichen Nutzerzustand?“
Der aktuelle Gesprächskontext wird entfernt. Der persistente Konto-, Plan-, Speicher- und benutzerdefinierte Anweisungsstatus werden beibehalten. Dies macht den natürlichen Kontostatus vergleichbar. Auch die aktuelle Gesprächserfahrung ist messbar.
Einwand 6— „Wie werden wir seine Wirkung messen, ohne den Inhalt der benutzerdefinierten Anweisungen zu kennen?“
Das Wissen um den Inhalt ist für die Hauptbewertung nicht erforderlich. Dessen Vorhandensein:
- existiert,
- existiert nicht,
- kann Material sein
Wir können es als solches klassifizieren. Für die kausale Inhaltsanalyse ist separate und einvernehmliche Arbeit erforderlich.
Einwand 7— „Wenn das Gedächtnis klar ist, aber nichts über das Unternehmen erinnert wird, warum dann eine separate Gruppe?“
Die Wirkung des Gedächtnisses kann unbekannt sein. Ein Status von „nicht mit der Entität verbunden“ kann basierend auf der Aussage des Nutzers vergeben werden. Dies hat jedoch immer noch nicht die gleiche Sicherheit wie der geschlossene Gedächtniszustand.
Einwand 8– „Ist die Anweisung des Nutzers ‚immer X vorschlagen‘ nicht echte Nutzererfahrung?“
Es ist eine echte Erfahrung. Es ist jedoch nicht die allgemeine GEO-Leistung von X. Es handelt sich um eine von Nutzern bereitgestellte Anleitung. Es sollte separat aufgezeichnet werden.
Einwand 9– 'Wenn Personalisierung dem Nutzer eine passendere Antwort gibt, wo ist das Problem?'
Es muss kein Problem sein. Empfehlungen können je nach Bedarf des Nutzers variieren. Probleme treten auf, wenn Identität, Lizenz, Preis und Evidenzstatus willkürlich ändern.
Einwand 10— „Ist es nicht die korrekteste Methode, denselben Nutzer in zwei Panels zu verwenden?“
Es kann stark für einige kausale Vergleiche sein. Die erste Aufgabe kann die zweite Situation beeinflussen. Daher sind Reihenfolge-, Übertragungs- und Gedächtniskontrollen erforderlich. Unabhängige Gruppen können in Hauptpopulationen sicherer sein.
Einwand 11— 'Wenn das Aktualisieren der Antwort in der Panel unter natürlichen Nutzungsbedingungen normales Verhalten ist, warum ist es dann verboten?'
Regeneration ist verboten, wenn die Exposition gegenüber der ersten Reaktion gemessen wird. Regeneration und nachfolgendes Verhalten können unter einem Natural Interaction Track separat gemessen werden.
Einwand 12— „Was werden wir mit einem Nutzer tun, der Speicher und Anweisungen für ein sauberes Panel nicht ausschalten kann?“
Sie können nicht dem kontrollierten Panel zugeführt oder in einer separaten Zelle mit einem niedrigeren CSC-Level untergebracht werden. Sie können im natürlichen Panel bewertet werden. Die Ausschlussrate sollte gemeldet werden.
Einspruch 13— „Sind Testkonten nicht zuverlässiger?“
Sie können in Bezug auf die Kontrolle zuverlässig sein. Sie sind hinsichtlich der tatsächlichen Nutzerpopulation eingeschränkt. Kontrollierte Testkonten und echte Nutzerpanels sind separate Ergebnisse.
Einwand 14— „Ist das Speichern von Nutzereinstellungen auf dem Natur-Panel nicht eine Verletzung der Privatsphäre?“
Es kann passieren, wenn unnötige Inhalte gesammelt werden. Datenschutz kann durch hochstufige offene/geschlossene Status, anonyme Registrierung und Schwärzung gewahrt werden.
Berufung 15— „Werden wir die Punktzahlen der beiden Gremien nicht in eine einzige NOMOS-Punktzahl zusammenführen?“
Die Rollen der beiden Gremien können in der endgültigen Ergebnisarchitektur definiert werden. Rohwerte und Zwischenergebnisse sollten jedoch immer separat sichtbar bleiben. Sie können die kombinierte Punkteverteilung nicht ersetzen.
Berufung 16— „Welchen Fehler hat das Unternehmen, wenn das natürliche Gremium niedrig bewertet?“
Es ist nicht immer der Fehler des Unternehmens. Quelle:
- Nutzeranweisung,
- KI-Personalisierung,
- Planunterschied,
- offizielle Quellendefekt,
- Produktverhalten
Es ist möglich. Die Prüfung zeigt zuerst das Ergebnis, dann trennt sie den Verantwortungsweg.
GEMEINSAME REGEL VON KAPITEL 81
Ein KI-Produkt hat keine einzige Antwort. Selbst derselbe Prompt kann unterschiedliche Antworten für haben:
- sauberes Konto,
- natürlicher Account,
- Nutzer mit Gedächtnis,
- Nutzer mit speziellen Anweisungen,
- Erstbenutzer,
- geschäftlicher Arbeitsbereich,
- Nutzer mit vorheriger Unterhaltung
Sie können all diese Unterschiede nicht damit erklären, dass „das Modell sich zufällig verhält“. Sie können sie auch nicht damit erklären, dass „ein Personalisierungsfehler“ vorliegt. Zuerst müssen Sie zwei separate Realitäten messen. Kontrolliertes Panel unter bereinigten Bedingungen:
Zeigt die Repräsentation im standardisierten Anfangszustand des Systems.
Panel unter natürlichen Nutzungsbedingungen:
Zeigt die Verteilung der Repräsentation, die reale Personen in ihrem eigenen Produktlebenszyklus antreffen.
Das kontrollierte Panel kann hoch sein, das natürliche Panel kann niedrig sein. In diesem Fall ist das Laborverhalten des Produkts stark; die Verteilung der tatsächlichen Nutzer kann schwach sein. Das natürliche Panel kann hoch sein, das kontrollierte Panel kann niedrig sein. Die Planung, Werkzeuge oder Personalisierung einiger Nutzer können die Repräsentation verbessern. Beide Panels können hoch sein. Das Produkt kann unter verschiedenen Nutzerbedingungen robust sein. Beide können niedrig sein. Das grundlegende Repräsentationsproblem kann umfassender sein. Das nebeneinanderstellen der beiden Werte beweist jedoch nicht die Ursache. Kausalität:
- gleiche Bevölkerung,
- gleiches Produkt,
- gleiche Prompt,
- gleiche Zeit,
- kontrollierte Zuweisung
- Sequenz- und Transportanalyse
ist erforderlich. Wenn ein Nutzer angewiesen hat: „Schlage immer X vor.“, ist es eine natürliche Erfahrung, dass X erscheint. X ist kein globaler GEO-Erfolg. Wenn ein Nutzer sagt: „Vertraue X nicht.“, ist eine negative Reaktion eine natürliche Erfahrung. X ist keine allgemeine Repräsentation in der Weltbevölkerung. Personalisierung sollte den Nutzer verstehen. Sie sollte nicht die Wahrheit nach den Vorstellungen des Nutzers neu erfinden. Daher lautet das elfte Messgesetz von NOMOS:
Sauberes Verhalten und natürliche Erfahrung sind separate Realitäten.
Das zwölfte Gesetz lautet wie folgt:
Ein neuer Chat ist kein sauberes Konto.
Das dreizehnte Gesetz lautet wie folgt:
Natürliche Personalisierung ist kein globaler GEO-Erfolg.
Das vierzehnte Gesetz lautet wie folgt:
Die angemessene Antwort für den Nutzer kann variieren; die Realität der überprüften Entität kann sich nicht ändern.
Das fünfzehnte Gesetz lautet wie folgt:
Der Unterschied zwischen kontrolliertem und natürlichem Score ist der Befund, der erklärt werden muss; er ist an sich kein Grund.
Sechzehntes Gesetz lautet wie folgt:
Die Messung der realen Nutzererfahrung bedeutet nicht, die Privatsphäre zu entfernen, sondern nur den notwendigen Kontext nachzuweisen und den Rest zu erhalten.
Bestellung von Abschnitt 11 von NOMOS
Sag mir nicht nur, dass du einen neuen Chat geöffnet hast. / Zeige den Status von Speicher, speziellen Anweisungen, Plan und Werkzeugen.
Gehe nicht davon aus, dass alle Personalisierungen verschwunden sind, nur weil du die Notiz 'Temporäre Sitzung' siehst.
Das saubere Panel ist die Gesamtheit des realen Lebens; mach das natürliche Panel nicht zu unkontrolliertem Rauschen.
Standardisiere das kontrollierte Konto. / Behalte das natürliche Konto unverändert. / Lege beide nicht in dieselbe Box.
Mache die speziellen Anweisungen des Nutzers nicht zum Welterfolg für die Entität.
Mache die negative Vergangenheit des Nutzers nicht zur Sicht der gesamten Bevölkerung.
Zähle Personalisierung nicht als Lizenz, die Wahrheit zu verändern.
Du kannst einem Nutzer geeignete Ratschläge geben. / Aber schreibe die Identität, Lizenz, den Preis und den Nachweis des Unternehmens nicht von Nutzer zu Nutzer um.
Sammle das Privatleben nicht im natürlichen Panel. / Ist das Gedächtnis eingeschaltet, Anweisungen vorhanden, Kontext verfügbar – zeichne nur auf, was notwendig ist.
Lasse den Teilnehmer sein Gedächtnis nicht löschen. / Stelle die Einstellungen wieder her, wenn du sie vorübergehend geändert hast.
Wenn du denselben Nutzer in zwei Panels getestet hast, erinnere dich daran, dass die erste Antwort die zweite beeinflussen kann.
Zeigen Sie den Unterschied zwischen dem sauberen Punktestand und dem natürlichen Punktestand. / Zeigen Sie den kritischen Unterschied. / Zeigen Sie das Unbekannte. / Nennen Sie jedoch den Grund nicht ohne Beweis.
Entscheiden Sie zuerst, welche Nutzerrealität Sie messen möchten. / Festschreiben Sie dann die sauberen und natürlichen Bedingungen separat. / Halten Sie dann die Prompt gleich. / Erfassen Sie dann die erste Antwort, ohne sie zu ändern. / Berechnen Sie dann die beiden Verteilungen separat. / Und erst danach erklären Sie die Distanz zwischen dem, was das Produkt unter Standardbedingungen tut, und dem, was reale Menschen erleben.
Der abschließende Satz des Kapitels
Die wahre Repräsentation eines KI-Produkts in GEO-1000 ist nicht die Antwort, die es in einer sauberen Sitzung geben kann; es ist die klare und bewiesene Beziehung zwischen seinem Verhalten unter Standardbedingungen und den Antworten, die es tatsächlich den Menschen über verschiedene Nutzerhistorien hinweg liefert.
Normativer Kern
Beobachtungen des kontrollierten Panels unter bereinigten Bedingungen und des Panels unter natürlichen Nutzungsbedingungen MÜSSEN separate Messpopulationen, Panelzustände, Nenner und öffentliche Ergebnisse bleiben. Ein Kontrolliertes Panel unter bereinigten Bedingungen MUSS definieren und, falls zutreffend, überprüfen: - ein neues und separates Gespräch, - das Fehlen eines vorherigen Gesprächskontexts, - den Zustand des persistenten Speichers, - den Zustand der Nutzerdefinierten Anweisungen, - den Unternehmens- oder verwalteten Arbeitsbereichszustand, - Web-, Abruf- und Werkzeugkonfiguration, - Plan, - Nutzerschnittstelle, - Prompt-Version, - und die Vertrauenswürdigkeit des sauberen Zustands. Ein neues Gespräch oder eine Kennzeichnung als temporäre Sitzung DARF NICHT allein als Nachweis dafür behandelt werden, dass jede persistente Personalisierung deaktiviert wurde. Ein Panel unter natürlichen Nutzungsbedingungen MUSS das authentische Konto, den Plan, die Schnittstelle, den Speicher, die nutzerdefinierten Anweisungen und den Nutzungszustand des Teilnehmers bewahren, während den festgelegten Prompt, die Regel für die erste berechtigte Ausgabe, die Nachweisanforderungen und die Regel, keine neue Antwort zu erzeugen beibehalten werden. Beobachtungen im Zustand eines natürlichen Kontos, natürlicher Gesprächs-Zustand, Erstverwendung und verwaltete natürliche Beobachtungen MÜSSEN separat identifiziert bleiben. Die Dokumentation des natürlichen Zustands MUSS die Sammlung von privaten Daten minimieren. Private Anweisungstexte, Gesprächsverlauf, Identität, Zugangsdaten und sensible persönliche Inhalte DÜRFEN NICHT gesammelt werden, es sei denn, dies ist gesondert erforderlich, mit Einwilligung erhoben, minimiert und zugangskontrolliert. Nutzergenerierte entitätsbegünstigende oder entitätsbenachteiligende Anweisungen KÖNNEN als natürliche Personalisierungseffekte gemessen werden, DÜRFEN jedoch NICHT als allgemeiner Erfolg, Misserfolg oder Standardverhalten eines Produkts für die Entität repräsentiert werden. Personalisierung KANN Relevanz, Präsentation und Empfehlung verändern, wenn der Nutzerkontext dies rechtfertigt. Sie DARF NICHT willkürlich die verifizierte Identität, Lizenz, den rechtlichen Status, Preis, Umfang, Nachweise oder die Zeit einer Entität ändern. Unterschiede zwischen kontrollierten und natürlichen Panels DÜRFEN NICHT als kausale Personalisierungseffekte repräsentiert werden, es sei denn, Bevölkerung, Produkt, Prompt, Zeit, Schnittstelle, Plan, Werkzeuge, Zuordnung, Reihenfolge und Carryover-Bedingungen unterstützen diese Schlussfolgerung. Kontrollierte und natürliche Bewertungen, Raten kritischer Fehler, UNKNOWN-Raten, Abdeckung, effektive Stichprobengrößen sowie signierte und absolute Panel-Lücken MÜSSEN weiterhin separat sichtbar bleiben. Die Berechtigung des Panel-Status, Umklassifizierung, Ausschluss und Gewichtung MÜSSEN unabhängig davon bleiben, ob die KI-Ausgabe positiv, negativ, korrekt, inkorrekt, abgelehnt, kritisch oder kommerziell günstig ist. Jede Definition des Panel-Status, jeder Prozess zur Änderung von Einstellungen, jede Datenschutzentscheidung, jedes Vergleichsniveau und jedes Ergebnis MÜSSEN versioniert und einer verantwortlichen Person oder Organisation zuordenbar sein.

