クイック回答
1,000 CSAT commentsをgoverned evidence workflowとして分析:decision/eligible corpus定義、request/response/text coverage測定、data minimization、original language/rating target保持、versioned codebook、2 human reviewerのstratified calibration、exact spanまたはabstain、locked holdout error audit、honest denominator aggregate、reviewed themeのみowned corrective workへ。
CSAT metric/corpus contractから開始
unit/rating target
comment、completed rating、conversation、unique respondentをunitに選択。teammate/chatbot/AI/product/serviceのrating objectを記録しsilent merge禁止。
population/timestamp
eligible、requested、responded、text-added populationとrequested/responded/started/updatedのwindow anchorを宣言。
denominator/multi-label math
request、response、text comment、eligible comment、unique respondent countを公開。multi-themeならshareは100%超過可能。false exclusivityにしない。
missingness/inference limit
blank、nonresponse、inaccessible channel、deleted、language exclusion、failed joinはdataでzero dissatisfactionではない。reviewed sampling designなしにobserved corpus外へinferしない。
1,000 commentsの10-step workflow
順番に実行。各stepはauditable output/stop conditionを作り、後工程でeligibility/privacy/calibration/evaluation failureを隠さない。
commentを見る前にanalysis questionを固定
reviewが支えるone decision(例:next quarterに直すverified service failure)を明記。owner、deadline、allowed/prohibited use、decision-changing evidenceを定義。“insight発見”だけではattractiveだがunauditableなthemeになる。
- required evidence/output
- approved question、decision owner、audience、exclusion、review date、nonrespondentを代表しない注記。
- human checkpoint
- qualified reviewerがscope、evidence、uncertainty、privacy、proposed action authorityを確認後にadvance。
eligible 1,000-comment corpusを定義
survey/version、rating object、requested/responded timestamp、window、product、region、channel、language、actor、duplicate、edit、deleted、latest completedかevery responseかを指定。source ID/query保持。
- required evidence/output
- input count、reason別exclusion、missing/blank、duplicate policy、extract time、immutable snapshot hashのreproducible manifest。
- human checkpoint
- qualified reviewerがscope、evidence、uncertainty、privacy、proposed action authorityを確認後にadvance。
respondentを読む前にmissing populationを測定
selected timestamp/populationでrequest/response denominator算定。channel、language、product、issue、accessibility route、agent typeなどpermitted cohortでcoverage比較。差はcoverage warningでありcustomer traitや事後weightではない。
- required evidence/output
- request/response/text-comment rate、nonresponse table、unknown、excluded cohort、descriptive/generalizable判断。
- human checkpoint
- qualified reviewerがscope、evidence、uncertainty、privacy、proposed action authorityを確認後にadvance。
textをminimizeし保護
purpose不要field削除、direct identifierをredact/tokenize、raw access制限、customer commentとinternal note分離、retention/deletion定義。prompt/log/export/screenshotへのcredential、health/payment、secret、third-party漏えい防止。
- required evidence/output
- field inventory、必要なlawful basis/consent、access、processor/model route、retention、deletion test、incident path、qualified redaction exception。
- human checkpoint
- qualified reviewerがscope、evidence、uncertainty、privacy、proposed action authorityを確認後にadvance。
language・context・rating objectを保持
originalとtranslation、detected language、method/version、confidence、permitted excerpt、rating target、score、channel、product、issue stateを保存。negation、sarcasm、accessibility表現、mixed language、product nameをnormalizeで消さない。
- required evidence/output
- original-translation link、glossary、low-confidence queue、no-translation path、reviewer language capability、teammate/chatbot/AI/product/service ratingの区別。
- human checkpoint
- qualified reviewerがscope、evidence、uncertainty、privacy、proposed action authorityを確認後にadvance。
明示other path付きcodebookを構築
themeにdefinition、inclusion/exclusion、positive/negative example、parent-child、multi-label、other/uncertainを設定。issue topic、sentiment、severity、resolution evidence、request type、actionを別軸にする。
- required evidence/output
- versioned codebook、change log、example provenance、max labels、precedence、uncertain code、full run前owner approval。
- human checkpoint
- qualified reviewerがscope、evidence、uncertainty、privacy、proposed action authorityを確認後にadvance。
blinded stratified sampleでcalibrate
1,000件前にrating、language、channel、product、issue state、length、timeでreproducible sample。2名以上qualified reviewerがindependent label、disagreement adjudicate、codebook revise、untouched holdout保持。agreementはdiagnosticでtruth/fairness証明でない。
- required evidence/output
- seed/strata、independent labels、disagreement、adjudicator、revision、per-label agreement、rare-class、holdout lock、stop/go。
- human checkpoint
- qualified reviewerがscope、evidence、uncertainty、privacy、proposed action authorityを確認後にadvance。
evidence span・abstention付きAI coding
各commentにID、codebook version、proposed labels、exact span、task-calibrated confidence、contradiction/missing flag、abstention reason。structured output validate、parse failure quarantine、retry idempotent。quote捏造/unsupported labelのsilent replace禁止。
- required evidence/output
- prompt/model/version、parameter、schema、span offset、abstention、retry、parse failure、cost/access log、immutable inputへのdeterministic link。
- human checkpoint
- qualified reviewerがscope、evidence、uncertainty、privacy、proposed action authorityを確認後にadvance。
overall accuracyだけでなくlabel/cohort別error audit
locked holdout/targeted sliceでper-label precision/recall、confusion、unsupported span、missed negation、translation error、abstention quality、multi-label omission、permitted cohort差を報告。low-volume/sensitiveはhuman review。
- required evidence/output
- denominator/interval付きresult、FP/FN example、minimum size、reviewer correction、threshold rationale、residual risk、rollback decision。
- human checkpoint
- qualified reviewerがscope、evidence、uncertainty、privacy、proposed action authorityを確認後にadvance。
evidenceを失わずthemeをdecisionへaggregate
eligible commentとunique respondentを別count。multi-labelを許可しpercentageを偽100%にしない。denominator、unknown、interval、example rule公開。priorityごとにrepresentative/contradictory comment、owner、hypothesis、due、verification、follow-up、decision log。
- required evidence/output
- reproducible table、hidden dedupeなし、cherry-pickなし、base rate、contradiction、owner、acceptance、same contractでremeasure。
- human checkpoint
- qualified reviewerがscope、evidence、uncertainty、privacy、proposed action authorityを確認後にadvance。
worked example:1,000 export rowsから742 eligible comments
hypothetical walkthroughでOpenMax customer data/benchmarkではない。1,000 rowsからno-comment unanswered 96、latest-completed rule duplicate 54、test 31、internal-note leak 22、window外18、rating object unreconciled 37を除外し742 comments。全exclusionをreason別保持。
- theme前にcoverage。 各denominatorでrequest/response/text-comment rateを報告しunderrepresented language/phone cohortをflag。
- scale前にcalibration。 2 reviewerがsampleをindependent codeしslow response/unresolved outcome confusionを発見、definition revise、holdout lock。
- theme count前にevidence。 exact span付きのみAI label。unsupported/uncertain translationはabstainしreviewerがhigh-impact/sampleをcorrect。
- causal overclaimなしにaction。 reviewed billing-clarity themeをowned documentation/invoice-message experimentへ。task completion、repeat contact、new-comment coverage、harmを測定しcausality/higher-CSATをclaimしない。
model・research・service outcomeを別測定
coding quality
per-label precision/recall、confusion、unsupported span、abstention、translation error、override、drift。overall accuracyはrare-theme failureを隠す。
research quality
coverage、missingness、sampling、duplicate、codebook stability、agreement、contradiction、example integrity、reproducibility。
service outcome
customer-confirmed completion、repeat、reopen、complaint、accessibility、safety、time、cost、cohort distribution。rating response/model qualityと分離。
OpenMaxによるanalysis coordination
OpenMaxはapproved extract、immutable manifest、redaction、language route、versioned codebook、blinded review、evidence-linked AI proposal、abstention、adjudication、holdout evaluation、correction、owner、deadline、remeasureをcoordinate。question、purpose/authority、codebook approval、sensitive interpretation、threshold、publication、consequential decisionはhuman。
privacy・fairness・interpretation boundary
- raw textをunapproved modelへupload、indefinite retain、internal note expose、新目的reuseをauthority/notice/access/deletion/security/processor reviewなしに行わない。
- wording、grammar、name、language、channel、sentimentだけでtrait、health、disability、identity、honesty、intent、emotion、performance、valueをinferしない。
- vividという理由だけでquote公開禁止。consent/authority、de-identification、meaning/context、contradiction、re-identification防止。
- explicit causal design、comparable population、stable metric、follow-up、uncertainty、missing-data、harm reviewなしにroot cause、all-customer representation、CSAT improvementをclaimしない。
情報源、編集方法、制限
OpenMax編集部はIntercom conversation rating setup/remarks、rating dataset/metric definition、reporting population/timestamp、NIST AI RMF 1.0、GAI Profileを確認し10-step workflow、metric contract、hypothetical 1,000-row caseを作成。2026年9月3日再確認。
- Intercom — Measure customer satisfaction with conversation ratings
- Intercom — Reporting metrics and attributes
- Intercom — Conversations reporting
- NIST — AI Risk Management Framework 1.0
- NIST — Generative AI Profile
よくある質問
human reviewなしで全1,000件をAI分析?
processは可能だがhuman corpus approval、codebook calibration、holdout error review、sensitive review、action authorizationが必要。
low ratingとnegative commentを一緒に分析?
score、text、rating target、timestamp、evidenceを別保持。関係分析は可能だがdisagreementは消すerrorでなくuseful data。
codebookのtheme数は?
universal numberなし。reviewerがreliableに使えるsmallest distinct set、other/uncertain保持、versioned evidenceでsplit/merge。
large themeはroot causeを示す?
no。frequencyはeligible corpusのcoded observation。root causeにはoperational corroborationとtested causal explanationが必要。
OpenMaxで何をautomate?
authorized extraction、manifest、redaction、coding proposal、evidence link、abstention、review、evaluation、action routing、remeasureをcoordinateしpurpose、approval、interpretation、consequential decisionはhuman。

