Hybrid AI-Text Detection & Generalization Diagnostic

MSc NLP Framework HC3 vs DAIGT Cross-Dataset Audit
Text Inspection & Segmentation
Preset:
Sliding Window Sequence (3 segments) Click window to inspect
Select a window chip above to view token boundaries and localized feature shifts.
Tripartite Evidence & Classification
Non-binary probabilistic calibration
Calibrated Authorial Diagnostic
Mixed / Uncertain Classification
Human: 32% Mixed/Uncertain: 48% AI-Associated: 20%
Statistical
Total Words: 71
Lexical TTR: 0.831
Avg Word Len: 6.4 chars
Sentence Variance: 3.2
Stylometric
Function Words: 0.394
Punctuation Density: 0.056
Pronoun Ratio: 0.000
Contractions: 0
Semantic / TF-IDF
Bigram Repetition: 0.000
Domain Coherence: 0.88
TF-IDF Sparsity: 0.91
Perplexity Proxy: Moderate
Empirical In-Domain vs. Cross-Dataset Transfer Matrix
Training → Evaluation Benchmark Model Architecture Accuracy F1 Score ROC-AUC Observed Error Vulnerability
HC3 → HC3 (In-Domain QA) Hybrid + Linear SVM 98.62% 0.9839 0.9986 Near-zero in-distribution error
DAIGT → DAIGT (In-Domain Essays) Semantic + Linear SVM 99.54% 0.9943 0.9999 Extremely high benchmark fidelity
HC3 → DAIGT (Cross-Domain) Hybrid + Linear SVM 67.11% 0.5468 0.6139 High False Negatives: misses AI essays
DAIGT → HC3 (Cross-Domain) Hybrid + Linear SVM 62.03% 0.6553 0.7455 High False Positives: misclassifies human QA