Tripartite Evidence & Classification
Non-binary probabilistic calibration
Calibrated Authorial Diagnostic
Mixed / Uncertain Classification
Statistical
Total Words:
71
Lexical TTR:
0.831
Avg Word Len:
6.4 chars
Sentence Variance:
3.2
Stylometric
Function Words:
0.394
Punctuation Density:
0.056
Pronoun Ratio:
0.000
Contractions:
0
Semantic / TF-IDF
Bigram Repetition:
0.000
Domain Coherence:
0.88
TF-IDF Sparsity:
0.91
Perplexity Proxy:
Moderate
Empirical In-Domain vs. Cross-Dataset Transfer Matrix
| Training → Evaluation Benchmark | Model Architecture | Accuracy | F1 Score | ROC-AUC | Observed Error Vulnerability |
|---|---|---|---|---|---|
| HC3 → HC3 (In-Domain QA) | Hybrid + Linear SVM | 98.62% | 0.9839 | 0.9986 | Near-zero in-distribution error |
| DAIGT → DAIGT (In-Domain Essays) | Semantic + Linear SVM | 99.54% | 0.9943 | 0.9999 | Extremely high benchmark fidelity |
| HC3 → DAIGT (Cross-Domain) | Hybrid + Linear SVM | 67.11% | 0.5468 | 0.6139 | High False Negatives: misses AI essays |
| DAIGT → HC3 (Cross-Domain) | Hybrid + Linear SVM | 62.03% | 0.6553 | 0.7455 | High False Positives: misclassifies human QA |