mailroom-dataset Corpus

EDA Dashboard — Generated 2026-09-13 · Pipeline run_all.py (P0–P6) · Data Lucius-Morningstar/mailroom-dataset v1 (corpus v9)
3,302
Documents
5
Doc Types
55
Strata
7.2×
Imbalance Ratio
13,753
CUAD Spans
100%
Offset Match

Corpus Composition

33.3%
18.2%
30.3%
4.6%
13.6%
insurance_claim — 1,100 contract — 600 correspondence — 1,000 merger_agreement — 152 corporate_record — 450

Key Findings

  • Token budget: 77% ≤4k; 90% ≤16k; 93% ≤32k; 100% ≤128k
  • CUAD: 509 contracts × 41 clause types; 13,753 spans, 100% exact offset
  • MAUD: 152 agreements × 22 tasks
  • Insurance: 13/13 fields 100% filled; coverage determination fully populated
  • Correspondence: intent 100% hydrated (1000 rows; aeslc_join 162; heuristic 105; llm_zero_shot 637; manual 96)
  • Split: train 2,979 / test 323 (9.8%)

Interactive Charts

04_text_length_violin
05_token_budget_coverage
06_text_length_ecdf
08_cuad_clause_presence
09_cuad_span_counts
10_cuad_top_clauses
11_cuad_cooccurrence
13_maud_task_frequency
14_maud_answer_distribution
16_claim_amount
17_coverage_determination
18_claim_dates
20_corr_topic_intent
23_imbalance_treemap
24_strata_ratio
26_filing_timeline
27_source_proportions
30_metadata_heatmap

Data Tables (17)

Full Summary Report

Loading...