kaal:claim:5541658-032
Benchmark results for legal LLMs may overstate capability because of data contamination: if a model saw a benchmark's ground truth answers during training, its measured performance reflects memorization rather than genuine generalization.
Source quote, verbatim
If a model has already seen a benchmark's ground-truth answers during training, its performance may reflect memorization rather than genuine generalization, making it hard to assess its ability on truly unseen tasks.
From
Cite as
Holds when
Classification
failuresupport: evidencedfailure: benchmark data contaminationfamily: measurement-and-metric-failureeconomics
Verify