EACL 2026 · Long Paper
A creative-writing evaluation benchmark with 43k training pairs and a 2.5k-pair debiased, human-labeled test set. Trained reward models improved human-preference agreement by 5 points over the strongest zero-shot judge.
EACL 2026 · Long Paper
A creative-writing evaluation benchmark with 43k training pairs and a 2.5k-pair debiased, human-labeled test set. Trained reward models improved human-preference agreement by 5 points over the strongest zero-shot judge.