Autoregressive Multi-trait Essay Scoring via Reinforcement Learning with Scoring-aware Multiple Rewards
Heejin Do, Sangwon Ryu, Gary Geunbae Lee
Abstract
Recent advances in automated essay scoring (AES) have shifted towards evaluating multiple traits to provide enriched feedback. Like typical AES systems, multi-trait AES employs the quadratic weighted kappa (QWK) to measure agreement with human raters, aligning closely with the rating schema; however, its non-differentiable nature prevents its direct use in neural network training. In this paper, we propose Scoring-aware Multi-reward Reinforcement Learning (SaMRL), which integrates actual evaluation schemes into the training process by designing QWK-based rewards with a mean-squared error penalty for multi-trait AES. Existing reinforcement learning (RL) applications in AES are limited to classification models despite associated performance degradation, as RL requires probability distributions; instead, we adopt an autoregressive score generation framework to leverage token generation probabilities for robust multi-trait score predictions. Empirical analyses demonstrate that SaMRL facilitates model training, notably enhancing scoring of previously inferior prompts.
Ask about this paper
Your agent reads all of it.
Lune indexed this paper to the last equation, along with the top-tier papers that cite it. Ask a question and the answer quotes them.
Your agent calls
Luneget_paper_fulltext
Free to start. No credit card required.
Terminal
Install the CLIlune papers fulltext ada36c6b-b49e-4f10-866f-ad826e96f376Builds on10
- Training language models to follow instructions with human feedbackLong Ouyang, Jeffrey Wu, Xu Jiang, Diogo Almeida et al.NeurIPS 2022 · 24,707 citations
- Learning to summarize with human feedbackNisan Stiennon, Long Ouyang, Jeffrey Wu, Daniel M. Ziegler et al.NeurIPS 2020 · 124 citations
- Automated Cross-prompt Scoring of Essay TraitsRobert Ridley, Liang He, Xin-Yu Dai, Shujian Huang et al.AAAI 2021 · 101 citations
- Training Large Language Models for Reasoning through Reverse Curriculum Reinforcement LearningZhiheng Xi, Wenxiang Chen, Boyang Hong, Senjie Jin et al.ICML 2024 · 70 citations
- Reinforcement Learning Can Be More Efficient with Multiple RewardsChristoph Dann, Yishay Mansour, Mehryar MohriICML 2023 · 24 citations
Related papers
- CEAES: Bidirectional Reinforcement Learning Optimization for Consistent and Explainable Essay AssessmentXia Li, Wenjing PanACL 2025 · 1 citation
- Multi-knowledge Enhanced Graph Neural Network for Multi-trait Essay ScoringShiman Zhao, Siyuan Liu, Zhiqi ShenAAAI 2026
- Improving Domain Generalization for Prompt-Aware Essay Scoring via Disentangled Representation LearningZhiwei Jiang, Tianyi Gao, Yafeng Yin, Meng Liu et al.ACL 2023 · 16 citations
- Mixture of Ordered Scoring Experts for Cross-prompt Essay Trait ScoringPo-Kai Chen, Bo-Wei Tsai, Shao-Kuan Wei, Chien-Yao Wang et al.ACL 2025
- Aggregating Multiple Heuristic Signals as Supervision for Unsupervised Automated Essay ScoringCong Wang, Zhiwei Jiang, Yafeng Yin, Zifeng Cheng et al.ACL 2023 · 4 citations
