Inicio
todoELE
  • Inicio
  • Materiales
    • πŸ“‹ Actividades
    • πŸ“ Conjugación
    • πŸ“Š Corpus
    • πŸ“” Diccionarios
    • βœ… Evaluación
    • βš™οΈ Gramática
    • πŸ“— Manuales
    • ✍️ Ortografía
    • πŸ“… Programación
    • πŸ—£οΈ Pronunciación
    • πŸ“ Recursos
    • πŸ”€ Vocabulario
    • πŸ’» Herramientas digitales
  • Formación
    • πŸ“š Bibliografía
    • πŸ‘₯ Congresos
    • πŸŽ“ Cursos
    • 🏫 Centros
    • 🏒 Organizaciones
    • πŸ“° Revistas
    • 🌍 Atlas de ELE
  • Trabajo
    • πŸ’Ό Ofertas de trabajo
    • ℹ️ Trabajo - Recursos
  • En la red
    • 🌐 Sitios ELE
    • πŸ“° Agregador
    • πŸ“§ Formespa
  • IA
    • ✨ Nuevos contenidos
    • πŸ“š Bibliografía IA
    • 🧰 Herramientas IA
    • πŸ’¬ Prompts
    • πŸ§ͺ Experiencias IA
    • 🌐 Sitios web IA
    • πŸ“° Actualidad IA
  • Comunidad
    • πŸ“° Actualidad ELE
    • 😊 Anécdotas ELE
    • πŸ“ Blog
    • πŸ“ŒTablón de anuncios
  • Buscar

Ruta de navegación

  • Inicio
  • Bibliografia
  • Evaluating large language models as raters in large-scale writing assessments: A psychometric framework for reliability and validity

Sección IA: Inteligencia artificial Bibliografía

Evaluating large language models as raters in large-scale writing assessments: A psychometric framework for reliability and validity

Yuehan Wang
Jinyan Huang
Lun Du
Yuxin Guo
Ying Liu
Rong Wang
2025
Computers & Education: Artificial Intelligence
9
https://www.sciencedirect.com/science/a…
artículo
estudio empírico
inteligencia artificial
expresión escrita
evaluación
grandes modelos de lenguaje
IA y enseñanza-aprendizaje de lenguas
IA y evaluación
modelos de lenguaje (LLM)
estudio empírico

Texto completo

In large-scale international writing assessments, human raters often exhibit inconsistency, undermining reliability and validity. Large language models (LLMs) offer a potential solution, but their assessment reliability remains underexplored. This study employed generalizability theory and many-facet Rasch modeling to compare human and LLM raters across three essay genres (4315 samples).Findings reveal that human-LLM discrepancies stem from fundamental evaluation differences, with minimal divergence in key-point scoring. Humans excel in holistic scoring scenarios but struggle with complex analytical rubrics where LLMs demonstrate advantages. While LLMs perform adequately for relative ranking tasks, they remain less reliable for absolute standard judgments. Claude models exhibited superior scoring stability compared to GPT models, approaching perfect reliability in key-point scoring. Detailed hierarchical rubrics enabled LLMs to achieve human-comparable consistency even on subjective dimensions.Both human and LLM raters demonstrated random scoring behaviors with different patterns. LLMs rely on surface similarities rather than deep semantic understanding, while humans struggle with lengthy, complex rubrics. All scoring systems suffered from restriction-of-range effects, with model scores clustering around specific rating levels (particularly scores 2-4). Additionally, GPT models and human raters both exhibited halo effects, where overall scores were heavily influenced by single dominant dimensions.Information function analysis indicated humans better suit broad-spectrum assessment, while LLMs excel at fine-grained evaluation within narrow intervals. Regarding severity, humans typically assigned higher scores than LLMs, with GPT models being most stringent and Claude positioned intermediately.These findings contribute significantly to educational assessment by establishing a systematic framework for evaluating automated scoring systems.

Texto completo en abierto (CC BY-NC 4.0).
  • Inicie sesión para enviar comentarios

Enviar publicación

Contenidos relacionados

  • How well can LLMs grade essays in Arabic?
  • LLMs do not grade essays like humans
  • Large language models and automated essay scoring of English language learner writing: Insights into validity and reliability
  • A framework for evaluation of large language models in essay assessment: Reliability, alignment, and causal reasoning
  • Opening the blackbox of LLM-based automated essay scoring: Insights into feature weighting patterns and score validity
  • Enhancing language learning through generative AI feedback on picture-cued writing tasks
Sobre Todoele Índice Publica Contacto: todoele@gmail.com
Política de privacidad Créditos