Inicio
todoELE
  • Inicio
  • Materiales
    • πŸ“‹ Actividades
    • πŸ“ Conjugación
    • πŸ“Š Corpus
    • πŸ“” Diccionarios
    • βœ… Evaluación
    • βš™οΈ Gramática
    • πŸ“— Manuales
    • ✍️ Ortografía
    • πŸ“… Programación
    • πŸ—£οΈ Pronunciación
    • πŸ“ Recursos
    • πŸ”€ Vocabulario
    • πŸ’» Herramientas digitales
  • Formación
    • πŸ“š Bibliografía
    • πŸ‘₯ Congresos
    • πŸŽ“ Cursos
    • 🏫 Centros
    • 🏒 Organizaciones
    • πŸ“° Revistas
    • 🌍 Atlas de ELE
  • Trabajo
    • πŸ’Ό Ofertas de trabajo
    • ℹ️ Trabajo - Recursos
  • En la red
    • 🌐 Sitios ELE
    • πŸ“° Agregador
    • πŸ“§ Formespa
  • IA
    • ✨ Nuevos contenidos
    • πŸ“š Bibliografía IA
    • 🧰 Herramientas IA
    • πŸ’¬ Prompts
    • πŸ§ͺ Experiencias IA
    • 🌐 Sitios web IA
    • πŸ“° Actualidad IA
  • Comunidad
    • πŸ“° Actualidad ELE
    • 😊 Anécdotas ELE
    • πŸ“ Blog
    • πŸ“ŒTablón de anuncios
  • Buscar

Ruta de navegación

  • Inicio
  • Bibliografia
  • Large Language Models for L2 Italian Writing Assessment: Effects of Prompt, Fine-Tuning, and Data Balance

Sección IA: Inteligencia artificial Bibliografía

Large Language Models for L2 Italian Writing Assessment: Effects of Prompt, Fine-Tuning, and Data Balance

Wenqian Huang
Pengzhan Yang
Guangyuan Yao
2026
Language Teaching Research
https://journals.sagepub.com/doi/10.117…
artículo
estudio empírico
evaluación
expresión escrita
grandes modelos de lenguaje
inteligencia artificial
MCER
enseñanza/aprendizaje de lenguas
IA y evaluación
modelos de lenguaje (LLM)
prompts

This study systematically evaluates generative pre-trained transformer (GPT)-based large language models for the automated writing evaluation of Italian as a second language (L2). Drawing on 1,832 learner texts, we compare six GPT-based experimental conditions: zero-shot and few-shot prompting with GPT-4.1 and GPT-5, and two fine-tuned GPT-4.1 models trained on either class-balanced or proportionally distributed datasets. Model performance against human common European framework of reference for languages (CEFR)-based ratings is examined using exact agreement, correlation coefficients, Quadratic Weighted Kappa, precision, recall, and F1-scores. Results reveal a clear hierarchy: the balanced fine-tuned GPT-4.1 model achieves near-operational reliability, whereas all prompting-based methods, including GPT-5, remain substantially weaker. Training data balance emerges as critical, as class-imbalanced fine-tuning was associated with weaker performance on high- and low-level texts. The findings highlight the need for balanced, language-specific corpora and task-aligned fine-tuning in L2 Italian automated writing assessment.

  • Inicie sesión para enviar comentarios

Enviar publicación

Contenidos relacionados

  • How well can LLMs grade essays in Arabic?
  • Large language models and automated essay scoring of English language learner writing: Insights into validity and reliability
  • EvalYaks: Instruction tuning datasets and LoRA fine-tuned models for automated scoring of CEFR B2 speaking assessment transcripts
  • A framework for evaluation of large language models in essay assessment: Reliability, alignment, and causal reasoning
  • Opening the blackbox of LLM-based automated essay scoring: Insights into feature weighting patterns and score validity
  • Level-specific feedback generation for scene descriptions via fine-tuning multimodal large language models
Sobre Todoele Índice Publica Contacto: todoele@gmail.com
Política de privacidad Créditos