Inicio
todoELE
  • Inicio
  • Materiales
    • πŸ“‹ Actividades
    • πŸ“ Conjugación
    • πŸ“Š Corpus
    • πŸ“” Diccionarios
    • βœ… Evaluación
    • βš™οΈ Gramática
    • πŸ“— Manuales
    • ✍️ Ortografía
    • πŸ“… Programación
    • πŸ—£οΈ Pronunciación
    • πŸ“ Recursos
    • πŸ”€ Vocabulario
    • πŸ’» Herramientas digitales
  • Formación
    • πŸ“š Bibliografía
    • πŸ‘₯ Congresos
    • πŸŽ“ Cursos
    • 🏫 Centros
    • 🏒 Organizaciones
    • πŸ“° Revistas
    • 🌍 Atlas de ELE
  • Trabajo
    • πŸ’Ό Ofertas de trabajo
    • ℹ️ Trabajo - Recursos
  • En la red
    • 🌐 Sitios ELE
    • πŸ“° Agregador
    • πŸ“§ Formespa
  • IA
    • ✨ Nuevos contenidos
    • πŸ“š Bibliografía IA
    • 🧰 Herramientas IA
    • πŸ’¬ Prompts
    • πŸ§ͺ Experiencias IA
    • 🌐 Sitios web IA
    • πŸ“° Actualidad IA
  • Comunidad
    • πŸ“° Actualidad ELE
    • 😊 Anécdotas ELE
    • πŸ“ Blog
    • πŸ“ŒTablón de anuncios
  • Buscar

Ruta de navegación

  • Inicio
  • Bibliografia
  • How to train your dragon: Evaluating prompting and fine-tuning for GPT-based item generation in L2 listening assessment

Sección IA: Inteligencia artificial Bibliografía

How to train your dragon: Evaluating prompting and fine-tuning for GPT-based item generation in L2 listening assessment

Vahid Aryadoust
Joann Wong
2026
Computers & Education: Artificial Intelligence
10
https://www.sciencedirect.com/science/a…
artículo
estudio empírico
inteligencia artificial
comprensión oral
evaluación
creación de materiales
ChatGPT
enseñanza/aprendizaje de lenguas
herramientas
tecnología educativa
IA y enseñanza-aprendizaje de lenguas
IA y evaluación
IA y creación de materiales
prompts
chatGPT
estudio empírico

Texto completo

Recent advances in large language models (LLMs), notably GPT models, have introduced new possibilities for automatic item generation (AIG) through prompt engineering. Although iterative prompt refinement can yield measurable improvements, this process eventually plateaus, as outputs remain inconsistent or misaligned with assessment constructs. This study reports an experimental comparison of prompting and fine-tuning to advance AIG for L2 listening assessment. First, we employed prompting and refined the instruction design over three successive iterations to determine an optimized prompt. We then fine-tuned GPT-4.1 using the same optimized prompt, holding prompt design constant to isolate the effect of model adaptation. We generated a total of 40 tests and 240 multiple-choice items in the four model conditions: three prompt-only iterations and one fine-tuned iteration. To contextualize model performance against professional assessment standards, we also compared the GPT-generated items with 245 expert-generated listening items used as the fine-tuning dataset. The generated items were evaluated using a hybrid two-tiered framework that combined rule-based metrics with human review to assess content validity and scalability. Fine-tuning produced stronger outcomes overall, yielding items that were more contextually grounded, linguistically coherent, and balanced than those generated through prompting alone, with some requiring minimal or no revision; however, generating higher-order items involving discourse-level reasoning remained challenging. The expert comparison showed that fine-tuned items performed comparably to expert-authored items on passage dependence but remained relatively weaker in avoiding absolute language and in targeting localized spans of necessary information. Additionally, issues such as longest-correct-option bias and uneven key distribution persisted, indicating limitations inherent in LLM-generated items. These findings demonstrate the value of fine-tuning for improving item quality and stability, while underscoring the continued need for multidimensional evaluation frameworks and expert benchmarking to ensure construct-aligned, valid assessment design.

Texto completo en abierto (CC BY 4.0).
  • Inicie sesión para enviar comentarios

Enviar publicación

Contenidos relacionados

  • Prompting With Purpose: Designing AI Interactions for Language Learning
  • Teacher feedback and ChatGPT feedback on Chinese university EFL learners’ English essay revision: A mixed-methods study
  • Using AI to Implement Effective Teaching Strategies in Classrooms: Five Strategies, Including Prompts
  • Exploring the use of Generative Artificial Intelligence (GenAI) in English language teaching: Voices from in-service teachers at an early-adopting Hong Kong secondary school
  • La inteligencia artificial generativa: una innovación transformadora en la enseñanza de lenguas
  • Análisis de textos generados por ChatGPT para la enseñanza del español: complejidad y adecuación a niveles de competencia
Sobre Todoele Índice Publica Contacto: todoele@gmail.com
Política de privacidad Créditos