Corpus: corpus escrito
Nº de entradas: 10Detalles Cerrar β
Etiquetas: humor corpus escrito corpus oral corpus de estudiantes
Descripción: Observahumor.com es un portal de la Universidad de Alicante que ofrece acceso libre a varios subcorpus de humor en español, diseñados para la investigación en pragmática y lingüística del humor. El portal reúne datos procedentes de géneros y contextos muy variados: 1.158 narraciones humorísticas escritas por niños y niñas de 8, 10 y 12 años de toda España; 105 secuencias extraídas de columnas periodísticas; 149 secuencias irónico-humorísticas de conversaciones coloquiales; 69 secuencias de...
Detalles Cerrar β
Etiquetas: corpus oral corpus escrito
Descripción: Se trata de un proyecto de compartición de corpus que han sido recogidos en ocasión de investigaciones del Grupo Nebrija-LAELE (Lingüística Aplicada a la Enseñanza de Lenguas Extranjeras), tanto en Proyectos I + D como en base a la tarea didáctica que se desarrolla en los ámbitos de posgrado del Departamento de Lenguas Aplicadas de la Universidad Nebrija. El objetivo es poner a disposición de los estudiosos y de los docentes de Español como lengua nativa, segunda y extranjera un portal que...
Detalles Cerrar β
Etiquetas: corpus escrito lenguaje técnico
Descripción: La plataforma Vocabulario Artístico reúne tres recursos complementarios para el estudio del léxico artístico en español: el Archivo Azcárate (AZCARTE), con 55.907 entradas de tecnicismos de las bellas artes, las artes plásticas, la heráldica y la indumentaria; el Corpus Azcárate de terminología artística (CARTE), que permite realizar búsquedas a través de 37 documentos históricos que suman más de 1.698.628 palabras ortográficas, seleccionados de entre las fuentes más significativas del archivo...
Detalles Cerrar β
Etiquetas: humor corpus escrito
Descripción: Humtext. Corpus de humor escrito es un corpus en línea diseñado específicamente para el estudio del humor escrito en publicaciones impresas, como periódicos, folletos, revistas, almanaques, libros, fascículos o fanzines. Este corpus complementa la base de datos multimodal Humcor, que recoge 125 años de producción oral humorística de distintas variedades del español de España, Hispanoamérica y Guinea Ecuatorial. ¿Qué incluye Humtext?Constituye una base de datos de textos humorísticos —chistes,...
Detalles Cerrar β
Etiquetas: corpus escrito corpus de estudiantes corpus para el análisis de errores
Descripción: Cuadernillo del corpus Muestras de textos para descargar: Nivel A2 - Plataforma Nivel B1 - Umbral Nivel B2 - Avanzado Nivel C1 - Dominio operativo eficaz "[...] el análisis de errores cometidos por los estudiantes extranjeros que aprenden español es un campo de investigación que todavía no ha alcanzado en España el desarrollo y la amplitud que serían deseables, entre otras razones tal vez por la no existencia de corpus lingüísticos que permitan analizar de manera sistemática los errores...
Detalles Cerrar β
Etiquetas: corpus general corpus de referencia corpus escrito corpus oral
Descripción: En el congreso celebrado en Medellín en marzo de 2007, las academias de la lengua española acordaron encomendar a la Real Academia Española la construcción del Corpus del Español del Siglo XXI (CORPES XXI), formado por textos escritos y orales procedentes de España, América, Filipinas y Guinea Ecuatorial con una distribución de 25 millones de formas por cada uno de los años correspondientes al siglo XXI.En enero de 2023 se publicó la versión 0.99, con más de 357 000 documentos y más de 381...
Detalles Cerrar β
Etiquetas: corpus oral corpus escrito sinohablantes
Descripción: El corpus CorSinoELE. Corpus de español hablado y escrito por sinohablantes consta de 395 textos orales y escritos producidos por 99 hablantes chinos estudiantes de la Universidad de Beihua, situada en la región china de Jilin, con un nivel de español A2 y B1. Cada estudiante ha elaborado cuatro textos, dos orales y dos escritos, que suponen un total de 15:43:15 de grabación y 55.276 palabras. En cada modalidad de producción (oral y escrita) hay textos descriptivos y narrativos motivados a...
Detalles Cerrar β
Etiquetas: corpus de estudiantes corpus escrito estudiantes japoneses
Descripción: Aplicación de consulta El Corpus de ELE en Japón (CELEN) es un corpus de aprendices de español cuya primera lengua es el japonés. Los datos que lo forman proceden de diversos contextos: el ámbito universitario, donde el español puede estudiarse como asignatura de lengua extranjera o como carrera, y contextos de aprendizaje informal en Internet como blogs electrónicos y foros. La versión 1.2, de abril de 2023, está compuesta por 6.196 textos escritos por 1.035 aprendices, con un total de...
Detalles Cerrar β
Etiquetas: lenguaje científico corpus escrito
Descripción: "El corpus Iberia es una herramienta informática creada entre 2008 y 2009 en el seno del Consejo Superior de Investigaciones Científicas para los estudios sobre el español, lengua de la ciencia en la sociedad del conocimiento. Se trata de un corpus textual panhispánico sobre el discurso científico-técnico (1985-hoy). Los objetivos que persigue son los siguientes: (a) recopilar el mayor número posible de documentos científicos escritos en español, (b) actualizar permanentemente con la producción...
Detalles Cerrar β
Etiquetas: modelos de lenguaje corpus escrito
Descripción: RedPajama-Data-v2 es un corpus multilingüe de acceso abierto para el entrenamiento de modelos de lenguaje, que está formado por 30 billones de formas léxicas (tokens), repartidos en 20.000 millones de documentos de texto. RedPajama incluye cinco subcorpus multilingües de textos, respectivamente, en alemán, español, francés, inglés e italiano. El subcorpus del español tiene casi 3 billones de palabras (2.800.000.000.000). RedPajama está disponible en GitHub y también se...
Etiquetas
- corpus oral (25)
- corpus sonoro (11)
- corpus escrito (10)
- variedades del español (10)
- corpus de estudiantes (9)
- inmigrantes (8)
- estudiantes universitarios (6)
- español para fines específicos (5)
- interacciones conversacionales (5)
- corpus de vídeo (4)
- corpus general (4)
- humor (4)
- sinohablantes (4)
- actos de habla (3)
- hablantes de herencia (3)