Corpus
Nº de entradas: 54Detalles Cerrar β
Etiquetas: corpus oral interacciones conversacionales
Descripción: El CEEHNI (Corpus de Expresión Emocional – Hablantes Nativos de español de origen español en la India) es un corpus oral compuesto por grabaciones de audio de ocho españoles residentes en la India, obtenidas mediante entrevistas semiestructuradas realizadas en línea a través de la plataforma Zoom. Las situaciones comunicativas se diseñaron para provocar respuestas emocionales espontáneas y se presentaron en formato dialogado, en el que la entrevistadora asume el papel de interlocutora. Cada...
Detalles Cerrar β
Etiquetas: corpus oral inmigrantes hablantes de herencia
Descripción: El corpus EmoEsBel_Sit_HH (Emocionalidad y mantenimiento del español en Bélgica en narraciones de situaciones emocionales por hablantes de español como lengua de herencia) forma parte de una investigación sobre el panorama lingüístico, sociocultural y emocional de migrantes y hablantes de herencia con ascendencia española en Bélgica. El corpus está alojado en el portal TransferLAELE de la Universidad Nebrija. Recoge fragmentos de entrevistas en las que se pide a los participantes —descendientes...
Detalles Cerrar β
Etiquetas: corpus escrito lenguaje técnico
Descripción: La plataforma Vocabulario Artístico reúne tres recursos complementarios para el estudio del léxico artístico en español: el Archivo Azcárate (AZCARTE), con 55.907 entradas de tecnicismos de las bellas artes, las artes plásticas, la heráldica y la indumentaria; el Corpus Azcárate de terminología artística (CARTE), que permite realizar búsquedas a través de 37 documentos históricos que suman más de 1.698.628 palabras ortográficas, seleccionados de entre las fuentes más significativas del archivo...
Detalles Cerrar β
Etiquetas: medios de comunicación panhispánico variedades del español corpus oral
Descripción: El Corpus Radiofónico Panhispánico (CO.RA.PAN) parte de una constatación fundamental: a pesar de los avances en la descripción del español pluricéntrico, todavía falta una base empírica sistemática y comparable que permita medir y describir las variedades nacionales del español estándar en todo el ámbito hispanohablante. La mayoría de los estudios existentes se concentran en la variación comunitaria o en los niveles coloquiales, mientras que la lengua estándar hablada, es decir, aquella...
Detalles Cerrar β
Etiquetas: corpus diacrónico variedades del español
Descripción: CoDiECh (Corpus Diacrónico del Español de Chile) es un corpus lingüístico de carácter histórico que reúne textos producidos por autores nacionales en la variedad chilena del español. Su propósito es ofrecer una base documental representativa de la tradición impresa nacional —tanto literaria como no literaria—, destinada principalmente al análisis lingüístico del español de Chile durante los siglos XIX y XX. No obstante, dada su condición de archivo digital, el CoDiECh ofrece ventajas...
Detalles Cerrar β
Etiquetas: corpus de vídeo actos de habla pragmática
Descripción: El corpus está compuesto por 108 vídeos (36 para cada acto de habla) de una duración total de 108 minutos y sus correspondientes transcripciones, con un total de 18737 palabras transcritas en total.Acto de habla del rechazo: 5655 palabras, 35 minutos transcritos.Acto de habla del cumplido: 5906 palabras, 27 minutos transcritos.Acto de habla de la disculpa: 7176 palabras, 46 minutos transcritos.Las grabaciones comenzaron a recopilarse en el campus de la universidad de Middlebury en Vermont,...
Detalles Cerrar β
Etiquetas: humor corpus multimodal
Descripción: Humnet. Corpus de humor digital en español es una base de datos creada para estudiar el humor digital en español y comprender cómo nos reímos en internet. Este recurso permite analizar cómo evoluciona el lenguaje, cómo se crean comunidades en torno a la diversión compartida y cómo el humor refleja tendencias sociales, patrones comunicativos y cambios culturales.Humnet reúne diferentes tipos de contenidos humorísticos —memes, desmotivaciones, chistes y posts humorísticos— en distintos...
Detalles Cerrar β
Etiquetas: corpus oral interacciones conversacionales
Descripción: El Corpus Oral de Madrid ha sido grabado entre 2016 y 2019. Se trata de un corpus de habla oral que representa el habla de Madrid. En su versión actual consta de 106 conversaciones entre 485 hablantes madrileños, resultando en 57 horas de grabación y 469.860 palabras.El proyecto CORMA surgió para documentar el español conversacional espontáneo tal y como se presenta actualmente en Madrid. Se define por los rasgos siguientes:representa un corpus de interacciones lingüísticas en marcos y...
Detalles Cerrar β
Etiquetas: humor corpus escrito
Descripción: Humtext. Corpus de humor escrito es un corpus en línea diseñado específicamente para el estudio del humor escrito en publicaciones impresas, como periódicos, folletos, revistas, almanaques, libros, fascículos o fanzines. Este corpus complementa la base de datos multimodal Humcor, que recoge 125 años de producción oral humorística de distintas variedades del español de España, Hispanoamérica y Guinea Ecuatorial. ¿Qué incluye Humtext?Constituye una base de datos de textos humorísticos —chistes,...
Detalles Cerrar β
Etiquetas: corpus de vídeo corpus sonoro humor
Descripción: Humcor (Corpus Oral Multimodal de Humor en Español) es un corpus en línea diseñado específicamente para el estudio del humor en español. Se trata de una base de datos de textos humorísticos que incluyen géneros como chistes, monólogos, sketches y ventrílocuos, en dos modalidades principales (visual y auditiva), provenientes de programas de televisión y radio y diferentes soportes como discos de vinilo, de pizarra y cintas de cassettes. Este corpus incluye materiales de todas las décadas desde...
Detalles Cerrar β
Etiquetas: español actual
Descripción: El Corpus del Español Actual (CEA) tiene 540 millones de palabras y está lematizado y etiquetado con información morfológica y/o categorial. El CEA está integrado por los siguientes elementos: la parte española del corpus paralelo español-inglés Europarl: European Parliament Proceedings Parallel Corpus v. 6 (1996-2010), el módulo en lengua española del Wikicorpus v. 1.0, que contiene una parte importante de la Wikipedia (2006), y la sección en español del MultiUN: Multilingual UN Parallel Text...
Detalles Cerrar β
Etiquetas: corpus oral corpus sonoro hablantes de Galicia
Descripción: El corpus para el estudio del español oral ESLORA contiene 60 horas de entrevistas semidirigidas y 20 horas de conversaciones de hablantes de Galicia grabadas entre los años 2007 y 2015. Los registros sonoros se transcribieron ortográficamente con alineación texto-voz para facilitar el acceso inmediato al audio desde la transcripción. En el proceso de enriquecimiento del corpus se han desarrollado recursos para la lematización y el etiquetado morfosintáctico de los textos que permiten realizar...
Detalles Cerrar β
Etiquetas: corpus oral variedades del español
Descripción: PRESEEA es un proyecto para la creación de un corpus de lengua española hablada representativo del mundo hispánico en su variedad geográfica y social. Esos materiales se reúnen atendiendo a la diversidad sociolingüística de las comunidades de habla hispanohablantes. PRESEEA agrupa a cerca de 40 equipos de investigación sociolingüística. Es el fruto del trabajo coordinado de investigadores comprometidos con una metodología común para reunir un banco de materiales coherente que posibilite su...
Detalles Cerrar β
Etiquetas: español coloquial
Descripción: El corp recogido en esta web presenta una muestra de español coloquial. Esta versión del corpus consta de sesenta y seis conversaciones, que incluyen el núcleo de la versión anterior (corpus 2.1), al que se le añaden nuevas muestras conversacionales. Además, un subcorpus de quince conversaciones se ha segmentado en diferentes unidades de análisis: discursos, diálogos, turnos, intervenciones, actos y subactos, siguiendo la teoría de unidades conversacionales desarrollada por el grupo Val.Es.Co....
Detalles Cerrar β
Etiquetas: español para fines específicos español para la medicina
Descripción: RERCOR (Recursos sobre enfermedades raras) es un portal de recursos lingüísticos multilingües del ámbito biomédico sobre un amplio grupo de enfermedades que buscan mayor visibilidad y prioridad en las políticas de salud pública: las enfermedades raras (ER), también denominadas enfermedades minoritarias o huérfanas. RERCOR tiene como objetivo proporcionar herramientas multilingües que permitan conocer mejor los usos lingüísticos propios de este subdominio médico, especialmente su terminología y...
Etiquetas
- corpus oral (25)
- corpus sonoro (11)
- corpus escrito (10)
- variedades del español (10)
- corpus de estudiantes (9)
- inmigrantes (8)
- estudiantes universitarios (6)
- español para fines específicos (5)
- interacciones conversacionales (5)
- corpus de vídeo (4)
- corpus general (4)
- humor (4)
- sinohablantes (4)
- actos de habla (3)
- hablantes de herencia (3)