Corpus
Nº de entradas: 57Detalles Cerrar β
Etiquetas: corpus oral corpus sonoro hablantes de Galicia
Descripción: El corpus para el estudio del español oral ESLORA contiene 60 horas de entrevistas semidirigidas y 20 horas de conversaciones de hablantes de Galicia grabadas entre los años 2007 y 2015. Los registros sonoros se transcribieron ortográficamente con alineación texto-voz para facilitar el acceso inmediato al audio desde la transcripción. En el proceso de enriquecimiento del corpus se han desarrollado recursos para la lematización y el etiquetado morfosintáctico de los textos que permiten realizar...
Detalles Cerrar β
Etiquetas: corpus oral variedades del español
Descripción: PRESEEA es un proyecto para la creación de un corpus de lengua española hablada representativo del mundo hispánico en su variedad geográfica y social. Esos materiales se reúnen atendiendo a la diversidad sociolingüística de las comunidades de habla hispanohablantes. PRESEEA agrupa a cerca de 40 equipos de investigación sociolingüística. Es el fruto del trabajo coordinado de investigadores comprometidos con una metodología común para reunir un banco de materiales coherente que posibilite su...
Detalles Cerrar β
Etiquetas: español coloquial
Descripción: El corp recogido en esta web presenta una muestra de español coloquial. Esta versión del corpus consta de sesenta y seis conversaciones, que incluyen el núcleo de la versión anterior (corpus 2.1), al que se le añaden nuevas muestras conversacionales. Además, un subcorpus de quince conversaciones se ha segmentado en diferentes unidades de análisis: discursos, diálogos, turnos, intervenciones, actos y subactos, siguiendo la teoría de unidades conversacionales desarrollada por el grupo Val.Es.Co....
Detalles Cerrar β
Etiquetas: español para fines específicos español para la medicina
Descripción: RERCOR (Recursos sobre enfermedades raras) es un portal de recursos lingüísticos multilingües del ámbito biomédico sobre un amplio grupo de enfermedades que buscan mayor visibilidad y prioridad en las políticas de salud pública: las enfermedades raras (ER), también denominadas enfermedades minoritarias o huérfanas. RERCOR tiene como objetivo proporcionar herramientas multilingües que permitan conocer mejor los usos lingüísticos propios de este subdominio médico, especialmente su terminología y...
Detalles Cerrar β
Etiquetas: interacciones conversacionales corpus de vídeo
Descripción: El Corpus GestINF es un corpus audiovisual de interacciones conversacionales que pretende ajustar, de la forma más precisa posible, las diferentes coordenadas que nos pueden ayudar a determinar la configuración informativa que está detrás de cualquier intercambio comunicativo, desde los distintos niveles de anidamiento del conocimiento compartido comunitario y personal (Clark, 1996) hasta los diferentes grados de activación informativa (Prince 1992; Chafe 1994; Dryer, 1996). Para controlar lo...
Detalles Cerrar β
Etiquetas: variedades del español español rural corpus oral corpus sonoro
Descripción: El Corpus Oral y Sonoro del Español Rural está formado por grabaciones de la lengua hablada en enclaves rurales de la Península Ibérica. Las entrevistas se obtuvieron con el propósito de ofrecer una muestra representativa de la variedad dialectal, pero también permiten conocer los modos de vida en el campo en la época previa a la mecanización agraria y a la despoblación rural.
Detalles Cerrar β
Etiquetas: corpus sonoro ámbito comercial
Descripción: El corpus DIACOM-es es un corpus diacrónico especializado que reúne textos de ámbito comercial en lengua española. Se publicó en 2022 en el seno del Depto. de Lenguas y Literaturas Extranjeras de la Universidad de Verona (Italia) y ha continuado alimentándose anualmente. Recientemente (octubre de 2024), también se han ampliado sus posibilidades de explotación para los usuarios externos. El corpus se ha diseñado y estructurado siguiendo tres ejes: temporal, geográfico y funcional. - En cuanto al...
Detalles Cerrar β
Etiquetas: español de Estados Unidos
Descripción: El Corpus del Español en los Estados Unidos (CORPEEU) es un proyecto iniciado en el ?Observatorio de la lengua española y las culturas hispánicas? del Instituto Cervantes en la Universidad de Harvard, con la colaboración de la Academia Norteamericana de la Lengua Española (ANLE). Los trabajos para la construcción del CORPEEU comenzaron en el otoño de 2017, dentro de la Universidad de Harvard, pero previamente se hizo necesaria una detenida reflexión sobre las implicaciones y dificultades,...
Detalles Cerrar β
Etiquetas: corpus multilingüe estudiantes universitarios narrativa
Descripción: El corpus CALMER (Corpus comparable para el estudio de la Adquisición y de las Lenguas: Multilingüe, Emoción, Relato) está compuesto por relatos narrativos manuscritos inspirados en un mismo relato gráfico de temática emocional. Este corpus pretende constituir una base de datos para la exploración de cuestiones particulares sobre el uso y la adquisición lingüísticas. El dispositivo de recogida de datos se inspira en los estudios tipológicos sobre la conceptualización y expresión del movimiento...
Detalles Cerrar β
Etiquetas: corpus oral corpus escrito sinohablantes
Descripción: El corpus CorSinoELE. Corpus de español hablado y escrito por sinohablantes consta de 395 textos orales y escritos producidos por 99 hablantes chinos estudiantes de la Universidad de Beihua, situada en la región china de Jilin, con un nivel de español A2 y B1. Cada estudiante ha elaborado cuatro textos, dos orales y dos escritos, que suponen un total de 15:43:15 de grabación y 55.276 palabras. En cada modalidad de producción (oral y escrita) hay textos descriptivos y narrativos motivados a...
Detalles Cerrar β
Etiquetas: corpus sonoro corpus de vídeo corpus para la enseñanza
Descripción: Este sitio contiene grabaciones en vídeo de conversaciones naturales entre hablantes de español para ser usadas como fuentes de lengua en enseñanza y aprendizaje de esta lengua. Las grabaciones han sido hechas abordando a hablantes en lugares públicos o aprovechando reuniones de amigxs y familiares, sin guion ni ningún requerimiento previo. Bajo cada grabación, en la misma página, hay una breve descripción, una transcripción ortográfica, una lista de los elementos de lengua interesantes que...
Detalles Cerrar β
Etiquetas: corpus sonoro textos periodísticos
Descripción: AnCora es un corpus del catalán (AnCora-CA) y del español (AnCora-ES) con diferentes niveles de anotación: lema y categoría morfológica constituyentes y funciones sintácticas estructura argumental y papeles temáticos clase semántica verbal tipo denotativo de los nombres deverbales sentidos de WordNet nominales entidades nombradas relaciones de correferencia El corpus de cada lengua contiene 500.000 paraules y están constituidos fundamentalmente por textos periodísticos. Para más información,...
Detalles Cerrar β
Etiquetas: corpus sonoro corpus de páginas web corpus oral corpus general
Descripción: Corpus creado por Mark Davies. Tiene cinco componentes: Género / Histórico Este es el Corpus del Español "original" (2001). El corpus contiene 100 millones de palabras de entre el siglo XIII y el siglo XX, y se puede utilizar para analizar la historia del español. Para el siglo XX, los datos están divididos equitativamente entre textos orales, de ficción, de periódicos y académicos, lo que permite realizar búsquedas para comparar géneros en español. Web / Dialectos Adición al...
Detalles Cerrar β
Etiquetas: corpus de estudiantes corpus escrito estudiantes japoneses
Descripción: Aplicación de consulta El Corpus de ELE en Japón (CELEN) es un corpus de aprendices de español cuya primera lengua es el japonés. Los datos que lo forman proceden de diversos contextos: el ámbito universitario, donde el español puede estudiarse como asignatura de lengua extranjera o como carrera, y contextos de aprendizaje informal en Internet como blogs electrónicos y foros. La versión 1.2, de abril de 2023, está compuesta por 6.196 textos escritos por 1.035 aprendices, con un total de...
Detalles Cerrar β
Etiquetas: corpus general corpus de referencia corpus escrito corpus oral
Descripción: En el congreso celebrado en Medellín en marzo de 2007, las academias de la lengua española acordaron encomendar a la Real Academia Española la construcción del Corpus del Español del Siglo XXI (CORPES XXI), formado por textos escritos y orales procedentes de España, América, Filipinas y Guinea Ecuatorial con una distribución de 25 millones de formas por cada uno de los años correspondientes al siglo XXI.En enero de 2023 se publicó la versión 0.99, con más de 357 000 documentos y más de 381...
Etiquetas
- corpus oral (26)
- corpus escrito (12)
- corpus sonoro (11)
- variedades del español (11)
- corpus de estudiantes (10)
- inmigrantes (8)
- estudiantes universitarios (7)
- español para fines específicos (5)
- interacciones conversacionales (5)
- corpus de vídeo (4)
- corpus general (4)
- corpus multilingüe (4)
- humor (4)
- sinohablantes (4)
- actos de habla (3)