Corpus
Nº de entradas: 54Detalles Cerrar β
Etiquetas: interacciones conversacionales corpus de vídeo
Descripción: El Corpus GestINF es un corpus audiovisual de interacciones conversacionales que pretende ajustar, de la forma más precisa posible, las diferentes coordenadas que nos pueden ayudar a determinar la configuración informativa que está detrás de cualquier intercambio comunicativo, desde los distintos niveles de anidamiento del conocimiento compartido comunitario y personal (Clark, 1996) hasta los diferentes grados de activación informativa (Prince 1992; Chafe 1994; Dryer, 1996). Para controlar lo...
Detalles Cerrar β
Etiquetas: variedades del español español rural corpus oral corpus sonoro
Descripción: El Corpus Oral y Sonoro del Español Rural está formado por grabaciones de la lengua hablada en enclaves rurales de la Península Ibérica. Las entrevistas se obtuvieron con el propósito de ofrecer una muestra representativa de la variedad dialectal, pero también permiten conocer los modos de vida en el campo en la época previa a la mecanización agraria y a la despoblación rural.
Detalles Cerrar β
Etiquetas: textos académicos
Descripción: El proyecto HARTA, Herramienta de Ayuda a la Redacción de Textos Académicos, ofrece un entorno de acceso abierto que tiene como objetivo ayudar a usar adecuadamente expresiones académicas como colocaciones (análisis detallado, estudio pormenorizado, corroborar una hipótesis) y fórmulas (a continuación, con el propósito de). HARTA ofrece la posibilidad de realizar consultas directas, bien a partir de un nombre como estudio para encontrar sus colocaciones, bien a partir de una...
Detalles Cerrar β
Etiquetas: corpus sonoro corpus de páginas web corpus oral corpus general
Descripción: Corpus creado por Mark Davies. Tiene cinco componentes: Género / Histórico Este es el Corpus del Español "original" (2001). El corpus contiene 100 millones de palabras de entre el siglo XIII y el siglo XX, y se puede utilizar para analizar la historia del español. Para el siglo XX, los datos están divididos equitativamente entre textos orales, de ficción, de periódicos y académicos, lo que permite realizar búsquedas para comparar géneros en español. Web / Dialectos Adición al...
Detalles Cerrar β
Etiquetas: corpus de estudiantes corpus escrito estudiantes japoneses
Descripción: Aplicación de consulta El Corpus de ELE en Japón (CELEN) es un corpus de aprendices de español cuya primera lengua es el japonés. Los datos que lo forman proceden de diversos contextos: el ámbito universitario, donde el español puede estudiarse como asignatura de lengua extranjera o como carrera, y contextos de aprendizaje informal en Internet como blogs electrónicos y foros. La versión 1.2, de abril de 2023, está compuesta por 6.196 textos escritos por 1.035 aprendices, con un total de...
Detalles Cerrar β
Etiquetas: corpus general corpus de referencia corpus escrito corpus oral
Descripción: En el congreso celebrado en Medellín en marzo de 2007, las academias de la lengua española acordaron encomendar a la Real Academia Española la construcción del Corpus del Español del Siglo XXI (CORPES XXI), formado por textos escritos y orales procedentes de España, América, Filipinas y Guinea Ecuatorial con una distribución de 25 millones de formas por cada uno de los años correspondientes al siglo XXI.En enero de 2023 se publicó la versión 0.99, con más de 357 000 documentos y más de 381...
Detalles Cerrar β
Etiquetas: corpus oral corpus sonoro variedades del español inmigrantes
Descripción: Los movimientos migratorios han transformado las ciudades en puntos multiculturales y plurilingües mediante procesos de gran complejidad social que han tenido su reflejo en las lenguas. Como resultado de la mezcla y el contacto de personas de distintos orígenes, las lenguas y los dialectos también entran en contacto, dando lugar a nuevas variedades del español. La Sociolingüística observa y analiza estas dinámicas de acomodación y de integración lingüística que caracterizan a los inmigrantes....
Detalles Cerrar β
Etiquetas: corpus general corpus de referencia
Descripción: El CREA cuenta, en su última versión (3.2, junio de 2008), con algo más de ciento sesenta millones de formas. Se compone de una amplia variedad de textos escritos y orales, producidos en todos los países de habla hispana desde 1975 hasta 2004. Los textos escritos, seleccionados tanto de libros como de periódicos y revistas, abarcan más de cien materias distintas. La lengua hablada está representada por transcripciones de documentos sonoros, obtenidos, en su mayor parte, de la radio y la...
Detalles Cerrar β
Etiquetas: combinaciones léxicas variedades del español colocaciones Colombia
Descripción: El Corpus léxico del español de Colombia recopila combinaciones léxicas, con criterio integral, es decir, las propias del país, las compartidas con otros países hispanoamericanos y con el español general. No se limita a los colombianismos. Se trata de un macroproyecto, planteado en fases sucesivas. Por combinaciones léxicas, nos referimos a todo tipo de unidades pluriverbales como compuestos, colocaciones, construcciones con verbos de apoyo, construcciones comparativas, locuciones, paremias (...
Detalles Cerrar β
Etiquetas: corpus diacrónico corpus diatópico español de América
Descripción: El Corpus Diacrónico y Diatópico del Español de América reúne tres conjuntos documentales; CORDIAM-Documentos, CORDIAM-Literatura y CORDIAM-Prensa. El CORDIAM contiene solo textos producidos en América. El CORDIAM tiene cuatro siglos de profundidad histórica. El primer documento corresponde al año 1494 y el último al año 1905. Abarca, por tanto, el período fundacional, el virreinal / colonial y el primer siglo de la mayoría de las independencias americanas. CORDIAM-Prensa contiene únicamente...
Detalles Cerrar β
Etiquetas: lenguaje científico corpus escrito
Descripción: "El corpus Iberia es una herramienta informática creada entre 2008 y 2009 en el seno del Consejo Superior de Investigaciones Científicas para los estudios sobre el español, lengua de la ciencia en la sociedad del conocimiento. Se trata de un corpus textual panhispánico sobre el discurso científico-técnico (1985-hoy). Los objetivos que persigue son los siguientes: (a) recopilar el mayor número posible de documentos científicos escritos en español, (b) actualizar permanentemente con la producción...
Detalles Cerrar β
Etiquetas: corpus de estudiantes corpus sonoro
Descripción: El objetivo del programa SPLLOC es promover la investigación sobre la adquisición del español como L2. El programa cuenta con dos proyectos SPLLOC 1 (abril 2006 - marzo 2008) y SPLLOC 2 (agosto 2008 - enero 2010). En ambos se recogen producciones de estudiantes de español de todos los niveles -de principiantes a avanzados- cuya primera lengua es el inglés. Como elemento de comparación el corpus también recoge producciones de hablantes nativos de español respondiendo a las mismas...
Detalles Cerrar β
Etiquetas: variedades del español corpus oral inmigrantes
Descripción: La ciudad de Sevilla (España) ha sido y sigue siendo receptora de nuevos habitantes de procedencia diferente, lo que la convierte en un punto multicultural y plurilingüe omnipresente en numerosos aspectos de la vida cotidiana. Con el objetivo de radiografiar esta diversidad, se ha elaborado el Corpus oral para el estudio del español de los migrantes residentes en la ciudad de Sevilla (Corpus.migra.sev), constituido por muestras de entrevistas semidirigidas de las diferentes...
Detalles Cerrar β
Etiquetas: corpus de estudiantes corpus sonoro
Descripción: El Corpus de aprendices de español como lengua extranjera (CAES) es un conjunto de textos escritos producidos por estudiantes de español con diferentes grados de dominio lingüistico (niveles A1 a C1 del Marco común europeo de referencia , aplicado al español en el Plan curricular del Instituto Cervantes. Niveles de referencia para el español ) y procedentes de once L1: alemán, árabe, chino mandarín, francés, griego, inglés, italiano, japonés, polaco, portugués y ruso. En su versión actual...
Detalles Cerrar β
Etiquetas: modelos de lenguaje corpus escrito
Descripción: RedPajama-Data-v2 es un corpus multilingüe de acceso abierto para el entrenamiento de modelos de lenguaje, que está formado por 30 billones de formas léxicas (tokens), repartidos en 20.000 millones de documentos de texto. RedPajama incluye cinco subcorpus multilingües de textos, respectivamente, en alemán, español, francés, inglés e italiano. El subcorpus del español tiene casi 3 billones de palabras (2.800.000.000.000). RedPajama está disponible en GitHub y también se...
Etiquetas
- corpus oral (25)
- corpus sonoro (11)
- corpus escrito (10)
- variedades del español (10)
- corpus de estudiantes (9)
- inmigrantes (8)
- estudiantes universitarios (6)
- español para fines específicos (5)
- interacciones conversacionales (5)
- corpus de vídeo (4)
- corpus general (4)
- humor (4)
- sinohablantes (4)
- actos de habla (3)
- hablantes de herencia (3)