Inicio
todoELE
  • Inicio
  • Materiales
    • πŸ“‹ Actividades
    • πŸ“ Conjugación
    • πŸ“Š Corpus
    • πŸ“” Diccionarios
    • βœ… Evaluación
    • βš™οΈ Gramática
    • πŸ“— Manuales
    • ✍️ Ortografía
    • πŸ“… Programación
    • πŸ—£οΈ Pronunciación
    • πŸ“ Recursos
    • πŸ”€ Vocabulario
    • πŸ’» Herramientas digitales
  • Formación
    • πŸ“š Bibliografía
    • πŸ‘₯ Congresos
    • πŸŽ“ Cursos
    • 🏫 Centros
    • 🏒 Organizaciones
    • πŸ“° Revistas
    • 🌍 Atlas de ELE
  • Trabajo
    • πŸ’Ό Ofertas de trabajo
    • ℹ️ Trabajo - Recursos
  • En la red
    • 🌐 Sitios ELE
    • πŸ“° Agregador
    • πŸ“§ Formespa
  • IA
    • ✨ Nuevos contenidos
    • πŸ“š Bibliografía IA
    • 🧰 Herramientas IA
    • πŸ’¬ Prompts
    • πŸ§ͺ Experiencias IA
    • 🌐 Sitios web IA
    • πŸ“° Actualidad IA
  • Comunidad
    • πŸ“° Actualidad ELE
    • 😊 Anécdotas ELE
    • πŸ“ Blog
    • πŸ“ŒTablón de anuncios
  • Buscar

Ruta de navegación

  • Inicio
  • Corpus

Corpus

Nº de entradas: 54
Paginación
  • Primera página «
  • Página anterior ‹
  • Página 1
  • Página 2
  • Página actual 3
  • Página 4
  • Siguiente página ›
  • Última página »
Corpus de artículos científicos - HARTA
http://www.dicesp.com:8083/
Detalles Cerrar βœ•

Etiquetas: textos académicos

Descripción: El proyecto HARTA, Herramienta de Ayuda a la Redacción de Textos Académicos, ofrece un entorno de acceso abierto que tiene como objetivo ayudar a usar adecuadamente expresiones académicas como colocaciones (análisis detallado, estudio pormenorizado, corroborar una hipótesis) y fórmulas (a continuación, con el propósito de). HARTA ofrece la posibilidad de realizar consultas directas, bien a partir de un nombre como estudio para encontrar sus colocaciones, bien a partir de una...

Ver ficha completa

Corpus del Español Actual (CEA)
https://spanishfn.org/tools/cea/spanish
Detalles Cerrar βœ•

Etiquetas: español actual

Descripción: El Corpus del Español Actual (CEA) tiene 540 millones de palabras y está lematizado y etiquetado con información morfológica y/o categorial. El CEA está integrado por los siguientes elementos: la parte española del corpus paralelo español-inglés Europarl: European Parliament Proceedings Parallel Corpus v. 6 (1996-2010), el módulo en lengua española del Wikicorpus v. 1.0, que contiene una parte importante de la Wikipedia (2006), y la sección en español del MultiUN: Multilingual UN Parallel Text...

Ver ficha completa

ESLORA - Corpus para el estudio de la lengua oral
http://eslora.usc.es/
Detalles Cerrar βœ•

Etiquetas: corpus oral corpus sonoro hablantes de Galicia

Descripción: El corpus para el estudio del español oral ESLORA contiene 60 horas de entrevistas semidirigidas y 20 horas de conversaciones de hablantes de Galicia grabadas entre los años 2007 y 2015. Los registros sonoros se transcribieron ortográficamente con alineación texto-voz para facilitar el acceso inmediato al audio desde la transcripción. En el proceso de enriquecimiento del corpus se han desarrollado recursos para la lematización y el etiquetado morfosintáctico de los textos que permiten realizar...

Ver ficha completa

Corpus de Referencia del Español Actual (CREA)
https://www.rae.es/banco-de-datos/crea
Detalles Cerrar βœ•

Etiquetas: corpus general corpus de referencia

Descripción: El CREA cuenta, en su última versión (3.2, junio de 2008), con algo más de ciento sesenta millones de formas. Se compone de una amplia variedad de textos escritos y orales, producidos en todos los países de habla hispana desde 1975 hasta 2004. Los textos escritos, seleccionados tanto de libros como de periódicos y revistas, abarcan más de cien materias distintas. La lengua hablada está representada por transcripciones de documentos sonoros, obtenidos, en su mayor parte, de la radio y la...

Ver ficha completa

Corpus léxico del español de Colombia
https://clicc.caroycuervo.gov.co/corpus…
Detalles Cerrar βœ•

Etiquetas: combinaciones léxicas variedades del español colocaciones Colombia

Descripción: El Corpus léxico del español de Colombia recopila combinaciones léxicas, con criterio integral, es decir, las propias del país, las compartidas con otros países hispanoamericanos y con el español general. No se limita a los colombianismos. Se trata de un macroproyecto, planteado en fases sucesivas. Por combinaciones léxicas, nos referimos a todo tipo de unidades pluriverbales como compuestos, colocaciones, construcciones con verbos de apoyo, construcciones comparativas, locuciones, paremias (...

Ver ficha completa

Corpus Diacrónico y Diatópico del Español de América (CORDIAM)
http://www.cordiam.org/
Detalles Cerrar βœ•

Etiquetas: corpus diacrónico corpus diatópico español de América

Descripción: El Corpus Diacrónico y Diatópico del Español de América reúne tres conjuntos documentales; CORDIAM-Documentos, CORDIAM-Literatura y CORDIAM-Prensa. El CORDIAM contiene solo textos producidos en América. El CORDIAM tiene cuatro siglos de profundidad histórica. El primer documento corresponde al año 1494 y el último al año 1905. Abarca, por tanto, el período fundacional, el virreinal / colonial y el primer siglo de la mayoría de las independencias americanas. CORDIAM-Prensa contiene únicamente...

Ver ficha completa

Corpus Iberia
http://iberia.cchs.csic.es/cgi-bin/iber…
Detalles Cerrar βœ•

Etiquetas: lenguaje científico corpus escrito

Descripción: "El corpus Iberia es una herramienta informática creada entre 2008 y 2009 en el seno del Consejo Superior de Investigaciones Científicas para los estudios sobre el español, lengua de la ciencia en la sociedad del conocimiento. Se trata de un corpus textual panhispánico sobre el discurso científico-técnico (1985-hoy). Los objetivos que persigue son los siguientes: (a) recopilar el mayor número posible de documentos científicos escritos en español, (b) actualizar permanentemente con la producción...

Ver ficha completa

Spanish Learner Language Oral Corpora (SPLLOC)
https://web-archive.southampton.ac.uk/w…
Detalles Cerrar βœ•

Etiquetas: corpus de estudiantes corpus sonoro

Descripción: El objetivo del programa SPLLOC es promover la investigación sobre la adquisición del español como L2.  El programa cuenta con dos proyectos SPLLOC 1 (abril 2006 - marzo 2008) y SPLLOC 2 (agosto 2008 - enero 2010). En ambos se recogen producciones de estudiantes de español de todos los niveles -de principiantes a avanzados- cuya primera lengua es el inglés. Como elemento de comparación el corpus también recoge producciones de hablantes nativos de español respondiendo a las mismas...

Ver ficha completa

Corpus oral del español de los migrantes residentes en la ciudad de Sevilla
https://corpusmigrasev.snlt.es/
Detalles Cerrar βœ•

Etiquetas: variedades del español corpus oral inmigrantes

Descripción: La ciudad de Sevilla (España) ha sido y sigue siendo receptora de nuevos habitantes de procedencia diferente, lo que la convierte en un punto multicultural y plurilingüe omnipresente en numerosos aspectos de la vida cotidiana. Con el objetivo de radiografiar esta diversidad, se ha elaborado el Corpus oral para el estudio del español de los migrantes residentes en la ciudad de Sevilla (Corpus.migra.sev), constituido por muestras de entrevistas semidirigidas de las diferentes...

Ver ficha completa

Corpus de aprendices de español (CAES)
https://galvan.usc.es/caes
Detalles Cerrar βœ•

Etiquetas: corpus de estudiantes corpus sonoro

Descripción: El Corpus de aprendices de español como lengua extranjera (CAES) es un conjunto de textos escritos producidos por estudiantes de español con diferentes grados de dominio lingüistico (niveles A1 a C1 del Marco común europeo de referencia , aplicado al español en el Plan curricular del Instituto Cervantes. Niveles de referencia para el español ) y procedentes de once L1: alemán, árabe, chino mandarín, francés, griego, inglés, italiano, japonés, polaco, portugués y ruso.  En su versión actual...

Ver ficha completa

RedPajama-Data-v2
https://github.com/togethercomputer/Red…
Detalles Cerrar βœ•

Etiquetas: modelos de lenguaje corpus escrito

Descripción: RedPajama-Data-v2 es un corpus multilingüe de acceso abierto para el entrenamiento de modelos de lenguaje, que está formado por 30 billones de formas léxicas (tokens), repartidos en 20.000 millones de documentos de texto. RedPajama incluye cinco subcorpus multilingües de textos, respectivamente, en alemán, español, francés, inglés e italiano. El subcorpus del español tiene casi 3 billones de palabras (2.800.000.000.000).  RedPajama está disponible en GitHub y también se...

Ver ficha completa

Corpus Escrito del Español L2 (CEDEL2)
http://cedel2.learnercorpora.com/
Detalles Cerrar βœ•

Etiquetas: corpus de estudiantes corpus sonoro

Descripción: CEDEL2 es un corpus lingüístico de aprendices de español que empezó a desarrollarse en 2006. La versión actual, versión 2, que incluye los datos de la 1, recoge las producciones de 4399 participantes y 1 105 936 words.

Ver ficha completa

Corpus de textos escritos para el análisis de errores de aprendices de E/LE (CORANE)
https://mele.web.uah.es/materiales-ele/
Detalles Cerrar βœ•

Etiquetas: corpus escrito corpus de estudiantes corpus para el análisis de errores

Descripción: Cuadernillo del corpus  Muestras de textos para descargar: Nivel A2 - Plataforma Nivel B1 - Umbral Nivel B2 - Avanzado Nivel C1 - Dominio operativo eficaz "[...] el análisis de errores cometidos por los estudiantes extranjeros que aprenden español es un campo de investigación que todavía no ha alcanzado en España el desarrollo y la amplitud que serían deseables, entre otras razones tal vez por la no existencia de corpus lingüísticos que permitan analizar de manera sistemática los errores...

Ver ficha completa

Corpus SEAH
https://www.seahproject.eu/resources.php
Detalles Cerrar βœ•

Etiquetas: español para fines específicos arquitectura corpus multilingüe

Descripción: Corpus de arquitectura y construcción que recoge un millón de palabras, en cada uno de estos idiomas: español, francés, italiano, alemán y ruso. Es un corpus dirigido a estudiantes de lenguas extranjeras. Este corpus se ha elaborado dentro del proyecto SEAH (Sharing European architectural heritage), proyecto en el que participan varias universidades europeas y que además de la creación del corpus tiene como objetivo s la explotación didáctica del mismo con la elaboración cinco...

Ver ficha completa

DIACOM-es
https://dh.dlls.univr.it/corpora/diacom…
Detalles Cerrar βœ•

Etiquetas: corpus sonoro ámbito comercial

Descripción: El corpus DIACOM-es es un corpus diacrónico especializado que reúne textos de ámbito comercial en lengua española. Se publicó en 2022 en el seno del Depto. de Lenguas y Literaturas Extranjeras de la Universidad de Verona (Italia) y ha continuado alimentándose anualmente. Recientemente (octubre de 2024), también se han ampliado sus posibilidades de explotación para los usuarios externos. El corpus se ha diseñado y estructurado siguiendo tres ejes: temporal, geográfico y funcional. - En cuanto al...

Ver ficha completa

Paginación
  • Primera página «
  • Página anterior ‹
  • Página 1
  • Página 2
  • Página actual 3
  • Página 4
  • Siguiente página ›
  • Última página »
Volver arriba ↑

Enviar corpus

Etiquetas

  • corpus oral (25)
  • corpus sonoro (11)
  • corpus escrito (10)
  • variedades del español (10)
  • corpus de estudiantes (9)
  • inmigrantes (8)
  • estudiantes universitarios (6)
  • español para fines específicos (5)
  • interacciones conversacionales (5)
  • corpus de vídeo (4)
  • corpus general (4)
  • humor (4)
  • sinohablantes (4)
  • actos de habla (3)
  • hablantes de herencia (3)
ver todas »
Sobre Todoele Índice Publica Contacto: todoele@gmail.com
Política de privacidad Créditos