¿De dónde aprenden los modelos de lenguaje (LLMs)?
Section outline
-
CLASE 6 - FUNDAMENTOS DE LA INTELIGENCIA ARTIFICIAL PARA AMPLIAR HORIZONTES CULTURALES
¿De dónde aprenden los modelos de lenguaje (LLMs)?
¿Con qué datos se entrenan los modelos y qué sabemos (o no) sobre ellos? En esta clase analizamos la composición de los datos con los que se entrenan los modelos de lenguaje. ¿De dónde provienen esos textos? Internet, libros digitalizados, artículos académicos, foros, repositorios de código y bases especializadas forman parte de los grandes corpus utilizados para su entrenamiento. Revisamos casos concretos —como BERT, GPT-1 o GPT-3— para comprender cómo han evolucionado las fuentes de datos y qué ocurre cuando las empresas dejan de transparentar esa información en versiones más recientes.
También exploramos cómo se clasifican los modelos según su nivel de apertura y transparencia: código abierto, pesos abiertos o código cerrado. ¿Qué implica poder auditar un modelo? ¿Qué diferencias existen en términos de costos, acceso y participación comunitaria? A través de ejemplos actuales, la invitación es reflexionar sobre la relación entre datos, transparencia y poder tecnológico, y preguntarnos qué tipo de modelos queremos promover en el ámbito educativo.
Al finalizar la clase, te invitamos a completar unas preguntas. Las respuestas son calificadas y completar la actividad es requisito para finalizar y acreditar el curso.
👨🏫 Docente: Guido Ivetta