Section outline

  • CLASE 6 - FUNDAMENTOS DE LA INTELIGENCIA ARTIFICIAL PARA AMPLIAR HORIZONTES CULTURALES

    ¿De dónde aprenden los modelos de lenguaje (LLMs)?

    ¿Con qué datos se entrenan los modelos y qué sabemos (o no) sobre ellos? En esta clase analizamos la composición de los datos con los que se entrenan los modelos de lenguaje. ¿De dónde provienen esos textos? Internet, libros digitalizados, artículos académicos, foros, repositorios de código y bases especializadas forman parte de los grandes corpus utilizados para su entrenamiento. Revisamos casos concretos —como BERT, GPT-1 o GPT-3— para comprender cómo han evolucionado las fuentes de datos y qué ocurre cuando las empresas dejan de transparentar esa información en versiones más recientes.

    También exploramos cómo se clasifican los modelos según su nivel de apertura y transparencia: código abierto, pesos abiertos o código cerrado. ¿Qué implica poder auditar un modelo? ¿Qué diferencias existen en términos de costos, acceso y participación comunitaria? A través de ejemplos actuales, la invitación es reflexionar sobre la relación entre datos, transparencia y poder tecnológico, y preguntarnos qué tipo de modelos queremos promover en el ámbito educativo.

    Al finalizar la clase, te invitamos a completar unas preguntas. Las respuestas son calificadas y completar la actividad es requisito para finalizar y acreditar el curso.

    👨‍🏫 Docente: Guido Ivetta

    • Debajo encontrás las diapositivas de la clase, pensadas como apoyo para volver sobre las ideas, preguntas y tensiones que se abren en el video.

      📚 Conceptos claves

      Código Abierto (Open Source): Modelos donde todo está a disposición: el código, los datos de entrenamiento y el modelo mismo. Permiten total transparencia y uso offline.

      Código Cerrado (Closed Source): Modelos de propiedad privada (como GPT-4 o Gemini) que solo se pueden usar a través de un servicio o interfaz. Son "cajas negras" sin transparencia interna.

      Modelo de Lenguaje (LLM): Sistema de inteligencia artificial entrenado con grandes volúmenes de texto para procesar, generar y entender el lenguaje humano de forma probabilística.

      Pesos Abiertos (Open Weights): Modelos que permiten su descarga y uso (con licencias permisivas), pero mantienen en secreto los datos con los que fueron entrenados.

      Poder Computacional: La capacidad de procesamiento necesaria para ejecutar o entrenar un modelo. Aunque un modelo sea "gratis", el cómputo para correrlo suele ser costoso.

      Una creación de Fundación Vía Libre en articulación con FAMAF – UNC.