Inteligencia Artificial · 3 min read · Dec 17, 2025

Destilación de Conocimiento: Cómo Hacer que los LLMs sean Más Fáciles y Ahorrar Precisión

Computadora

El artículo es un comentario escrito por Kirill Starkov.


El desarrollo de los LLMs modernos ha llevado a resultados increíbles: rendimiento de vanguardia, alta calidad y, desafortunadamente, costos computacionales. Los ingenieros tienden a elegir modelos más pequeños simplemente porque son más baratos y no requieren hardware especial.

El proceso de destilación de conocimiento fue inventado para abordar este problema: es una oportunidad para ahorrar tiempo, dinero y rendimiento de alta calidad al mismo tiempo. Nuestro experto, Kirill Starkov, Ingeniero Senior de Aprendizaje Automático, comentará sobre esta tecnología y compartirá su propia experiencia.

¿Cómo funciona la destilación de conocimiento?

La idea de la destilación de conocimiento (KD) se puede explicar con el ejemplo de la interacción ‘maestro-estudiante’: es una transferencia de conocimiento de un modelo de lenguaje grande a uno pequeño. El modelo ‘estudiante’ será tan eficiente como su ‘maestro’ pero será más adecuado para la implementación.

Hay dos formas de entrenar el modelo ‘estudiante’: destilación de etiquetas duras y suaves.

La destilación de etiquetas duras tiene tres etapas:

  1. Recolección de prompts

  2. Respuestas a los prompts, generadas por el modelo “maestro”

  3. Formación del conjunto de datos etiquetado

Después de eso, el modelo pequeño aprende a imitar las respuestas del modelo grande con el conjunto de datos etiquetado, marcado como verdad fundamental.

La destilación de etiquetas duras es más fácil y tiene menos costos computacionales que la destilación de etiquetas suaves, pero esta última es más precisa porque transfiere la distribución predictiva individual del modelo grande.

‘Las etiquetas suaves enseñan mejor que los objetivos duros porque proporcionan más información de aprendizaje y mucha menos varianza en el gradiente entre los casos de entrenamiento cuando tienen alta entropía. El modelo “estudiante” puede ser entrenado con muchos menos datos que el modelo “maestro” original.’

Una de las métricas más importantes en ML es la función de pérdida o entropía cruzada. La implementación de KD requiere otro tipo de métrica de pérdida: pérdida suave. ‘La pérdida suave es una entropía cruzada ponderada cuando asignamos diferentes pesos para prevenir falsos positivos o falsos negativos del modelo “maestro”.’

La fórmula de Divergencia de Kullback-Leibler (KLDiv) se utiliza para calcular la pérdida de destilación.

LKD = KL(softmax(zt/T) || softmax(zs/T)) ⋅ T2

Donde T es temperatura (generalmente >1)

zt y zs son logits del maestro y del estudiante, respectivamente.

Función de pérdida de objetivo duro

L CE = CrossEntropy( y verdadero,softmax( z s))

Pérdida total (combinada)

L = αL CE + (1− α) ⋅ L KD

Donde α es un hiperparámetro (comúnmente 0.1 a 0.9)

Implementación de la destilación de conocimiento

La destilación de conocimiento se utiliza a menudo en proyectos con recursos operativos limitados, donde la implementación de LLMs engorrosos es imposible.

‘La destilación de conocimiento es imprescindible en programas de visión por computadora y detección de objetos. Los modelos más pequeños son adecuados para su implementación en dispositivos con recursos de procesamiento limitados, como cámaras de seguridad y drones.’

Los modelos pequeños también se utilizan en programas de procesamiento de lenguaje natural. ‘NLP requiere respuesta en tiempo real con alta velocidad y eficiencia, por lo que los modelos “estudiante” entrenados son perfectos para chat-bots, programas de traducción y otros dispositivos móviles.’

Caso de implementación: Visión por Computadora DSSL

Como se mencionó anteriormente, la destilación de conocimiento se utiliza en tecnologías modernas de CV. Kirill Starkov decidió mejorar el dispositivo detector de seguridad con la implementación de un pequeño modelo de lenguaje.

‘En ese caso, vimos que la destilación de conocimiento es realmente útil, porque verificamos los resultados con una métrica especial: precisión media promedio.’

La Precisión Media Promedio (mAP) mide la precisión de los detectores de objetos. Proporciona un solo número que resume la curva de precisión-recall, reflejando qué tan bien está funcionando un modelo en diferentes niveles de umbral. ‘Antes de la implementación de KD, nuestra mAP era 27.4; después—34.2.’

Ventajas y desventajas de la destilación de conocimiento

KD siempre se trata de un mejor rendimiento: las ventajas comunes son la reducción de costos operativos, inferencia más rápida, preservación de patrones complejos.

Pero esta tecnología puede tener algunas desventajas. El desequilibrio entre las condiciones de aprendizaje y la inferencia puede llevar a un sesgo de exposición porque el modelo de lenguaje “estudiante” no puede aprender a corregir sus propios errores.

La destilación de etiquetas suaves es computacionalmente costosa durante el entrenamiento, ya que se almacenan y procesan distribuciones de probabilidad completas en lugar de índices de token individuales.

También requiere una integración más profunda entre estudiante y maestro para acceder a las probabilidades internas de un modelo grande, lo que hace que sea más difícil de implementar que los enfoques estándar.

Esta historia fue publicada originalmente el 23 de octubre de 2021.

Share: X/Twitter LinkedIn

Recibe nuevas publicaciones en tu bandeja de entrada.

No spam. Cancela la suscripción en cualquier momento.