COMWAY

Machine learning explicado para no técnicos: supervisado, no supervisado y refuerzo

Diferencias entre los principales tipos de aprendizaje automático con ejemplos cotidianos. Sin matemática, con criterio para entender qué propone tu proveedor de IA.

Equipo Comway · 9 min de lectura
Diagrama explicativo con tres bloques que muestra los paradigmas de machine learning

Machine learning explicado para no técnicos: supervisado, no supervisado y refuerzo

Cuando un proveedor te dice “usamos machine learning”, probablemente está usando alguna de tres familias de técnicas con principios distintos. Saber cuál te están vendiendo te permite hacer preguntas mejores y validar si lo que prometen es razonable.

Este post traduce las tres familias principales sin matemática, con ejemplos cotidianos. La parte técnica está apoyada en fuentes públicas referenciadas.

Qué es machine learning

Wikipedia ubica el origen del término en Arthur Samuel, en 1959, un investigador de IBM pionero en computer gaming e IA (fuente). La definición moderna: algoritmos que aprenden patrones a partir de datos, sin ser programados explícitamente para cada caso particular.

Diferencia clave con la programación tradicional:

  • Programa tradicional: programador escribe reglas → datos entran → resultado sale.
  • Machine learning: datos + resultados deseados entran → algoritmo aprende reglas.

El sistema aprende del ejemplo. Cuanto mejor el ejemplo, mejor el aprendizaje.

Familia 1 — Aprendizaje supervisado

Definición

Wikipedia lo define como: “la computadora recibe ejemplos de inputs y sus outputs deseados, dados por un ‘maestro’, y el objetivo es aprender una regla general que mapee inputs a outputs” (fuente).

Tenés un dataset etiquetado. Cada fila tiene un input (foto de perro, mail) y un output conocido (raza del perro, “spam” o “no spam”). El modelo aprende la relación.

Ejemplos cotidianos

  • Filtro anti-spam: aprendió de millones de mails marcados manualmente como spam o no.
  • Reconocimiento facial: aprendió de millones de fotos etiquetadas con la identidad correcta.
  • Predicción de churn: aprendió de clientes históricos, sabiendo cuáles se fueron y cuáles se quedaron.
  • Diagnóstico por imagen médica: entrenado con imágenes y diagnóstico confirmado por médicos.
  • Scoring crediticio: aprendió de créditos pasados con default conocido.

Algoritmos comunes

Wikipedia y la documentación de scikit-learn (fuente) listan los principales:

  • Regresión lineal y logística
  • Árboles de decisión y random forests
  • Gradient boosting (XGBoost, LightGBM, CatBoost)
  • Support vector machines (SVM)
  • k-nearest neighbors
  • Redes neuronales

Sub-tipos

  • Clasificación: el output es una categoría (spam / no spam, gato / perro / loro).
  • Regresión: el output es un número continuo (precio, temperatura, tiempo de reparación).

Cuándo conviene

Cuando tenés:

  • Histórico de casos con la respuesta correcta conocida.
  • Suficientes ejemplos por categoría (cientos o miles, dependiendo del problema).
  • Variables predictoras claras y consistentes en el tiempo.

Limitaciones

  • Necesita datos etiquetados, que pueden ser caros de generar (etiquetar 50.000 imágenes médicas no es trivial).
  • Sesgos del dataset se reproducen en el modelo. Si los datos históricos son sesgados, el modelo lo será.
  • No generaliza a casos muy distintos a los del entrenamiento.

Familia 2 — Aprendizaje no supervisado

Definición

Wikipedia: “no se le dan etiquetas al algoritmo de aprendizaje, dejándolo solo para encontrar estructura en sus inputs” (fuente).

Tenés un dataset sin etiquetar. El algoritmo busca agrupar, segmentar o reducir dimensionalidad sobre la base de similitudes que descubre solo.

Ejemplos cotidianos

  • Segmentación de clientes: encontrar grupos de clientes que se comportan parecido (sin saber a priori cuántos grupos hay ni qué los caracteriza).
  • Detección de anomalías: identificar transacciones que se desvían del patrón habitual (potenciales fraudes).
  • Recomendadores básicos “los clientes que compraron X también compraron Y” se basan en estructuras descubiertas no supervisadamente.
  • Compresión de datos: técnicas como PCA reducen dimensionalidad para análisis o visualización.

Algoritmos comunes

  • k-means y variantes (clustering basado en distancia).
  • Clustering jerárquico.
  • DBSCAN (clustering basado en densidad).
  • PCA (reducción de dimensionalidad).
  • Autoencoders (reducción y reconstrucción con redes neuronales).
  • Detección de anomalías: isolation forest, one-class SVM.

Cuándo conviene

  • Cuando no sabés a priori qué buscar pero querés entender estructura.
  • Para detectar patrones inesperados (fraude, comportamiento inusual de equipos).
  • Como paso previo a otro análisis (segmentar y luego decidir qué hacer con cada segmento).

Limitaciones

  • Subjetividad en evaluar resultados: no hay métrica clara de “acertó / falló”.
  • Resultados pueden ser difíciles de interpretar para negocio.
  • Muchos algoritmos requieren elegir hiperparámetros (cuántos clusters esperar, por ejemplo) sin guía obvia.

Familia 3 — Aprendizaje por refuerzo

Definición

Wikipedia: “un programa interactúa con un entorno dinámico donde debe ejecutar cierto objetivo… el programa recibe recompensas como feedback, que intenta maximizar” (fuente).

Distinto de los dos anteriores. El sistema toma acciones y recibe recompensas o castigos del entorno. Aprende por prueba y error a maximizar la recompensa acumulada en el tiempo (fuente RL).

Ejemplos cotidianos

  • Agentes que juegan: AlphaGo, agentes de StarCraft, Dota2.
  • Conducción autónoma: el agente aprende a conducir en simulador (y luego en real) maximizando llegar a destino sin chocar.
  • Robótica: brazos industriales que aprenden a manipular objetos.
  • Trading algorítmico: agentes que aprenden políticas de compra/venta.
  • Optimización de catálogo o pricing: probar precios y observar conversiones.

Conceptos clave

  • Agente: el sistema que toma decisiones.
  • Entorno: lo que hay alrededor (puede ser real o simulado).
  • Estado: situación actual.
  • Acción: qué hace el agente.
  • Recompensa: feedback numérico (positivo o negativo).
  • Política: estrategia que aprende el agente para mapear estados a acciones.

Cuándo conviene

  • Cuando hay un simulador del entorno donde practicar millones de veces.
  • Cuando la decisión es secuencial y cada acción afecta las siguientes.
  • Cuando la recompensa es definible numéricamente.

Limitaciones

  • Caro y lento entrenar.
  • En el mundo real (no simulador), explorar puede ser destructivo (un robot que aprende a no chocar puede romper cosas en el camino).
  • Los modelos pueden encontrar explotaciones del entorno —comportamientos que maximizan recompensa de forma no deseada.

Una mención al deep learning

Deep learning no es una familia separada, es una técnica que se aplica dentro de las tres familias. Usa redes neuronales con muchas capas. Wikipedia lo define como “parte de una familia más amplia de métodos de machine learning, basada en redes neuronales artificiales con aprendizaje de representación” (fuente).

  • Deep learning supervisado: redes para visión, NLP clásico, modelos predictivos avanzados.
  • Deep learning no supervisado: autoencoders, modelos generativos.
  • Deep reinforcement learning: AlphaGo, agentes complejos.

Los modelos grandes de lenguaje (LLMs) detrás de los agentes de IA modernos son deep learning —entrenados en una mezcla de pre-training no supervisado masivo y fine-tuning supervisado y por refuerzo (RLHF).

Cómo elegir cuando alguien te ofrece “ML”

Cuatro preguntas que despejan rápido la conversación:

1. “¿Qué tipo de aprendizaje usan?”

Si la respuesta es vaga (“usamos algoritmos avanzados”), bandera roja. Un proveedor serio dice “supervisado para X, no supervisado para Y, y combinamos con un modelo de fundación para Z”.

2. “¿Qué datos necesitan y de dónde salen?”

Si necesitan datos etiquetados que no existen, hay que generarlos —cosa que cuesta y nunca está incluida en el presupuesto si no se discute. Si dicen “sus datos actuales alcanzan”, pediles que muestren ejemplos concretos.

3. “¿Cómo evalúan que el modelo funciona?”

Las métricas tienen que ser concretas: precisión, recall, F1, AUC, MAE, etc. Y tienen que medirse sobre datos que el modelo no vio durante el entrenamiento. Si la respuesta es “lo probamos en los mismos datos que usamos para entrenar”, es directamente fraudulento.

4. “¿Qué pasa cuando el modelo se equivoca?”

Todos los modelos se equivocan. Los profesionales tienen plan de contingencia: cuándo escalar a humano, cuándo bloquear, cómo retroalimentar al modelo con los errores para que mejore.

Conclusión

Machine learning no es magia. Hay tres familias de técnicas con propósitos distintos, fortalezas y limitaciones específicas. Saber cuál estás contratando es el primer paso para evitar comprar promesas vacías. Y el detalle clave: cualquier sistema de ML serio requiere datos de calidad, métricas claras para validar, y un plan para cuando se equivoca. Lo demás es marketing.

Fuentes y referencias

Fuentes

Compartir: X / Twitter LinkedIn WhatsApp
WhatsApp Cotizar