Conceptos clave de aprendizaje supervisadoVersion en ligne
Conceptos vistos en clase
1
Según la analogía de "preparar una receta", ¿qué representa el diseño experimental en Machine Learning?
2
Si un modelo de Machine Learning muestra un rendimiento excelente con los datos de entrenamiento pero falla drásticamente con datos nuevos, ¿qué problema está ocurriendo y cuál es su analogía?
3
¿Cuál es el objetivo principal del algoritmo de Máquinas de Vectores de Soporte (SVM)?
4
En un escenario de clasificación de correos electrónicos como ‘spam’ o ‘legítimo’, un ‘falso positivo’ sería costoso porque podría hacer que el usuario se pierda un correo importante. ¿Qué métrica deberíamos priorizar para minimizar este riesgo?
5
¿Qué es la validación cruzada (Cross-Validation) y cuál es su propósito principal?
6
Comparando los algoritmos, ¿cuál es generalmente considerado el más fácil de interpretar y explicar a una audiencia no técnica?
7
Un modelo que intenta predecir una trayectoria parabólica compleja usando una simple regresión lineal es un ejemplo clásico de:
8
¿Qué problema es particularmente crítico para el algoritmo KNN, haciéndolo muy sensible a este factor?
9
Si tu objetivo es construir un modelo robusto y confiable, ¿por qué es crucial un buen diseño experimental que evite la ‘contaminación de datos’?
10
En la matriz de confusión, ¿qué representan los 'Falsos Negativos' (FN)?
Explicación
La respuesta correcta, "Planificar cómo se entrenará y probará un modelo, decidiendo qué datos usar y cómo medir su rendimiento", resume precisamente la función del diseño experimental en Machine Learning (ML), tal como lo define la analogía de la receta:
¿Qué representa el Diseño Experimental? El diseño experimental es la planificación de CÓMO se va a entrenar y probar el modelo. Es como el chef que primero escribe la receta.
Decidir qué datos usar: En la analogía de la receta, esto se traduce en elegir qué ingredientes se van a usar y en qué proporciones (por ejemplo, ¿más chocolate vs. menos chocolate?). En ML, se trata de decidir qué datos usar y cómo dividirlos.
Cómo entrenar y probar: En la receta, esto es decidir a qué temperatura hornear y con qué personas probar la pizza/galletas. En ML, es establecer cómo se entrenará el modelo y cómo se medirá si funciona bien.
Medir el rendimiento: Esto corresponde a decidir cómo medir si funciona bien o cómo se va a preguntar si están ricas. Esto requiere definir objetivos medibles y métricas específicas (como la precisión o el F1-score).
El diseño experimental es, por lo tanto, la base para obtener resultados reproducibles y modelos confiables que funcionen en producción.
Lo que sucede en Machine Learning (ML): El modelo funciona de manera excelente con los datos que ya vio (datos de entrenamiento o práctica), pero falla dramáticamente con datos nuevos. En ML, el modelo se aprende "demasiado bien" los datos de entrenamiento, incluyendo el "ruido" y los detalles sin importancia.
La señal de alarma es clara: "Si tu modelo es perfecto con los datos de práctica pero pésimo con datos nuevos... ¡tienes overfitting!". El objetivo del diseño experimental es precisamente maximizar la validez y generalización del modelo, lo cual se pierde completamente con el overfitting.
El algoritmo de Máquinas de Vectores de Soporte es un enfoque de clasificación potente dentro del aprendizaje supervisado. Su misión principal es, de hecho, encontrar el hiperplano óptimo que maximiza el margen de separación entre diferentes clases de datos.
Un "falso positivo" en este contexto significa que un correo legítimo es incorrectamente clasificado como spam. Para minimizar este riesgo, la métrica clave a priorizar sería la Precisión (Precision), ya que mide la proporción de correos identificados como spam que realmente eran spam, y una alta precisión indica menos falsos positivos.
La validación cruzada divide los datos en "k" partes y realiza múltiples entrenamientos y pruebas para obtener una evaluación más robusta y confiable del modelo, evitando sobreajuste o evaluaciones optimistas.
Árboles de Decisión, porque su estructura, similar a un diagrama de flujo con reglas paso a paso, es fácil de entender incluso para personas sin conocimientos técnicos.
Underfitting. Esto pasa cuando el modelo es demasiado simple para captar el patrón complejo de los datos, como intentar dibujar una curva con solo una línea recta.
La presencia de ruido en los datos y la correcta elección del parámetro K. Esto se debe a que si los datos tienen valores atípicos o se elige un valor de K inadecuado, el modelo puede hacer predicciones muy inexactas.
Un buen diseño evita que la información del futuro "contamine" el entrenamiento. Si esto pasa, el modelo parecerá muy bueno durante las pruebas, pero fallará en el mundo real porque no aprendió patrones reales, sino "trampas" de los datos.
Casos positivos que el modelo clasificó incorrectamente como negativos. Un falso negativo es como una "alarma que no sonó": el modelo dice que no pasa nada, cuando en realidad sí hay un problema. Por ejemplo, predecir que una persona no tiene una enfermedad cuando en realidad sí la tiene.
|