Aprendizaje automático a partir de datos: más muestras, más precisión

InformáticaDatos, IA y aprendizaje automáticoEdades 16–17

Un clasificador sencillo aprende de muestras etiquetadas: calcula el centroide de cada clase y usa la mediatriz entre los dos centroides como frontera de decisión. Los estudiantes ajustan el número de muestras de entrenamiento, la tasa de ruido en las etiquetas y el sesgo en la recogida de datos; el modelo se vuelve a entrenar y su precisión se mide sobre un conjunto fijo de 400 muestras de prueba. Cuando los datos de entrenamiento vienen sobre todo de un grupo, la precisión global sigue pareciendo alta, pero la del grupo menos representado cae bruscamente: así actúa el sesgo de datos.