Selección Wrapper

Selecciona los atributos más relevantes de una tabla de datos mediante métodos wrapper, que evalúan subconjuntos de atributos entrenando repetidamente un modelo predictivo (a diferencia del filtro univariante, que no entrena ningún modelo).

Descripción

Los métodos wrapper suelen ser más lentos que los de filtro, pero tienen en cuenta las interacciones entre atributos, ya que evalúan conjuntos de atributos con un modelo real en lugar de puntuar cada atributo por separado.

Entradas

  • Data: una tabla de datos de Orange con una variable objetivo definida.

Salidas

  • Data: la misma tabla, con solo los atributos seleccionados. La variable objetivo y los metadatos se conservan siempre.

1. Elige un método wrapper

Método

Qué hace

RFE (Eliminación Recursiva)

Entrena el modelo, elimina el atributo menos importante, y repite hasta llegar al número de atributos indicado.

RFECV

Igual que RFE, pero usa validación cruzada para elegir automáticamente el número óptimo de atributos (no hace falta indicarlo).

SFS (Selección Secuencial)

Añade (o quita) atributos uno a uno, evaluando cada paso con validación cruzada, hasta llegar al número de atributos indicado.

2. Elige un modelo base (estimador)

Los tres métodos necesitan un modelo predictivo con el que evaluar los atributos. El widget ofrece un modelo lineal y un modelo de árboles, adaptados automáticamente al tipo de variable objetivo (categórica o numérica):

Estimador

Notas

Regresión Logística / Lineal

Rápido. Funciona mejor cuando la relación entre atributos y target es aproximadamente lineal.

Bosque Aleatorio

Más lento, pero capta relaciones no lineales entre atributos.

3. Parámetros de cada método

Parámetro

Métodos que lo usan

Qué significa

Número de atributos a seleccionar

RFE, SFS

Cuántos atributos debe conservar el resultado final.

Paso

RFE, RFECV

Cuántos atributos se eliminan en cada iteración.

Mínimo de atributos a conservar

RFECV

Límite inferior de la búsqueda automática por validación cruzada.

Pliegues de validación cruzada (cv)

RFECV, SFS

En cuántos grupos se divide a los datos para evaluar cada paso.

Dirección

SFS

Hacia adelante: empieza sin atributos y va añadiendo. Hacia atrás: empieza con todos y va quitando.

Métrica (scoring)

RFECV, SFS

Con qué métrica se compara cada subconjunto de atributos durante la validación cruzada (por defecto, la del propio modelo).

4. Resultado

El widget envía a su salida la misma tabla de datos, pero con solo los atributos seleccionados.

Notas importantes

  • Los métodos wrapper pueden tardar varios segundos o minutos con muchos atributos o datasets grandes, especialmente RFECV y SFS con dirección «hacia atrás» (evalúan muchas combinaciones con validación cruzada). Por eso este widget no aplica los cambios automáticamente: hay que pulsar Apply después de ajustar los parámetros.

  • Si hay valores ausentes, imputa antes con el widget «Impute» de Orange.