A Comparison of Feature Selection Using SHAP-Values for Tree and Non-tree-Based Models
A Comparison of Feature Selection Using SHAP-Values for Tree and Non-tree-Based Models
Samenvatting
In de gezondheidszorg zijn datasets van klinische onderzoeken vaak hoogdimensionaal en hebben ze een kleine steekproefomvang, wat het risico op overfitting vergroot. Bovendien richt onderzoek in deze context zich doorgaans niet alleen op de nauwkeurigheid van de resulterende modellen, maar ook op de verklaarbaarheid ervan. Kenmerkselectie kan overfitting tegengaan en waardevolle inzichten bieden in relevante kenmerken. Het gebruik van SHAP-waarden (SHapley Additive exPlanation) is een nuttig hulpmiddel gebleken om significante kenmerken te identificeren. In dit artikel stellen we voor om Kernel SHAP te implementeren in de shap-select-module om de functionaliteit ervan uit te breiden naar niet-boomgebaseerde modellen. Dit gebeurt door de introductie van een masker dat achtergrondwaarden genereert die SHAP gebruikt om het verwijderen van een kenmerk te simuleren. De prestaties worden vervolgens geëvalueerd op een kleine, hoogdimensionale dataset, en de resulterende kenmerkselectie wordt beoordeeld. De resultaten tonen aan dat, ondanks een grotere instabiliteit in de prestatiemaatstaven, het vermogen van de methode om significante kenmerken te identificeren veelbelovend blijft. Deze bevindingen kunnen dienen als uitgangspunt voor verder onderzoek naar de relatie tussen kenmerkkenmerken en methoden voor kenmerkselectie, evenals voor het verbeteren van het vermogen om relevante kenmerken te identificeren met behulp van SHAP-waarden voor kenmerkselectie.

| Organisatie | |
| Datum | 2026-06-01 |
| Type | |
| DOI | 10.1007/978-981-92-0068-9_22 |
| Taal | Engels |



























