Kyle Cheng, Aaron Sethi
Over the past decade, immunotherapy has emerged as one of the most promising treatments for cancer. Specifically, immune checkpoint inhibitors (ICIs) have revolutionized treatment for non-small cell lung cancer (NSCLC), yet only 20–30% of patients experience an objective response. Reliable biomarkers include programmed death-ligand 1 (PD-L1) tumour proportion score and tumour mutational burden (TMB), though they are not universally predictive alone. This study aims to improve patient selection by developing a logistic regression machine learning model for ICI response prediction in NSCLC patients. We analyzed a public dataset of 224 ICI-treated NSCLC patients from Memorial Sloan Kettering (MSK) Cancer Center, incorporating clinical, pathologic, and genomic data. Baseline features such as age, PD-L1 tumour proportion score, TMB, neutrophil-to-lymphocyte ratio (NLR), pack-year smoking history, among others were evaluated. Exploratory data analysis was followed by model training and optimized with Lasso/L1 regularization. Performance was assessed using ROC-AUC, F1 scores, and 5-fold cross-validation. The final model achieved an ROC-AUC of 0.84, 80% accuracy, an F1 score of 0.67, and recall of 1.0. Responder precision reached 50%, compared to non-model guided rates of 20–30%. Previous approaches such as deep learning, multimodal feature fusion and other black-box approaches are limited by their complexity and lack of interpretability, posing significant challenges for real-world clinical application. In contrast, our white-box model employs a prospective, robust, and efficient design that re-trains on new, real-time data, spares non-responders from unnecessary costs, and advances personalized immunotherapy research. ---------- Au cours de la dernière décennie, l’immunothérapie est devenue l’un des traitements les plus prometteurs contre le cancer. Plus précisément, les inhibiteurs de points de contrôle immunitaire (ICI) ont révolutionné le traitement du cancer du poumon non à petites cellules (CPNPC), mais seulement 20 à 30 % des patients présentent une réponse objective. Les biomarqueurs fiables comprennent le score de proportion tumorale du ligand 1 de mort programmée (PD-L1) et la charge mutationnelle tumorale (TMB), bien qu’ils ne soient pas universellement prédictifs à eux seuls. Cette étude vise à améliorer la sélection des patients en développant un modèle d’apprentissage automatique basé sur la régression logistique pour prédire la réponse aux ICI chez les patients atteints de CPNPC. Nous avons analysé un ensemble de données publiques portant sur 224 patients atteints de CPNPC traités par ICI au Memorial Sloan Kettering (MSK) Cancer Center, en intégrant des données cliniques, pathologiques et génomiques. Des paramètres initiaux tels que l’âge, le score de proportion tumorale de PD-L1, la TMB, le rapport neutrophiles/lymphocytes (NLR) et l’antécédent tabagique en paquets-années, entre autres, ont été évaluées. Une analyse exploratoire des données a été suivie de l’entraînement du modèle, optimisé par une régularisation Lasso (L1). Les performances ont été évaluées à l’aide de l’aire sous la courbe ROC (ROC-AUC), des scores F1 et d’une validation croisée en 5 plis. Le modèle final a atteint une ROC-AUC de 0,84, une exactitude de 80 %, un score F1 de 0,67 et un rappel de 1,0. La précision chez les patients répondeurs a atteint 50 %, comparativement à un taux de 20 à 30 % en l’absence de guidage par modèle. Les approches précédentes, telles que l’apprentissage profond, la fusion de caractéristiques multimodales et d’autres méthodes de type « boîte noire », sont limitées par leur complexité et à leur manque d’interprétabilité, ce qui pose des défis importants pour une application clinique en pratique réelle. À l’inverse, notre modèle de type « boîte blanche » repose sur une conception prospective, robuste et efficace qui permet de se réentraîner sur de nouvelles données en temps réel, évite aux non-répondeurs des coûts inutiles et avancer la recherche en immunothérapie personnalisée.