Integrative cfDNA profiling from low-pass whole-genome sequencing enables tissue-of-origin prediction in cancer.
Résumé
Cette étude présente un classificateur d'apprentissage automatique en ensemble empilé pour prédire le tissu d'origine des cancers à partir de l'ADN tumoral circulant (ADNtc). Le modèle intègre 11 caractéristiques multidimensionnelles de l'ADNtc, incluant des signaux génomiques, fragmentomiques, de méthylation/répétition et microbiens, obtenues par séquençage du génome entier à faible couverture. Il a démontré une performance robuste, atteignant des précisions top-1 et top-2 de 80% et 90% sur une cohorte de validation indépendante de 1 221 échantillons. Le classificateur s'est avéré efficace même avec de faibles fractions tumorales et a pu identifier le site primaire dans 73,3% des cas de cancers de primitif inconnu (CPI). Cette approche non invasive offre un potentiel significatif pour guider les décisions cliniques.
Analyse
CLINIQUE: Ce classificateur a un impact clinique immédiat en offrant une méthode non invasive pour identifier le tissu d'origine des cancers, particulièrement utile pour les cancers de primitif inconnu (CPI) et les cancers primaires multiples (CPM). Avec une précision top-1 de 80% et top-2 de 90% sur une cohorte de validation indépendante, et une performance maintenue même avec de faibles fractions tumorales (71% top-1), il pourrait justifier des essais cliniques pour évaluer son intégration dans les algorithmes diagnostiques actuels. L'identification du site primaire dans 73,3% des cas de CPI pourrait directement améliorer la prise en charge thérapeutique et le pronostic. Le temps d'impact clinique pourrait être de 3-5 ans, après validation prospective. BIOMOL: La découverte réside dans l'intégration de multiples signaux de l'ADNtc (génomiques, fragmentomiques, méthylation/répétition, microbiens) pour une classification précise du tissu d'origine. La technologie utilisée est le séquençage du génome entier à faible couverture (low-pass WGS) de l'ADNtc, une approche coût-efficace et non invasive. L'analyse de l'importance des caractéristiques a identifié le positionnement des nucléosomes, la distribution de la taille des fragments et les éléments répétés comme des contributeurs clés, suggérant de nouveaux biomarqueurs potentiels. L'utilisation de l'ADNtc, une biopsie liquide, permet une détection précoce et un suivi non invasif, avec des implications pour le dépistage et le diagnostic. BIOINFO: L'étude a développé un classificateur d'apprentissage automatique en ensemble empilé (stacked ensemble machine learning classifier). Ce modèle intègre les prédictions de cinq algorithmes de base (Deep Learning, Distributed Random Forest, Gradient Boosting Machine, Generalized Linear Model, XGBoost) entraînés dans un cadre de validation croisée à cinq volets. Le modèle a été optimisé pour la précision top-1 et a été évalué sur des cohortes d'entraînement (n=1 814) et de validation indépendantes (n=1 221), démontrant une robustesse. L'analyse de l'importance des caractéristiques a permis d'identifier les signaux les plus pertinents. Une fois déployé cliniquement, cet outil pourrait automatiser et améliorer la précision du diagnostic du tissu d'origine, complétant ou remplaçant des méthodes diagnostiques multimodales actuelles.