Comparaison des grands modèles de langage aux réunions de concertation pluridisciplinaire pour les recommandations de traitement en oncologie
Évaluation comparative de l'intelligence artificielle pour la prise de décision clinique en oncologie (BEACON) : une évaluation prospective, multicentrique et en aveugle des grands modèles de langage de pointe par rapport aux recommandations des réunions de concertation pluridisciplinaire en oncologie pour la planification du traitement
Promoteur : Assistance Publique - Hôpitaux de Paris
Titre et résumé traduits de l’anglais par le portail, à partir de la fiche publiée par le registre source, le 16 septembre 2026. Traduction automatique, sans relecture médicale : elle ne modifie ni n’interprète le contenu ; en cas de doute, le texte original fait foi.
Texte original (anglais)
Benchmarking Large Language Models Against Tumour Boards for Oncology Treatment Recommendations
Benchmarking AI for Clinical Oncology decisioNmaking (BEACON): A Prospective, Multicentre, Blinded Evaluation of Frontier Large Language Models Against Multidisciplinary Tumour Board Recommendations in Oncology Treatment Planning
BEACON (Benchmarking AI for Clinical Oncology decisioNmaking) is a prospective, multicentre, comparative, blinded, non-interventional benchmark evaluating the treatment recommendations of five frontier large language models (LLMs) against the recommendations of multidisciplinary tumour boards (RCP) in oncology treatment planning. One hundred standardised synthetic cases (20 per localisation, across breast, lung, urological, digestive and gynaecological cancers) are submitted as identical structured input to two independent tumour boards per localisation and to five frontier LLMs. Each recommendation - human or model - is decomposed into five predefined decision domains (intent, surgery, radiotherapy, systemic therapy, work-up and biomarkers) and scored 0/1/2 for concordance against a two-tier reference: the consensus of the two tumour boards, complemented by an a priori locked guideline matrix (ESMO, NCCN). The primary endpoint is domain-level concordance between LLM and RCP consensus, expressed as a linearly weighted Cohen's kappa. A co-primary safety endpoint captures the proportion of recommendations carrying serious harm potential, because concordance alone can conceal dangerous errors. Because expert boards may disagree with one another on identical cases, model performance is always interpreted against the human consensus. BEACON is designed as reusable, openly licensed, pre-registered infrastructure: all synthetic cases, evaluation rubrics, the locked guideline matrix, scoring algorithms and verbatim prompts are released for full reproducibility.
BEACON (évaluation comparative de l'intelligence artificielle pour la prise de décision clinique en oncologie) est une évaluation prospective, multicentrique, comparative, en aveugle et non interventionnelle, comparant les recommandations de traitement de cinq grands modèles de langage (LLM) de pointe aux recommandations des réunions de concertation pluridisciplinaire (RCP) en oncologie pour la planification du traitement. Cent cas synthétiques standardisés (20 par localisation, couvrant les cancers du sein, du poumon, urologiques, digestifs et gynécologiques) sont soumis sous forme de données structurées identiques à deux RCP indépendantes par localisation et à cinq LLM de pointe. Chaque recommandation - humaine ou générée par un modèle - est décomposée en cinq domaines de décision prédéfinis (intention thérapeutique, chirurgie, radiothérapie, traitement systémique, bilan et biomarqueurs) et notée 0/1/2 pour la concordance par rapport à une référence à deux niveaux : le consensus des deux RCP, complété par une matrice de référence verrouillée a priori (ESMO, NCCN). Le critère de jugement principal est la concordance au niveau des domaines entre les LLM et le consensus des RCP, exprimée sous la forme d'un kappa de Cohen pondéré linéairement. Un critère de jugement co-principal de sécurité mesure la proportion de recommandations comportant un potentiel de préjudice grave, car la seule concordance peut dissimuler des erreurs dangereuses. Étant donné que des comités d'experts peuvent être en désaccord entre eux sur des cas identiques, la performance des modèles est toujours interprétée par rapport au consensus humain. BEACON est conçue comme une infrastructure réutilisable, ouvertement accessible et préenregistrée : tous les cas synthétiques, les grilles d'évaluation, la matrice de référence verrouillée, les algorithmes de notation et les invites (prompts) exactes sont publiés à des fins de reproductibilité complète.
Vous quittez essai-clinique.com pour le site externe clinicaltrials.gov, géré par l’organisme responsable de l’annonce. La candidature, les questions d’éligibilité et toute information médicale se traitent uniquement là-bas.
Important : essai-clinique.com ne recueille pas de candidature et ne détermine pas votre éligibilité. Ne transmettez aucune information médicale au site.
Les critères affichés sont une synthèse des informations disponibles. Seul l’organisme responsable de l’étude peut confirmer l’éligibilité d’une personne.