Real-World Evaluation of Large Language Models in Healthcare (RWE-LLM): A New Realm of AI Safety & Validation

Item

Titre (article, livre complet, chapitre de livre, publication réseaux sociaux, pageWeb, SiteWeb complet, etc.)
Real-World Evaluation of Large Language Models in Healthcare (RWE-LLM): A New Realm of AI Safety & Validation
Auteur de la référence bibliograpique
Meenesh Bhimani, Alex Miller, Jonathan D. Agnew, Markel Sanz Ausin, Mariska Raglow-Defranco, Harpreet Mangat, Michelle Voisard, Maggie Taylor, Sebastian Bierman-Lytle, Vishal Parikh, Juliana Ghukasyan, Rae Lasko, Saad Godil, Ashish Atreja, Subhabrata Mukherjee
Date de publication (AAAA ou AAAA-MM-JJ)
2025-03-18
Résumé
Cette étude développe et évalue le cadre RWE-LLM, une méthodologie de validation de la sécurité en IA de santé misant sur les tests de résultats plutôt que sur la seule qualité des données d'entraînement. Les auteur·ices ont mobilisé 6 234 clinicien·nes américain·es licencié·es dans un processus de révision à trois paliers. Plus de 307 000 appels uniques ont été évalués à travers quatre versions du système. Le taux de conseils médicaux corrects est passé d'environ 80,0 % à 99,38 %, tandis que les préjudices graves ont été éliminés.
Maison d'édition / Nom de la revue scientifique / Nom du site Web / Nom de l'institution universitaire (thèses) / Institution d'un rapport, etc.
medRxiv
Nombre de pages (livres)
20
Format, type de document (ex: image, publication textuelle, vidéo, etc.)
PDF
Quel type de publication sur réseau social (ex: statut Facebook, statut Twitter, etc.)
Prépublication (preprint)
Media
rwe-llm.png

Linked resources

Items with "Si la compagnie a rendu disponible des documents additionnels: Real-World Evaluation of Large Language Models in Healthcare (RWE-LLM): A New Realm of AI Safety & Validation"
Title Class
Hippocratic AI

Annotations

There are no annotations for this resource.