Real-World Evaluation of Large Language Models in Healthcare (RWE-LLM): A New Realm of AI Safety & Validation
Item
- Titre (article, livre complet, chapitre de livre, publication réseaux sociaux, pageWeb, SiteWeb complet, etc.)
- Real-World Evaluation of Large Language Models in Healthcare (RWE-LLM): A New Realm of AI Safety & Validation
- Auteur de la référence bibliograpique
- Meenesh Bhimani, Alex Miller, Jonathan D. Agnew, Markel Sanz Ausin, Mariska Raglow-Defranco, Harpreet Mangat, Michelle Voisard, Maggie Taylor, Sebastian Bierman-Lytle, Vishal Parikh, Juliana Ghukasyan, Rae Lasko, Saad Godil, Ashish Atreja, Subhabrata Mukherjee
- Date de publication (AAAA ou AAAA-MM-JJ)
- 2025-03-18
- Résumé
- Cette étude développe et évalue le cadre RWE-LLM, une méthodologie de validation de la sécurité en IA de santé misant sur les tests de résultats plutôt que sur la seule qualité des données d'entraînement. Les auteur·ices ont mobilisé 6 234 clinicien·nes américain·es licencié·es dans un processus de révision à trois paliers. Plus de 307 000 appels uniques ont été évalués à travers quatre versions du système. Le taux de conseils médicaux corrects est passé d'environ 80,0 % à 99,38 %, tandis que les préjudices graves ont été éliminés.
- Maison d'édition / Nom de la revue scientifique / Nom du site Web / Nom de l'institution universitaire (thèses) / Institution d'un rapport, etc.
- medRxiv
- Nombre de pages (livres)
- 20
- Format, type de document (ex: image, publication textuelle, vidéo, etc.)
- Quel type de publication sur réseau social (ex: statut Facebook, statut Twitter, etc.)
- Prépublication (preprint)
- URL (adresse Web)
- https://www.medrxiv.org/content/10.1101/2025.03.17.25324157v1
- Media
rwe-llm.png
Linked resources
| Title | Class |
|---|---|
Hippocratic AI |
Annotations
There are no annotations for this resource.

