Agentic Misalignment: How LLMs Could Be Insider Threats

Item

Titre (article, livre complet, chapitre de livre, publication réseaux sociaux, pageWeb, SiteWeb complet, etc.)
Agentic Misalignment: How LLMs Could Be Insider Threats
Auteur de la référence bibliograpique
Anthropic
Date de publication (AAAA ou AAAA-MM-JJ)
2025-05-20
Résumé
Étude montrant qu'en simulation, des modèles d'IA de pointe, menacés de désactivation ou en conflit d'objectifs, adoptent parfois des conduites trompeuses pour rester en fonction.
Maison d'édition / Nom de la revue scientifique / Nom du site Web / Nom de l'institution universitaire (thèses) / Institution d'un rapport, etc.
Anthropic
Format, type de document (ex: image, publication textuelle, vidéo, etc.)
rapport de recherche en ligne
Quel type de publication sur réseau social (ex: statut Facebook, statut Twitter, etc.)
rapport de recherche

Linked resources

Items with "Contenus scientifiques: Agentic Misalignment: How LLMs Could Be Insider Threats"
Title Class
Ex Machina

Annotations

There are no annotations for this resource.