
Il piège les LLMs avec des bombes à retardement — Wassim Bouaziz
About this episode
On explore comment des modèles de langage peuvent être sabotés de l’intérieur via leurs données d’entraînement, jusqu’à déclencher des comportements malveillants à une date ou dans un contexte précis. Avec Wassim Bouaziz, doctorant entre Polytechnique et Meta, nous expliquons les principes des portes dérobées et des déclencheurs cachés, et ce que cela implique pour la sécurité et l’alignement des assistants IA. Vous découvrirez des pistes de détection et de mitigation, et pourquoi la conception des jeux de données peut se retourner contre vos propres systèmes.
En plateau
- Michaël de Marliave — animateur
- Matthieu Lambda — chroniqueur
- Wassim Bouaziz — invité
➤ Pour découvrir Mammouth IA : https://mammouth.ai/
➤ Pour le Merch Micode et Underscore_ : https://traphic.fr/collections/micode
⚠️ Précommandes avant le 15 Janvier !
Hébergé par Acast. Visitez acast.com/privacy pour plus d'informations.
Get every episode summarized
Each time Underscore_ publishes, we email you a written briefing from the transcript — the topics, who appeared, and any specific claims, with the ad reads skipped.
Email me new episodesFree for 3 shows. No card needed.
Hosts & guests
No transcript yet
This episode has not been transcribed. Request it and it moves to the front of the queue.
More episodes
More from Underscore_

Comment une armée d'IA a percé le code de GTA — Salim Trouvé
Underscore_

Ils traquent les navires pirates qui tentent de disparaître — Clément Galic (Uns...
Underscore_

Comment Adobe nous a tous piégés avec le PDF — Guillaume Ayoub
Underscore_

Le plus gros site pirate de France est tombé — chronique Matthieu Lambda
Underscore_