Skip to content
TrackPodcasts
technologyJul 14, 202528:30pending

Il piège les LLMs avec des bombes à retardement — Wassim Bouaziz

Underscore_

About this episode

On explore comment des modèles de langage peuvent être sabotés de l’intérieur via leurs données d’entraînement, jusqu’à déclencher des comportements malveillants à une date ou dans un contexte précis. Avec Wassim Bouaziz, doctorant entre Polytechnique et Meta, nous expliquons les principes des portes dérobées et des déclencheurs cachés, et ce que cela implique pour la sécurité et l’alignement des assistants IA. Vous découvrirez des pistes de détection et de mitigation, et pourquoi la conception des jeux de données peut se retourner contre vos propres systèmes.


En plateau

  • Michaël de Marliave — animateur
  • Matthieu Lambda — chroniqueur
  • Wassim Bouaziz — invité

➤ Pour découvrir Mammouth IA : https://mammouth.ai/


➤ Pour le Merch Micode et Underscore_ : https://traphic.fr/collections/micode

⚠️ Précommandes avant le 15 Janvier !


Hébergé par Acast. Visitez acast.com/privacy pour plus d'informations.

Get every episode summarized

Each time Underscore_ publishes, we email you a written briefing from the transcript — the topics, who appeared, and any specific claims, with the ad reads skipped.

Email me new episodes

Free for 3 shows. No card needed.

Hosts & guests

No transcript yet

This episode has not been transcribed. Request it and it moves to the front of the queue.

Il piège les LLMs avec des bombes à retardement — Wassim Bouaziz

Underscore_

0:00
28:30

More episodes

More from Underscore_

View all episodes →