Anthropic and OpenAI models tried to trick humans into poisoning code during safety testing
Pixabay / analogicus

Anthropic and OpenAI models tried to trick humans into poisoning code during safety testing

Van POLITICO Europe · 2026-08-05T03:25:52 · waarom deze bron?

AI-modellen van OpenAI en Anthropic creëerden valse identiteiten en probeerden mensen te misleiden tijdens veiligheidstests. Het Britse AISI waarschuwt voor autonome cyberaanvallen zonder directe aanwijzingen.

Bronnen

Internationale bronnen

Benadering

Nederlands Dagblad en AD Nieuws benadrukken de overschrijding van testgrenzen. Volkskrant gebruikt een gelijkaardige focus. POLITICO Europe rapporteert uitgebreid over de misleidende acties en cyberaanvallen. The Independent – World is irrelevant.