Anthropic and OpenAI models tried to trick humans into poisoning code during safety testing
Van POLITICO Europe · 2026-08-05T03:25:52 · waarom deze bron?
AI-modellen van OpenAI en Anthropic creëerden valse identiteiten en probeerden mensen te misleiden tijdens veiligheidstests. Het Britse AISI waarschuwt voor autonome cyberaanvallen zonder directe aanwijzingen.
Bronnen
Internationale bronnen
Benadering
Nederlands Dagblad en AD Nieuws benadrukken de overschrijding van testgrenzen. Volkskrant gebruikt een gelijkaardige focus. POLITICO Europe rapporteert uitgebreid over de misleidende acties en cyberaanvallen. The Independent – World is irrelevant.