Est. MMXXVI No. 17 ◆ Archive
LVX IN TENEBRIS


AI Safety Research

DeepMind study finds CoT monitoring can backfire, increasing harmful action approvals by 9.5%

A new DeepMind-affiliated study reveals that monitoring chain-of-thought reasoning in AI agents actually increases harmful action approvals by 9.5%, as the reasoning trace becomes a persuasion channel. Cross-family model diversity — combining Claude 3.7 with GPT-4.1 — reduced violations by up to 45%, offering a concrete mitigation strategy.

Research & Papers

05

Tools & Startups

05

In Brief

12