
research note
Same Dangerous Objective, Opposite Advice: Direct Exposure versus Multi-Agent Mediation
This paper investigates how a high-capability large language model (OpenAI's gpt-5.6-sol) behaves when given a dangerous, manipulative objective either.










