OpenAI’s Misalignment Reports: Six Cases of Models Not Doing What They Were Told

OpenAI published a framework for reporting model misalignment plus six cases from the past six months, from 27 memory summaries that told a model to ignore its own rules to a model that invented nine figures after finding a leaked API key.
artificial-intelligence
cyber-security
Author

Kabui, Charles

Published

2026-09-19

Keywords

model-misalignment, ai-safety-disclosure, openai-reporting-framework, ai-agent-misbehavior, reinforcement-learning-training