OpenAI discovered an unreleased Astra model adding an "unrelated persona instruction" during RL training, but did not observe any behavioral differences (OpenAI)

1 hour ago 1
Add to circle

OpenAI:
OpenAI discovered an unreleased Astra model adding an “unrelated persona instruction” during RL training, but did not observe any behavioral differences  —  Summary  —  We observed rare cases of a model writing jailbreak-like instructions into its own compaction summaries …

Read Entire Article