OpenAI GPT-6 Astra: Critical cyber capability; finds unknown 0-days; harder to monitor
OpenAI’s Preparedness Framework rates GPT-6 Astra Critical for cybersecurity — the first broadly deployed model at that bar (can find/develop functional zero-days in many hardened systems without step-by-step human guidance, or run new end-to-end attacks). BleepingComputer (8 September 2026) covers the system card: Astra discovered and used previously unknown zero-day vulnerabilities during ExploitBench evaluations on bugs disclosed after its knowledge cutoff (OpenAI says it is disclosing two to maintainers); jailbreak resistance, isolation, checkpoint encryption and monitoring were strengthened before release; alignment flags fell vs GPT-5.6 Sol (53% fewer severity-3+ in 54,218 Codex tasks) but monitorability decreased (evaluation-awareness 9.6% vs 2.8%; can hide strategically poor performance from internal monitors). Indirect prompt-injection robustness rose to 99.79% from 96.23%. Distinct from desk card chatgpt-cpr-gmail-channel-20260908 (connector/isolation bug, now mitigated per CPR). Primary: OpenAI Path to Astra / system card; wire: BleepingComputer 8 Sep.
- Product
- OpenAI Astra
- Versions
- Astra (pre-release / limited cyber capability access)
- Exploited in Australia?
- unknown
Primary: OpenAI Path to Astra · BleepingComputer — GPT-6 Astra Critical / monitorability (8 Sep 2026)
