[un]prompted 2026 Day 1 Main 28m talk 5m read Glass-Box Security: Operationalizing Mechanistic Interpretability for Defending AI Agents Carl Hurd ai securitydefensive security