Add Distributional AGI Safety paper
## New Paper
Adding a simulation study of governance trade-offs in multi-agent AI systems using probabilistic soft labels to the **Social Simulation & Agent Societies** section.
**Key contributions:**
- Identifies a critical adversarial threshold (37.5–50%) beyond which governance mechanisms fail in multi-agent populations
- Demonstrates that structural collusion detection provides qualitatively different protection than individual-level governance levers (taxes, staking, audits)
- Replaces binary safety labels with calibrated probabilities to capture adverse selection dynamics invisible to classification
Framework + paper: https://github.com/swarm-ai-safety/swarm
合并状态:未合并 关闭于 2026-02-12 1 条评论