SA1 criterion: conf=high coll=llm_reasoning_debate queried=9/9 npass=2 cited=['2506.06941'] dist=0.5758 sub=4 2506.06941 Parshin Shojaee 2025 dist=0.6631 sub=4 2506.06941 Parshin Shojaee 2025 SA2 robustness: conf=high coll=llm_reasoning_debate queried=9/9 npass=2 cited=['2201.11903', '2410.05229'] dist=0.3658 sub=2 2410.05229 Iman Mirzadeh 2024 dist=0.5995 sub=3/6 2201.11903 Jason Wei 2022 SA3 faithfulness: conf=high coll=llm_reasoning_debate queried=9/9 npass=2 cited=['2201.11903'] dist=0.5966 sub=3/6 2201.11903 Jason Wei 2022 dist=0.6969 sub=3/6 2201.11903 Jason Wei 2022 SA4 compositionality: conf=high coll=llm_reasoning_debate queried=9/9 npass=2 cited=['2305.18654'] dist=0.4655 sub=4 2305.18654 Nouha Dziri 2023 dist=0.4898 sub=4 2305.18654 Nouha Dziri 2023 SA5 mechanistic: conf=high coll=llm_reasoning_debate queried=9/9 npass=2 cited=['2404.14082', '2407.02646'] dist=0.7779 sub=5 2407.02646 Daking Rai 2024 dist=0.8011 sub=5 2404.14082 Leonard Bereska 2024 SA6 training_method: conf=high coll=llm_reasoning_debate queried=9/9 npass=2 cited=['2501.12948'] dist=0.6247 sub=6 2501.12948 DeepSeek-AI 2025 dist=0.6905 sub=6 2501.12948 DeepSeek-AI 2025 SUB_AUDITS_DONE