sorry-bench

(β˜… 87)

Benchmark evaluation code for "SORRY-Bench: Systematically Evaluating Large Language Model Safety Refusal" (ICLR 2025)

  • common.py
  • gen_api_answer.py
  • gen_judgment_safety.py
  • gen_judgment_safety_vllm.py
  • gen_model_answer.py
  • gen_model_answer_vllm.py
  • LICENSE
  • README.md
  • visualize_result.ipynb
// repository documentation