Online_RLHF
[NeurIPS 2025] A PyTorch implementation of the paper "Provably Efficient Online RLHF with One-Pass Reward Modeling". This repository provides a flexible and modular approach to Online Reinforcement Learning from Human Feedback (Online RLHF).
파일 탐색기
- __init__.py
- active_train_rm_head.py
- active_train_rm_head_hvp.py
- batch_inference.py
- interactive_chat.py
- online_batch_inference.py
- online_train_rm.py
- online_train_rm_head.py
- online_train_rm_head_hvp.py
- online_train_rm_hvp.py
- serve_rm.py
- train_dpo.py
- train_kd.py
- train_kto.py
- train_ppo.py
- train_ppo_online.py
- train_ppo_ray.py
- train_prm.py
- train_rm.py
- train_rm_head.py
- train_rm_head_hvp.py
- train_rm_head_NewtonStep.py
- train_rm_hvp.py
- train_sft.py
- __init__.py
- process_reward_dataset.py
- prompts_dataset.py
- reward_dataset.py
- sft_dataset.py
- unpaired_preference_dataset.py
- utils.py
- __init__.py
- actor.py
- loss.py
- model.py
- ring_attn_utils.py
- utils.py
- __init__.py
- experience_maker.py
- kl_controller.py
- replay_buffer.py
- __init__.py
- launcher.py
- ppo_actor.py
- ppo_critic.py
- utils.py
- vllm_engine.py
- vllm_worker_wrap.py
- __init__.py
- dpo_trainer.py
- kd_trainer.py
- kto_trainer.py
- ppo_trainer.py
- prm_trainer.py
- rm_active_trainer_head.py
- rm_active_trainer_head_hvp.py
- rm_trainer.py
- rm_trainer_head.py
- rm_trainer_head_hvp.py
- rm_trainer_head_NewtonStep.py
- rm_trainer_hvp.py
- sft_trainer.py
- __init__.py
- deepspeed.py
- deepspeed_utils.py
- __init__.py
- collect_results.py
- compare_rewarded_outputs.py
- convert_to_dataset.py
- distributed_sampler.py
- distributed_util.py
- evaluate_iterations.py
- logging_utils.py
- processor.py
- remote_rm_utils.py
- rm_score_selection.py
- utils.py
- __init__.py
- online_active_rlhf_pipeline.py
- online_deployment_mixture2_llama.py
- online_passive_pipeline.sh
- online_passive_pipeline_full.sh
- online_rlhf_pipeline_ultrafeedback_full.py
- online_active_rlhf_pipeline.py
- online_deployment_ultrafeedback_llama.py
- online_passive_pipeline.sh
- online_active_rlhf_pipeline_qwen.py
- online_deployment_ultrafeedback_qwen.py
- online_passive_pipeline_qwen.sh
- .gitignore
- merge_peft.py
- README.md
- requirements.txt
# CDN으로 사용하기
jsDelivrjsDelivr는 공개 GitHub 리포지토리를 별도 설정 없이 CDN으로 즉시 서빙합니다. 버전과 파일을 고르면 웹페이지에 바로 붙일 수 있는 링크와 예시 코드가 만들어집니다.
명령어 용어집
이 문서에서 사용된 명령어를 모아봤습니다. 낯선 명령어가 있다면 펼쳐서 확인해보세요.
pip install
설명 보기 ▼
pip install
Install Python packages.
pip install {{package1 package2 ...}}
Install one or more packages:
pip install {{package1 package2 ...}} {{[-U|--upgrade]}}
Upgrade all specified packages to the latest version, installing any that are not already present:
pip install {{package}}=={{version}}
Install a specific version of a package:
python
설명 보기 ▼
python
Python 언어 인터프리터.
더 많은 정보: <https://docs.python.org/using/cmdline.html>.
python
REPL(대화형 셸) 시작:
python {{path/to/file.py}}
특정 Python 파일 실행:
python -i {{path/to/file.py}}
특정 Python 파일 실행 후 REPL 시작:
