SongGen
[ICML 2025] SongGen: A Single Stage Auto-regressive Transformer for Text-to-Song Generation
파일 탐색기
최종 버전 다운로드 (.zip)- motivation1.jpg
- init_model_mixed.py
- data_musiccaps.json
- inter_A_V_step1_5.json
- inter_A_V_step2_a.json
- inter_A_V_step2_b.json
- inter_A_V_step3.json
- mixed_pro_step1.json
- mixed_pro_step2_a.json
- mixed_pro_step2_b.json
- mixed_pro_step3.json
- __init__.py
- lyrics_encoder.py
- lyrics_tokenizer.py
- vocab.json
- zh_num2words.py
- config_hubert_general.yaml
- baseline.yml
- diff-mb.yml
- equal-mb.yml
- no-adv.yml
- no-data-balance.yml
- no-low-hop.yml
- no-mb.yml
- no-mpd-msd.yml
- no-mpd.yml
- only-speech.yml
- 1024x.yml
- 128x.yml
- 1536x.yml
- 768x.yml
- 16khz.yml
- 24khz.yml
- 44khz-16kbps.yml
- 44khz.yml
- 24kbps.yml
- 256d.yml
- 2d.yml
- 32d.yml
- 4d.yml
- 512d.yml
- dropout-0.0.yml
- dropout-0.25.yml
- dropout-0.5.yml
- medium.yml
- small.yml
- 1gpu.yml
- base.yml
- __init__.py
- encodec.py
- __init__.py
- base.py
- dac.py
- discriminator.py
- __init__.py
- layers.py
- loss.py
- quantize.py
- __init__.py
- decode.py
- encode.py
- __init__.py
- __main__.py
- compute_entropy.py
- evaluate.py
- get_samples.py
- mushra.py
- organize_daps.py
- save_test_set.py
- train.py
- train_no_adv.py
- __init__.py
- test_cli.py
- test_train.py
- .dockerignore
- .gitattributes
- .gitignore
- .pre-commit-config.yaml
- __init__.py
- docker-compose.yml
- Dockerfile
- Dockerfile.dev
- LICENSE
- requirements.txt
- setup.py
- __init__.py
- msstftd.py
- soundstream.py
- soundstream2.py
- soundstream_semantic.py
- __init__.py
- base_layers.py
- position_encoding.py
- pqmf.py
- torch_stft.py
- __init__.py
- frequency_discriminator.py
- __init__.py
- conv.py
- loss.py
- lstm.py
- norm.py
- seanet.py
- semantic_module.py
- transformer.py
- __init__.py
- ac.py
- core_vq.py
- core_vq_lsx_version.py
- distrib.py
- vq.py
- __init__.py
- ddp_utils.py
- hifigan_mel.py
- utils.py
- __init__.py
- inference.py
- main_launch_vqdp.py
- requirements.txt
- __init__.py
- configuration_xcodec.py
- modeling_xcodec.py
- __init__.py
- configuration_songgen.py
- custom_modeling_outputs.py
- logits_processors.py
- modeling_songgen_dual_track.py
- modeling_songgen_mixed.py
- processing_songgen.py
- __init__.py
- arguments.py
- data.py
- eval.py
- my_proxy.py
- preprocess_data.py
- README.md
- run_songgen_training_dual_track.py
- run_songgen_training_mixed.py
- utils.py
- .gitignore
- LICENSE.txt
- README.md
- setup.py
# 설치 가이드
1. 코드 내려받기
git clone https://github.com/LiuZH-19/SongGen
깃허브에서 프로젝트 코드 전체를 내 컴퓨터로 내려받습니다.
cd SongGen
방금 내려받은 프로젝트 폴더 안으로 이동합니다.
2. 공식 설치 스크립트
쉬움 추천사전 준비물
- Python 3 pip 명령어를 쓰려면 Python이 필요합니다.
pip install torch==2.3.0 torchvision==0.18.0 torchaudio==2.3.0 --index-url https://download.pytorch.org/whl/cu118
PyPI에 배포된 패키지를 바로 설치합니다. 소스 클론이 필요 없습니다.
pip install flash-attn==2.6.1 --no-build-isolation
PyPI에 배포된 패키지를 바로 설치합니다. 소스 클론이 필요 없습니다.
설치 후 새 터미널을 열고, 프로그램의 버전 확인 명령(예: --version)으로 정상 설치됐는지 확인하세요.
이 레포의 README에 적힌 실제 명령어를 그대로 가져왔습니다.
3. Docker
쉬움사전 준비물
- Git GitHub에서 프로젝트 코드를 내려받으려면 필요합니다.
- Docker Desktop 컨테이너를 빌드하고 실행하려면 필요합니다. 설치 후 실행해서 백그라운드에 켜두세요.
⚠️ 이 프로젝트는 규모가 큰 저장소라, 이 방법이 실제 핵심 제품이 아니라 내부 하위 패키지를 가리키는 것일 수 있습니다. README 전체를 함께 확인해보세요.
docker compose -f songgen/xcodec_wrapper/xcodec_infer/descriptaudiocodec/docker-compose.yml up -d --build
compose 설정 파일에 정의된 서비스들을 대상으로 명령을 실행합니다.
터미널에 docker compose ps 를 입력해 컨테이너들이 Up 상태인지 확인하세요. README에 포트 번호가 적혀있다면 브라우저에서 http://localhost:포트번호 로 접속해보세요.
4. Python
쉬움사전 준비물
pip install torch==2.3.0 torchvision==0.18.0 torchaudio==2.3.0 --index-url https://download.pytorch.org/whl/cu118
PyPI에 배포된 패키지를 바로 설치합니다. 소스 클론이 필요 없습니다.
pip install flash-attn==2.6.1 --no-build-isolation
PyPI에 배포된 패키지를 바로 설치합니다. 소스 클론이 필요 없습니다.
pip install -e .
requirements.txt 등에 명시된 파이썬 라이브러리를 설치합니다.
에러 메시지 없이 실행되고 터미널에 안내 문구가 출력되면 정상입니다.
이 레포의 README에 적힌 실제 명령어를 그대로 가져왔습니다.
// repository documentation
Was this content helpful?
(0 ratings)
