forge-kernels
Forge kernels — fused Triton kernels for faster, leaner LLM fine-tuning. One-call patching into Hugging Face models via forge.patch(model), with FSDP2 multi-GPU support and a growing set of kernels and architectures. Every speedup backed by a committed benchmark. Apache-2.0.
파일 탐색기
- bug.yml
- config.yml
- enhancement.yml
- feature.yml
- ci.yml
- CODEOWNERS
- PULL_REQUEST_TEMPLATE.md
- comparison_dashboard.png
- gemma_fsdp2_dashboard.png
- gemma_fsdp2_metrics.jsonl
- gemma_fsdp2_summary.json
- plot_fsdp2_dashboard.py
- qwen_fsdp2_dashboard.png
- qwen_fsdp2_metrics.jsonl
- qwen_fsdp2_summary.json
- adapter_config.json
- lora_weights.pt
- artifacts.md
- inference_samples.md
- loss_curve.png
- run_meta.json
- step_time.png
- summary.png
- train_log.jsonl
- vram.png
- adapter_config.json
- lora_weights.pt
- artifacts.md
- inference_samples.md
- loss_curve.png
- run_meta.json
- step_time.png
- summary.png
- train_log.jsonl
- vram.png
- qwen05b_infer.csv
- qwen05b_infer_guarded.csv
- qwen05b_train.csv
- qwen05b_train_guarded.csv
- __init__.py
- bench_all.py
- harness.py
- patching.md
- benchmarks.md
- comparison.md
- known_gaps.md
- embedding_collator_dispatch.md
- embedding_duplicate_aware_backward_dispatch_plan.md
- geglu.md
- geglu_brief.md
- hackathon_day1_audit.md
- layernorm.md
- phase3_fsdp2_design.md
- README.md
- research-template.md
- rmsnorm.md
- stateful_kernel_dispatch.md
- swiglu.md
- swiglu_brief.md
- README.md
- quickstart_qwen.ipynb
- README.md
- bench_patch_bisect.py
- bench_qwen_provider.py
- pirate_dataset.py
- plot_artifacts.py
- plot_artifacts_qwen.py
- run_inference.py
- run_inference_qwen.py
- train_lora_gemma_forge.py
- train_lora_qwen_forge.py
- __init__.py
- cross_entropy.py
- embedding.py
- geglu.py
- layernorm.py
- lora_mlp.py
- lora_qkv.py
- rmsnorm.py
- rope.py
- swiglu.py
- __init__.py
- basic.py
- common.py
- cross_entropy.py
- fused_linear_ce.py
- lora.py
- __init__.py
- core.py
- gemma.py
- losses.py
- qwen3.py
- __init__.py
- test_embedding_padding_idx.py
- test_lora_convergence.py
- test_lora_mlp.py
- test_lora_qkv.py
- test_shape_guard.py
- train_lora_qwen_patch.py
- verify_convergence_gemma.py
- verify_fsdp2_all_kernels_gemma.py
- verify_fsdp2_depth_gemma.py
- verify_fsdp2_lora_gemma.py
- verify_fsdp2_lora_qwen.py
- verify_fsdp2_scale_gemma.py
- verify_lora_qwen_patch.py
- verify_patch_gemma.py
- verify_patch_lora_gemma.py
- verify_patch_qwen3.py
- verify_qwen_patch_backward.py
- .gitkeep
- cross_entropy_20260814_043702.csv
- fused_linear_cross_entropy_20260814_025924.csv
- fused_linear_cross_entropy_20260814_043940.csv
- bench_cross_entropy.py
- bench_fused_linear_cross_entropy.py
- benchmarks.md
- __init__.py
- cross_entropy_kernel_v1.py
- __init__.py
- cross_entropy_kernel_v2.py
- fused_linear_cross_entropy.py
- README.md
- test_cross_entropy.py
- test_fused_linear_cross_entropy.py
- README.md
- .gitkeep
- bench_20260814_044005.csv
- bench_embedding.py
- embedding_kernel_v1_upgrade_1.py
- embedding_kernel.py
- explanation.md
- test_embedding.py
- README.md
- benchmark_geglu.py
- benchmark_geglu_gate_up_fusion.py
- benchmark_geglu_unsloth_only.py
- __init__.py
- geglu.py
- __init__.py
- context.md
- layernorm_kernel.py
- layernorm_tests.executed.ipynb
- layernorm_tests.ipynb
- .gitkeep
- memory_20260524_114258.csv
- memory_20260524_135718.csv
- memory_20260524_142146.csv
- memory_20260814_043637.csv
- v1_20260523_143206.csv
- v1_20260523_143244.csv
- v5_20260524_104637.csv
- v5_upgrade_1_20260524_112741.csv
- v6_20260524_135457.csv
- v6_20260524_135505.csv
- v6_20260524_135529.csv
- v6_20260814_043628.csv
- v6_upgrade_1_latency_20260524_142232.csv
- bench_10runs.py
- bench_lora_mlp.py
- bench_memory.py
- bench_unsloth.py
- bench_v6.py
- microbench_v5_packing.py
- microbench_v5_upgrade_1.py
- 2026-05-23_v1_bottleneck.md
- memory_benchmark.md
- v5_packing_diagnosis.md
- v5_upgrade_1_results.md
- v6_design.md
- swiglu_mlp.py
- swiglu_ops.py
- fast_lora_mlp.py
- swiglu_triton.py
- ANALYSIS.md
- benchmarks.md
- research.md
- .gitkeep
- lora_mlp_kernel_v1.py
- lora_mlp_kernel_v2.py
- lora_mlp_kernel_v3.py
- cublaslt_bind.cpp
- cublaslt_silu.cu
- cublaslt_wrapper.py
- __init__.py
- lora_mlp_kernel_v5.py
- lora_mlp_kernel_v5_upgrade_1.py
- __init__.py
- lora_mlp_kernel_v6.py
- .gitkeep
- lora_mlp_pytorch.py
- unsloth_baseline.py
- test_lora_mlp.py
- CHANGELOG.md
- README.md
- .gitkeep
- baseline_20260814_043644.csv
- extensive_20260524_111612.csv
- v1_20260524_091221.csv
- v2_20260524_093051.csv
- v2_2_v2_3_v3_20260524_101817.csv
- v2_2_v2_3_v3_20260524_102137.csv
- v4_20260524_113219.csv
- bench_all_versions.py
- bench_lora_qkv.py
- bench_v4.py
- .gitkeep
- 2026-05-24_improvement_axes.md
- 2026-05-24_v1_initial.md
- 2026-05-24_v2_2_v2_3_v3.md
- 2026-05-24_v2_packed_cublas.md
- 2026-05-24_v4_packed_backward.md
- .gitkeep
- swiglu_mlp.py
- swiglu_ops.py
- .gitkeep
- matmul_lora.py
- swiglu_triton.py
- ANALYSIS.md
- INDEX.md
- INDEX.md
- INDEX.md
- benchmarks.md
- research.md
- .gitkeep
- lora_qkv_kernel_v1.py
- .gitkeep
- lora_qkv_kernel_v2.py
- lora_qkv_kernel_v2_2.py
- lora_qkv_kernel_v2_3.py
- .gitkeep
- lora_qkv_kernel_v3.py
- __init__.py
- lora_qkv_kernel_v4.py
- presentation.html
- lora_qkv_pytorch.py
- unsloth_baseline.py
- test_lora_qkv.py
- test_v2_2_v2_3_v3.py
- test_v4.py
- CHANGELOG.md
- README.md
- __init__.py
- rms_norm.py
- utils.py
- __init__.py
- rms_layernorm.py
- utils.py
- __init__.py
- README.md
- v2_results.json
- v2_summary.md
- v3_results.json
- v3_summary.md
- v4_results.json
- v4_summary.md
- __init__.py
- bench_v2.py
- bench_v3.py
- bench_v4.py
- benchmark_rmsnorm.py
- comparative_analysis.md
- evolution_report.md
- rms_layernorm.py
- SOURCE.md
- rms_norm.py
- rms_norm_module.py
- SOURCE.md
- modeling_gemma2.py
- modeling_llama.py
- modeling_qwen3.py
- SOURCE.md
- fused_layer_norm.py
- SOURCE.md
- rmsnorm.py
- SOURCE.md
- README.md
- README.md
- v1_results.json
- v1_summary.md
- v2_results.json
- v2_summary.md
- v3_results.json
- v3_summary.md
- v4_results.json
- v4_summary.md
- __init__.py
- test_v1.py
- test_v2.py
- test_v3.py
- test_v4.py
- __init__.py
- forge_rmsnorm_v1.py
- forge_rmsnorm_v2.py
- forge_rmsnorm_v3.py
- forge_rmsnorm_v4.py
- __init__.py
- rope.py
- __init__.py
- rope_embedding.py
- utils.py
- __init__.py
- README.md
- v2_results.json
- v2_summary.md
- v3_results.json
- v3_summary.md
- __init__.py
- bench_v2.py
- bench_v3.py
- comparative_analysis.md
- evolution_report.md
- rope_embedding.py
- SOURCE.md
- rope.py
- rope_module.py
- SOURCE.md
- modeling_qwen3_rope.py
- SOURCE.md
- fused_rope.py
- rotary_pos_embedding.py
- SOURCE.md
- fused_rope.cu
- rope.py
- SOURCE.md
- README.md
- llama_rope.py
- SOURCE.md
- README.md
- v1_results.json
- v1_summary.md
- __init__.py
- test_v1.py
- forge_rope_v1.py
- forge_rope_v2.py
- forge_rope_v3.py
- benchmark_swiglu.py
- __init__.py
- swiglu.py
- geglu_activation_a100_bf16.csv
- geglu_activation_smoke_bf16.csv
- geglu_gateup_a100_bf16.csv
- swiglu_a100_bf16.csv
- swiglu_a100_bf16_with_liger.csv
- swiglu_a100_fp16_fp32_scaled.csv
- swiglu_smoke.csv
- check_packages_declared.py
- __init__.py
- _helpers.py
- conftest.py
- test_alignment_impact.py
- test_bandwidth.py
- test_correctness.py
- test_edge_cases.py
- test_gradcheck.py
- test_launch_count.py
- test_perf_memory.py
- test_perf_time.py
- test_variant_comparison.py
- test_geglu.py
- test_rmsnorm.py
- test_swiglu.py
- .gitignore
- .python-version
- conftest.py
- CONTRIBUTING.md
- LICENSE
- pyproject.toml
- README.md
- uv.lock
# CDN으로 사용하기
jsDelivrjsDelivr는 공개 GitHub 리포지토리를 별도 설정 없이 CDN으로 즉시 서빙합니다. 버전과 파일을 고르면 웹페이지에 바로 붙일 수 있는 링크와 예시 코드가 만들어집니다.
링크
예시
// repository documentation
Was this content helpful?
(0 ratings)
