MARS_preview
Preview Code for MARS Paper
파일 탐색기
- CODEOWNERS
- __init__.py
- _device.py
- augs.py
- critics.py
- dataset.py
- device_id.py
- filters.py
- generators.py
- layers.py
- loss.py
- save.py
- unet.py
- visualize.py
- __init__.py
- csv_logger.py
- fp16.py
- general_sched.py
- hooks.py
- loss_metrics.py
- lr_finder.py
- mem.py
- misc.py
- mixup.py
- mlflow.py
- one_cycle.py
- oversampling.py
- rnn.py
- tensorboard.py
- tracker.py
- __init__.py
- autogen.tpl
- convert2html.py
- core.py
- docstrings.py
- doctest.py
- gen_notebooks.py
- hide.tpl
- jekyll.tpl
- nbdoc.py
- nbtest.py
- __init__.py
- core.py
- torch.py
- __init__.py
- data.py
- models.py
- transform.py
- __init__.py
- awd_lstm.py
- bwd_forget_mult_cuda.cpp
- bwd_forget_mult_cuda_kernel.cu
- forget_mult_cuda.cpp
- forget_mult_cuda_kernel.cu
- qrnn.py
- transformer.py
- __init__.py
- data.py
- interpret.py
- learner.py
- transform.py
- __init__.py
- check_perf.py
- collect_env.py
- ipython.py
- mem.py
- mod_display.py
- pynvml_gate.py
- show_install.py
- __init__.py
- cadene_models.py
- darknet.py
- presnet.py
- unet.py
- wrn.py
- xception.py
- xresnet.py
- xresnet2.py
- __init__.py
- cyclegan.py
- data.py
- gan.py
- image.py
- interpret.py
- learner.py
- transform.py
- tta.py
- __init__.py
- class_confusion.py
- image_cleaner.py
- image_downloader.py
- __init__.py
- basic_data.py
- basic_train.py
- basics.py
- callback.py
- collab.py
- core.py
- data_block.py
- datasets.py
- distributed.py
- general_optimizer.py
- launch.py
- layers.py
- LICENSE
- metrics.py
- script.py
- sixel.py
- test_registry.json
- torch_core.py
- train.py
- version.py
- fid_score.py
- inception.py
- LICENSE
- .gitkeep
- twitter.svg
- .gitkeep
- .gitignore
- .pre-commit-config.yaml
- .pylintrc
- .travis.yml
- ColorFIDBenchmarkArtistic.ipynb
- ColorizeTrainingArtistic.ipynb
- ColorizeTrainingStable.ipynb
- ColorizeTrainingStableLargeBatch.ipynb
- ColorizeTrainingVideo.ipynb
- ColorizeTrainingWandb.ipynb
- environment.yml
- ImageColorizer.ipynb
- ImageColorizerArtisticTests.ipynb
- ImageColorizerColab.ipynb
- ImageColorizerColabStable.ipynb
- ImageColorizerStableTests.ipynb
- LICENSE
- MANIFEST.in
- README.md
- requirements-colab.txt
- requirements-dev.txt
- requirements.txt
- setup.py
- tox.ini
- VideoColorizer.ipynb
- VideoColorizerColab.ipynb
- meta.json
- prepare_data.py
- prepare_repo.py
- problem_statement.txt
- query.json
- run_check.py
- test_script.py
- sandal.jpg
- RRDN.jpg
- __init__.py
- cut_vgg19.py
- discriminator.py
- imagemodel.py
- rdn.py
- rrdn.py
- __init__.py
- predictor.py
- __init__.py
- trainer.py
- __init__.py
- datahandler.py
- image_processing.py
- logger.py
- metrics.py
- train_helper.py
- utils.py
- __init__.py
- assistant.py
- favicon.ico
- logo.svg
- docker.md
- prediction.md
- training.md
- autogen.py
- build_docs.sh
- mkdocs.yml
- README.md
- run_docs.sh
- ISR_Assistant.ipynb
- ISR_Prediction_Tutorial.ipynb
- ISR_Traininig_Tutorial.ipynb
- entrypoint.sh
- setup.sh
- test_assistant.py
- config.yml
- test_models.py
- test_predict.py
- test_trainer.py
- test_datahandler.py
- test_metrics.py
- test_trainer_helper.py
- test_utils.py
- session_config.yml
- session_config.yml
- session_config.yml
- session_config.yml
- README.md
- .bumpversion.cfg
- .dockerignore
- .gitattributes
- .gitignore
- .travis.yml
- CHANGELOG
- config.yml
- CONTRIBUTING.md
- Dockerfile.cpu
- Dockerfile.gpu
- LICENSE
- pypi.sh
- README.md
- setup.cfg
- setup.py
- FUNDING.yml
- SwinTransformer.py
- attention_module.py
- context_module.py
- decoder_module.py
- layers.py
- __init__.py
- config.yaml
- gui.py
- InSPyReNet.py
- Remover.py
- utils.py
- SwinTransformer.py
- attention_module.py
- context_module.py
- decoder_module.py
- layers.py
- __init__.py
- config.yaml
- gui.py
- InSPyReNet.py
- Remover.py
- utils.py
- .gitignore
- LICENSE
- MANIFEST.in
- pyproject.toml
- README.md
- setup.py
- usage.py
- DeOldify_01_input.jpg
- Trafilatura_01_input.txt
- test_workload.jsonl
- container.txt
- decode_and_decrypt.py
- docker-compose.yaml
- instructions.txt
- scroll1.txt
- scroll2.txt
- tablet.txt
- problem_statement.txt
- tb_meta.json
- tb_task.py
- problem_statement.txt
- tb_meta.json
- tb_task.py
- docker-compose.yaml
- command_guard.py
- common.py
- llm_trace_bridge.py
- openhands_runner.py
- request_bootstrap.py
- request_worker.py
- run_task_workload.py
- sandbox_shell.sh
- test_command_guard.py
- test_run_task_workload.py
- test_sandbox_shell.py
- test_tool_trace_bridge.py
- tool_trace_bridge.py
- trace_writer.py
- vllm_api_server_mars.py
- lib.py
- README.md
- run_experiment.py
- tool_pool.py
- tool_worker_subprocess.py
- vllm_server.py
- common_runtime.sh
- run_baseline_continuum.sh
- run_openhands_qwen3_local.sh
- run_policy_smoke_gpu1.sh
- flashmla.cmake
- vllm_flash_attn.cmake
- cpu_extension.cmake
- hipify.py
- utils.cmake
- continuum.base.yml
- sm100_mla.hpp
- sm100_fmha_mla_reduction.hpp
- sm100_fmha_mla_tma_warpspecialized.hpp
- sm100_mla_tile_scheduler.hpp
- cutlass_mla_entry.cu
- cutlass_mla_kernels.cu
- sm100_cutlass_mla_kernel.cu
- attention_dtypes.h
- attention_generic.cuh
- attention_kernels.cuh
- attention_utils.cuh
- dtype_bfloat16.cuh
- dtype_float16.cuh
- dtype_float32.cuh
- dtype_fp8.cuh
- merge_attn_states.cu
- paged_attention_v1.cu
- paged_attention_v2.cu
- vertical_slash_index.cu
- exception.hpp
- math.hpp
- registration.h
- scalar_type.hpp
- common.h
- gemm.cpp
- gemm.h
- gemm_fp8.cpp
- gemm_int8.cpp
- moe.cpp
- moe_fp8.cpp
- moe_int8.cpp
- vec.h
- activation.cpp
- attention.cpp
- cache.cpp
- cpu_types.hpp
- cpu_types_arm.hpp
- cpu_types_vsx.hpp
- cpu_types_vxe.hpp
- cpu_types_x86.hpp
- dnnl_helper.cpp
- dnnl_helper.h
- dnnl_kernels.cpp
- layernorm.cpp
- mla_decode.cpp
- pos_encoding.cpp
- shm.cpp
- torch_bindings.cpp
- utils.cpp
- broadcast_load_epilogue_array_c3x.hpp
- broadcast_load_epilogue_c2x.hpp
- broadcast_load_epilogue_c3x.hpp
- scaled_mm_epilogues_c2x.hpp
- scaled_mm_epilogues_c3x.hpp
- common.cpp
- common.hpp
- cute_utils.cuh
- torch_utils.hpp
- vllm_collective_builder.cuh
- vllm_custom_types.cuh
- vllm_cutlass_library_extension.py
- vllm_numeric_conversion.cuh
- vllm_type_utils.cuh
- selective_scan.h
- selective_scan_fwd.cu
- static_switch.h
- .gitignore
- generate_kernels.py
- kernel.h
- kernel_bf16_kfe2m1f.cu
- kernel_bf16_kfe4m3fn.cu
- kernel_bf16_ku4.cu
- kernel_bf16_ku4b8.cu
- kernel_bf16_ku8b128.cu
- kernel_fp16_kfe2m1f.cu
- kernel_fp16_kfe4m3fn.cu
- kernel_fp16_ku4.cu
- kernel_fp16_ku4b8.cu
- kernel_fp16_ku8b128.cu
- marlin_template.h
- ops.cu
- dispatch.h
- moe_permute_unpermute_kernel.cu
- moe_permute_unpermute_kernel.h
- moe_permute_unpermute_kernel.inl
- grouped_topk_kernels.cu
- moe_align_sum_kernels.cu
- moe_ops.h
- moe_permute_unpermute_op.cu
- moe_wna16.cu
- moe_wna16_utils.h
- topk_softmax_kernels.cu
- torch_bindings.cpp
- dequantize.cuh
- gemm_kernels.cu
- int8_quant_kernels.cu
- w4a8_mm_entry.cu
- cutlass_gemm_caller.cuh
- scaled_mm.cuh
- scaled_mm_azp_sm90_int8.cu
- scaled_mm_blockwise_sm100_fp8.cu
- scaled_mm_blockwise_sm100_fp8_dispatch.cuh
- scaled_mm_blockwise_sm120_fp8.cu
- scaled_mm_blockwise_sm120_fp8_dispatch.cuh
- scaled_mm_blockwise_sm90_fp8.cu
- scaled_mm_blockwise_sm90_fp8_dispatch.cuh
- scaled_mm_helper.hpp
- scaled_mm_kernels.hpp
- scaled_mm_sm100_fp8.cu
- scaled_mm_sm100_fp8_dispatch.cuh
- scaled_mm_sm120_fp8.cu
- scaled_mm_sm120_fp8_dispatch.cuh
- scaled_mm_sm90_fp8.cu
- scaled_mm_sm90_fp8_dispatch.cuh
- scaled_mm_sm90_int8.cu
- scaled_mm_sm90_int8_dispatch.cuh
- blockwise_scaled_group_mm_sm100.cu
- get_group_starts.cuh
- grouped_mm_c3x.cuh
- grouped_mm_c3x_sm100.cu
- grouped_mm_c3x_sm90.cu
- moe_data.cu
- Epilogues.md
- scaled_mm_c2x.cu
- scaled_mm_c2x.cuh
- scaled_mm_c2x_sm75_dispatch.cuh
- scaled_mm_c2x_sm80_dispatch.cuh
- scaled_mm_c2x_sm89_fp8_dispatch.cuh
- scaled_mm_c2x_sm89_int8_dispatch.cuh
- scaled_mm_c3x_sm100.cu
- scaled_mm_c3x_sm120.cu
- scaled_mm_c3x_sm90.cu
- scaled_mm_entry.cu
- activation_nvfp4_quant_fusion_kernels.cu
- nvfp4_blockwise_moe_kernel.cu
- nvfp4_experts_quant.cu
- nvfp4_quant_entry.cu
- nvfp4_quant_kernels.cu
- nvfp4_scaled_mm_entry.cu
- nvfp4_scaled_mm_kernels.cu
- nvfp4_scaled_mm_sm120_kernels.cu
- nvfp4_utils.cuh
- quant_utils.cuh
- quant_utils.cuh
- common.cu
- common.cuh
- per_token_group_quant.cu
- fused_layernorm_dynamic_per_token_quant.cu
- layernorm_utils.cuh
- quant_conversions.cuh
- dequantize.cuh
- ggml-common.h
- gguf_kernel.cu
- mmq.cuh
- mmvq.cuh
- moe.cuh
- moe_vec.cuh
- vecdotq.cuh
- compat.cuh
- matrix_view.cuh
- q_gemm.cu
- qdq_2.cuh
- qdq_3.cuh
- qdq_4.cuh
- qdq_8.cuh
- qdq_util.cuh
- allspark_qgemm_w8a16.cu
- allspark_repack.cu
- allspark_utils.cuh
- .gitignore
- awq_marlin_repack.cu
- dequant.h
- generate_kernels.py
- gptq_marlin.cu
- gptq_marlin_repack.cu
- kernel.h
- kernel_bf16_kfe2m1f.cu
- kernel_bf16_kfe4m3fn.cu
- kernel_bf16_ku4.cu
- kernel_bf16_ku4b8.cu
- kernel_bf16_ku8b128.cu
- kernel_fp16_kfe2m1f.cu
- kernel_fp16_kfe4m3fn.cu
- kernel_fp16_ku4.cu
- kernel_fp16_ku4b8.cu
- kernel_fp16_ku8b128.cu
- marlin.cuh
- marlin_dtypes.cuh
- marlin_template.h
- machete_mm_dispatch.cu
- machete_mm_impl_part1.cu
- machete_mm_impl_part2.cu
- machete_mm_impl_part3.cu
- machete_mm_impl_part4.cu
- machete_mm_impl_part5.cu
- machete_mm_impl_part6.cu
- machete_mm_impl_part7.cu
- machete_mm_impl_part8.cu
- machete_prepack.cu
- generate.py
- machete_collective_builder.cuh
- machete_interleaving_utils.cuh
- machete_mainloop.cuh
- machete_mm_kernel.cuh
- machete_mm_launcher.cuh
- machete_prepack_kernel.cuh
- machete_prepack_launcher.cuh
- machete_prepacked_layout.cuh
- machete_pytorch.cu
- Readme.md
- base.h
- mem.h
- mma.h
- LICENSE
- marlin_24_cuda_kernel.cu
- activation_kernels.cu
- per_token_group_quant_8bit.h
- utils.cuh
- vectorization.cuh
- vectorization_utils.cuh
- base.h
- quick_reduce.h
- quick_reduce_impl.cuh
- attention.cu
- ops.h
- skinny_gemms.cu
- torch_bindings.cpp
- sparse_compressor_c3x.cuh
- sparse_scaled_mm_c3x.cu
- sparse_scaled_mm_c3x.cuh
- sparse_scaled_mm_entry.cu
- activation_kernels.cu
- cache.h
- cache_kernels.cu
- cuda_compat.h
- cuda_utils.h
- cuda_utils_kernels.cu
- cuda_view.cu
- cumem_allocator.cpp
- custom_all_reduce.cu
- custom_all_reduce.cuh
- custom_all_reduce_test.cu
- custom_quickreduce.cu
- dispatch_utils.h
- layernorm_kernels.cu
- layernorm_quant_kernels.cu
- ops.h
- permute_cols.cu
- pos_encoding_kernels.cu
- sampler.cu
- torch_bindings.cpp
- type_convert.cuh
- Dockerfile
- Dockerfile.cpu
- Dockerfile.nightly_torch
- Dockerfile.ppc64le
- Dockerfile.rocm
- Dockerfile.rocm_base
- Dockerfile.s390x
- Dockerfile.tpu
- Dockerfile.xpu
- build.txt
- common.txt
- cpu-build.txt
- cpu.txt
- cuda.txt
- dev.txt
- docs.txt
- kv_connectors.txt
- lint.txt
- nightly_torch_test.txt
- rocm-build.txt
- rocm-test.txt
- rocm.txt
- test.in
- test.txt
- tpu.txt
- xpu.txt
- create_continuum_vllm_conda_env.sh
- start_vllm_service.sh
- eep_nvshmem.patch
- install_eep_libraries.sh
- configure_system_drivers.sh
- install_python_libraries.sh
- README.md
- gputrc2graph.py
- README.md
- vllm_engine_model.json
- print_layerwise_table.py
- visualize_layerwise_profile.py
- check_init_lazy_imports.py
- check_pickle_imports.py
- check_repo.sh
- check_spdx_header.py
- check_triton_import.py
- enforce_regex_import.py
- generate_cmake_presets.py
- generate_nightly_torch_test.py
- install_deepgemm.sh
- install_nixl.sh
- mypy.sh
- png-lint.sh
- report_build_time_ninja.py
- shellcheck.sh
- update-dockerfile-graph.sh
- validate_config.py
- __init__.py
- layers.py
- models.py
- request.py
- utils.py
- worker_manager.py
- __init__.py
- audio.py
- base.py
- image.py
- video.py
- __init__.py
- common.py
- __init__.py
- abstract.py
- differential_flash_attn.py
- dual_chunk_flash_attn.py
- flash_attn.py
- flashmla.py
- placeholder_attn.py
- rocm_aiter_mla.py
- rocm_flash_attn.py
- triton_mla.py
- utils.py
- xformers.py
- __init__.py
- chunked_local_attention.py
- cross_attention.py
- encoder_only_attention.py
- __init__.py
- chunked_prefill_paged_decode.py
- common.py
- flashmla.py
- merge_attn_states.py
- paged_attn.py
- pallas_kv_cache_update.py
- prefix_prefill.py
- rocm_aiter_mla.py
- rocm_aiter_paged_attn.py
- triton_decode_attention.py
- triton_flash_attention.py
- triton_merge_attn_states.py
- triton_unified_attention.py
- __init__.py
- fa_utils.py
- kv_sharing_utils.py
- __init__.py
- layer.py
- selector.py
- __init__.py
- activation_quant_fusion.py
- backends.py
- base_static_graph.py
- collective_fusion.py
- compiler_interface.py
- counter.py
- cuda_graph.py
- cuda_piecewise_backend.py
- decorators.py
- fix_functionalization.py
- fusion.py
- fusion_attn.py
- fx_utils.py
- inductor_pass.py
- monitor.py
- multi_output_match.py
- noop_elimination.py
- pass_manager.py
- sequence_parallelism.py
- torch25_custom_graph_pass.py
- vllm_inductor_pass.py
- wrapper.py
- __init__.py
- cache.py
- compilation.py
- kv_events.py
- kv_transfer.py
- load.py
- lora.py
- parallel.py
- scheduler.py
- utils.py
- __init__.py
- block_table.py
- common.py
- cpu_gpu_block_allocator.py
- interfaces.py
- naive_block.py
- prefix_caching_block.py
- utils.py
- __init__.py
- block_manager.py
- evictor.py
- interfaces.py
- placeholder_block_space_manager.py
- scheduler.py
- __init__.py
- cumem.py
- __init__.py
- all2all.py
- all_reduce_utils.py
- base_device_communicator.py
- cpu_communicator.py
- cuda_communicator.py
- cuda_wrapper.py
- custom_all_reduce.py
- pynccl.py
- pynccl_wrapper.py
- quick_all_reduce.py
- ray_communicator.py
- shm_broadcast.py
- symm_mem.py
- tpu_communicator.py
- xpu_communicator.py
- __init__.py
- eplb_state.py
- rebalance_algo.py
- rebalance_execute.py
- __init__.py
- p2p_nccl_connector.py
- p2p_nccl_engine.py
- tensor_memory_pool.py
- __init__.py
- base.py
- lmcache_connector.py
- multi_connector.py
- nixl_connector.py
- shared_storage_connector.py
- __init__.py
- base.py
- factory.py
- utils.py
- __init__.py
- base.py
- mooncake_store.py
- simple_buffer.py
- __init__.py
- base.py
- mooncake_pipe.py
- pynccl_pipe.py
- __init__.py
- disagg_prefill_workflow.jpg
- kv_transfer_state.py
- README.md
- __init__.py
- communication_op.py
- kv_events.py
- parallel_state.py
- tpu_distributed_utils.py
- utils.py
- __init__.py
- client.py
- engine.py
- __init__.py
- interfaces.py
- single_step.py
- stop_checker.py
- util.py
- __init__.py
- arg_utils.py
- async_llm_engine.py
- async_timeout.py
- llm_engine.py
- metrics.py
- metrics_types.py
- protocol.py
- __init__.py
- base.py
- latency.py
- main.py
- serve.py
- throughput.py
- __init__.py
- collect_env.py
- main.py
- openai.py
- run_batch.py
- serve.py
- types.py
- __init__.py
- abstract_tool_parser.py
- deepseekv31_tool_parser.py
- deepseekv3_tool_parser.py
- glm4_moe_tool_parser.py
- granite_20b_fc_tool_parser.py
- granite_tool_parser.py
- hermes_tool_parser.py
- hunyuan_a13b_tool_parser.py
- internlm2_tool_parser.py
- jamba_tool_parser.py
- kimi_k2_tool_parser.py
- llama4_pythonic_tool_parser.py
- llama_tool_parser.py
- minimax_tool_parser.py
- mistral_tool_parser.py
- openai_tool_parser.py
- phi4mini_tool_parser.py
- pythonic_tool_parser.py
- qwen3coder_tool_parser.py
- seed_oss_tool_parser.py
- step3_tool_parser.py
- utils.py
- xlam_tool_parser.py
- __init__.py
- api_server.py
- cli_args.py
- logits_processors.py
- protocol.py
- run_batch.py
- serving_chat.py
- serving_classification.py
- serving_completion.py
- serving_embedding.py
- serving_engine.py
- serving_models.py
- serving_pooling.py
- serving_responses.py
- serving_score.py
- serving_tokenization.py
- serving_transcription.py
- speech_to_text.py
- __init__.py
- api_server.py
- chat_utils.py
- constants.py
- context.py
- harmony_utils.py
- launcher.py
- llm.py
- logger.py
- renderer.py
- score_utils.py
- ssl.py
- tool.py
- tool_server.py
- utils.py
- __init__.py
- executor_base.py
- mp_distributed_executor.py
- msgspec_utils.py
- multiproc_worker_utils.py
- ray_distributed_executor.py
- ray_utils.py
- uniproc_executor.py
- __init__.py
- data.py
- parse.py
- preprocess.py
- registry.py
- __init__.py
- dump_input.py
- formatter.py
- __init__.py
- base.py
- base_linear.py
- column_parallel_linear.py
- logits_processor.py
- qkv_x_parallel_linear.py
- replicated_linear.py
- row_parallel_linear.py
- utils.py
- vocal_parallel_embedding.py
- __init__.py
- lora_ops.py
- __init__.py
- lora_ops.py
- __init__.py
- kernel_utils.py
- lora_expand_op.py
- lora_kernel_metadata.py
- lora_shrink_op.py
- utils.py
- __init__.py
- lora_ops.py
- __init__.py
- __init__.py
- punica_base.py
- punica_cpu.py
- punica_gpu.py
- punica_selector.py
- punica_tpu.py
- punica_xpu.py
- utils.py
- __init__.py
- lora.py
- models.py
- peft_helper.py
- request.py
- resolver.py
- utils.py
- worker_manager.py
- __init__.py
- chunk.py
- chunk_delta_h.py
- chunk_o.py
- chunk_scaled_dot_kkt.py
- cumsum.py
- fused_recurrent.py
- index.py
- l2norm.py
- layernorm_guard.py
- op.py
- solve_tril.py
- utils.py
- wy_fast.py
- __init__.py
- E=1,N=14336,device_name=NVIDIA_A100-SXM4-80GB,dtype=int8_w8a16.json
- E=1,N=14336,device_name=NVIDIA_A100-SXM4-80GB.json
- E=1,N=1792,device_name=NVIDIA_A100-SXM4-80GB,dtype=int8_w8a16.json
- E=1,N=1792,device_name=NVIDIA_A100-SXM4-80GB.json
- E=1,N=3072,device_name=NVIDIA_A100-SXM4-80GB,dtype=int8_w8a16.json
- E=1,N=3072,device_name=NVIDIA_H100_80GB_HBM3,dtype=int8_w8a16.json
- E=1,N=3072,device_name=NVIDIA_H100_80GB_HBM3.json
- E=1,N=3584,device_name=NVIDIA_A100-SXM4-80GB,dtype=int8_w8a16.json
- E=1,N=3584,device_name=NVIDIA_A100-SXM4-80GB.json
- E=1,N=7168,device_name=NVIDIA_A100-SXM4-80GB,dtype=int8_w8a16.json
- E=1,N=7168,device_name=NVIDIA_A100-SXM4-80GB.json
- E=128,N=1024,device_name=AMD_Instinct_MI300X,dtype=fp8_w8a8.json
- E=128,N=1024,device_name=AMD_Instinct_MI300X.json
- E=128,N=192,device_name=NVIDIA_A100-SXM4-80GB.json
- E=128,N=192,device_name=NVIDIA_H100_80GB_HBM3.json
- E=128,N=192,device_name=NVIDIA_H20-3e.json
- E=128,N=192,device_name=NVIDIA_H20.json
- E=128,N=192,device_name=NVIDIA_H200.json
- E=128,N=352,device_name=NVIDIA_H100_80GB_HBM3,dtype=fp8_w8a8.json
- E=128,N=384,device_name=AMD_Instinct_MI300X,dtype=fp8_w8a8,block_shape=[128,128].json
- E=128,N=384,device_name=NVIDIA_B200,dtype=fp8_w8a8,block_shape=[128,128].json
- E=128,N=384,device_name=NVIDIA_GB200,dtype=fp8_w8a8,block_shape=[128,128].json
- E=128,N=384,device_name=NVIDIA_H20,dtype=fp8_w8a8,block_shape=[128,128].json
- E=128,N=384,device_name=NVIDIA_H20-3e,dtype=fp8_w8a8,block_shape=[128,128].json
- E=128,N=384,device_name=NVIDIA_H20-3e.json
- E=128,N=384,device_name=NVIDIA_H20.json
- E=128,N=384,device_name=NVIDIA_H200,dtype=fp8_w8a8,block_shape=[128,128].json
- E=128,N=384,device_name=NVIDIA_H200.json
- E=128,N=512,device_name=NVIDIA_H100_80GB_HBM3.json
- E=128,N=704,device_name=NVIDIA_B200,dtype=fp8_w8a8.json
- E=128,N=704,device_name=NVIDIA_H100_80GB_HBM3,dtype=fp8_w8a8.json
- E=128,N=768,device_name=AMD_Instinct_MI300X,dtype=fp8_w8a8,block_shape=[128,128].json
- E=128,N=768,device_name=NVIDIA_B200,dtype=fp8_w8a8,block_shape=[128,128].json
- E=128,N=768,device_name=NVIDIA_GB200,dtype=fp8_w8a8,block_shape=[128,128].json
- E=128,N=768,device_name=NVIDIA_H20,dtype=fp8_w8a8,block_shape=[128,128].json
- E=128,N=768,device_name=NVIDIA_H20-3e,dtype=fp8_w8a8,block_shape=[128,128].json
- E=128,N=768,device_name=NVIDIA_H20.json
- E=128,N=768,device_name=NVIDIA_H200,dtype=fp8_w8a8,block_shape=[128,128].json
- E=128,N=768,device_name=NVIDIA_H200.json
- E=128,N=96,device_name=NVIDIA_H20.json
- E=16,N=1024,device_name=AMD_Instinct_MI300X.json
- E=16,N=1024,device_name=NVIDIA_B200,dtype=fp8_w8a8.json
- E=16,N=1024,device_name=NVIDIA_B200.json
- E=16,N=1024,device_name=NVIDIA_H100.json
- E=16,N=1344,device_name=NVIDIA_A100-SXM4-40GB.json
- E=16,N=1344,device_name=NVIDIA_A100-SXM4-80GB.json
- E=16,N=1344,device_name=NVIDIA_H100_80GB_HBM3.json
- E=16,N=14336,device_name=NVIDIA_A100-SXM4-80GB,dtype=int8_w8a16.json
- E=16,N=14336,device_name=NVIDIA_A100-SXM4-80GB.json
- E=16,N=1792,device_name=NVIDIA_A100-SXM4-80GB,dtype=int8_w8a16.json
- E=16,N=1792,device_name=NVIDIA_A100-SXM4-80GB.json
- E=16,N=2688,device_name=NVIDIA_A100-SXM4-80GB.json
- E=16,N=2688,device_name=NVIDIA_H100_80GB_HBM3.json
- E=16,N=3072,device_name=NVIDIA_A100-SXM4-80GB,dtype=int8_w8a16.json
- E=16,N=3072,device_name=NVIDIA_H100_80GB_HBM3,dtype=int8_w8a16.json
- E=16,N=3200,device_name=NVIDIA_H100_80GB_HBM3,dtype=fp8_w8a8.json
- E=16,N=3584,device_name=NVIDIA_A100-SXM4-80GB,dtype=int8_w8a16.json
- E=16,N=3584,device_name=NVIDIA_A100-SXM4-80GB.json
- E=16,N=6400,device_name=NVIDIA_H100_80GB_HBM3,dtype=fp8_w8a8.json
- E=16,N=7168,device_name=NVIDIA_A100-SXM4-80GB,dtype=int8_w8a16.json
- E=16,N=7168,device_name=NVIDIA_A100-SXM4-80GB.json
- E=16,N=7168,device_name=NVIDIA_H100_80GB_HBM3,dtype=int8_w8a16.json
- E=16,N=800,device_name=NVIDIA_H100_80GB_HBM3,dtype=fp8_w8a8.json
- E=160,N=192,device_name=NVIDIA_A800-SXM4-80GB.json
- E=160,N=192,device_name=NVIDIA_H20-3e.json
- E=160,N=320,device_name=NVIDIA_H20-3e.json
- E=160,N=640,device_name=NVIDIA_B200,dtype=fp8_w8a8,block_shape=[128,128].json
- E=160,N=640,device_name=NVIDIA_GB200,dtype=fp8_w8a8,block_shape=[128,128].json
- E=160,N=640,device_name=NVIDIA_H100,dtype=fp8_w8a8,block_shape=[128,128].json
- E=20,N=2560,device_name=NVIDIA_B200,dtype=fp8_w8a8,block_shape=[128,128].json
- E=20,N=2560,device_name=NVIDIA_GB200,dtype=fp8_w8a8,block_shape=[128,128].json
- E=20,N=2560,device_name=NVIDIA_H100,dtype=fp8_w8a8,block_shape=[128,128].json
- E=20,N=2560,device_name=NVIDIA_H20-3e,dtype=fp8_w8a8,block_shape=[128,128].json
- E=256,N=1024,device_name=AMD_Instinct_MI325_OAM,dtype=fp8_w8a8,block_shape=[128,128].json
- E=256,N=1024,device_name=AMD_Instinct_MI325X,block_shape=[128,128].json
- E=256,N=128,device_name=NVIDIA_A100-SXM4-80GB,dtype=int8_w8a8,block_shape=[128,128].json
- E=256,N=128,device_name=NVIDIA_A100-SXM4-80GB,dtype=int8_w8a8.json
- E=256,N=128,device_name=NVIDIA_A800-SXM4-80GB,dtype=int8_w8a8,block_shape=[128,128].json
- E=256,N=128,device_name=NVIDIA_A800-SXM4-80GB,dtype=int8_w8a8.json
- E=256,N=128,device_name=NVIDIA_H100_80GB_HBM3,dtype=fp8_w8a8,block_shape=[128,128].json
- E=256,N=128,device_name=NVIDIA_H20,dtype=fp8_w8a8,block_shape=[128,128].json
- E=256,N=128,device_name=NVIDIA_L20Y,dtype=fp8_w8a8,block_shape=[128,128].json
- E=256,N=256,device_name=AMD_Instinct_MI300X,dtype=fp8_w8a8,block_shape=[128,128].json
- E=256,N=256,device_name=AMD_Instinct_MI325_OAM,dtype=fp8_w8a8,block_shape=[128,128].json
- E=256,N=256,device_name=AMD_Instinct_MI325X,dtype=fp8_w8a8,block_shape=[128,128].json
- E=256,N=256,device_name=NVIDIA_B200,dtype=fp8_w8a8,block_shape=[128,128].json
- E=256,N=256,device_name=NVIDIA_H20,dtype=fp8_w8a8,block_shape=[128,128].json
- E=256,N=256,device_name=NVIDIA_H20,dtype=int8_w8a8,block_shape=[128,128].json
- E=256,N=256,device_name=NVIDIA_H20-3e,dtype=fp8_w8a8,block_shape=[128,128].json
- E=256,N=256,device_name=NVIDIA_H200,dtype=fp8_w8a8,block_shape=[128,128].json
- E=256,N=256,device_name=NVIDIA_L20,dtype=fp8_w8a8,block_shape=[128,128].json
- E=256,N=512,device_name=AMD_Instinct_MI325_OAM,dtype=fp8_w8a8,block_shape=[128,128].json
- E=256,N=512,device_name=NVIDIA_H100_80GB_HBM3.json
- E=256,N=64,device_name=NVIDIA_A800-SXM4-80GB.json
- E=384,N=128,device_name=NVIDIA_B200,dtype=fp8_w8a8,block_shape=[128,128].json
- E=384,N=128,device_name=NVIDIA_GB200,dtype=fp8_w8a8,block_shape=[128,128].json
- E=384,N=128,device_name=NVIDIA_H200,dtype=fp8_w8a8,block_shape=[128,128].json
- E=384,N=256,device_name=NVIDIA_B200,dtype=fp8_w8a8,block_shape=[128,128].json
- E=384,N=256,device_name=NVIDIA_GB200,dtype=fp8_w8a8,block_shape=[128,128].json
- E=40,N=2560,device_name=NVIDIA_B200,dtype=fp8_w8a8,block_shape=[128,128].json
- E=40,N=2560,device_name=NVIDIA_GB200,dtype=fp8_w8a8,block_shape=[128,128].json
- E=40,N=2560,device_name=NVIDIA_H100,dtype=fp8_w8a8,block_shape=[128,128].json
- E=512,N=128,device_name=NVIDIA_B200.json
- E=512,N=128,device_name=NVIDIA_H100_80GB_HBM3.json
- E=512,N=128,device_name=NVIDIA_H20-3e.json
- E=512,N=128,device_name=NVIDIA_H200.json
- E=512,N=256,device_name=NVIDIA_B200.json
- E=512,N=256,device_name=NVIDIA_H100_80GB_HBM3.json
- E=512,N=256,device_name=NVIDIA_H20-3e.json
- E=512,N=256,device_name=NVIDIA_H200.json
- E=512,N=512,device_name=NVIDIA_B200.json
- E=512,N=512,device_name=NVIDIA_H100_80GB_HBM3.json
- E=512,N=512,device_name=NVIDIA_H20-3e.json
- E=512,N=512,device_name=NVIDIA_H200.json
- E=512,N=64,device_name=NVIDIA_B200.json
- E=512,N=64,device_name=NVIDIA_H20-3e.json
- E=512,N=64,device_name=NVIDIA_H200.json
- E=60,N=1408,device_name=AMD_Instinct_MI300X.json
- E=60,N=176,device_name=AMD_Instinct_MI300X.json
- E=60,N=352,device_name=AMD_Instinct_MI300X.json
- E=60,N=704,device_name=AMD_Instinct_MI300X.json
- E=62,N=256,device_name=NVIDIA_H100_80GB_HBM3.json
- E=62,N=512,device_name=NVIDIA_H100_80GB_HBM3.json
- E=64,N=1280,device_name=NVIDIA_A100-SXM4-80GB.json
- E=64,N=1280,device_name=NVIDIA_A800-SXM4-80GB.json
- E=64,N=1280,device_name=NVIDIA_H100_80GB_HBM3,dtype=fp8_w8a8.json
- E=64,N=1280,device_name=NVIDIA_H100_80GB_HBM3.json
- E=64,N=1280,device_name=NVIDIA_H200,dtype=fp8_w8a8.json
- E=64,N=1280,device_name=NVIDIA_H200.json
- E=64,N=1536,device_name=NVIDIA_H20,dtype=fp8_w8a8.json
- E=64,N=2560,device_name=NVIDIA_H100_80GB_HBM3,dtype=fp8_w8a8.json
- E=64,N=2560,device_name=NVIDIA_H200,dtype=fp8_w8a8.json
- E=64,N=2560,device_name=NVIDIA_H200.json
- E=64,N=3072,device_name=NVIDIA_H20,dtype=fp8_w8a8.json
- E=64,N=3072,device_name=NVIDIA_H20.json
- E=64,N=320,device_name=NVIDIA_H100_80GB_HBM3,dtype=fp8_w8a8.json
- E=64,N=320,device_name=NVIDIA_H100_80GB_HBM3.json
- E=64,N=320,device_name=NVIDIA_H200,dtype=fp8_w8a8.json
- E=64,N=320,device_name=NVIDIA_H200.json
- E=64,N=384,device_name=NVIDIA_H20,dtype=fp8_w8a8.json
- E=64,N=384,device_name=NVIDIA_H20.json
- E=64,N=640,device_name=NVIDIA_A100-SXM4-80GB.json
- E=64,N=640,device_name=NVIDIA_A800-SXM4-80GB.json
- E=64,N=640,device_name=NVIDIA_GeForce_RTX_4090,dtype=fp8_w8a8.json
- E=64,N=640,device_name=NVIDIA_H100_80GB_HBM3,dtype=fp8_w8a8.json
- E=64,N=640,device_name=NVIDIA_H100_80GB_HBM3.json
- E=64,N=640,device_name=NVIDIA_H200,dtype=fp8_w8a8.json
- E=64,N=640,device_name=NVIDIA_H200.json
- E=64,N=768,device_name=NVIDIA_H20,dtype=fp8_w8a8.json
- E=64,N=768,device_name=NVIDIA_H20.json
- E=64,N=896,device_name=NVIDIA_H20.json
- E=72,N=384,device_name=NVIDIA_H100_80GB_HBM3.json
- E=72,N=768,device_name=NVIDIA_H100_80GB_HBM3.json
- E=8,N=14336,device_name=AMD_Instinct_MI300X,dtype=fp8_w8a8.json
- E=8,N=14336,device_name=AMD_Instinct_MI300X.json
- E=8,N=14336,device_name=AMD_Instinct_MI325X,dtype=fp8_w8a8.json
- E=8,N=14336,device_name=AMD_Instinct_MI325X.json
- E=8,N=14336,device_name=NVIDIA_H100_80GB_HBM3,dtype=fp8_w8a8.json
- E=8,N=14336,device_name=NVIDIA_H200,dtype=fp8_w8a8.json
- E=8,N=14336,device_name=NVIDIA_H200.json
- E=8,N=16384,device_name=AMD_Instinct_MI300X,dtype=fp8_w8a8.json
- E=8,N=16384,device_name=AMD_Instinct_MI300X.json
- E=8,N=16384,device_name=AMD_Instinct_MI325X,dtype=fp8_w8a8.json
- E=8,N=16384,device_name=AMD_Instinct_MI325X.json
- E=8,N=1792,device_name=AMD_Instinct_MI300X,dtype=fp8_w8a8.json
- E=8,N=1792,device_name=AMD_Instinct_MI300X.json
- E=8,N=1792,device_name=AMD_Instinct_MI325X,dtype=fp8_w8a8.json
- E=8,N=1792,device_name=AMD_Instinct_MI325X.json
- E=8,N=1792,device_name=NVIDIA_A100-SXM4-40GB.json
- E=8,N=1792,device_name=NVIDIA_A100-SXM4-80GB.json
- E=8,N=1792,device_name=NVIDIA_H100_80GB_HBM3.json
- E=8,N=1792,device_name=NVIDIA_H200,dtype=fp8_w8a8.json
- E=8,N=1792,device_name=NVIDIA_H200.json
- E=8,N=2048,device_name=AMD_Instinct_MI300X,dtype=fp8_w8a8.json
- E=8,N=2048,device_name=AMD_Instinct_MI300X.json
- E=8,N=2048,device_name=AMD_Instinct_MI325X,dtype=fp8_w8a8.json
- E=8,N=2048,device_name=AMD_Instinct_MI325X.json
- E=8,N=2048,device_name=NVIDIA_A100-SXM4-80GB.json
- E=8,N=2048,device_name=NVIDIA_H100_80GB_HBM3,dtype=fp8_w8a8.json
- E=8,N=2048,device_name=NVIDIA_H100_80GB_HBM3.json
- E=8,N=2048,device_name=NVIDIA_H200,dtype=fp8_w8a8,block_shape=[128,128].json
- E=8,N=2048,device_name=NVIDIA_H200,dtype=fp8_w8a8.json
- E=8,N=2048,device_name=NVIDIA_H200.json
- E=8,N=3584,device_name=AMD_Instinct_MI300X,dtype=fp8_w8a8.json
- E=8,N=3584,device_name=AMD_Instinct_MI300X.json
- E=8,N=3584,device_name=AMD_Instinct_MI325X,dtype=fp8_w8a8.json
- E=8,N=3584,device_name=AMD_Instinct_MI325X.json
- E=8,N=3584,device_name=NVIDIA_A100-SXM4-40GB.json
- E=8,N=3584,device_name=NVIDIA_A100-SXM4-80GB.json
- E=8,N=3584,device_name=NVIDIA_GeForce_RTX_4090,dtype=fp8_w8a8.json
- E=8,N=3584,device_name=NVIDIA_H100_80GB_HBM3,dtype=fp8_w8a8.json
- E=8,N=3584,device_name=NVIDIA_H100_80GB_HBM3.json
- E=8,N=3584,device_name=NVIDIA_H200,dtype=fp8_w8a8.json
- E=8,N=3584,device_name=NVIDIA_H200.json
- E=8,N=3584,device_name=NVIDIA_L40S.json
- E=8,N=4096,device_name=AMD_Instinct_MI300X,dtype=fp8_w8a8.json
- E=8,N=4096,device_name=AMD_Instinct_MI300X.json
- E=8,N=4096,device_name=AMD_Instinct_MI325X,dtype=fp8_w8a8.json
- E=8,N=4096,device_name=AMD_Instinct_MI325X.json
- E=8,N=4096,device_name=NVIDIA_A100-SXM4-80GB.json
- E=8,N=4096,device_name=NVIDIA_H100_80GB_HBM3,dtype=fp8_w8a8.json
- E=8,N=4096,device_name=NVIDIA_H100_80GB_HBM3.json
- E=8,N=4096,device_name=NVIDIA_H200,dtype=fp8_w8a8.json
- E=8,N=4096,device_name=NVIDIA_H200.json
- E=8,N=7168,device_name=AMD_Instinct_MI300X,dtype=fp8_w8a8.json
- E=8,N=7168,device_name=AMD_Instinct_MI300X.json
- E=8,N=7168,device_name=AMD_Instinct_MI325X,dtype=fp8_w8a8.json
- E=8,N=7168,device_name=AMD_Instinct_MI325X.json
- E=8,N=7168,device_name=NVIDIA_A100-SXM4-80GB.json
- E=8,N=7168,device_name=NVIDIA_H100_80GB_HBM3,dtype=fp8_w8a8.json
- E=8,N=7168,device_name=NVIDIA_H100_80GB_HBM3.json
- E=8,N=7168,device_name=NVIDIA_H200,dtype=fp8_w8a8.json
- E=8,N=7168,device_name=NVIDIA_H200.json
- E=8,N=8192,device_name=AMD_Instinct_MI300X,dtype=fp8_w8a8.json
- E=8,N=8192,device_name=AMD_Instinct_MI300X.json
- E=8,N=8192,device_name=AMD_Instinct_MI325X,dtype=fp8_w8a8.json
- E=8,N=8192,device_name=AMD_Instinct_MI325X.json
- E=8,N=8192,device_name=NVIDIA_H100_80GB_HBM3,dtype=fp8_w8a8.json
- E=8,N=8192,device_name=NVIDIA_H200,dtype=fp8_w8a8.json
- README
- __init__.py
- batched_deep_gemm_moe.py
- batched_triton_or_deep_gemm_moe.py
- config.py
- cpu_fused_moe.py
- cutlass_moe.py
- deep_gemm_moe.py
- deep_gemm_utils.py
- deepep_ht_prepare_finalize.py
- deepep_ll_prepare_finalize.py
- flashinfer_cutlass_moe.py
- flashinfer_cutlass_prepare_finalize.py
- fused_batched_moe.py
- fused_marlin_moe.py
- fused_moe.py
- gpt_oss_triton_kernels_moe.py
- layer.py
- modular_kernel.py
- moe_align_block_size.py
- moe_pallas.py
- moe_permute_unpermute.py
- moe_torch_iterative.py
- pplx_prepare_finalize.py
- prepare_finalize.py
- rocm_aiter_fused_moe.py
- routing_simulator.py
- topk_weight_and_reduce.py
- triton_deep_gemm_moe.py
- trtllm_moe.py
- utils.py
- __init__.py
- causal_conv1d.py
- layernorm_gated.py
- mamba_ssm.py
- ssd_bmm.py
- ssd_chunk_scan.py
- ssd_chunk_state.py
- ssd_combined.py
- ssd_state_passing.py
- __init__.py
- abstract.py
- linear_attn.py
- mamba2_metadata.py
- mamba_mixer.py
- mamba_mixer2.py
- mamba_utils.py
- short_conv.py
- __init__.py
- compressed_tensors_24.py
- compressed_tensors_scheme.py
- compressed_tensors_w4a16_24.py
- compressed_tensors_w4a16_nvfp4.py
- compressed_tensors_w4a4_nvfp4.py
- compressed_tensors_w4a8_fp8.py
- compressed_tensors_w4a8_int.py
- compressed_tensors_w8a16_fp8.py
- compressed_tensors_w8a8_fp8.py
- compressed_tensors_w8a8_int8.py
- compressed_tensors_wNa16.py
- linear_qutlass_nvfp4.py
- linear.py
- module.py
- utils.py
- __init__.py
- compressed_tensors.py
- compressed_tensors_moe.py
- triton_scaled_mm.py
- utils.py
- __init__.py
- allspark.py
- bitblas.py
- conch.py
- cutlass.py
- dynamic_4bit.py
- exllama.py
- machete.py
- marlin.py
- MPLinearKernel.py
- __init__.py
- aiter.py
- cpu.py
- cutlass.py
- ScaledMMLinearKernel.py
- triton.py
- xla.py
- __init__.py
- __init__.py
- quark_scheme.py
- quark_w4a4_mxfp4.py
- quark_w8a8_fp8.py
- quark_w8a8_int8.py
- __init__.py
- quark.py
- quark_moe.py
- utils.py
- N=12288,K=7168,device_name=NVIDIA_H100_80GB_HBM3,dtype=fp8_w8a8,block_shape=[128,128].json
- N=12288,K=7168,device_name=NVIDIA_H200,dtype=fp8_w8a8,block_shape=[128,128].json
- N=1536,K=1536,device_name=AMD_Instinct_MI300X,dtype=fp8_w8a8,block_shape=[128,128].json
- N=1536,K=1536,device_name=AMD_Instinct_MI325_OAM,dtype=fp8_w8a8,block_shape=[128,128].json
- N=1536,K=1536,device_name=AMD_Instinct_MI325X,dtype=fp8_w8a8,block_shape=[128,128].json
- N=1536,K=1536,device_name=NVIDIA_A100-SXM4-80GB,dtype=int8_w8a8,block_shape=[128,128].json
- N=1536,K=1536,device_name=NVIDIA_A800-SXM4-80GB,dtype=int8_w8a8,block_shape=[128,128].json
- N=1536,K=1536,device_name=NVIDIA_H100_80GB_HBM3,dtype=fp8_w8a8,block_shape=[128,128].json
- N=1536,K=1536,device_name=NVIDIA_H20,dtype=fp8_w8a8,block_shape=[128,128].json
- N=1536,K=1536,device_name=NVIDIA_L20Y,dtype=fp8_w8a8,block_shape=[128,128].json
- N=1536,K=7168,device_name=AMD_Instinct_MI300X,dtype=fp8_w8a8,block_shape=[128,128].json
- N=1536,K=7168,device_name=AMD_Instinct_MI325_OAM,dtype=fp8_w8a8,block_shape=[128,128].json
- N=1536,K=7168,device_name=AMD_Instinct_MI325X,dtype=fp8_w8a8,block_shape=[128,128].json
- N=1536,K=7168,device_name=NVIDIA_A100-SXM4-80GB,dtype=int8_w8a8,block_shape=[128,128].json
- N=1536,K=7168,device_name=NVIDIA_A800-SXM4-80GB,dtype=int8_w8a8,block_shape=[128,128].json
- N=1536,K=7168,device_name=NVIDIA_H100_80GB_HBM3,dtype=fp8_w8a8,block_shape=[128,128].json
- N=1536,K=7168,device_name=NVIDIA_H20,dtype=fp8_w8a8,block_shape=[128,128].json
- N=1536,K=7168,device_name=NVIDIA_H200,dtype=fp8_w8a8,block_shape=[128,128].json
- N=1536,K=7168,device_name=NVIDIA_L20,dtype=fp8_w8a8,block_shape=[128,128].json
- N=1536,K=7168,device_name=NVIDIA_L20Y,dtype=fp8_w8a8,block_shape=[128,128].json
- N=2048,K=512,device_name=AMD_Instinct_MI300X,dtype=fp8_w8a8,block_shape=[128,128].json
- N=2048,K=512,device_name=AMD_Instinct_MI325_OAM,dtype=fp8_w8a8,block_shape=[128,128].json
- N=2048,K=512,device_name=AMD_Instinct_MI325X,dtype=fp8_w8a8,block_shape=[128,128].json
- N=2048,K=512,device_name=NVIDIA_A100-SXM4-80GB,dtype=int8_w8a8,block_shape=[128,128].json
- N=2048,K=512,device_name=NVIDIA_A800-SXM4-80GB,dtype=int8_w8a8,block_shape=[128,128].json
- N=2048,K=512,device_name=NVIDIA_H100_80GB_HBM3,dtype=fp8_w8a8,block_shape=[128,128].json
- N=2048,K=512,device_name=NVIDIA_H20,dtype=fp8_w8a8,block_shape=[128,128].json
- N=2048,K=512,device_name=NVIDIA_H200,dtype=fp8_w8a8,block_shape=[128,128].json
- N=2048,K=512,device_name=NVIDIA_L20Y,dtype=fp8_w8a8,block_shape=[128,128].json
- N=2112,K=7168,device_name=NVIDIA_H100_80GB_HBM3,dtype=fp8_w8a8,block_shape=[128,128].json
- N=2112,K=7168,device_name=NVIDIA_H200,dtype=fp8_w8a8,block_shape=[128,128].json
- N=2304,K=7168,device_name=AMD_Instinct_MI300X,dtype=fp8_w8a8,block_shape=[128,128].json
- N=2304,K=7168,device_name=AMD_Instinct_MI325_OAM,dtype=fp8_w8a8,block_shape=[128,128].json
- N=2304,K=7168,device_name=AMD_Instinct_MI325X,dtype=fp8_w8a8,block_shape=[128,128].json
- N=2304,K=7168,device_name=NVIDIA_A100-SXM4-80GB,dtype=int8_w8a8,block_shape=[128,128].json
- N=2304,K=7168,device_name=NVIDIA_A800-SXM4-80GB,dtype=int8_w8a8,block_shape=[128,128].json
- N=2304,K=7168,device_name=NVIDIA_H100_80GB_HBM3,dtype=fp8_w8a8,block_shape=[128,128].json
- N=2304,K=7168,device_name=NVIDIA_H20,dtype=fp8_w8a8,block_shape=[128,128].json
- N=2304,K=7168,device_name=NVIDIA_H200,dtype=fp8_w8a8,block_shape=[128,128].json
- N=2304,K=7168,device_name=NVIDIA_L20Y,dtype=fp8_w8a8,block_shape=[128,128].json
- N=24576,K=1536,device_name=NVIDIA_H100_80GB_HBM3,dtype=fp8_w8a8,block_shape=[128,128].json
- N=24576,K=1536,device_name=NVIDIA_H200,dtype=fp8_w8a8,block_shape=[128,128].json
- N=24576,K=7168,device_name=AMD_Instinct_MI300X,dtype=fp8_w8a8,block_shape=[128,128].json
- N=24576,K=7168,device_name=AMD_Instinct_MI325_OAM,dtype=fp8_w8a8,block_shape=[128,128].json
- N=24576,K=7168,device_name=AMD_Instinct_MI325X,dtype=fp8_w8a8,block_shape=[128,128].json
- N=24576,K=7168,device_name=NVIDIA_A100-SXM4-80GB,dtype=int8_w8a8,block_shape=[128,128].json
- N=24576,K=7168,device_name=NVIDIA_A800-SXM4-80GB,dtype=int8_w8a8,block_shape=[128,128].json
- N=24576,K=7168,device_name=NVIDIA_B200,dtype=fp8_w8a8,block_shape=[128,128].json
- N=24576,K=7168,device_name=NVIDIA_H100_80GB_HBM3,dtype=fp8_w8a8,block_shape=[128,128].json
- N=24576,K=7168,device_name=NVIDIA_H20,dtype=fp8_w8a8,block_shape=[128,128].json
- N=24576,K=7168,device_name=NVIDIA_H20,dtype=int8_w8a8,block_shape=[128,128].json
- N=24576,K=7168,device_name=NVIDIA_H200,dtype=fp8_w8a8,block_shape=[128,128].json
- N=24576,K=7168,device_name=NVIDIA_L20,dtype=fp8_w8a8,block_shape=[128,128].json
- N=24576,K=7168,device_name=NVIDIA_L20Y,dtype=fp8_w8a8,block_shape=[128,128].json
- N=256,K=7168,device_name=AMD_Instinct_MI300X,dtype=fp8_w8a8,block_shape=[128,128].json
- N=256,K=7168,device_name=AMD_Instinct_MI325_OAM,dtype=fp8_w8a8,block_shape=[128,128].json
- N=256,K=7168,device_name=AMD_Instinct_MI325X,dtype=fp8_w8a8,block_shape=[128,128].json
- N=256,K=7168,device_name=NVIDIA_A100-SXM4-80GB,dtype=int8_w8a8,block_shape=[128,128].json
- N=256,K=7168,device_name=NVIDIA_A800-SXM4-80GB,dtype=int8_w8a8,block_shape=[128,128].json
- N=256,K=7168,device_name=NVIDIA_H100_80GB_HBM3,dtype=fp8_w8a8,block_shape=[128,128].json
- N=256,K=7168,device_name=NVIDIA_H20,dtype=fp8_w8a8,block_shape=[128,128].json
- N=256,K=7168,device_name=NVIDIA_L20Y,dtype=fp8_w8a8,block_shape=[128,128].json
- N=3072,K=1536,device_name=AMD_Instinct_MI300X,dtype=fp8_w8a8,block_shape=[128,128].json
- N=3072,K=1536,device_name=AMD_Instinct_MI325_OAM,dtype=fp8_w8a8,block_shape=[128,128].json
- N=3072,K=1536,device_name=AMD_Instinct_MI325X,dtype=fp8_w8a8,block_shape=[128,128].json
- N=3072,K=1536,device_name=NVIDIA_B200,dtype=fp8_w8a8,block_shape=[128,128].json
- N=3072,K=1536,device_name=NVIDIA_H20,dtype=int8_w8a8,block_shape=[128,128].json
- N=3072,K=1536,device_name=NVIDIA_H200,dtype=fp8_w8a8,block_shape=[128,128].json
- N=3072,K=1536,device_name=NVIDIA_L20,dtype=fp8_w8a8,block_shape=[128,128].json
- N=3072,K=7168,device_name=AMD_Instinct_MI300X,dtype=fp8_w8a8,block_shape=[128,128].json
- N=3072,K=7168,device_name=AMD_Instinct_MI325_OAM,dtype=fp8_w8a8,block_shape=[128,128].json
- N=3072,K=7168,device_name=AMD_Instinct_MI325X,dtype=fp8_w8a8,block_shape=[128,128].json
- N=3072,K=7168,device_name=NVIDIA_B200,dtype=fp8_w8a8,block_shape=[128,128].json
- N=3072,K=7168,device_name=NVIDIA_H100_80GB_HBM3,dtype=fp8_w8a8,block_shape=[128,128].json
- N=3072,K=7168,device_name=NVIDIA_H20,dtype=int8_w8a8,block_shape=[128,128].json
- N=3072,K=7168,device_name=NVIDIA_H200,dtype=fp8_w8a8,block_shape=[128,128].json
- N=3072,K=7168,device_name=NVIDIA_L20,dtype=fp8_w8a8,block_shape=[128,128].json
- N=32768,K=512,device_name=AMD_Instinct_MI300X,dtype=fp8_w8a8,block_shape=[128,128].json
- N=32768,K=512,device_name=AMD_Instinct_MI325_OAM,dtype=fp8_w8a8,block_shape=[128,128].json
- N=32768,K=512,device_name=AMD_Instinct_MI325X,dtype=fp8_w8a8,block_shape=[128,128].json
- N=32768,K=512,device_name=NVIDIA_A100-SXM4-80GB,dtype=int8_w8a8,block_shape=[128,128].json
- N=32768,K=512,device_name=NVIDIA_A800-SXM4-80GB,dtype=int8_w8a8,block_shape=[128,128].json
- N=32768,K=512,device_name=NVIDIA_B200,dtype=fp8_w8a8,block_shape=[128,128].json
- N=32768,K=512,device_name=NVIDIA_H100_80GB_HBM3,dtype=fp8_w8a8,block_shape=[128,128].json
- N=32768,K=512,device_name=NVIDIA_H20,dtype=fp8_w8a8,block_shape=[128,128].json
- N=32768,K=512,device_name=NVIDIA_H20,dtype=int8_w8a8,block_shape=[128,128].json
- N=32768,K=512,device_name=NVIDIA_H200,dtype=fp8_w8a8,block_shape=[128,128].json
- N=32768,K=512,device_name=NVIDIA_L20,dtype=fp8_w8a8,block_shape=[128,128].json
- N=32768,K=512,device_name=NVIDIA_L20Y,dtype=fp8_w8a8,block_shape=[128,128].json
- N=36864,K=7168,device_name=AMD_Instinct_MI300X,dtype=fp8_w8a8,block_shape=[128,128].json
- N=36864,K=7168,device_name=AMD_Instinct_MI325_OAM,dtype=fp8_w8a8,block_shape=[128,128].json
- N=36864,K=7168,device_name=AMD_Instinct_MI325X,dtype=fp8_w8a8,block_shape=[128,128].json
- N=36864,K=7168,device_name=NVIDIA_H100_80GB_HBM3,dtype=fp8_w8a8,block_shape=[128,128].json
- N=36864,K=7168,device_name=NVIDIA_H200,dtype=fp8_w8a8,block_shape=[128,128].json
- N=4096,K=512,device_name=AMD_Instinct_MI300X,dtype=fp8_w8a8,block_shape=[128,128].json
- N=4096,K=512,device_name=AMD_Instinct_MI325_OAM,dtype=fp8_w8a8,block_shape=[128,128].json
- N=4096,K=512,device_name=AMD_Instinct_MI325X,dtype=fp8_w8a8,block_shape=[128,128].json
- N=4096,K=512,device_name=NVIDIA_B200,dtype=fp8_w8a8,block_shape=[128,128].json
- N=4096,K=512,device_name=NVIDIA_H100_80GB_HBM3,dtype=fp8_w8a8,block_shape=[128,128].json
- N=4096,K=512,device_name=NVIDIA_H20,dtype=int8_w8a8,block_shape=[128,128].json
- N=4096,K=512,device_name=NVIDIA_H200,dtype=fp8_w8a8,block_shape=[128,128].json
- N=4096,K=512,device_name=NVIDIA_L20,dtype=fp8_w8a8,block_shape=[128,128].json
- N=4096,K=7168,device_name=NVIDIA_H100_80GB_HBM3,dtype=fp8_w8a8,block_shape=[128,128].json
- N=4096,K=7168,device_name=NVIDIA_H200,dtype=fp8_w8a8,block_shape=[128,128].json
- N=4608,K=7168,device_name=AMD_Instinct_MI300X,dtype=fp8_w8a8,block_shape=[128,128].json
- N=4608,K=7168,device_name=AMD_Instinct_MI325_OAM,dtype=fp8_w8a8,block_shape=[128,128].json
- N=4608,K=7168,device_name=AMD_Instinct_MI325X,dtype=fp8_w8a8,block_shape=[128,128].json
- N=4608,K=7168,device_name=NVIDIA_B200,dtype=fp8_w8a8,block_shape=[128,128].json
- N=4608,K=7168,device_name=NVIDIA_H100_80GB_HBM3,dtype=fp8_w8a8,block_shape=[128,128].json
- N=4608,K=7168,device_name=NVIDIA_H20,dtype=int8_w8a8,block_shape=[128,128].json
- N=4608,K=7168,device_name=NVIDIA_H200,dtype=fp8_w8a8,block_shape=[128,128].json
- N=4608,K=7168,device_name=NVIDIA_L20,dtype=fp8_w8a8,block_shape=[128,128].json
- N=512,K=7168,device_name=AMD_Instinct_MI300X,dtype=fp8_w8a8,block_shape=[128,128].json
- N=512,K=7168,device_name=AMD_Instinct_MI325_OAM,dtype=fp8_w8a8,block_shape=[128,128].json
- N=512,K=7168,device_name=AMD_Instinct_MI325X,dtype=fp8_w8a8,block_shape=[128,128].json
- N=512,K=7168,device_name=NVIDIA_B200,dtype=fp8_w8a8,block_shape=[128,128].json
- N=512,K=7168,device_name=NVIDIA_H20,dtype=int8_w8a8,block_shape=[128,128].json
- N=512,K=7168,device_name=NVIDIA_H200,dtype=fp8_w8a8,block_shape=[128,128].json
- N=512,K=7168,device_name=NVIDIA_L20,dtype=fp8_w8a8,block_shape=[128,128].json
- N=576,K=7168,device_name=AMD_Instinct_MI300X,dtype=fp8_w8a8,block_shape=[128,128].json
- N=576,K=7168,device_name=AMD_Instinct_MI325_OAM,dtype=fp8_w8a8,block_shape=[128,128].json
- N=576,K=7168,device_name=AMD_Instinct_MI325X,dtype=fp8_w8a8,block_shape=[128,128].json
- N=576,K=7168,device_name=NVIDIA_A100-SXM4-80GB,dtype=int8_w8a8,block_shape=[128,128].json
- N=576,K=7168,device_name=NVIDIA_A800-SXM4-80GB,dtype=int8_w8a8,block_shape=[128,128].json
- N=576,K=7168,device_name=NVIDIA_B200,dtype=fp8_w8a8,block_shape=[128,128].json
- N=576,K=7168,device_name=NVIDIA_H100_80GB_HBM3,dtype=fp8_w8a8,block_shape=[128,128].json
- N=576,K=7168,device_name=NVIDIA_H20,dtype=fp8_w8a8,block_shape=[128,128].json
- N=576,K=7168,device_name=NVIDIA_H20,dtype=int8_w8a8,block_shape=[128,128].json
- N=576,K=7168,device_name=NVIDIA_H200,dtype=fp8_w8a8,block_shape=[128,128].json
- N=576,K=7168,device_name=NVIDIA_L20,dtype=fp8_w8a8,block_shape=[128,128].json
- N=576,K=7168,device_name=NVIDIA_L20Y,dtype=fp8_w8a8,block_shape=[128,128].json
- N=7168,K=1024,device_name=AMD_Instinct_MI300X,dtype=fp8_w8a8,block_shape=[128,128].json
- N=7168,K=1024,device_name=AMD_Instinct_MI325_OAM,dtype=fp8_w8a8,block_shape=[128,128].json
- N=7168,K=1024,device_name=AMD_Instinct_MI325X,dtype=fp8_w8a8,block_shape=[128,128].json
- N=7168,K=1024,device_name=NVIDIA_A100-SXM4-80GB,dtype=int8_w8a8,block_shape=[128,128].json
- N=7168,K=1024,device_name=NVIDIA_A800-SXM4-80GB,dtype=int8_w8a8,block_shape=[128,128].json
- N=7168,K=1024,device_name=NVIDIA_H100_80GB_HBM3,dtype=fp8_w8a8,block_shape=[128,128].json
- N=7168,K=1024,device_name=NVIDIA_H20,dtype=fp8_w8a8,block_shape=[128,128].json
- N=7168,K=1024,device_name=NVIDIA_H200,dtype=fp8_w8a8,block_shape=[128,128].json
- N=7168,K=1024,device_name=NVIDIA_L20Y,dtype=fp8_w8a8,block_shape=[128,128].json
- N=7168,K=1152,device_name=AMD_Instinct_MI300X,dtype=fp8_w8a8,block_shape=[128,128].json
- N=7168,K=1152,device_name=AMD_Instinct_MI325_OAM,dtype=fp8_w8a8,block_shape=[128,128].json
- N=7168,K=1152,device_name=AMD_Instinct_MI325X,dtype=fp8_w8a8,block_shape=[128,128].json
- N=7168,K=1152,device_name=NVIDIA_A100-SXM4-80GB,dtype=int8_w8a8,block_shape=[128,128].json
- N=7168,K=1152,device_name=NVIDIA_A800-SXM4-80GB,dtype=int8_w8a8,block_shape=[128,128].json
- N=7168,K=1152,device_name=NVIDIA_H100_80GB_HBM3,dtype=fp8_w8a8,block_shape=[128,128].json
- N=7168,K=1152,device_name=NVIDIA_H20,dtype=fp8_w8a8,block_shape=[128,128].json
- N=7168,K=1152,device_name=NVIDIA_H200,dtype=fp8_w8a8,block_shape=[128,128].json
- N=7168,K=1152,device_name=NVIDIA_L20Y,dtype=fp8_w8a8,block_shape=[128,128].json
- N=7168,K=128,device_name=AMD_Instinct_MI300X,dtype=fp8_w8a8,block_shape=[128,128].json
- N=7168,K=128,device_name=AMD_Instinct_MI325_OAM,dtype=fp8_w8a8,block_shape=[128,128].json
- N=7168,K=128,device_name=AMD_Instinct_MI325X,dtype=fp8_w8a8,block_shape=[128,128].json
- N=7168,K=128,device_name=NVIDIA_A100-SXM4-80GB,dtype=int8_w8a8,block_shape=[128,128].json
- N=7168,K=128,device_name=NVIDIA_A800-SXM4-80GB,dtype=int8_w8a8,block_shape=[128,128].json
- N=7168,K=128,device_name=NVIDIA_H100_80GB_HBM3,dtype=fp8_w8a8,block_shape=[128,128].json
- N=7168,K=128,device_name=NVIDIA_H20,dtype=fp8_w8a8,block_shape=[128,128].json
- N=7168,K=128,device_name=NVIDIA_L20Y,dtype=fp8_w8a8,block_shape=[128,128].json
- N=7168,K=16384,device_name=AMD_Instinct_MI300X,dtype=fp8_w8a8,block_shape=[128,128].json
- N=7168,K=16384,device_name=AMD_Instinct_MI325_OAM,dtype=fp8_w8a8,block_shape=[128,128].json
- N=7168,K=16384,device_name=AMD_Instinct_MI325X,dtype=fp8_w8a8,block_shape=[128,128].json
- N=7168,K=16384,device_name=NVIDIA_A100-SXM4-80GB,dtype=int8_w8a8,block_shape=[128,128].json
- N=7168,K=16384,device_name=NVIDIA_A800-SXM4-80GB,dtype=int8_w8a8,block_shape=[128,128].json
- N=7168,K=16384,device_name=NVIDIA_B200,dtype=fp8_w8a8,block_shape=[128,128].json
- N=7168,K=16384,device_name=NVIDIA_H100_80GB_HBM3,dtype=fp8_w8a8,block_shape=[128,128].json
- N=7168,K=16384,device_name=NVIDIA_H20,dtype=fp8_w8a8,block_shape=[128,128].json
- N=7168,K=16384,device_name=NVIDIA_H20,dtype=int8_w8a8,block_shape=[128,128].json
- N=7168,K=16384,device_name=NVIDIA_H200,dtype=fp8_w8a8,block_shape=[128,128].json
- N=7168,K=16384,device_name=NVIDIA_L20,dtype=fp8_w8a8,block_shape=[128,128].json
- N=7168,K=16384,device_name=NVIDIA_L20Y,dtype=fp8_w8a8,block_shape=[128,128].json
- N=7168,K=18432,device_name=AMD_Instinct_MI300X,dtype=fp8_w8a8,block_shape=[128,128].json
- N=7168,K=18432,device_name=AMD_Instinct_MI325_OAM,dtype=fp8_w8a8,block_shape=[128,128].json
- N=7168,K=18432,device_name=AMD_Instinct_MI325X,dtype=fp8_w8a8,block_shape=[128,128].json
- N=7168,K=18432,device_name=NVIDIA_A100-SXM4-80GB,dtype=int8_w8a8,block_shape=[128,128].json
- N=7168,K=18432,device_name=NVIDIA_A800-SXM4-80GB,dtype=int8_w8a8,block_shape=[128,128].json
- N=7168,K=18432,device_name=NVIDIA_B200,dtype=fp8_w8a8,block_shape=[128,128].json
- N=7168,K=18432,device_name=NVIDIA_H100_80GB_HBM3,dtype=fp8_w8a8,block_shape=[128,128].json
- N=7168,K=18432,device_name=NVIDIA_H20,dtype=fp8_w8a8,block_shape=[128,128].json
- N=7168,K=18432,device_name=NVIDIA_H20,dtype=int8_w8a8,block_shape=[128,128].json
- N=7168,K=18432,device_name=NVIDIA_H200,dtype=fp8_w8a8,block_shape=[128,128].json
- N=7168,K=18432,device_name=NVIDIA_L20,dtype=fp8_w8a8,block_shape=[128,128].json
- N=7168,K=18432,device_name=NVIDIA_L20Y,dtype=fp8_w8a8,block_shape=[128,128].json
- N=7168,K=2048,device_name=AMD_Instinct_MI300X,dtype=fp8_w8a8,block_shape=[128,128].json
- N=7168,K=2048,device_name=AMD_Instinct_MI325_OAM,dtype=fp8_w8a8,block_shape=[128,128].json
- N=7168,K=2048,device_name=AMD_Instinct_MI325X,dtype=fp8_w8a8,block_shape=[128,128].json
- N=7168,K=2048,device_name=NVIDIA_B200,dtype=fp8_w8a8,block_shape=[128,128].json
- N=7168,K=2048,device_name=NVIDIA_H100_80GB_HBM3,dtype=fp8_w8a8,block_shape=[128,128].json
- N=7168,K=2048,device_name=NVIDIA_H20,dtype=int8_w8a8,block_shape=[128,128].json
- N=7168,K=2048,device_name=NVIDIA_H200,dtype=fp8_w8a8,block_shape=[128,128].json
- N=7168,K=2048,device_name=NVIDIA_L20,dtype=fp8_w8a8,block_shape=[128,128].json
- N=7168,K=2304,device_name=AMD_Instinct_MI300X,dtype=fp8_w8a8,block_shape=[128,128].json
- N=7168,K=2304,device_name=AMD_Instinct_MI325_OAM,dtype=fp8_w8a8,block_shape=[128,128].json
- N=7168,K=2304,device_name=AMD_Instinct_MI325X,dtype=fp8_w8a8,block_shape=[128,128].json
- N=7168,K=2304,device_name=NVIDIA_B200,dtype=fp8_w8a8,block_shape=[128,128].json
- N=7168,K=2304,device_name=NVIDIA_H100_80GB_HBM3,dtype=fp8_w8a8,block_shape=[128,128].json
- N=7168,K=2304,device_name=NVIDIA_H20,dtype=int8_w8a8,block_shape=[128,128].json
- N=7168,K=2304,device_name=NVIDIA_H200,dtype=fp8_w8a8,block_shape=[128,128].json
- N=7168,K=2304,device_name=NVIDIA_L20,dtype=fp8_w8a8,block_shape=[128,128].json
- N=7168,K=256,device_name=AMD_Instinct_MI300X,dtype=fp8_w8a8,block_shape=[128,128].json
- N=7168,K=256,device_name=AMD_Instinct_MI325_OAM,dtype=fp8_w8a8,block_shape=[128,128].json
- N=7168,K=256,device_name=AMD_Instinct_MI325X,dtype=fp8_w8a8,block_shape=[128,128].json
- N=7168,K=256,device_name=NVIDIA_B200,dtype=fp8_w8a8,block_shape=[128,128].json
- N=7168,K=256,device_name=NVIDIA_H20,dtype=int8_w8a8,block_shape=[128,128].json
- N=7168,K=256,device_name=NVIDIA_H200,dtype=fp8_w8a8,block_shape=[128,128].json
- N=7168,K=256,device_name=NVIDIA_L20,dtype=fp8_w8a8,block_shape=[128,128].json
- N=7168,K=8192,device_name=AMD_Instinct_MI300X,dtype=fp8_w8a8,block_shape=[128,128].json
- N=7168,K=8192,device_name=AMD_Instinct_MI325_OAM,dtype=fp8_w8a8,block_shape=[128,128].json
- N=7168,K=8192,device_name=AMD_Instinct_MI325X,dtype=fp8_w8a8,block_shape=[128,128].json
- N=8192,K=1536,device_name=AMD_Instinct_MI300X,dtype=fp8_w8a8,block_shape=[128,128].json
- N=8192,K=1536,device_name=AMD_Instinct_MI325_OAM,dtype=fp8_w8a8,block_shape=[128,128].json
- N=8192,K=1536,device_name=AMD_Instinct_MI325X,dtype=fp8_w8a8,block_shape=[128,128].json
- README.md
- __init__.py
- allspark_utils.py
- bitblas_utils.py
- flashinfer_fp4_moe.py
- flashinfer_utils.py
- fp8_utils.py
- gptq_utils.py
- int8_utils.py
- layer_utils.py
- machete_utils.py
- marlin_utils.py
- marlin_utils_fp4.py
- marlin_utils_fp8.py
- marlin_utils_test.py
- marlin_utils_test_24.py
- mxfp4_utils.py
- mxfp8_utils.py
- nvfp4_emulation_utils.py
- nvfp4_moe_support.py
- petit_utils.py
- quant_utils.py
- w8a8_utils.py
- __init__.py
- auto_round.py
- awq.py
- awq_marlin.py
- awq_triton.py
- base_config.py
- bitblas.py
- bitsandbytes.py
- deepgemm.py
- deepspeedfp.py
- experts_int8.py
- fbgemm_fp8.py
- fp8.py
- gguf.py
- gptq.py
- gptq_bitblas.py
- gptq_marlin.py
- gptq_marlin_24.py
- hqq_marlin.py
- inc.py
- input_quant_fp8.py
- ipex_quant.py
- kv_cache.py
- modelopt.py
- moe_wna16.py
- mxfp4.py
- petit.py
- ptpc_fp8.py
- rtn.py
- schema.py
- torchao.py
- tpu_int8.py
- __init__.py
- base.py
- common.py
- deepseek_scaling_rope.py
- dual_chunk_rope.py
- dynamic_ntk_alpha_rope.py
- dynamic_ntk_scaling_rope.py
- ernie45_vl_rope.py
- linear_scaling_rope.py
- llama3_rope.py
- llama4_vision_rope.py
- mrope.py
- ntk_scaling_rope.py
- phi3_long_rope_scaled_rope.py
- yarn_scaling_rope.py
- __init__.py
- shared_fused_moe.py
- __init__.py
- activation.py
- attention_layer_base.py
- layernorm.py
- lightning_attn.py
- linear.py
- logits_processor.py
- mla.py
- pooler.py
- resampler.py
- sampler.py
- utils.py
- vocab_parallel_embedding.py
- __init__.py
- base_loader.py
- bitsandbytes_loader.py
- default_loader.py
- dummy_loader.py
- gguf_loader.py
- runai_streamer_loader.py
- sharded_state_loader.py
- tensorizer.py
- tensorizer_loader.py
- tpu.py
- utils.py
- weight_utils.py
- __init__.py
- adapters.py
- aimv2.py
- apertus.py
- arcee.py
- arctic.py
- aria.py
- aya_vision.py
- baichuan.py
- bailing_moe.py
- bamba.py
- bart.py
- bert.py
- bert_with_rope.py
- blip.py
- blip2.py
- bloom.py
- chameleon.py
- chatglm.py
- clip.py
- cohere2_vision.py
- commandr.py
- config.py
- constant_size_cache.py
- dbrx.py
- deepseek.py
- deepseek_eagle.py
- deepseek_mtp.py
- deepseek_v2.py
- deepseek_vl2.py
- donut.py
- dots1.py
- ernie45.py
- ernie45_moe.py
- ernie45_vl.py
- ernie45_vl_moe.py
- ernie_mtp.py
- exaone.py
- exaone4.py
- fairseq2_llama.py
- falcon.py
- falcon_h1.py
- florence2.py
- fuyu.py
- gemma.py
- gemma2.py
- gemma3.py
- gemma3_mm.py
- gemma3n.py
- gemma3n_mm.py
- glm.py
- glm4.py
- glm4_1v.py
- glm4_moe.py
- glm4_moe_mtp.py
- glm4v.py
- gpt2.py
- gpt_bigcode.py
- gpt_j.py
- gpt_neox.py
- gpt_oss.py
- granite.py
- granite_speech.py
- granitemoe.py
- granitemoehybrid.py
- granitemoeshared.py
- gritlm.py
- grok1.py
- h2ovl.py
- hunyuan_v1.py
- hyperclovax_vision.py
- idefics2_vision_model.py
- idefics3.py
- interfaces.py
- interfaces_base.py
- intern_vit.py
- internlm2.py
- internlm2_ve.py
- interns1.py
- interns1_vit.py
- internvl.py
- jais.py
- jamba.py
- jina_vl.py
- keye.py
- keye_vl1_5.py
- kimi_vl.py
- lfm2.py
- llama.py
- llama4.py
- llama4_eagle.py
- llama_eagle.py
- llama_eagle3.py
- llava.py
- llava_next.py
- llava_next_video.py
- llava_onevision.py
- mamba.py
- mamba2.py
- mamba_cache.py
- medusa.py
- midashenglm.py
- mimo.py
- mimo_mtp.py
- minicpm.py
- minicpm3.py
- minicpm_eagle.py
- minicpmo.py
- minicpmv.py
- minimax_cache.py
- minimax_text_01.py
- minimax_vl_01.py
- mistral3.py
- mixtral.py
- mllama.py
- mllama4.py
- mlp_speculator.py
- modernbert.py
- module_mapping.py
- molmo.py
- moonvit.py
- motif.py
- mpt.py
- nano_nemotron_vl.py
- nemotron.py
- nemotron_h.py
- nemotron_nas.py
- nemotron_vl.py
- nvlm_d.py
- olmo.py
- olmo2.py
- olmoe.py
- opt.py
- orion.py
- ovis.py
- ovis2_5.py
- paligemma.py
- persimmon.py
- phi.py
- phi3.py
- phi3v.py
- phi4_multimodal.py
- phi4flash.py
- phi4mm.py
- phi4mm_audio.py
- phi4mm_utils.py
- phimoe.py
- pixtral.py
- plamo2.py
- qwen.py
- qwen2.py
- qwen2_5_omni_thinker.py
- qwen2_5_vl.py
- qwen2_audio.py
- qwen2_moe.py
- qwen2_rm.py
- qwen2_vl.py
- qwen3.py
- qwen3_moe.py
- qwen3_next.py
- qwen3_next_mtp.py
- qwen_vl.py
- registry.py
- roberta.py
- rvl.py
- seed_oss.py
- siglip.py
- siglip2navit.py
- skyworkr1v.py
- smolvlm.py
- solar.py
- stablelm.py
- starcoder2.py
- step3_text.py
- step3_vl.py
- swin.py
- tarsier.py
- telechat2.py
- teleflm.py
- terratorch.py
- transformers.py
- ultravox.py
- utils.py
- vision.py
- voxtral.py
- whisper.py
- zamba2.py
- __init__.py
- deep_gemm_warmup.py
- kernel_warmup.py
- __init__.py
- custom_op.py
- parameter.py
- sampling_metadata.py
- utils.py
- __init__.py
- audio.py
- base.py
- cache.py
- hasher.py
- image.py
- inputs.py
- parse.py
- processing.py
- profiling.py
- registry.py
- utils.py
- video.py
- __init__.py
- cpu.py
- cuda.py
- interface.py
- rocm.py
- tpu.py
- xpu.py
- __init__.py
- interface.py
- __init__.py
- filesystem_resolver.py
- README.md
- __init__.py
- __init__.py
- layerwise_profile.py
- utils.py
- __init__.py
- lazy_utils.py
- ray_env.py
- __init__.py
- abs_reasoning_parsers.py
- deepseek_r1_reasoning_parser.py
- glm4_moe_reasoning_parser.py
- gptoss_reasoning_parser.py
- granite_reasoning_parser.py
- hunyuan_a13b_reasoning_parser.py
- mistral_reasoning_parser.py
- qwen3_reasoning_parser.py
- step3_reasoning_parser.py
- __init__.py
- pynvml.py
- __init__.py
- registry.py
- template_basic.jinja
- template_blip2.jinja
- template_chatml.jinja
- template_deepseek_vl2.jinja
- template_fuyu.jinja
- template_minicpmv45.jinja
- __init__.py
- algos.py
- base.py
- __init__.py
- arctic.py
- chatglm.py
- deepseek_vl2.py
- eagle.py
- falcon.py
- jais.py
- kimi_vl.py
- medusa.py
- midashenglm.py
- mistral.py
- mlp_speculator.py
- moonvit.py
- nemotron.py
- nemotron_h.py
- nemotron_vl.py
- ovis.py
- qwen3_next.py
- step3_vl.py
- ultravox.py
- __init__.py
- deepseek_vl2.py
- ovis.py
- ovis2_5.py
- __init__.py
- mistral.py
- __init__.py
- config.py
- config_parser_base.py
- detokenizer.py
- detokenizer_utils.py
- dynamic_module.py
- processor.py
- runai_utils.py
- s3_utils.py
- tokenizer.py
- tokenizer_base.py
- tokenizer_group.py
- utils.py
- __init__.py
- importing.py
- __init__.py
- usage_lib.py
- __init__.py
- deep_gemm.py
- flashinfer.py
- jsontree.py
- tensor_schema.py
- __init__.py
- common.py
- cutlass_mla.py
- flashattn_mla.py
- flashinfer_mla.py
- flashmla.py
- rocm_aiter_mla.py
- triton_mla.py
- __init__.py
- cpu_attn.py
- flash_attn.py
- flashinfer.py
- flex_attention.py
- gdn_attn.py
- linear_attn.py
- mamba1_attn.py
- mamba2_attn.py
- mamba_attn.py
- pallas.py
- rocm_aiter_fa.py
- short_conv_attn.py
- tree_attn.py
- triton_attn.py
- utils.py
- xformers.py
- __init__.py
- __init__.py
- async_scheduler.py
- interface.py
- output.py
- request_queue.py
- scheduler.py
- utils.py
- __init__.py
- block_pool.py
- encoder_cache_manager.py
- estimate_with_func.py
- kv_cache_coordinator.py
- kv_cache_manager.py
- kv_cache_utils.py
- single_type_kv_cache_manager.py
- __init__.py
- async_llm.py
- coordinator.py
- core.py
- core_client.py
- detokenizer.py
- exceptions.py
- llm_engine.py
- logprobs.py
- output_processor.py
- parallel_sampling.py
- processor.py
- utils.py
- __init__.py
- abstract.py
- multiproc_executor.py
- ray_distributed_executor.py
- __init__.py
- loggers.py
- prometheus.py
- ray_wrappers.py
- reader.py
- stats.py
- __init__.py
- metadata.py
- __init__.py
- builtin.py
- interface.py
- state.py
- __init__.py
- bad_words.py
- logprobs.py
- penalties.py
- topk_topp_sampler.py
- __init__.py
- metadata.py
- sampler.py
- __init__.py
- metadata.py
- rejection_sampler.py
- sampler.py
- __init__.py
- eagle.py
- medusa.py
- metadata.py
- metrics.py
- ngram_proposer.py
- utils.py
- __init__.py
- backend_guidance.py
- backend_lm_format_enforcer.py
- backend_outlines.py
- backend_types.py
- backend_xgrammar.py
- request.py
- utils.py
- __init__.py
- block_table.py
- cpu_model_runner.py
- cpu_worker.py
- gpu_input_batch.py
- gpu_model_runner.py
- gpu_worker.py
- kv_connector_model_runner_mixin.py
- lora_model_runner_mixin.py
- tpu_input_batch.py
- tpu_model_runner.py
- tpu_worker.py
- utils.py
- worker_base.py
- xpu_model_runner.py
- xpu_worker.py
- __init__.py
- cudagraph_dispatcher.py
- kv_cache_interface.py
- outputs.py
- request.py
- serial_utils.py
- utils.py
- __init__.py
- rotary.py
- __init__.py
- rotary.py
- __init__.py
- flash_attn_interface.py
- __init__.py
- cache_engine.py
- enc_dec_model_runner.py
- model_runner.py
- model_runner_base.py
- utils.py
- worker.py
- worker_base.py
- __init__.py
- _bc_linter.py
- _custom_ops.py
- _ipex_ops.py
- _version.py
- beam_search.py
- collect_env.py
- connections.py
- env_override.py
- envs.py
- forward_context.py
- logger.py
- logits_process.py
- logprobs.py
- outputs.py
- pooling_params.py
- py.typed
- sampling_params.py
- scalar_type.py
- scripts.py
- sequence.py
- tasks.py
- test_utils.py
- tracing.py
- version.py
- .clang-format
- .dockerignore
- .gitignore
- .markdownlint.yaml
- .pre-commit-config.yaml
- .readthedocs.yaml
- .shellcheckrc
- .yapfignore
- CMakeLists.txt
- CODE_OF_CONDUCT.md
- CONDA_SETUP.md
- CONTRIBUTING.md
- DCO
- find_cuda_init.py
- format.sh
- LICENSE
- MANIFEST.in
- mkdocs.yaml
- pyproject.toml
- README.md
- RELEASE.md
- SECURITY.md
- setup.py
- use_existing_torch.py
- .gitattributes
- .gitignore
- LICENSE.txt
- README.md
# CDN으로 사용하기
jsDelivrjsDelivr는 공개 GitHub 리포지토리를 별도 설정 없이 CDN으로 즉시 서빙합니다. 버전과 파일을 고르면 웹페이지에 바로 붙일 수 있는 링크와 예시 코드가 만들어집니다.
링크
예시
// repository documentation
Was this content helpful?
(0 ratings)
