From 9b381fb3def6a57e8f6802e07c911c61e4b25c87 Mon Sep 17 00:00:00 2001 From: hackit Date: Sun, 28 Jun 2026 17:25:21 +0000 Subject: [PATCH] Add local models via Git LFS (23 models, ~143 GB) --- .gitattributes | 12 + .../Qwen3.5-0.8B-Q4_K_M.gguf | 3 + chat/gguf/unsloth/Qwen3.5-0.8B-GGUF/README.md | 996 ++++++ .../unsloth/Qwen3.5-0.8B-GGUF/mmproj-F16.gguf | 3 + .../Qwen3.5-2B-GGUF/Qwen3.5-2B-Q4_K_M.gguf | 3 + chat/gguf/unsloth/Qwen3.5-2B-GGUF/README.md | 1033 ++++++ .../unsloth/Qwen3.5-2B-GGUF/mmproj-F16.gguf | 3 + .../Qwen3.5-4B-GGUF/Qwen3.5-4B-Q4_K_M.gguf | 3 + chat/gguf/unsloth/Qwen3.5-4B-GGUF/README.md | 1201 +++++++ .../unsloth/Qwen3.5-4B-GGUF/mmproj-F16.gguf | 3 + .../Qwen3.5-9B-GGUF/Qwen3.5-9B-Q4_K_M.gguf | 3 + chat/gguf/unsloth/Qwen3.5-9B-GGUF/README.md | 1199 +++++++ .../unsloth/Qwen3.5-9B-GGUF/mmproj-F16.gguf | 3 + .../Qwen3.6-35B-A3B-UD-Q4_K_M.gguf | 3 + .../unsloth/Qwen3.6-35B-A3B-GGUF/README.md | 1073 ++++++ .../Qwen3.6-35B-A3B-GGUF/mmproj-F16.gguf | 3 + .../unsloth/gemma-4-12b-it-GGUF/README.md | 609 ++++ .../gemma-4-12b-it-Q4_K_M.gguf | 3 + .../gemma-4-12b-it-GGUF/mmproj-F16.gguf | 3 + .../unsloth/gemma-4-26B-A4B-it-GGUF/README.md | 546 ++++ .../gemma-4-26B-A4B-it-GGUF/config.json | 145 + .../gemma-4-26B-A4B-it-UD-Q4_K_M.gguf | 3 + .../gemma-4-26B-A4B-it-GGUF/mmproj-F16.gguf | 3 + .../gemma-4-E2B-it-qat-mobile-GGUF/README.md | 578 ++++ .../config.json | 190 ++ .../gemma-4-E2B-it-qat-UD-Q2_K_XL.gguf | 3 + .../mmproj-F16.gguf | 3 + .../unsloth/gemma-4-E4B-it-GGUF/README.md | 548 ++++ .../unsloth/gemma-4-E4B-it-GGUF/config.json | 197 ++ .../gemma-4-E4B-it-Q4_K_M.gguf | 3 + .../gemma-4-E4B-it-GGUF/mmproj-F16.gguf | 3 + .../gemma-4-E4B-it-qat-mobile-GGUF/README.md | 578 ++++ .../config.json | 197 ++ .../gemma-4-E4B-it-qat-UD-Q2_K_XL.gguf | 3 + .../mmproj-F16.gguf | 3 + .../Qwen3.5-0.8B-MLX-4bit/.gitattributes | 36 + .../Qwen3.5-0.8B-MLX-4bit/README.md | 75 + .../Qwen3.5-0.8B-MLX-4bit/chat_template.jinja | 154 + .../Qwen3.5-0.8B-MLX-4bit/config.json | 106 + .../Qwen3.5-0.8B-MLX-4bit/model.safetensors | 3 + .../model.safetensors.index.json | 854 +++++ .../preprocessor_config.json | 21 + .../processor_config.json | 63 + .../Qwen3.5-0.8B-MLX-4bit/tokenizer.json | 3 + .../tokenizer_config.json | 32 + .../video_preprocessor_config.json | 21 + .../Qwen3.5-0.8B-MLX-4bit/vocab.json | 3 + .../Qwen3.5-2B-MLX-4bit/.gitattributes | 36 + .../Qwen3.5-2B-MLX-4bit/README.md | 75 + .../Qwen3.5-2B-MLX-4bit/chat_template.jinja | 154 + .../Qwen3.5-2B-MLX-4bit/config.json | 106 + .../Qwen3.5-2B-MLX-4bit/model.safetensors | 3 + .../model.safetensors.index.json | 998 ++++++ .../preprocessor_config.json | 21 + .../Qwen3.5-2B-MLX-4bit/processor_config.json | 63 + .../Qwen3.5-2B-MLX-4bit/tokenizer.json | 3 + .../Qwen3.5-2B-MLX-4bit/tokenizer_config.json | 32 + .../video_preprocessor_config.json | 21 + .../Qwen3.5-2B-MLX-4bit/vocab.json | 3 + .../Qwen3.5-4B-MLX-4bit/.gitattributes | 36 + .../Qwen3.5-4B-MLX-4bit/README.md | 75 + .../Qwen3.5-4B-MLX-4bit/chat_template.jinja | 154 + .../Qwen3.5-4B-MLX-4bit/config.json | 114 + .../Qwen3.5-4B-MLX-4bit/model.safetensors | 3 + .../model.safetensors.index.json | 1228 +++++++ .../preprocessor_config.json | 21 + .../Qwen3.5-4B-MLX-4bit/processor_config.json | 63 + .../Qwen3.5-4B-MLX-4bit/tokenizer.json | 3 + .../Qwen3.5-4B-MLX-4bit/tokenizer_config.json | 32 + .../video_preprocessor_config.json | 21 + .../Qwen3.5-4B-MLX-4bit/vocab.json | 3 + .../Qwen3.5-9B-MLX-4bit/.gitattributes | 36 + .../Qwen3.5-9B-MLX-4bit/README.md | 76 + .../Qwen3.5-9B-MLX-4bit/chat_template.jinja | 154 + .../Qwen3.5-9B-MLX-4bit/config.json | 113 + .../model-00001-of-00002.safetensors | 3 + .../model-00002-of-00002.safetensors | 3 + .../model.safetensors.index.json | 1267 +++++++ .../preprocessor_config.json | 21 + .../Qwen3.5-9B-MLX-4bit/processor_config.json | 63 + .../Qwen3.5-9B-MLX-4bit/tokenizer.json | 3 + .../Qwen3.5-9B-MLX-4bit/tokenizer_config.json | 32 + .../video_preprocessor_config.json | 21 + .../Qwen3.5-9B-MLX-4bit/vocab.json | 3 + .../Qwen3.6-35B-A3B-4bit/.gitattributes | 36 + .../Qwen3.6-35B-A3B-4bit/README.md | 25 + .../Qwen3.6-35B-A3B-4bit/chat_template.jinja | 154 + .../Qwen3.6-35B-A3B-4bit/config.json | 773 +++++ .../Qwen3.6-35B-A3B-4bit/configuration.json | 1 + .../generation_config.json | 12 + .../model-00001-of-00004.safetensors | 3 + .../model-00002-of-00004.safetensors | 3 + .../model-00003-of-00004.safetensors | 3 + .../model-00004-of-00004.safetensors | 3 + .../model.safetensors.index.json | 2097 ++++++++++++ .../preprocessor_config.json | 21 + .../processor_config.json | 64 + .../Qwen3.6-35B-A3B-4bit/tokenizer.json | 3 + .../tokenizer_config.json | 32 + .../video_preprocessor_config.json | 21 + .../Qwen3.6-35B-A3B-4bit/vocab.json | 3 + .../gemma-4-12B-it-4bit/.gitattributes | 36 + .../gemma-4-12B-it-4bit/README.md | 7 + .../gemma-4-12B-it-4bit/chat_template.jinja | 363 +++ .../gemma-4-12B-it-4bit/config.json | 183 ++ .../generation_config.json | 18 + .../model-00001-of-00002.safetensors | 3 + .../model-00002-of-00002.safetensors | 3 + .../model.safetensors.index.json | 1348 ++++++++ .../gemma-4-12B-it-4bit/processor_config.json | 40 + .../gemma-4-12B-it-4bit/tokenizer.json | 3 + .../gemma-4-12B-it-4bit/tokenizer_config.json | 95 + .../gemma-4-26b-a4b-it-4bit/.gitattributes | 36 + .../gemma-4-26b-a4b-it-4bit/README.md | 25 + .../chat_template.jinja | 363 +++ .../gemma-4-26b-a4b-it-4bit/config.json | 1117 +++++++ .../generation_config.json | 14 + .../model-00001-of-00003.safetensors | 3 + .../model-00002-of-00003.safetensors | 3 + .../model-00003-of-00003.safetensors | 3 + .../model.safetensors.index.json | 1704 ++++++++++ .../processor_config.json | 32 + .../gemma-4-26b-a4b-it-4bit/tokenizer.json | 3 + .../tokenizer_config.json | 74 + .../gemma-4-e2b-it-4bit/.gitattributes | 36 + .../gemma-4-e2b-it-4bit/README.md | 25 + .../gemma-4-e2b-it-4bit/chat_template.jinja | 360 ++ .../gemma-4-e2b-it-4bit/config.json | 201 ++ .../generation_config.json | 14 + .../gemma-4-e2b-it-4bit/model.safetensors | 3 + .../model.safetensors.index.json | 2656 +++++++++++++++ .../gemma-4-e2b-it-4bit/processor_config.json | 42 + .../gemma-4-e2b-it-4bit/tokenizer.json | 3 + .../gemma-4-e2b-it-4bit/tokenizer_config.json | 74 + .../gemma-4-e4b-it-4bit/.gitattributes | 36 + .../gemma-4-e4b-it-4bit/README.md | 25 + .../gemma-4-e4b-it-4bit/chat_template.jinja | 360 ++ .../gemma-4-e4b-it-4bit/config.json | 208 ++ .../generation_config.json | 14 + .../gemma-4-e4b-it-4bit/model.safetensors | 3 + .../model.safetensors.index.json | 2901 +++++++++++++++++ .../gemma-4-e4b-it-4bit/processor_config.json | 42 + .../gemma-4-e4b-it-4bit/tokenizer.json | 3 + .../gemma-4-e4b-it-4bit/tokenizer_config.json | 74 + .../.gitattributes | 36 + .../LICENSE | 177 + .../NOTICE.md | 6 + .../README.md | 223 ++ .../assets/bonsai-logo.svg | 1 + .../manifest.json | 101 + .../model_index.json | 4 + .../text_encoder-hqq-4bit/config.json | 68 + .../text_encoder-hqq-4bit/qmodel.pt | 3 + .../tokenizer/added_tokens.json | 28 + .../tokenizer/chat_template.jinja | 89 + .../tokenizer/merges.txt | 3 + .../tokenizer/special_tokens_map.json | 31 + .../tokenizer/tokenizer.json | 3 + .../tokenizer/tokenizer_config.json | 239 ++ .../tokenizer/vocab.json | 3 + .../transformer-gemlite-int1/config.json | 27 + .../gemlite_autotune.json | 1 + .../quantization_config.json | 162 + .../transformer-gemlite-int1/state_dict.pt | 3 + .../vae/config.json | 41 + .../vae/diffusion_pytorch_model.safetensors | 3 + .../.gitattributes | 36 + .../LICENSE | 177 + .../NOTICE.md | 6 + .../README.md | 224 ++ .../assets/bonsai-logo.svg | 1 + .../manifest.json | 101 + .../model_index.json | 4 + .../text_encoder-hqq-4bit/config.json | 68 + .../text_encoder-hqq-4bit/qmodel.pt | 3 + .../tokenizer/added_tokens.json | 28 + .../tokenizer/chat_template.jinja | 89 + .../tokenizer/merges.txt | 3 + .../tokenizer/special_tokens_map.json | 31 + .../tokenizer/tokenizer.json | 3 + .../tokenizer/tokenizer_config.json | 239 ++ .../tokenizer/vocab.json | 3 + .../transformer-gemlite-int2/config.json | 27 + .../gemlite_autotune.json | 1 + .../quantization_config.json | 163 + .../transformer-gemlite-int2/state_dict.pt | 3 + .../vae/config.json | 41 + .../vae/diffusion_pytorch_model.safetensors | 3 + .../.gitattributes | 37 + .../bonsai-image-binary-4B-mlx-1bit/LICENSE | 177 + .../bonsai-image-binary-4B-mlx-1bit/NOTICE.md | 6 + .../bonsai-image-binary-4B-mlx-1bit/README.md | 207 ++ .../assets/bonsai-logo.svg | 1 + .../manifest.json | 136 + .../model_index.json | 4 + .../scheduler/scheduler_config.json | 18 + .../text_encoder-mlx-4bit/added_tokens.json | 28 + .../text_encoder-mlx-4bit/config.json | 38 + .../text_encoder-mlx-4bit/merges.txt | 3 + .../text_encoder-mlx-4bit/model.safetensors | 3 + .../model.safetensors.index.json | 911 ++++++ .../special_tokens_map.json | 31 + .../text_encoder-mlx-4bit/tokenizer.json | 3 + .../tokenizer_config.json | 240 ++ .../text_encoder-mlx-4bit/vocab.json | 3 + .../tokenizer/added_tokens.json | 28 + .../tokenizer/chat_template.jinja | 89 + .../tokenizer/merges.txt | 3 + .../tokenizer/special_tokens_map.json | 31 + .../tokenizer/tokenizer.json | 3 + .../tokenizer/tokenizer_config.json | 239 ++ .../tokenizer/vocab.json | 3 + .../transformer-packed-mflux/config.json | 27 + .../diffusion_pytorch_model.safetensors | 3 + .../quantization_config.json | 120 + .../vae/config.json | 40 + .../vae/diffusion_pytorch_model.safetensors | 3 + .../.gitattributes | 37 + .../bonsai-image-ternary-4B-mlx-2bit/LICENSE | 177 + .../NOTICE.md | 6 + .../README.md | 213 ++ .../assets/bonsai-logo.svg | 1 + .../manifest.json | 136 + .../model_index.json | 4 + .../scheduler/scheduler_config.json | 18 + .../text_encoder-mlx-4bit/added_tokens.json | 28 + .../text_encoder-mlx-4bit/config.json | 38 + .../text_encoder-mlx-4bit/merges.txt | 3 + .../text_encoder-mlx-4bit/model.safetensors | 3 + .../model.safetensors.index.json | 911 ++++++ .../special_tokens_map.json | 31 + .../text_encoder-mlx-4bit/tokenizer.json | 3 + .../tokenizer_config.json | 240 ++ .../text_encoder-mlx-4bit/vocab.json | 3 + .../tokenizer/added_tokens.json | 28 + .../tokenizer/chat_template.jinja | 89 + .../tokenizer/merges.txt | 3 + .../tokenizer/special_tokens_map.json | 31 + .../tokenizer/tokenizer.json | 3 + .../tokenizer/tokenizer_config.json | 239 ++ .../tokenizer/vocab.json | 3 + .../transformer-packed-mflux/config.json | 27 + .../diffusion_pytorch_model.safetensors | 3 + .../quantization_config.json | 120 + .../vae/config.json | 40 + .../vae/diffusion_pytorch_model.safetensors | 3 + 246 files changed, 38788 insertions(+) create mode 100644 .gitattributes create mode 100644 chat/gguf/unsloth/Qwen3.5-0.8B-GGUF/Qwen3.5-0.8B-Q4_K_M.gguf create mode 100644 chat/gguf/unsloth/Qwen3.5-0.8B-GGUF/README.md create mode 100644 chat/gguf/unsloth/Qwen3.5-0.8B-GGUF/mmproj-F16.gguf create mode 100644 chat/gguf/unsloth/Qwen3.5-2B-GGUF/Qwen3.5-2B-Q4_K_M.gguf create mode 100644 chat/gguf/unsloth/Qwen3.5-2B-GGUF/README.md create mode 100644 chat/gguf/unsloth/Qwen3.5-2B-GGUF/mmproj-F16.gguf create mode 100644 chat/gguf/unsloth/Qwen3.5-4B-GGUF/Qwen3.5-4B-Q4_K_M.gguf create mode 100644 chat/gguf/unsloth/Qwen3.5-4B-GGUF/README.md create mode 100644 chat/gguf/unsloth/Qwen3.5-4B-GGUF/mmproj-F16.gguf create mode 100644 chat/gguf/unsloth/Qwen3.5-9B-GGUF/Qwen3.5-9B-Q4_K_M.gguf create mode 100644 chat/gguf/unsloth/Qwen3.5-9B-GGUF/README.md create mode 100644 chat/gguf/unsloth/Qwen3.5-9B-GGUF/mmproj-F16.gguf create mode 100644 chat/gguf/unsloth/Qwen3.6-35B-A3B-GGUF/Qwen3.6-35B-A3B-UD-Q4_K_M.gguf create mode 100644 chat/gguf/unsloth/Qwen3.6-35B-A3B-GGUF/README.md create mode 100644 chat/gguf/unsloth/Qwen3.6-35B-A3B-GGUF/mmproj-F16.gguf create mode 100644 chat/gguf/unsloth/gemma-4-12b-it-GGUF/README.md create mode 100644 chat/gguf/unsloth/gemma-4-12b-it-GGUF/gemma-4-12b-it-Q4_K_M.gguf create mode 100644 chat/gguf/unsloth/gemma-4-12b-it-GGUF/mmproj-F16.gguf create mode 100644 chat/gguf/unsloth/gemma-4-26B-A4B-it-GGUF/README.md create mode 100644 chat/gguf/unsloth/gemma-4-26B-A4B-it-GGUF/config.json create mode 100644 chat/gguf/unsloth/gemma-4-26B-A4B-it-GGUF/gemma-4-26B-A4B-it-UD-Q4_K_M.gguf create mode 100644 chat/gguf/unsloth/gemma-4-26B-A4B-it-GGUF/mmproj-F16.gguf create mode 100644 chat/gguf/unsloth/gemma-4-E2B-it-qat-mobile-GGUF/README.md create mode 100644 chat/gguf/unsloth/gemma-4-E2B-it-qat-mobile-GGUF/config.json create mode 100644 chat/gguf/unsloth/gemma-4-E2B-it-qat-mobile-GGUF/gemma-4-E2B-it-qat-UD-Q2_K_XL.gguf create mode 100644 chat/gguf/unsloth/gemma-4-E2B-it-qat-mobile-GGUF/mmproj-F16.gguf create mode 100644 chat/gguf/unsloth/gemma-4-E4B-it-GGUF/README.md create mode 100644 chat/gguf/unsloth/gemma-4-E4B-it-GGUF/config.json create mode 100644 chat/gguf/unsloth/gemma-4-E4B-it-GGUF/gemma-4-E4B-it-Q4_K_M.gguf create mode 100644 chat/gguf/unsloth/gemma-4-E4B-it-GGUF/mmproj-F16.gguf create mode 100644 chat/gguf/unsloth/gemma-4-E4B-it-qat-mobile-GGUF/README.md create mode 100644 chat/gguf/unsloth/gemma-4-E4B-it-qat-mobile-GGUF/config.json create mode 100644 chat/gguf/unsloth/gemma-4-E4B-it-qat-mobile-GGUF/gemma-4-E4B-it-qat-UD-Q2_K_XL.gguf create mode 100644 chat/gguf/unsloth/gemma-4-E4B-it-qat-mobile-GGUF/mmproj-F16.gguf create mode 100644 chat/mlx/mlx-community/Qwen3.5-0.8B-MLX-4bit/.gitattributes create mode 100644 chat/mlx/mlx-community/Qwen3.5-0.8B-MLX-4bit/README.md create mode 100644 chat/mlx/mlx-community/Qwen3.5-0.8B-MLX-4bit/chat_template.jinja create mode 100644 chat/mlx/mlx-community/Qwen3.5-0.8B-MLX-4bit/config.json create mode 100644 chat/mlx/mlx-community/Qwen3.5-0.8B-MLX-4bit/model.safetensors create mode 100644 chat/mlx/mlx-community/Qwen3.5-0.8B-MLX-4bit/model.safetensors.index.json create mode 100644 chat/mlx/mlx-community/Qwen3.5-0.8B-MLX-4bit/preprocessor_config.json create mode 100644 chat/mlx/mlx-community/Qwen3.5-0.8B-MLX-4bit/processor_config.json create mode 100644 chat/mlx/mlx-community/Qwen3.5-0.8B-MLX-4bit/tokenizer.json create mode 100644 chat/mlx/mlx-community/Qwen3.5-0.8B-MLX-4bit/tokenizer_config.json create mode 100644 chat/mlx/mlx-community/Qwen3.5-0.8B-MLX-4bit/video_preprocessor_config.json create mode 100644 chat/mlx/mlx-community/Qwen3.5-0.8B-MLX-4bit/vocab.json create mode 100644 chat/mlx/mlx-community/Qwen3.5-2B-MLX-4bit/.gitattributes create mode 100644 chat/mlx/mlx-community/Qwen3.5-2B-MLX-4bit/README.md create mode 100644 chat/mlx/mlx-community/Qwen3.5-2B-MLX-4bit/chat_template.jinja create mode 100644 chat/mlx/mlx-community/Qwen3.5-2B-MLX-4bit/config.json create mode 100644 chat/mlx/mlx-community/Qwen3.5-2B-MLX-4bit/model.safetensors create mode 100644 chat/mlx/mlx-community/Qwen3.5-2B-MLX-4bit/model.safetensors.index.json create mode 100644 chat/mlx/mlx-community/Qwen3.5-2B-MLX-4bit/preprocessor_config.json create mode 100644 chat/mlx/mlx-community/Qwen3.5-2B-MLX-4bit/processor_config.json create mode 100644 chat/mlx/mlx-community/Qwen3.5-2B-MLX-4bit/tokenizer.json create mode 100644 chat/mlx/mlx-community/Qwen3.5-2B-MLX-4bit/tokenizer_config.json create mode 100644 chat/mlx/mlx-community/Qwen3.5-2B-MLX-4bit/video_preprocessor_config.json create mode 100644 chat/mlx/mlx-community/Qwen3.5-2B-MLX-4bit/vocab.json create mode 100644 chat/mlx/mlx-community/Qwen3.5-4B-MLX-4bit/.gitattributes create mode 100644 chat/mlx/mlx-community/Qwen3.5-4B-MLX-4bit/README.md create mode 100644 chat/mlx/mlx-community/Qwen3.5-4B-MLX-4bit/chat_template.jinja create mode 100644 chat/mlx/mlx-community/Qwen3.5-4B-MLX-4bit/config.json create mode 100644 chat/mlx/mlx-community/Qwen3.5-4B-MLX-4bit/model.safetensors create mode 100644 chat/mlx/mlx-community/Qwen3.5-4B-MLX-4bit/model.safetensors.index.json create mode 100644 chat/mlx/mlx-community/Qwen3.5-4B-MLX-4bit/preprocessor_config.json create mode 100644 chat/mlx/mlx-community/Qwen3.5-4B-MLX-4bit/processor_config.json create mode 100644 chat/mlx/mlx-community/Qwen3.5-4B-MLX-4bit/tokenizer.json create mode 100644 chat/mlx/mlx-community/Qwen3.5-4B-MLX-4bit/tokenizer_config.json create mode 100644 chat/mlx/mlx-community/Qwen3.5-4B-MLX-4bit/video_preprocessor_config.json create mode 100644 chat/mlx/mlx-community/Qwen3.5-4B-MLX-4bit/vocab.json create mode 100644 chat/mlx/mlx-community/Qwen3.5-9B-MLX-4bit/.gitattributes create mode 100644 chat/mlx/mlx-community/Qwen3.5-9B-MLX-4bit/README.md create mode 100644 chat/mlx/mlx-community/Qwen3.5-9B-MLX-4bit/chat_template.jinja create mode 100644 chat/mlx/mlx-community/Qwen3.5-9B-MLX-4bit/config.json create mode 100644 chat/mlx/mlx-community/Qwen3.5-9B-MLX-4bit/model-00001-of-00002.safetensors create mode 100644 chat/mlx/mlx-community/Qwen3.5-9B-MLX-4bit/model-00002-of-00002.safetensors create mode 100644 chat/mlx/mlx-community/Qwen3.5-9B-MLX-4bit/model.safetensors.index.json create mode 100644 chat/mlx/mlx-community/Qwen3.5-9B-MLX-4bit/preprocessor_config.json create mode 100644 chat/mlx/mlx-community/Qwen3.5-9B-MLX-4bit/processor_config.json create mode 100644 chat/mlx/mlx-community/Qwen3.5-9B-MLX-4bit/tokenizer.json create mode 100644 chat/mlx/mlx-community/Qwen3.5-9B-MLX-4bit/tokenizer_config.json create mode 100644 chat/mlx/mlx-community/Qwen3.5-9B-MLX-4bit/video_preprocessor_config.json create mode 100644 chat/mlx/mlx-community/Qwen3.5-9B-MLX-4bit/vocab.json create mode 100644 chat/mlx/mlx-community/Qwen3.6-35B-A3B-4bit/.gitattributes create mode 100644 chat/mlx/mlx-community/Qwen3.6-35B-A3B-4bit/README.md create mode 100644 chat/mlx/mlx-community/Qwen3.6-35B-A3B-4bit/chat_template.jinja create mode 100644 chat/mlx/mlx-community/Qwen3.6-35B-A3B-4bit/config.json create mode 100644 chat/mlx/mlx-community/Qwen3.6-35B-A3B-4bit/configuration.json create mode 100644 chat/mlx/mlx-community/Qwen3.6-35B-A3B-4bit/generation_config.json create mode 100644 chat/mlx/mlx-community/Qwen3.6-35B-A3B-4bit/model-00001-of-00004.safetensors create mode 100644 chat/mlx/mlx-community/Qwen3.6-35B-A3B-4bit/model-00002-of-00004.safetensors create mode 100644 chat/mlx/mlx-community/Qwen3.6-35B-A3B-4bit/model-00003-of-00004.safetensors create mode 100644 chat/mlx/mlx-community/Qwen3.6-35B-A3B-4bit/model-00004-of-00004.safetensors create mode 100644 chat/mlx/mlx-community/Qwen3.6-35B-A3B-4bit/model.safetensors.index.json create mode 100644 chat/mlx/mlx-community/Qwen3.6-35B-A3B-4bit/preprocessor_config.json create mode 100644 chat/mlx/mlx-community/Qwen3.6-35B-A3B-4bit/processor_config.json create mode 100644 chat/mlx/mlx-community/Qwen3.6-35B-A3B-4bit/tokenizer.json create mode 100644 chat/mlx/mlx-community/Qwen3.6-35B-A3B-4bit/tokenizer_config.json create mode 100644 chat/mlx/mlx-community/Qwen3.6-35B-A3B-4bit/video_preprocessor_config.json create mode 100644 chat/mlx/mlx-community/Qwen3.6-35B-A3B-4bit/vocab.json create mode 100644 chat/mlx/mlx-community/gemma-4-12B-it-4bit/.gitattributes create mode 100644 chat/mlx/mlx-community/gemma-4-12B-it-4bit/README.md create mode 100644 chat/mlx/mlx-community/gemma-4-12B-it-4bit/chat_template.jinja create mode 100644 chat/mlx/mlx-community/gemma-4-12B-it-4bit/config.json create mode 100644 chat/mlx/mlx-community/gemma-4-12B-it-4bit/generation_config.json create mode 100644 chat/mlx/mlx-community/gemma-4-12B-it-4bit/model-00001-of-00002.safetensors create mode 100644 chat/mlx/mlx-community/gemma-4-12B-it-4bit/model-00002-of-00002.safetensors create mode 100644 chat/mlx/mlx-community/gemma-4-12B-it-4bit/model.safetensors.index.json create mode 100644 chat/mlx/mlx-community/gemma-4-12B-it-4bit/processor_config.json create mode 100644 chat/mlx/mlx-community/gemma-4-12B-it-4bit/tokenizer.json create mode 100644 chat/mlx/mlx-community/gemma-4-12B-it-4bit/tokenizer_config.json create mode 100644 chat/mlx/mlx-community/gemma-4-26b-a4b-it-4bit/.gitattributes create mode 100644 chat/mlx/mlx-community/gemma-4-26b-a4b-it-4bit/README.md create mode 100644 chat/mlx/mlx-community/gemma-4-26b-a4b-it-4bit/chat_template.jinja create mode 100644 chat/mlx/mlx-community/gemma-4-26b-a4b-it-4bit/config.json create mode 100644 chat/mlx/mlx-community/gemma-4-26b-a4b-it-4bit/generation_config.json create mode 100644 chat/mlx/mlx-community/gemma-4-26b-a4b-it-4bit/model-00001-of-00003.safetensors create mode 100644 chat/mlx/mlx-community/gemma-4-26b-a4b-it-4bit/model-00002-of-00003.safetensors create mode 100644 chat/mlx/mlx-community/gemma-4-26b-a4b-it-4bit/model-00003-of-00003.safetensors create mode 100644 chat/mlx/mlx-community/gemma-4-26b-a4b-it-4bit/model.safetensors.index.json create mode 100644 chat/mlx/mlx-community/gemma-4-26b-a4b-it-4bit/processor_config.json create mode 100644 chat/mlx/mlx-community/gemma-4-26b-a4b-it-4bit/tokenizer.json create mode 100644 chat/mlx/mlx-community/gemma-4-26b-a4b-it-4bit/tokenizer_config.json create mode 100644 chat/mlx/mlx-community/gemma-4-e2b-it-4bit/.gitattributes create mode 100644 chat/mlx/mlx-community/gemma-4-e2b-it-4bit/README.md create mode 100644 chat/mlx/mlx-community/gemma-4-e2b-it-4bit/chat_template.jinja create mode 100644 chat/mlx/mlx-community/gemma-4-e2b-it-4bit/config.json create mode 100644 chat/mlx/mlx-community/gemma-4-e2b-it-4bit/generation_config.json create mode 100644 chat/mlx/mlx-community/gemma-4-e2b-it-4bit/model.safetensors create mode 100644 chat/mlx/mlx-community/gemma-4-e2b-it-4bit/model.safetensors.index.json create mode 100644 chat/mlx/mlx-community/gemma-4-e2b-it-4bit/processor_config.json create mode 100644 chat/mlx/mlx-community/gemma-4-e2b-it-4bit/tokenizer.json create mode 100644 chat/mlx/mlx-community/gemma-4-e2b-it-4bit/tokenizer_config.json create mode 100644 chat/mlx/mlx-community/gemma-4-e4b-it-4bit/.gitattributes create mode 100644 chat/mlx/mlx-community/gemma-4-e4b-it-4bit/README.md create mode 100644 chat/mlx/mlx-community/gemma-4-e4b-it-4bit/chat_template.jinja create mode 100644 chat/mlx/mlx-community/gemma-4-e4b-it-4bit/config.json create mode 100644 chat/mlx/mlx-community/gemma-4-e4b-it-4bit/generation_config.json create mode 100644 chat/mlx/mlx-community/gemma-4-e4b-it-4bit/model.safetensors create mode 100644 chat/mlx/mlx-community/gemma-4-e4b-it-4bit/model.safetensors.index.json create mode 100644 chat/mlx/mlx-community/gemma-4-e4b-it-4bit/processor_config.json create mode 100644 chat/mlx/mlx-community/gemma-4-e4b-it-4bit/tokenizer.json create mode 100644 chat/mlx/mlx-community/gemma-4-e4b-it-4bit/tokenizer_config.json create mode 100644 image/gemlite/prism-ml/bonsai-image-binary-4B-gemlite-1bit/.gitattributes create mode 100644 image/gemlite/prism-ml/bonsai-image-binary-4B-gemlite-1bit/LICENSE create mode 100644 image/gemlite/prism-ml/bonsai-image-binary-4B-gemlite-1bit/NOTICE.md create mode 100644 image/gemlite/prism-ml/bonsai-image-binary-4B-gemlite-1bit/README.md create mode 100644 image/gemlite/prism-ml/bonsai-image-binary-4B-gemlite-1bit/assets/bonsai-logo.svg create mode 100644 image/gemlite/prism-ml/bonsai-image-binary-4B-gemlite-1bit/manifest.json create mode 100644 image/gemlite/prism-ml/bonsai-image-binary-4B-gemlite-1bit/model_index.json create mode 100644 image/gemlite/prism-ml/bonsai-image-binary-4B-gemlite-1bit/text_encoder-hqq-4bit/config.json create mode 100644 image/gemlite/prism-ml/bonsai-image-binary-4B-gemlite-1bit/text_encoder-hqq-4bit/qmodel.pt create mode 100644 image/gemlite/prism-ml/bonsai-image-binary-4B-gemlite-1bit/text_encoder-hqq-4bit/tokenizer/added_tokens.json create mode 100644 image/gemlite/prism-ml/bonsai-image-binary-4B-gemlite-1bit/text_encoder-hqq-4bit/tokenizer/chat_template.jinja create mode 100644 image/gemlite/prism-ml/bonsai-image-binary-4B-gemlite-1bit/text_encoder-hqq-4bit/tokenizer/merges.txt create mode 100644 image/gemlite/prism-ml/bonsai-image-binary-4B-gemlite-1bit/text_encoder-hqq-4bit/tokenizer/special_tokens_map.json create mode 100644 image/gemlite/prism-ml/bonsai-image-binary-4B-gemlite-1bit/text_encoder-hqq-4bit/tokenizer/tokenizer.json create mode 100644 image/gemlite/prism-ml/bonsai-image-binary-4B-gemlite-1bit/text_encoder-hqq-4bit/tokenizer/tokenizer_config.json create mode 100644 image/gemlite/prism-ml/bonsai-image-binary-4B-gemlite-1bit/text_encoder-hqq-4bit/tokenizer/vocab.json create mode 100644 image/gemlite/prism-ml/bonsai-image-binary-4B-gemlite-1bit/transformer-gemlite-int1/config.json create mode 100644 image/gemlite/prism-ml/bonsai-image-binary-4B-gemlite-1bit/transformer-gemlite-int1/gemlite_autotune.json create mode 100644 image/gemlite/prism-ml/bonsai-image-binary-4B-gemlite-1bit/transformer-gemlite-int1/quantization_config.json create mode 100644 image/gemlite/prism-ml/bonsai-image-binary-4B-gemlite-1bit/transformer-gemlite-int1/state_dict.pt create mode 100644 image/gemlite/prism-ml/bonsai-image-binary-4B-gemlite-1bit/vae/config.json create mode 100644 image/gemlite/prism-ml/bonsai-image-binary-4B-gemlite-1bit/vae/diffusion_pytorch_model.safetensors create mode 100644 image/gemlite/prism-ml/bonsai-image-ternary-4B-gemlite-2bit/.gitattributes create mode 100644 image/gemlite/prism-ml/bonsai-image-ternary-4B-gemlite-2bit/LICENSE create mode 100644 image/gemlite/prism-ml/bonsai-image-ternary-4B-gemlite-2bit/NOTICE.md create mode 100644 image/gemlite/prism-ml/bonsai-image-ternary-4B-gemlite-2bit/README.md create mode 100644 image/gemlite/prism-ml/bonsai-image-ternary-4B-gemlite-2bit/assets/bonsai-logo.svg create mode 100644 image/gemlite/prism-ml/bonsai-image-ternary-4B-gemlite-2bit/manifest.json create mode 100644 image/gemlite/prism-ml/bonsai-image-ternary-4B-gemlite-2bit/model_index.json create mode 100644 image/gemlite/prism-ml/bonsai-image-ternary-4B-gemlite-2bit/text_encoder-hqq-4bit/config.json create mode 100644 image/gemlite/prism-ml/bonsai-image-ternary-4B-gemlite-2bit/text_encoder-hqq-4bit/qmodel.pt create mode 100644 image/gemlite/prism-ml/bonsai-image-ternary-4B-gemlite-2bit/text_encoder-hqq-4bit/tokenizer/added_tokens.json create mode 100644 image/gemlite/prism-ml/bonsai-image-ternary-4B-gemlite-2bit/text_encoder-hqq-4bit/tokenizer/chat_template.jinja create mode 100644 image/gemlite/prism-ml/bonsai-image-ternary-4B-gemlite-2bit/text_encoder-hqq-4bit/tokenizer/merges.txt create mode 100644 image/gemlite/prism-ml/bonsai-image-ternary-4B-gemlite-2bit/text_encoder-hqq-4bit/tokenizer/special_tokens_map.json create mode 100644 image/gemlite/prism-ml/bonsai-image-ternary-4B-gemlite-2bit/text_encoder-hqq-4bit/tokenizer/tokenizer.json create mode 100644 image/gemlite/prism-ml/bonsai-image-ternary-4B-gemlite-2bit/text_encoder-hqq-4bit/tokenizer/tokenizer_config.json create mode 100644 image/gemlite/prism-ml/bonsai-image-ternary-4B-gemlite-2bit/text_encoder-hqq-4bit/tokenizer/vocab.json create mode 100644 image/gemlite/prism-ml/bonsai-image-ternary-4B-gemlite-2bit/transformer-gemlite-int2/config.json create mode 100644 image/gemlite/prism-ml/bonsai-image-ternary-4B-gemlite-2bit/transformer-gemlite-int2/gemlite_autotune.json create mode 100644 image/gemlite/prism-ml/bonsai-image-ternary-4B-gemlite-2bit/transformer-gemlite-int2/quantization_config.json create mode 100644 image/gemlite/prism-ml/bonsai-image-ternary-4B-gemlite-2bit/transformer-gemlite-int2/state_dict.pt create mode 100644 image/gemlite/prism-ml/bonsai-image-ternary-4B-gemlite-2bit/vae/config.json create mode 100644 image/gemlite/prism-ml/bonsai-image-ternary-4B-gemlite-2bit/vae/diffusion_pytorch_model.safetensors create mode 100644 image/mlx/prism-ml/bonsai-image-binary-4B-mlx-1bit/.gitattributes create mode 100644 image/mlx/prism-ml/bonsai-image-binary-4B-mlx-1bit/LICENSE create mode 100644 image/mlx/prism-ml/bonsai-image-binary-4B-mlx-1bit/NOTICE.md create mode 100644 image/mlx/prism-ml/bonsai-image-binary-4B-mlx-1bit/README.md create mode 100644 image/mlx/prism-ml/bonsai-image-binary-4B-mlx-1bit/assets/bonsai-logo.svg create mode 100644 image/mlx/prism-ml/bonsai-image-binary-4B-mlx-1bit/manifest.json create mode 100644 image/mlx/prism-ml/bonsai-image-binary-4B-mlx-1bit/model_index.json create mode 100644 image/mlx/prism-ml/bonsai-image-binary-4B-mlx-1bit/scheduler/scheduler_config.json create mode 100644 image/mlx/prism-ml/bonsai-image-binary-4B-mlx-1bit/text_encoder-mlx-4bit/added_tokens.json create mode 100644 image/mlx/prism-ml/bonsai-image-binary-4B-mlx-1bit/text_encoder-mlx-4bit/config.json create mode 100644 image/mlx/prism-ml/bonsai-image-binary-4B-mlx-1bit/text_encoder-mlx-4bit/merges.txt create mode 100644 image/mlx/prism-ml/bonsai-image-binary-4B-mlx-1bit/text_encoder-mlx-4bit/model.safetensors create mode 100644 image/mlx/prism-ml/bonsai-image-binary-4B-mlx-1bit/text_encoder-mlx-4bit/model.safetensors.index.json create mode 100644 image/mlx/prism-ml/bonsai-image-binary-4B-mlx-1bit/text_encoder-mlx-4bit/special_tokens_map.json create mode 100644 image/mlx/prism-ml/bonsai-image-binary-4B-mlx-1bit/text_encoder-mlx-4bit/tokenizer.json create mode 100644 image/mlx/prism-ml/bonsai-image-binary-4B-mlx-1bit/text_encoder-mlx-4bit/tokenizer_config.json create mode 100644 image/mlx/prism-ml/bonsai-image-binary-4B-mlx-1bit/text_encoder-mlx-4bit/vocab.json create mode 100644 image/mlx/prism-ml/bonsai-image-binary-4B-mlx-1bit/tokenizer/added_tokens.json create mode 100644 image/mlx/prism-ml/bonsai-image-binary-4B-mlx-1bit/tokenizer/chat_template.jinja create mode 100644 image/mlx/prism-ml/bonsai-image-binary-4B-mlx-1bit/tokenizer/merges.txt create mode 100644 image/mlx/prism-ml/bonsai-image-binary-4B-mlx-1bit/tokenizer/special_tokens_map.json create mode 100644 image/mlx/prism-ml/bonsai-image-binary-4B-mlx-1bit/tokenizer/tokenizer.json create mode 100644 image/mlx/prism-ml/bonsai-image-binary-4B-mlx-1bit/tokenizer/tokenizer_config.json create mode 100644 image/mlx/prism-ml/bonsai-image-binary-4B-mlx-1bit/tokenizer/vocab.json create mode 100644 image/mlx/prism-ml/bonsai-image-binary-4B-mlx-1bit/transformer-packed-mflux/config.json create mode 100644 image/mlx/prism-ml/bonsai-image-binary-4B-mlx-1bit/transformer-packed-mflux/diffusion_pytorch_model.safetensors create mode 100644 image/mlx/prism-ml/bonsai-image-binary-4B-mlx-1bit/transformer-packed-mflux/quantization_config.json create mode 100644 image/mlx/prism-ml/bonsai-image-binary-4B-mlx-1bit/vae/config.json create mode 100644 image/mlx/prism-ml/bonsai-image-binary-4B-mlx-1bit/vae/diffusion_pytorch_model.safetensors create mode 100644 image/mlx/prism-ml/bonsai-image-ternary-4B-mlx-2bit/.gitattributes create mode 100644 image/mlx/prism-ml/bonsai-image-ternary-4B-mlx-2bit/LICENSE create mode 100644 image/mlx/prism-ml/bonsai-image-ternary-4B-mlx-2bit/NOTICE.md create mode 100644 image/mlx/prism-ml/bonsai-image-ternary-4B-mlx-2bit/README.md create mode 100644 image/mlx/prism-ml/bonsai-image-ternary-4B-mlx-2bit/assets/bonsai-logo.svg create mode 100644 image/mlx/prism-ml/bonsai-image-ternary-4B-mlx-2bit/manifest.json create mode 100644 image/mlx/prism-ml/bonsai-image-ternary-4B-mlx-2bit/model_index.json create mode 100644 image/mlx/prism-ml/bonsai-image-ternary-4B-mlx-2bit/scheduler/scheduler_config.json create mode 100644 image/mlx/prism-ml/bonsai-image-ternary-4B-mlx-2bit/text_encoder-mlx-4bit/added_tokens.json create mode 100644 image/mlx/prism-ml/bonsai-image-ternary-4B-mlx-2bit/text_encoder-mlx-4bit/config.json create mode 100644 image/mlx/prism-ml/bonsai-image-ternary-4B-mlx-2bit/text_encoder-mlx-4bit/merges.txt create mode 100644 image/mlx/prism-ml/bonsai-image-ternary-4B-mlx-2bit/text_encoder-mlx-4bit/model.safetensors create mode 100644 image/mlx/prism-ml/bonsai-image-ternary-4B-mlx-2bit/text_encoder-mlx-4bit/model.safetensors.index.json create mode 100644 image/mlx/prism-ml/bonsai-image-ternary-4B-mlx-2bit/text_encoder-mlx-4bit/special_tokens_map.json create mode 100644 image/mlx/prism-ml/bonsai-image-ternary-4B-mlx-2bit/text_encoder-mlx-4bit/tokenizer.json create mode 100644 image/mlx/prism-ml/bonsai-image-ternary-4B-mlx-2bit/text_encoder-mlx-4bit/tokenizer_config.json create mode 100644 image/mlx/prism-ml/bonsai-image-ternary-4B-mlx-2bit/text_encoder-mlx-4bit/vocab.json create mode 100644 image/mlx/prism-ml/bonsai-image-ternary-4B-mlx-2bit/tokenizer/added_tokens.json create mode 100644 image/mlx/prism-ml/bonsai-image-ternary-4B-mlx-2bit/tokenizer/chat_template.jinja create mode 100644 image/mlx/prism-ml/bonsai-image-ternary-4B-mlx-2bit/tokenizer/merges.txt create mode 100644 image/mlx/prism-ml/bonsai-image-ternary-4B-mlx-2bit/tokenizer/special_tokens_map.json create mode 100644 image/mlx/prism-ml/bonsai-image-ternary-4B-mlx-2bit/tokenizer/tokenizer.json create mode 100644 image/mlx/prism-ml/bonsai-image-ternary-4B-mlx-2bit/tokenizer/tokenizer_config.json create mode 100644 image/mlx/prism-ml/bonsai-image-ternary-4B-mlx-2bit/tokenizer/vocab.json create mode 100644 image/mlx/prism-ml/bonsai-image-ternary-4B-mlx-2bit/transformer-packed-mflux/config.json create mode 100644 image/mlx/prism-ml/bonsai-image-ternary-4B-mlx-2bit/transformer-packed-mflux/diffusion_pytorch_model.safetensors create mode 100644 image/mlx/prism-ml/bonsai-image-ternary-4B-mlx-2bit/transformer-packed-mflux/quantization_config.json create mode 100644 image/mlx/prism-ml/bonsai-image-ternary-4B-mlx-2bit/vae/config.json create mode 100644 image/mlx/prism-ml/bonsai-image-ternary-4B-mlx-2bit/vae/diffusion_pytorch_model.safetensors diff --git a/.gitattributes b/.gitattributes new file mode 100644 index 0000000..c8ebd75 --- /dev/null +++ b/.gitattributes @@ -0,0 +1,12 @@ +*.safetensors filter=lfs diff=lfs merge=lfs -text +*.gguf filter=lfs diff=lfs merge=lfs -text +*.bin filter=lfs diff=lfs merge=lfs -text +*.pt filter=lfs diff=lfs merge=lfs -text +*.pth filter=lfs diff=lfs merge=lfs -text +*.onnx filter=lfs diff=lfs merge=lfs -text +*.npz filter=lfs diff=lfs merge=lfs -text +*.model filter=lfs diff=lfs merge=lfs -text +*.tiktoken filter=lfs diff=lfs merge=lfs -text +tokenizer.json filter=lfs diff=lfs merge=lfs -text +vocab.json filter=lfs diff=lfs merge=lfs -text +merges.txt filter=lfs diff=lfs merge=lfs -text diff --git a/chat/gguf/unsloth/Qwen3.5-0.8B-GGUF/Qwen3.5-0.8B-Q4_K_M.gguf b/chat/gguf/unsloth/Qwen3.5-0.8B-GGUF/Qwen3.5-0.8B-Q4_K_M.gguf new file mode 100644 index 0000000..e18ef50 --- /dev/null +++ b/chat/gguf/unsloth/Qwen3.5-0.8B-GGUF/Qwen3.5-0.8B-Q4_K_M.gguf @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:bd258782e35f7f458f8aced1adc053e6e92e89bc735ba3be89d38a06121dc517 +size 532517120 diff --git a/chat/gguf/unsloth/Qwen3.5-0.8B-GGUF/README.md b/chat/gguf/unsloth/Qwen3.5-0.8B-GGUF/README.md new file mode 100644 index 0000000..a2a3a7c --- /dev/null +++ b/chat/gguf/unsloth/Qwen3.5-0.8B-GGUF/README.md @@ -0,0 +1,996 @@ +--- +tags: +- unsloth +library_name: transformers +license: apache-2.0 +license_link: https://huggingface.co/Qwen/Qwen3.5-0.8B/blob/main/LICENSE +pipeline_tag: image-text-to-text +base_model: +- Qwen/Qwen3.5-0.8B +--- +
+

+

To run Qwen3.5 locally - Read our Guide!

+

+

+ Unsloth Dynamic 2.0 achieves superior accuracy & outperforms other leading quants. +

+
+ + + + + + + + + +
+
+ +- You can now also fine-tune the model locally with [Unsloth](https://github.com/unslothai/unsloth). +- Read our [Qwen3.5 fine-tuning guide here](https://unsloth.ai/docs/models/qwen3.5/fine-tune). + +--- + +# Qwen3.5-0.8B + + + +[![Qwen Chat](https://img.shields.io/badge/%F0%9F%92%9C%EF%B8%8F%20Qwen%20Chat%20-536af5)](https://chat.qwen.ai) + +> [!Note] +> This repository contains model weights and configuration files for the post-trained model in the Hugging Face Transformers format. +> +> These artifacts are compatible with Hugging Face Transformers, vLLM, SGLang, KTransformers, etc. +> +> In light of its parameter scale, the intended use cases are prototyping, task-specific fine-tuning, and other research or development purposes. + +Over recent months, we have intensified our focus on developing foundation models that deliver exceptional utility and performance. Qwen3.5 represents a significant leap forward, integrating breakthroughs in multimodal learning, architectural efficiency, reinforcement learning scale, and global accessibility to empower developers and enterprises with unprecedented capability and efficiency. + +## Qwen3.5 Highlights + +Qwen3.5 features the following enhancement: + +- **Unified Vision-Language Foundation**: Early fusion training on multimodal tokens achieves cross-generational parity with Qwen3 and outperforms Qwen3-VL models across reasoning, coding, agents, and visual understanding benchmarks. + +- **Efficient Hybrid Architecture**: Gated Delta Networks combined with sparse Mixture-of-Experts deliver high-throughput inference with minimal latency and cost overhead. + +- **Scalable RL Generalization**: Reinforcement learning scaled across million-agent environments with progressively complex task distributions for robust real-world adaptability. + +- **Global Linguistic Coverage**: Expanded support to 201 languages and dialects, enabling inclusive, worldwide deployment with nuanced cultural and regional understanding. + +- **Next-Generation Training Infrastructure**: Near-100% multimodal training efficiency compared to text-only training and asynchronous RL frameworks supporting massive-scale agent scaffolds and environment orchestration. + +For more details, please refer to our blog post [Qwen3.5](https://qwen.ai/blog?id=qwen3.5). + + +## Model Overview + +- Type: Causal Language Model with Vision Encoder +- Training Stage: Pre-training & Post-training +- Language Model + - Number of Parameters: 0.8B + - Hidden Dimension: 1024 + - Token Embedding: 248320 (Padded) + - Number of Layers: 24 + - Hidden Layout: 6 × (3 × (Gated DeltaNet → FFN) → 1 × (Gated Attention → FFN)) + - Gated DeltaNet: + - Number of Linear Attention Heads: 16 for V and 16 for QK + - Head Dimension: 128 + - Gated Attention: + - Number of Attention Heads: 8 for Q and 2 for KV + - Head Dimension: 256 + - Rotary Position Embedding Dimension: 64 + - Feed Forward Network: + - Intermediate Dimension: 3584 + - LM Output: 248320 (Tied to token embedding) + - MTP: trained with multi-steps +- Context Length: 262,144 natively + +## Benchmark Results + +### Language + +
+ + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + +
Qwen3-4B-2507Qwen3-1.7BQwen3.5-2BQwen3.5-0.8B
Non-Thinking Mode
MMLU-Pro69.640.255.329.7
MMLU-Redux84.264.469.248.5
C-Eval80.261.065.246.4
SuperGPQA42.821.030.416.9
IFEval83.468.261.252.1
MMMLU64.946.756.934.1
Knowledge & STEM (Thinking)
MMLU-Pro74.056.566.542.3
MMLU-Redux86.173.979.659.5
C-Eval82.268.173.250.5
SuperGPQA47.831.237.521.3
GPQA65.840.151.611.9
Instruction Following (Thinking)
IFEval87.472.578.644.0
IFBench50.426.741.321.0
MultiChallenge41.727.233.718.9
Long Context (Thinking)
AA-LCR32.06.725.64.7
LongBench v242.826.538.726.1
Reasoning (Thinking)
HMMT Feb 2557.510.222.9--
HMMT Nov 2569.68.919.6--
General Agent (Thinking)
BFCL-V439.9--43.625.3
TAU2-Bench43.2--48.811.6
Multilingualism (Thinking)
MMMLU70.857.063.144.3
MMLU-ProX62.449.452.334.6
NOVA-6347.140.346.442.4
INCLUDE64.451.855.440.6
Global PIQA73.563.169.359.4
PolyMATH46.225.226.18.2
WMT24++58.939.345.827.2
MAXIFE72.150.760.639.2
+

+* TAU2-Bench: we follow the official setup except for the airline domain, where all models are evaluated by applying the fixes proposed in the Claude Opus 4.5 system card. +
+* MMLU-ProX: we report the averaged accuracy on 29 languages.
+* WMT24++: a harder subset of WMT24 after difficulty labeling and rebalancing; we report the averaged scores on 55 languages using XCOMET-XXL.
+* MAXIFE: we report the accuracy on English + multilingual original prompts (totally 23 settings).
+* Experimental settings: top_p=0.95, top_k=20, presence_penalty=1.5, and temperature=1.0 were used.
+* Empty cells (--) indicate scores not yet available or not applicable. +

+
+ +### Vision Language + + +
+ + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + +
Qwen3-VL-4BQwen3-VL-2BQwen3.5-2BQwen3.5-0.8B
STEM and Puzzle
MMMU70.861.464.2/64.249/47.4
MMMU-Pro57.042.550.3/47.731.2/31.4
Mathvista(mini)79.573.676.7/73.962.2/58.6
DynaMath74.466.773.6/69.649.9/46.5
ZEROBench0.00.01.0/0.00.0/0.0
ZEROBench_sub18.913.217.1/18.612.9/11.4
VlmsAreBlind68.650.075.8/74.359.4/57.3
General VQA
RealWorldQA73.269.574.5/71.263.4/61.6
MMStar73.268.171.7/68.058.3/55.9
MMBenchEN-DEV-v1.186.781.983.3/81.369.9/68.0
SimpleVQA48.843.638.5/39.531.3/30.4
HallusionBench64.154.958.0/51.353.1/46.7
Text Recognition and Document Understanding
MMLongBench-Doc44.433.845.4/38.833.6/28.1
AI2D_TEST84.980.483.3/81.569.9/68.7
CC-OCR73.868.372.9/75.863.2/66.7
OmniDocBench1.580.065.979.8/80.961.0/70.6
CharXiv(RQ)50.337.158.8/52.641.3/38.2
OCRBench80.879.284.5/85.474.5/79.1
Spatial Intelligence
RefCOCO(avg)88.284.884.8/84.379.3/77.8
CountBench89.484.191.4/86.877.0/68.6
ODInW1339.436.035.9/40.531.6/33.2
ERQA47.341.843.8/33.034.5/23.8
EmbSpatialBench80.775.977.9/66.468.6/54.6
RefSpatialBench45.328.932.9/30.023.5/21.7
Hypersim11.911.212.4/12.411.9/11.0
SUNRGBD28.028.628.7/25.626.1/23.3
Nuscene4.94.06.9/8.55.7/7.0
Video Understanding
VideoMME(w sub.)76.067.975.6/--63.8/--
VideoMME(w/o sub.)68.962.169.0/--57.7/--
VideoMMMU69.454.162.1/--44.3/--
MLVU75.769.276.2/--65.6/--
MVBench69.364.564.9/--55.8/--
LVBench53.547.657.1/--45.1/--
MMVU58.648.948.6/--34.3/--
Visual Agent
ScreenSpot Pro59.548.5--/54.5--/46.5
Medical VQA
SLAKE65.961.174.4/67.562.6/59.5
PMC-VQA48.442.448.8/54.040.4/45.5
MedXpertQA-MM26.313.026.9/19.117.1/25.3
+ +

+* Scores of Qwen3.5 models are reported as Thinking / Non-thinking.
+* MathVision: our model’s score is evaluated using a fixed prompt, e.g., “Please reason step by step, and put your final answer within \boxed{}.” For other models, we report the higher score between runs with and without the \boxed{} formatting.
+* Experimental settings: For the Video benchmarks, we used top_p=0.95, top_k=20, presence_penalty=1.5, and temperature=1.0. All other benchmarks adopted the same sampling configuration but with temperature=0.6 under the thinking mode. Under the non-thinking mode, the sampling parameters were set to top_p=0.8, top_k=20, presence_penalty=1.5, and temperature=0.7.
+* Empty cells (--) indicate scores not yet available or not applicable. +

+
+ +## Quickstart + +> [!Important] +> Qwen3.5 models support both non-thinking and thinking mode. **Qwen3.5-0.8B operates in non-thinking mode by default**. +> To enable thinking, refer to the examples [here](#thinking-mode). + +For streamlined integration, we recommend using Qwen3.5 via APIs. Below is a guide to use Qwen3.5 via OpenAI-compatible API. + +### Serving Qwen3.5 + +Qwen3.5 can be served via APIs with popular inference frameworks. +In the following, we show example commands to launch OpenAI-Compatible API servers for Qwen3.5 models. + +> [!Important] +> Inference efficiency and throughput vary significantly across frameworks. +> We recommend using the latest framework versions to ensure optimal performance and compatibility. +> For production workloads or high-throughput scenarios, dedicated serving engines such as SGLang, KTransformers or vLLM are strongly recommended. + +> [!Important] +> The model has a default context length of 262,144 tokens. +> If you encounter out-of-memory (OOM) errors, consider reducing the context window. + +#### SGLang + +[SGLang](https://github.com/sgl-project/sglang) is a fast serving framework for large language models and vision language models. +SGLang from the main branch of the open-source repository is required for Qwen3.5, which can be installed using the following command in a fresh environment: +```shell +uv pip install 'git+https://github.com/sgl-project/sglang.git#subdirectory=python&egg=sglang[all]' +``` +See [its documentation](https://docs.sglang.ai/get_started/install.html) for more details. + +The following will create API endpoints at `http://localhost:8000/v1`: + +- **Standard Version**: The following command can be used to create an API endpoint with maximum context length 262,144 tokens using tensor parallel on 8 GPUs. + + ```shell + python -m sglang.launch_server --model-path Qwen/Qwen3.5-0.8B --port 8000 --tp-size 1 --mem-fraction-static 0.8 --context-length 262144 + ``` + +- **Tool Use**: To support tool use, you can use the following command. + + ```shell + python -m sglang.launch_server --model-path Qwen/Qwen3.5-0.8B --port 8000 --tp-size 1 --mem-fraction-static 0.8 --context-length 262144 --tool-call-parser qwen3_coder + ``` + +- **Multi-Token Prediction (MTP)**: The following command is recommended for MTP: + + ```shell + python -m sglang.launch_server --model-path Qwen/Qwen3.5-0.8B --port 8000 --tp-size 1 --mem-fraction-static 0.8 --context-length 262144 --speculative-algo NEXTN --speculative-num-steps 3 --speculative-eagle-topk 1 --speculative-num-draft-tokens 4 + ``` + +#### vLLM + +[vLLM](https://github.com/vllm-project/vllm) is a high-throughput and memory-efficient inference and serving engine for LLMs. +vLLM from the main branch of the open-source repository is required for Qwen3.5, which can be installed using the following command in a fresh environment: +```shell +uv pip install vllm --torch-backend=auto --extra-index-url https://wheels.vllm.ai/nightly +``` +See [its documentation](https://docs.vllm.ai/en/stable/getting_started/installation/index.html) for more details. + +For detailed Qwen3.5 usage guide, see the [vLLM Qwen3.5 recipe](https://docs.vllm.ai/projects/recipes/en/latest/Qwen/Qwen3.5.html). + +The following will create API endpoints at `http://localhost:8000/v1`: + +- **Standard Version**: The following command can be used to create an API endpoint with maximum context length 262,144 tokens using tensor parallel on 8 GPUs. + + ```shell + vllm serve Qwen/Qwen3.5-0.8B --port 8000 --tensor-parallel-size 1 --max-model-len 262144 + ``` + +- **Tool Call**: To support tool use, you can use the following command. + + ```shell + vllm serve Qwen/Qwen3.5-0.8B --port 8000 --tensor-parallel-size 1 --max-model-len 262144 --enable-auto-tool-choice --tool-call-parser qwen3_coder + ``` + +- **Multi-Token Prediction (MTP)**: The following command is recommended for MTP: + + ```shell + vllm serve Qwen/Qwen3.5-0.8B --port 8000 --tensor-parallel-size 1 --max-model-len 262144 --speculative-config '{"method":"qwen3_next_mtp","num_speculative_tokens":2}' + ``` + +- **Text-Only**: The following command skips the vision encoder and multimodal profiling to free up memory for additional KV cache: + + ```shell + vllm serve Qwen/Qwen3.5-0.8B --port 8000 --tensor-parallel-size 1 --max-model-len 262144 --language-model-only + ``` + +#### KTransformers + +[KTransformers](https://github.com/kvcache-ai/ktransformers) is a flexible framework for experiencing cutting-edge LLM inference optimizations with CPU-GPU heterogeneous computing. +For running Qwen3.5 with KTransformers, see the [KTransformers Deployment Guide](https://github.com/kvcache-ai/ktransformers/blob/main/doc/en/Qwen3.5.md). + +#### Hugging Face Transformers + +Hugging Face Transformers contains a _lightweight_ server which can be used for quick testing and moderate load deployment. +The latest `transformers` is required for Qwen3.5: +```shell +pip install "transformers[serving] @ git+https://github.com/huggingface/transformers.git@main" +``` +See [its documentation](https://huggingface.co/docs/transformers/main/serving) for more details. Please also make sure torchvision and pillow are installed. + +Then, run `transformers serve` to launch a server with API endpoints at `http://localhost:8000/v1`; it will place the model on accelerators if available: +```shell +transformers serve --force-model Qwen/Qwen3.5-0.8B --port 8000 --continuous-batching +``` + +### Using Qwen3.5 via the Chat Completions API + +The chat completions API is accessible via standard HTTP requests or OpenAI SDKs. +Here, we show examples using the OpenAI Python SDK. + +Before starting, make sure it is installed and the API key and the API base URL is configured, e.g.: +```shell +pip install -U openai + +# Set the following accordingly +export OPENAI_BASE_URL="http://localhost:8000/v1" +export OPENAI_API_KEY="EMPTY" +``` + +> [!Tip] +> We recommend using the following set of sampling parameters for generation +> - Non-thinking mode for text tasks: `temperature=1.0, top_p=1.00, top_k=20, min_p=0.0, presence_penalty=2.0, repetition_penalty=1.0` +> - Non-thinking mode for VL tasks: `temperature=0.7, top_p=0.80, top_k=20, min_p=0.0, presence_penalty=1.5, repetition_penalty=1.0` +> - Thinking mode for text tasks: `temperature=1.0, top_p=0.95, top_k=20, min_p=0.0, presence_penalty=1.5, repetition_penalty=1.0` +> - Thinking mode for VL or precise coding (e.g. WebDev) tasks : `temperature=0.6, top_p=0.95, top_k=20, min_p=0.0, presence_penalty=0.0, repetition_penalty=1.0` +> +> Please note that the support for sampling parameters varies according to inference frameworks. + +#### Text-Only Input + +```python +from openai import OpenAI +# Configured by environment variables +client = OpenAI() + +messages = [ + {"role": "user", "content": "Give me a short introduction to large language models."}, +] + +chat_response = client.chat.completions.create( + model="Qwen/Qwen3.5-0.8B", + messages=messages, + max_tokens=32768, + temperature=1.0, + top_p=1.0, + presence_penalty=2.0, + extra_body={ + "top_k": 20, + }, +) +print("Chat response:", chat_response) +``` + +#### Image Input + +```python +from openai import OpenAI +# Configured by environment variables +client = OpenAI() + +messages = [ + { + "role": "user", + "content": [ + { + "type": "image_url", + "image_url": { + "url": "https://qianwen-res.oss-accelerate.aliyuncs.com/Qwen3.5/demo/RealWorld/RealWorld-04.png" + } + }, + { + "type": "text", + "text": "Where is this?" + } + ] + } +] + +chat_response = client.chat.completions.create( + model="Qwen/Qwen3.5-0.8B", + messages=messages, + max_tokens=32768, + temperature=0.7, + top_p=0.8, + presence_penalty=1.5, + extra_body={ + "top_k": 20, + }, +) +print("Chat response:", chat_response) +``` + +#### Video Input + +```python +from openai import OpenAI +# Configured by environment variables +client = OpenAI() + +messages = [ + { + "role": "user", + "content": [ + { + "type": "video_url", + "video_url": { + "url": "https://qianwen-res.oss-accelerate.aliyuncs.com/Qwen3.5/demo/video/N1cdUjctpG8.mp4" + } + }, + { + "type": "text", + "text": "Summarize the video content." + } + ] + } +] + +# When vLLM is launched with `--media-io-kwargs '{"video": {"num_frames": -1}}'`, +# video frame sampling can be configured via `extra_body` (e.g., by setting `fps`). +# This feature is currently supported only in vLLM. +# +# By default, `fps=2` and `do_sample_frames=True`. +# With `do_sample_frames=True`, you can customize the `fps` value to set your desired video sampling rate. +chat_response = client.chat.completions.create( + model="Qwen/Qwen3.5-0.8B", + messages=messages, + max_tokens=32768, + temperature=0.7, + top_p=0.8, + presence_penalty=1.5, + extra_body={ + "top_k": 20, + "mm_processor_kwargs": {"fps": 2, "do_sample_frames": True}, + }, +) + +print("Chat response:", chat_response) +``` + +#### Thinking Mode + +> [!Important] +> Qwen3.5 does not officially support the soft switch of Qwen3, i.e., `/think` and `/nothink`. + +You can make the model think before response by configuring the API parameters. +For example, + +```python +from openai import OpenAI +# Configured by environment variables +client = OpenAI() + +messages = [ + {"role": "user", "content": "Type \"I love Qwen3.5\" backwards"}, +] + +chat_response = client.chat.completions.create( + model="Qwen/Qwen3.5-0.8B", + messages=messages, + max_tokens=81920, + temperature=1.0, + top_p=0.95, + presence_penalty=1.5, + extra_body={ + "top_k": 20, + "enable_thinking": True, + }, +) +print("Chat response:", chat_response) +``` + +> [!Important] +> In thinking mode, we have observed that when using the recommended sampling parameters, Qwen3.5-0.8B is more prone to entering thinking loops compared to other Qwen3.5 models, which may prevent it from terminating generation properly. +> We recommend further tuning the sampling parameters specific to your use case and utilizing the API's streaming generation mode (if supported) to enable timely detection and interruption of such anomalous generation behaviors. + + +## Agentic Usage + +Qwen3.5 excels in tool calling capabilities. + +### Qwen-Agent + +We recommend using [Qwen-Agent](https://github.com/QwenLM/Qwen-Agent) to quickly build Agent applications with Qwen3.5. + +To define the available tools, you can use the MCP configuration file, use the integrated tool of Qwen-Agent, or integrate other tools by yourself. +```python +import os +from qwen_agent.agents import Assistant + +# Define LLM +# Using OpenAI-compatible API endpoint. The API backend should disable response parsers. +llm_cfg = { + # Use your own model service compatible with OpenAI API by vLLM/SGLang: + 'model': 'Qwen/Qwen3.5-0.8B', + 'model_type': 'qwenvl_oai', + 'model_server': 'http://localhost:8000/v1', # api_base + 'api_key': 'EMPTY', + + 'generate_cfg': { + 'use_raw_api': True, + # Pass the parameter of whether to enable thinking mode in this way + # 'extra_body': { + # 'chat_template_kwargs': {'enable_thinking': True} + # }, + }, +} + +# Define Tools +tools = [ + {'mcpServers': { # You can specify the MCP configuration file + "filesystem": { + "command": "npx", + "args": ["-y", "@modelcontextprotocol/server-filesystem", "/Users/xxxx/Desktop"] + } + } + } +] + +# Define Agent +bot = Assistant(llm=llm_cfg, function_list=tools) + +# Streaming generation +messages = [{'role': 'user', 'content': 'Help me organize my desktop.'}] +for responses in bot.run(messages=messages): + pass +print(responses) + +# Streaming generation +messages = [{'role': 'user', 'content': 'Develop a dog website and save it on the desktop'}] +for responses in bot.run(messages=messages): + pass +print(responses) +``` + +### Qwen Code + + +[Qwen Code](https://github.com/QwenLM/qwen-code) is an open-source AI agent for the terminal, optimized for Qwen models. It helps you understand large codebases, automate tedious work, and ship faster. + +For more information, please refer to [Qwen Code](https://qwenlm.github.io/qwen-code-docs/). + +## Best Practices + +To achieve optimal performance, we recommend the following settings: + +1. **Sampling Parameters**: + - We suggest using the following sets of sampling parameters depending on the mode and task type: + - **Non-thinking mode for text tasks**: + `temperature=1.0`, `top_p=1.00`, `top_k=20`, `min_p=0.0`, `presence_penalty=2.0`, `repetition_penalty=1.0` + - **Non-thinking mode for VL tasks**: + `temperature=0.7`, `top_p=0.80`, `top_k=20`, `min_p=0.0`, `presence_penalty=1.5`, `repetition_penalty=1.0` + - **Thinking mode for text tasks**: + `temperature=1.0`, `top_p=0.95`, `top_k=20`, `min_p=0.0`, `presence_penalty=1.5`, `repetition_penalty=1.0` + - **Thinking mode for VL or precise coding (e.g., WebDev) tasks**: + `temperature=0.6`, `top_p=0.95`, `top_k=20`, `min_p=0.0`, `presence_penalty=0.0`, `repetition_penalty=1.0` + + - For supported frameworks, you can adjust the `presence_penalty` parameter between 0 and 2 to reduce endless repetitions. However, using a higher value may occasionally result in language mixing and a slight decrease in model performance. + +2. **Adequate Output Length**: We recommend using an output length of 32,768 tokens for most queries. For benchmarking on highly complex problems, such as those found in math and programming competitions, we suggest setting the max output length to 81,920 tokens. This provides the model with sufficient space to generate detailed and comprehensive responses, thereby enhancing its overall performance. + +3. **Standardize Output Format**: We recommend using prompts to standardize model outputs when benchmarking. + - **Math Problems**: Include "Please reason step by step, and put your final answer within \boxed{}." in the prompt. + - **Multiple-Choice Questions**: Add the following JSON structure to the prompt to standardize responses: "Please show your choice in the `answer` field with only the choice letter, e.g., `"answer": "C"`." + +4. **No Thinking Content in History**: In multi-turn conversations, the historical model output should only include the final output part and does not need to include the thinking content. It is implemented in the provided chat template in Jinja2. However, for frameworks that do not directly use the Jinja2 chat template, it is up to the developers to ensure that the best practice is followed. + +5. **Long Video Understanding**: To optimize inference efficiency for plain text and images, the `size` parameter in the released `video_preprocessor_config.json` is conservatively configured. It is recommended to set the `longest_edge` parameter in the video_preprocessor_config file to 469,762,048 (corresponding to 224k video tokens) to enable higher frame-rate sampling for hour-scale videos and thereby achieve superior performance. For example, + ```json + {"longest_edge": 469762048, "shortest_edge": 4096} + ``` + + Alternatively, override the default values via engine startup parameters. For implementation details, refer to: [vLLM](https://github.com/vllm-project/vllm/pull/34330) / [SGLang](https://github.com/sgl-project/sglang/pull/18467). + + +### Citation + +If you find our work helpful, feel free to give us a cite. + +```bibtex +@misc{qwen3.5, + title = {{Qwen3.5}: Towards Native Multimodal Agents}, + author = {{Qwen Team}}, + month = {February}, + year = {2026}, + url = {https://qwen.ai/blog?id=qwen3.5} +} +``` \ No newline at end of file diff --git a/chat/gguf/unsloth/Qwen3.5-0.8B-GGUF/mmproj-F16.gguf b/chat/gguf/unsloth/Qwen3.5-0.8B-GGUF/mmproj-F16.gguf new file mode 100644 index 0000000..5e51ff9 --- /dev/null +++ b/chat/gguf/unsloth/Qwen3.5-0.8B-GGUF/mmproj-F16.gguf @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:56e4c6cfe73b0c82e3e82bc518d7591997e61d81f723fc41a586f4fa69ea2453 +size 204987232 diff --git a/chat/gguf/unsloth/Qwen3.5-2B-GGUF/Qwen3.5-2B-Q4_K_M.gguf b/chat/gguf/unsloth/Qwen3.5-2B-GGUF/Qwen3.5-2B-Q4_K_M.gguf new file mode 100644 index 0000000..2dd42a9 --- /dev/null +++ b/chat/gguf/unsloth/Qwen3.5-2B-GGUF/Qwen3.5-2B-Q4_K_M.gguf @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:aaf42c8b7c3cab2bf3d69c355048d4a0ee9973d48f16c731c0520ee914699223 +size 1280835840 diff --git a/chat/gguf/unsloth/Qwen3.5-2B-GGUF/README.md b/chat/gguf/unsloth/Qwen3.5-2B-GGUF/README.md new file mode 100644 index 0000000..2780db4 --- /dev/null +++ b/chat/gguf/unsloth/Qwen3.5-2B-GGUF/README.md @@ -0,0 +1,1033 @@ +--- +tags: +- unsloth +library_name: transformers +license: apache-2.0 +license_link: https://huggingface.co/Qwen/Qwen3.5-2B/blob/main/LICENSE +pipeline_tag: image-text-to-text +base_model: +- Qwen/Qwen3.5-2B +--- +
+

+

To run Qwen3.5 locally - Read our Guide!

+

+

+ Unsloth Dynamic 2.0 achieves superior accuracy & outperforms other leading quants. +

+
+ + + + + + + + + +
+
+ +- You can now also fine-tune the model locally with [Unsloth](https://github.com/unslothai/unsloth). +- Read our [Qwen3.5 fine-tuning guide here](https://unsloth.ai/docs/models/qwen3.5/fine-tune). + +--- + +# Qwen3.5-2B + + + +[![Qwen Chat](https://img.shields.io/badge/%F0%9F%92%9C%EF%B8%8F%20Qwen%20Chat%20-536af5)](https://chat.qwen.ai) + +> [!Note] +> This repository contains model weights and configuration files for the post-trained model in the Hugging Face Transformers format. +> +> These artifacts are compatible with Hugging Face Transformers, vLLM, SGLang, KTransformers, etc. +> +> In light of its parameter scale, the intended use cases are prototyping, task-specific fine-tuning, and other research or development purposes. + + +Over recent months, we have intensified our focus on developing foundation models that deliver exceptional utility and performance. Qwen3.5 represents a significant leap forward, integrating breakthroughs in multimodal learning, architectural efficiency, reinforcement learning scale, and global accessibility to empower developers and enterprises with unprecedented capability and efficiency. + +## Qwen3.5 Highlights + +Qwen3.5 features the following enhancement: + +- **Unified Vision-Language Foundation**: Early fusion training on multimodal tokens achieves cross-generational parity with Qwen3 and outperforms Qwen3-VL models across reasoning, coding, agents, and visual understanding benchmarks. + +- **Efficient Hybrid Architecture**: Gated Delta Networks combined with sparse Mixture-of-Experts deliver high-throughput inference with minimal latency and cost overhead. + +- **Scalable RL Generalization**: Reinforcement learning scaled across million-agent environments with progressively complex task distributions for robust real-world adaptability. + +- **Global Linguistic Coverage**: Expanded support to 201 languages and dialects, enabling inclusive, worldwide deployment with nuanced cultural and regional understanding. + +- **Next-Generation Training Infrastructure**: Near-100% multimodal training efficiency compared to text-only training and asynchronous RL frameworks supporting massive-scale agent scaffolds and environment orchestration. + +For more details, please refer to our blog post [Qwen3.5](https://qwen.ai/blog?id=qwen3.5). + + +## Model Overview + +- Type: Causal Language Model with Vision Encoder +- Training Stage: Pre-training & Post-training +- Language Model + - Number of Parameters: 2B + - Hidden Dimension: 2048 + - Token Embedding: 248320 (Padded) + - Number of Layers: 24 + - Hidden Layout: 6 × (3 × (Gated DeltaNet → FFN) → 1 × (Gated Attention → FFN)) + - Gated DeltaNet: + - Number of Linear Attention Heads: 16 for V and 16 for QK + - Head Dimension: 128 + - Gated Attention: + - Number of Attention Heads: 8 for Q and 2 for KV + - Head Dimension: 256 + - Rotary Position Embedding Dimension: 64 + - Feed Forward Network: + - Intermediate Dimension: 6144 + - LM Output: 248320 (Tied to token embedding) + - MTP: trained with multi-steps +- Context Length: 262,144 natively + +## Benchmark Results + +### Language + +
+ + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + +
Qwen3-4B-2507Qwen3-1.7BQwen3.5-2BQwen3.5-0.8B
Instruct (Non-Thinking) Mode
MMLU-Pro69.640.255.329.7
MMLU-Redux84.264.469.248.5
C-Eval80.261.065.246.4
SuperGPQA42.821.030.416.9
IFEval83.468.261.252.1
MMMLU64.946.756.934.1
Knowledge & STEM (Thinking)
MMLU-Pro74.056.566.542.3
MMLU-Redux86.173.979.659.5
C-Eval82.268.173.250.5
SuperGPQA47.831.237.521.3
GPQA65.840.151.611.9
Instruction Following (Thinking)
IFEval87.472.578.644.0
IFBench50.426.741.321.0
MultiChallenge41.727.233.718.9
Long Context (Thinking)
AA-LCR32.06.725.64.7
LongBench v242.826.538.726.1
Reasoning (Thinking)
HMMT Feb 2557.510.222.9--
HMMT Nov 2569.68.919.6--
General Agent (Thinking)
BFCL-V439.9--43.625.3
TAU2-Bench43.2--48.811.6
Multilingualism (Thinking)
MMMLU70.857.063.144.3
MMLU-ProX62.449.452.334.6
NOVA-6347.140.346.442.4
INCLUDE64.451.855.440.6
Global PIQA73.563.169.359.4
PolyMATH46.225.226.18.2
WMT24++58.939.345.827.2
MAXIFE72.150.760.639.2
+

+* TAU2-Bench: we follow the official setup except for the airline domain, where all models are evaluated by applying the fixes proposed in the Claude Opus 4.5 system card. +
+* MMLU-ProX: we report the averaged accuracy on 29 languages.
+* WMT24++: a harder subset of WMT24 after difficulty labeling and rebalancing; we report the averaged scores on 55 languages using XCOMET-XXL.
+* MAXIFE: we report the accuracy on English + multilingual original prompts (totally 23 settings).
+* Experimental settings: top_p=0.95, top_k=20, presence_penalty=1.5, and temperature=1.0 were used.
+* Empty cells (--) indicate scores not yet available or not applicable. +

+
+ +### Vision Language + +
+ + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + +
Qwen3-VL-4BQwen3-VL-2BQwen3.5-2BQwen3.5-0.8B
STEM and Puzzle
MMMU70.861.464.2/64.249/47.4
MMMU-Pro57.042.550.3/47.731.2/31.4
Mathvista(mini)79.573.676.7/73.962.2/58.6
DynaMath74.466.773.6/69.649.9/46.5
ZEROBench0.00.01/00/0
ZEROBench_sub18.913.217.1/18.612.9/11.4
VlmsAreBlind68.650.075.8/74.359.4/57.3
General VQA
RealWorldQA73.269.574.5/71.263.4/61.6
MMStar73.268.171.7/68.058.3/55.9
MMBenchEN-DEV-v1.186.781.983.3/81.369.9/68.0
SimpleVQA48.843.638.5/39.531.3/30.4
HallusionBench64.154.958.0/51.353.1/46.7
Text Recognition and Document Understanding
MMLongBench-Doc44.433.845.4/38.833.6/28.1
AI2D_TEST84.980.483.3/81.569.9/68.7
CC-OCR73.868.372.9/75.863.2/66.7
OmniDocBench1.580.065.979.8/80.961.0/70.6
CharXiv(RQ)50.337.158.8/52.641.3/38.2
OCRBench80.879.284.5/85.474.5/79.1
Spatial Intelligence
RefCOCO(avg)88.284.884.8/84.379.3/77.8
CountBench89.484.191.4/86.877.0/68.6
ODInW1339.436.035.9/40.531.6/33.2
ERQA47.341.843.8/33.034.5/23.8
EmbSpatialBench80.775.977.9/66.468.6/54.6
RefSpatialBench45.328.932.9/30.023.5/21.7
Hypersim11.911.212.4/12.411.9/11.0
SUNRGBD28.028.628.7/25.626.1/23.3
Nuscene4.94.06.9/8.55.7/7.0
Video Understanding
VideoMME(w sub.)76.067.975.6/--63.8/--
VideoMME(w/o sub.)68.962.169.0/--57.7/--
VideoMMMU69.454.162.1/--44.3/--
MLVU75.769.276.2/--65.6/--
MVBench69.364.564.9/--55.8/--
LVBench53.547.657.1/--45.1/--
MMVU58.648.948.6/--34.3/--
Visual Agent
ScreenSpot Pro59.548.5--/54.5--/46.5
Medical VQA
SLAKE65.961.174.4/67.562.6/59.5
PMC-VQA48.442.448.8/54.040.4/45.5
MedXpertQA-MM26.313.026.9/19.117.1/25.3
+ +

+* Scores of Qwen3.5 models are reported as Thinking / Non-thinking.
+* MathVision: our model’s score is evaluated using a fixed prompt, e.g., “Please reason step by step, and put your final answer within \boxed{}.” For other models, we report the higher score between runs with and without the \boxed{} formatting.
+* Experimental settings: For the Video benchmarks, we used top_p=0.95, top_k=20, presence_penalty=1.5, and temperature=1.0. All other benchmarks adopted the same hyperparameter configuration but with temperature=0.6 under the thinking mode. Under the no-thinking mode, the inference hyperparameters were set to top_p=0.8, top_k=20, presence_penalty=1.5, and temperature=0.7.
+* Empty cells (--) indicate scores not yet available or not applicable. +

+
+ +## Quickstart + +> [!Important] +> Qwen3.5 models support both non-thinking and thinking mode. **Qwen3.5-2B operates in non-thinking mode by default**. +> To enable thinking, refer to the examples [here](#thinking-mode). + +For streamlined integration, we recommend using Qwen3.5 via APIs. Below is a guide to use Qwen3.5 via OpenAI-compatible API. + +### Serving Qwen3.5 + +Qwen3.5 can be served via APIs with popular inference frameworks. +In the following, we show example commands to launch OpenAI-Compatible API servers for Qwen3.5 models. + +> [!Important] +> Inference efficiency and throughput vary significantly across frameworks. +> We recommend using the latest framework versions to ensure optimal performance and compatibility. +> For production workloads or high-throughput scenarios, dedicated serving engines such as SGLang, KTransformers or vLLM are strongly recommended. + +> [!Important] +> The model has a default context length of 262,144 tokens. +> If you encounter out-of-memory (OOM) errors, consider reducing the context window. + +#### SGLang + +[SGLang](https://github.com/sgl-project/sglang) is a fast serving framework for large language models and vision language models. +SGLang from the main branch of the open-source repository is required for Qwen3.5, which can be installed using the following command in a fresh environment: +```shell +uv pip install 'git+https://github.com/sgl-project/sglang.git#subdirectory=python&egg=sglang[all]' +``` +See [its documentation](https://docs.sglang.ai/get_started/install.html) for more details. + +The following will create API endpoints at `http://localhost:8000/v1`: + +- **Standard Version**: The following command can be used to create an API endpoint with maximum context length 262,144 tokens using tensor parallel on 8 GPUs. + + ```shell + python -m sglang.launch_server --model-path Qwen/Qwen3.5-2B --port 8000 --tp-size 1 --mem-fraction-static 0.8 --context-length 262144 + ``` + +- **Tool Use**: To support tool use, you can use the following command. + + ```shell + python -m sglang.launch_server --model-path Qwen/Qwen3.5-2B --port 8000 --tp-size 1 --mem-fraction-static 0.8 --context-length 262144 --tool-call-parser qwen3_coder + ``` + +- **Multi-Token Prediction (MTP)**: The following command is recommended for MTP: + + ```shell + python -m sglang.launch_server --model-path Qwen/Qwen3.5-2B --port 8000 --tp-size 1 --mem-fraction-static 0.8 --context-length 262144 --speculative-algo NEXTN --speculative-num-steps 3 --speculative-eagle-topk 1 --speculative-num-draft-tokens 4 + ``` + +#### vLLM + +[vLLM](https://github.com/vllm-project/vllm) is a high-throughput and memory-efficient inference and serving engine for LLMs. +vLLM from the main branch of the open-source repository is required for Qwen3.5, which can be installed using the following command in a fresh environment: +```shell +uv pip install vllm --torch-backend=auto --extra-index-url https://wheels.vllm.ai/nightly +``` +See [its documentation](https://docs.vllm.ai/en/stable/getting_started/installation/index.html) for more details. + +For detailed Qwen3.5 usage guide, see the [vLLM Qwen3.5 recipe](https://docs.vllm.ai/projects/recipes/en/latest/Qwen/Qwen3.5.html). + +The following will create API endpoints at `http://localhost:8000/v1`: + +- **Standard Version**: The following command can be used to create an API endpoint with maximum context length 262,144 tokens using tensor parallel on 8 GPUs. + + ```shell + vllm serve Qwen/Qwen3.5-2B --port 8000 --tensor-parallel-size 1 --max-model-len 262144 + ``` + +- **Tool Call**: To support tool use, you can use the following command. + + ```shell + vllm serve Qwen/Qwen3.5-2B --port 8000 --tensor-parallel-size 1 --max-model-len 262144 --enable-auto-tool-choice --tool-call-parser qwen3_coder + ``` + +- **Multi-Token Prediction (MTP)**: The following command is recommended for MTP: + + ```shell + vllm serve Qwen/Qwen3.5-2B --port 8000 --tensor-parallel-size 1 --max-model-len 262144 --speculative-config '{"method":"qwen3_next_mtp","num_speculative_tokens":2}' + ``` + +- **Text-Only**: The following command skips the vision encoder and multimodal profiling to free up memory for additional KV cache: + + ```shell + vllm serve Qwen/Qwen3.5-2B --port 8000 --tensor-parallel-size 1 --max-model-len 262144 --language-model-only + ``` + +#### KTransformers + +[KTransformers](https://github.com/kvcache-ai/ktransformers) is a flexible framework for experiencing cutting-edge LLM inference optimizations with CPU-GPU heterogeneous computing. +For running Qwen3.5 with KTransformers, see the [KTransformers Deployment Guide](https://github.com/kvcache-ai/ktransformers/blob/main/doc/en/Qwen3.5.md). + +#### Hugging Face Transformers + +Hugging Face Transformers contains a _lightweight_ server which can be used for quick testing and moderate load deployment. +The latest `transformers` is required for Qwen3.5: +```shell +pip install "transformers[serving] @ git+https://github.com/huggingface/transformers.git@main" +``` +See [its documentation](https://huggingface.co/docs/transformers/main/serving) for more details. Please also make sure torchvision and pillow are installed. + +Then, run `transformers serve` to launch a server with API endpoints at `http://localhost:8000/v1`; it will place the model on accelerators if available: +```shell +transformers serve --force-model Qwen/Qwen3.5-2B --port 8000 --continuous-batching +``` + +### Using Qwen3.5 via the Chat Completions API + +The chat completions API is accessible via standard HTTP requests or OpenAI SDKs. +Here, we show examples using the OpenAI Python SDK. + +Before starting, make sure it is installed and the API key and the API base URL is configured, e.g.: +```shell +pip install -U openai + +# Set the following accordingly +export OPENAI_BASE_URL="http://localhost:8000/v1" +export OPENAI_API_KEY="EMPTY" +``` + +> [!Tip] +> We recommend using the following set of sampling parameters for generation +> - Non-thinking mode for text tasks: `temperature=1.0, top_p=1.00, top_k=20, min_p=0.0, presence_penalty=2.0, repetition_penalty=1.0` +> - Non-thinking mode for VL tasks: `temperature=0.7, top_p=0.80, top_k=20, min_p=0.0, presence_penalty=1.5, repetition_penalty=1.0` +> - Thinking mode for text tasks: `temperature=1.0, top_p=0.95, top_k=20, min_p=0.0, presence_penalty=1.5, repetition_penalty=1.0` +> - Thinking mode for VL or precise coding (e.g. WebDev) tasks : `temperature=0.6, top_p=0.95, top_k=20, min_p=0.0, presence_penalty=0.0, repetition_penalty=1.0` +> +> Please note that the support for sampling parameters varies according to inference frameworks. + +#### Text-Only Input + +```python +from openai import OpenAI +# Configured by environment variables +client = OpenAI() + +messages = [ + {"role": "user", "content": "Give me a short introduction to large language models."}, +] + +chat_response = client.chat.completions.create( + model="Qwen/Qwen3.5-2B", + messages=messages, + max_tokens=32768, + temperature=1.0, + top_p=1.0, + presence_penalty=2.0, + extra_body={ + "top_k": 20, + }, +) +print("Chat response:", chat_response) +``` + +#### Image Input + +```python +from openai import OpenAI +# Configured by environment variables +client = OpenAI() + +messages = [ + { + "role": "user", + "content": [ + { + "type": "image_url", + "image_url": { + "url": "https://qianwen-res.oss-accelerate.aliyuncs.com/Qwen3.5/demo/RealWorld/RealWorld-04.png" + } + }, + { + "type": "text", + "text": "Where is this?" + } + ] + } +] + +chat_response = client.chat.completions.create( + model="Qwen/Qwen3.5-2B", + messages=messages, + max_tokens=32768, + temperature=0.7, + top_p=0.8, + presence_penalty=1.5, + extra_body={ + "top_k": 20, + }, +) +print("Chat response:", chat_response) +``` + +#### Video Input + +```python +from openai import OpenAI +# Configured by environment variables +client = OpenAI() + +messages = [ + { + "role": "user", + "content": [ + { + "type": "video_url", + "video_url": { + "url": "https://qianwen-res.oss-accelerate.aliyuncs.com/Qwen3.5/demo/video/N1cdUjctpG8.mp4" + } + }, + { + "type": "text", + "text": "Summarize the video content." + } + ] + } +] + +# When vLLM is launched with `--media-io-kwargs '{"video": {"num_frames": -1}}'`, +# video frame sampling can be configured via `extra_body` (e.g., by setting `fps`). +# This feature is currently supported only in vLLM. +# +# By default, `fps=2` and `do_sample_frames=True`. +# With `do_sample_frames=True`, you can customize the `fps` value to set your desired video sampling rate. +chat_response = client.chat.completions.create( + model="Qwen/Qwen3.5-2B", + messages=messages, + max_tokens=32768, + temperature=0.7, + top_p=0.8, + presence_penalty=1.5, + extra_body={ + "top_k": 20, + "mm_processor_kwargs": {"fps": 2, "do_sample_frames": True}, + }, +) + +print("Chat response:", chat_response) +``` + +#### Thinking Mode + +> [!Important] +> Qwen3.5 does not officially support the soft switch of Qwen3, i.e., `/think` and `/nothink`. + +You can make the model think before response by configuring the API parameters. +For example, + +```python +from openai import OpenAI +# Configured by environment variables +client = OpenAI() + +messages = [ + {"role": "user", "content": "Type \"I love Qwen3.5\" backwards"}, +] + +chat_response = client.chat.completions.create( + model="Qwen/Qwen3.5-2B", + messages=messages, + max_tokens=81920, + temperature=1.0, + top_p=0.95, + presence_penalty=1.5, + extra_body={ + "top_k": 20, + "enable_thinking": True, + }, +) +print("Chat response:", chat_response) +``` + +```python +from openai import OpenAI +# Configured by environment variables +client = OpenAI() + +messages = [ + { + "role": "user", + "content": [ + { + "type": "image_url", + "image_url": { + "url": "https://qianwen-res.oss-accelerate.aliyuncs.com/Qwen3.5/demo/CI_Demo/mathv-1327.jpg" + } + }, + { + "type": "text", + "text": "The centres of the four illustrated circles are in the corners of the square. The two big circles touch each other and also the two little circles. With which factor do you have to multiply the radii of the little circles to obtain the radius of the big circles?\nChoices:\n(A) $\\frac{2}{9}$\n(B) $\\sqrt{5}$\n(C) $0.8 \\cdot \\pi$\n(D) 2.5\n(E) $1+\\sqrt{2}$" + } + ] + } +] + +chat_response = client.chat.completions.create( + model="Qwen/Qwen3.5-2B", + messages=messages, + max_tokens=81920, + temperature=1.0, + top_p=0.95, + presence_penalty=1.5, + extra_body={ + "top_k": 20, + }, +) +print("Chat response:", chat_response) +``` + +> [!Important] +> In thinking mode, we have observed that when using the recommended sampling parameters, Qwen3.5-2B is more prone to entering thinking loops compared to other Qwen3.5 models, which may prevent it from terminating generation properly. +> We recommend further tuning the sampling parameters specific to your use case and utilizing the API's streaming generation mode (if supported) to enable timely detection and interruption of such anomalous generation behaviors. + + +## Agentic Usage + +Qwen3.5 excels in tool calling capabilities. + +### Qwen-Agent + +We recommend using [Qwen-Agent](https://github.com/QwenLM/Qwen-Agent) to quickly build Agent applications with Qwen3.5. + +To define the available tools, you can use the MCP configuration file, use the integrated tool of Qwen-Agent, or integrate other tools by yourself. +```python +import os +from qwen_agent.agents import Assistant + +# Define LLM +# Using OpenAI-compatible API endpoint. The API backend should disable response parsers. +llm_cfg = { + # Use your own model service compatible with OpenAI API by vLLM/SGLang: + 'model': 'Qwen/Qwen3.5-2B', + 'model_type': 'qwenvl_oai', + 'model_server': 'http://localhost:8000/v1', # api_base + 'api_key': 'EMPTY', + + 'generate_cfg': { + 'use_raw_api': True, + # Pass the parameter of whether to enable thinking mode in this way + # 'extra_body': { + # 'chat_template_kwargs': {'enable_thinking': True} + # }, + }, +} + +# Define Tools +tools = [ + {'mcpServers': { # You can specify the MCP configuration file + "filesystem": { + "command": "npx", + "args": ["-y", "@modelcontextprotocol/server-filesystem", "/Users/xxxx/Desktop"] + } + } + } +] + +# Define Agent +bot = Assistant(llm=llm_cfg, function_list=tools) + +# Streaming generation +messages = [{'role': 'user', 'content': 'Help me organize my desktop.'}] +for responses in bot.run(messages=messages): + pass +print(responses) + +# Streaming generation +messages = [{'role': 'user', 'content': 'Develop a dog website and save it on the desktop'}] +for responses in bot.run(messages=messages): + pass +print(responses) +``` + +### Qwen Code + + +[Qwen Code](https://github.com/QwenLM/qwen-code) is an open-source AI agent for the terminal, optimized for Qwen models. It helps you understand large codebases, automate tedious work, and ship faster. + +For more information, please refer to [Qwen Code](https://qwenlm.github.io/qwen-code-docs/). + +## Best Practices + +To achieve optimal performance, we recommend the following settings: + +1. **Sampling Parameters**: + - We suggest using the following sets of sampling parameters depending on the mode and task type: + - **Non-thinking mode for text tasks**: + `temperature=1.0`, `top_p=1.00`, `top_k=20`, `min_p=0.0`, `presence_penalty=2.0`, `repetition_penalty=1.0` + - **Non-thinking mode for VL tasks**: + `temperature=0.7`, `top_p=0.80`, `top_k=20`, `min_p=0.0`, `presence_penalty=1.5`, `repetition_penalty=1.0` + - **Thinking mode for text tasks**: + `temperature=1.0`, `top_p=0.95`, `top_k=20`, `min_p=0.0`, `presence_penalty=1.5`, `repetition_penalty=1.0` + - **Thinking mode for VL or precise coding (e.g., WebDev) tasks**: + `temperature=0.6`, `top_p=0.95`, `top_k=20`, `min_p=0.0`, `presence_penalty=0.0`, `repetition_penalty=1.0` + + - For supported frameworks, you can adjust the `presence_penalty` parameter between 0 and 2 to reduce endless repetitions. However, using a higher value may occasionally result in language mixing and a slight decrease in model performance. + +2. **Adequate Output Length**: We recommend using an output length of 32,768 tokens for most queries. For benchmarking on highly complex problems, such as those found in math and programming competitions, we suggest setting the max output length to 81,920 tokens. This provides the model with sufficient space to generate detailed and comprehensive responses, thereby enhancing its overall performance. + +3. **Standardize Output Format**: We recommend using prompts to standardize model outputs when benchmarking. + - **Math Problems**: Include "Please reason step by step, and put your final answer within \boxed{}." in the prompt. + - **Multiple-Choice Questions**: Add the following JSON structure to the prompt to standardize responses: "Please show your choice in the `answer` field with only the choice letter, e.g., `"answer": "C"`." + +4. **No Thinking Content in History**: In multi-turn conversations, the historical model output should only include the final output part and does not need to include the thinking content. It is implemented in the provided chat template in Jinja2. However, for frameworks that do not directly use the Jinja2 chat template, it is up to the developers to ensure that the best practice is followed. + +5. **Long Video Understanding**: To optimize inference efficiency for plain text and images, the `size` parameter in the released `video_preprocessor_config.json` is conservatively configured. It is recommended to set the `longest_edge` parameter in the video_preprocessor_config file to 469,762,048 (corresponding to 224k video tokens) to enable higher frame-rate sampling for hour-scale videos and thereby achieve superior performance. For example, + ```json + {"longest_edge": 469762048, "shortest_edge": 4096} + ``` + + Alternatively, override the default values via engine startup parameters. For implementation details, refer to: [vLLM](https://github.com/vllm-project/vllm/pull/34330) / [SGLang](https://github.com/sgl-project/sglang/pull/18467). + + +### Citation + +If you find our work helpful, feel free to give us a cite. + +```bibtex +@misc{qwen3.5, + title = {{Qwen3.5}: Towards Native Multimodal Agents}, + author = {{Qwen Team}}, + month = {February}, + year = {2026}, + url = {https://qwen.ai/blog?id=qwen3.5} +} +``` \ No newline at end of file diff --git a/chat/gguf/unsloth/Qwen3.5-2B-GGUF/mmproj-F16.gguf b/chat/gguf/unsloth/Qwen3.5-2B-GGUF/mmproj-F16.gguf new file mode 100644 index 0000000..5c87505 --- /dev/null +++ b/chat/gguf/unsloth/Qwen3.5-2B-GGUF/mmproj-F16.gguf @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:7035e9cb8d7c6a9681d07eef9a364783e86ea4cd73faab2eabb4f43a101830c7 +size 668227264 diff --git a/chat/gguf/unsloth/Qwen3.5-4B-GGUF/Qwen3.5-4B-Q4_K_M.gguf b/chat/gguf/unsloth/Qwen3.5-4B-GGUF/Qwen3.5-4B-Q4_K_M.gguf new file mode 100644 index 0000000..4ca59aa --- /dev/null +++ b/chat/gguf/unsloth/Qwen3.5-4B-GGUF/Qwen3.5-4B-Q4_K_M.gguf @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:00fe7986ff5f6b463e62455821146049db6f9313603938a70800d1fb69ef11a4 +size 2740937888 diff --git a/chat/gguf/unsloth/Qwen3.5-4B-GGUF/README.md b/chat/gguf/unsloth/Qwen3.5-4B-GGUF/README.md new file mode 100644 index 0000000..265d2de --- /dev/null +++ b/chat/gguf/unsloth/Qwen3.5-4B-GGUF/README.md @@ -0,0 +1,1201 @@ +--- +tags: +- unsloth +library_name: transformers +license: apache-2.0 +license_link: https://huggingface.co/Qwen/Qwen3.5-4B/blob/main/LICENSE +pipeline_tag: image-text-to-text +base_model: +- Qwen/Qwen3.5-4B +--- +
+

+

To run Qwen3.5 locally - Read our Guide!

+

+

+ Unsloth Dynamic 2.0 achieves superior accuracy & outperforms other leading quants. +

+
+ + + + + + + + + +
+
+ +- You can now also fine-tune the model locally with [Unsloth](https://github.com/unslothai/unsloth). +- Read our [Qwen3.5 fine-tuning guide here](https://unsloth.ai/docs/models/qwen3.5/fine-tune). + +--- + +# Qwen3.5-4B + + + +[![Qwen Chat](https://img.shields.io/badge/%F0%9F%92%9C%EF%B8%8F%20Qwen%20Chat%20-536af5)](https://chat.qwen.ai) + +> [!Note] +> This repository contains model weights and configuration files for the post-trained model in the Hugging Face Transformers format. +> +> These artifacts are compatible with Hugging Face Transformers, vLLM, SGLang, KTransformers, etc. + +Over recent months, we have intensified our focus on developing foundation models that deliver exceptional utility and performance. Qwen3.5 represents a significant leap forward, integrating breakthroughs in multimodal learning, architectural efficiency, reinforcement learning scale, and global accessibility to empower developers and enterprises with unprecedented capability and efficiency. + +## Qwen3.5 Highlights + +Qwen3.5 features the following enhancement: + +- **Unified Vision-Language Foundation**: Early fusion training on multimodal tokens achieves cross-generational parity with Qwen3 and outperforms Qwen3-VL models across reasoning, coding, agents, and visual understanding benchmarks. + +- **Efficient Hybrid Architecture**: Gated Delta Networks combined with sparse Mixture-of-Experts deliver high-throughput inference with minimal latency and cost overhead. + +- **Scalable RL Generalization**: Reinforcement learning scaled across million-agent environments with progressively complex task distributions for robust real-world adaptability. + +- **Global Linguistic Coverage**: Expanded support to 201 languages and dialects, enabling inclusive, worldwide deployment with nuanced cultural and regional understanding. + +- **Next-Generation Training Infrastructure**: Near-100% multimodal training efficiency compared to text-only training and asynchronous RL frameworks supporting massive-scale agent scaffolds and environment orchestration. + + +![Benchmark Results](https://qianwen-res.oss-accelerate-overseas.aliyuncs.com/Qwen3.5/Figures/qwen3.5_small_size_score.png) + +For more details, please refer to our blog post [Qwen3.5](https://qwen.ai/blog?id=qwen3.5). + + +## Model Overview + +- Type: Causal Language Model with Vision Encoder +- Training Stage: Pre-training & Post-training +- Language Model + - Number of Parameters: 4B + - Hidden Dimension: 2560 + - Token Embedding: 248320 (Padded) + - Number of Layers: 32 + - Hidden Layout: 8 × (3 × (Gated DeltaNet → FFN) → 1 × (Gated Attention → FFN)) + - Gated DeltaNet: + - Number of Linear Attention Heads: 32 for V and 16 for QK + - Head Dimension: 128 + - Gated Attention: + - Number of Attention Heads: 16 for Q and 4 for KV + - Head Dimension: 256 + - Rotary Position Embedding Dimension: 64 + - Feed Forward Network: + - Intermediate Dimension: 9216 + - LM Output: 248320 (Tied to token embedding) + - MTP: trained with multi-steps +- Context Length: 262,144 natively and extensible up to 1,010,000 tokens. + +## Benchmark Results + +### Language + +
+ + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + +
GPT-OSS-120BGPT-OSS-20BQwen3-Next-80B-A3B-ThinkingQwen3-30BA3B-Thinking-2507Qwen3.5-9BQwen3.5-4B
Knowledge & STEM
MMLU-Pro80.874.882.780.982.579.1
MMLU-Redux91.087.892.591.491.188.8
C-Eval76.271.489.787.488.285.1
SuperGPQA54.648.560.856.858.252.9
GPQA Diamond80.171.577.273.481.776.2
Instruction Following
IFEval88.988.288.988.991.589.8
IFBench69.065.161.551.564.559.2
MultiChallenge45.340.151.346.554.549.0
Long Context
AA-LCR50.730.751.749.063.057.0
LongBench v248.245.648.044.855.250.0
Reasoning & Coding
HMMT Feb 2590.076.773.763.183.274.0
HMMT Nov 2590.081.881.273.882.976.8
LiveCodeBench v682.774.668.766.065.655.8
OJBench41.536.329.725.129.224.1
General Agent
BFCL-V4----49.742.466.150.3
TAU2-Bench----57.441.979.179.9
VITA-Bench----29.514.129.822.0
DeepPlanning----0.44.918.017.6
Multilingualism
MMMLU78.269.781.378.481.276.1
MMLU-ProX74.567.373.669.176.371.5
NOVA-6351.148.753.352.555.954.3
INCLUDE74.065.378.374.475.671.0
Global PIQA84.179.883.580.283.278.9
PolyMATH54.030.962.452.657.351.1
WMT24++74.467.857.469.372.666.6
MAXIFE83.780.179.977.483.478.0
+

+* TAU2-Bench: we follow the official setup except for the airline domain, where all models are evaluated by applying the fixes proposed in the Claude Opus 4.5 system card.
+
+* MMLU-ProX: we report the averaged accuracy on 29 languages.
+* WMT24++: a harder subset of WMT24 after difficulty labeling and rebalancing; we report the averaged scores on 55 languages using XCOMET-XXL.
+* MAXIFE: we report the accuracy on English + multilingual original prompts (totally 23 settings).
+* Empty cells (--) indicate scores not yet available or not applicable. +

+
+ + +### Vision Language + +
+ + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + +
GPT-5-Nano-2025-08-07Gemini-2.5-Flash-LiteQwen3-VL-30B-A3BQwen3.5-9BQwen3.5-4B
STEM and Puzzle
MMMU75.873.476.078.477.6
MMMU-Pro57.259.763.070.166.3
MathVision62.252.165.778.974.6
Mathvista(mini)71.572.881.985.785.1
We-Math62.532.170.075.275.4
DynaMath78.069.980.183.683.3
ZEROBench1.01.00.03.03.0
ZEROBench_sub22.219.223.731.126.3
VlmsAreBlind66.768.472.593.792.6
BabyVision14.417.518.628.6/25.816.0/19.1
General VQA
RealWorldQA71.872.277.480.379.5
MMStar68.669.175.579.778.3
MMBenchEN-DEV-v1.180.382.788.990.189.4
SimpleVQA46.054.154.351.243.4
HallusionBench58.464.566.069.365.0
Text Recognition and Document Understanding
OmniDocBench1.555.979.486.887.786.2
CharXiv(RQ)50.156.156.673.070.8
MMLongBench-Doc31.846.547.457.754.2
CC-OCR58.972.977.879.376.7
AI2D_TEST81.985.786.990.289.6
OCRBench75.382.583.989.285.0
Spatial Intelligence
ERQA45.844.345.355.554.0
CountBench80.079.290.097.296.3
RefCOCO(avg)----89.389.788.1
EmbSpatialBench74.266.180.683.081.3
RefSpatialBench12.611.254.258.554.6
LingoQA57.017.862.080.474.4
Hypersim----11.413.512.5
Nuscene----10.311.89.9
Video Understanding
VideoMME(w sub.)71.774.679.984.583.5
VideoMME(w/o sub.)66.272.773.378.476.9
VideoMMMU63.069.275.078.974.1
MLVU69.278.578.984.482.8
MVBench----72.074.471.2
LVBench--60.959.270.066.4
MMVU63.165.366.167.864.9
Visual Agent
ScreenSpot Pro----60.565.260.3
OSWorld-Verified----30.641.835.6
AndroidWorld----55.057.858.6
Tool Calling
TIR-Bench18.521.522.545.6/31.938.9/29.9
V*68.169.683.290.1/88.584.3/86.4
Medical VQA
SLAKE57.065.068.879.076.1
PMC-VQA37.848.851.557.955.5
MedXpertQA-MM26.735.335.549.942.9
+ +

+* MathVision: our model’s score is evaluated using a fixed prompt, e.g., “Please reason step by step, and put your final answer within \boxed{}.” For other models, we report the higher score between runs with and without the \boxed{} formatting.
+* BabyVision: scores reported as "with CI / without CI".
+* TIR-Bench and V*: scores reported as "with CI / without CI".
+* Empty cells (--) indicate scores not yet available or not applicable. +

+ +
+ + + +## Quickstart + +> [!Important] +> Qwen3.5 models operate in thinking mode by default, generating thinking content signified by `\n...\n\n` before producing the final responses. +> To disable thinking content and obtain direct response, refer to the examples [here](#instruct-or-non-thinking-mode). + + +For streamlined integration, we recommend using Qwen3.5 via APIs. Below is a guide to use Qwen3.5 via OpenAI-compatible API. + +### Serving Qwen3.5 + +Qwen3.5 can be served via APIs with popular inference frameworks. +In the following, we show example commands to launch OpenAI-Compatible API servers for Qwen3.5 models. + + +> [!Important] +> Inference efficiency and throughput vary significantly across frameworks. +> We recommend using the latest framework versions to ensure optimal performance and compatibility. +> For production workloads or high-throughput scenarios, dedicated serving engines such as SGLang, KTransformers or vLLM are strongly recommended. + +> [!Important] +> The model has a default context length of 262,144 tokens. +> If you encounter out-of-memory (OOM) errors, consider reducing the context window. +> However, because Qwen3.5 leverages extended context for complex tasks, we advise maintaining a context length of at least 128K tokens to preserve thinking capabilities. + +#### SGLang + +[SGLang](https://github.com/sgl-project/sglang) is a fast serving framework for large language models and vision language models. +SGLang from the main branch of the open-source repository is required for Qwen3.5, which can be installed using the following command in a fresh environment: +```shell +uv pip install 'git+https://github.com/sgl-project/sglang.git#subdirectory=python&egg=sglang[all]' +``` +See [its documentation](https://docs.sglang.ai/get_started/install.html) for more details. + +The following will create API endpoints at `http://localhost:8000/v1`: + +- **Standard Version**: The following command can be used to create an API endpoint with maximum context length 262,144 tokens using tensor parallel on 8 GPUs. + + ```shell + python -m sglang.launch_server --model-path Qwen/Qwen3.5-4B --port 8000 --tp-size 1 --mem-fraction-static 0.8 --context-length 262144 --reasoning-parser qwen3 + ``` + +- **Tool Use**: To support tool use, you can use the following command. + + ```shell + python -m sglang.launch_server --model-path Qwen/Qwen3.5-4B --port 8000 --tp-size 1 --mem-fraction-static 0.8 --context-length 262144 --reasoning-parser qwen3 --tool-call-parser qwen3_coder + ``` + +- **Multi-Token Prediction (MTP)**: The following command is recommended for MTP: + + ```shell + python -m sglang.launch_server --model-path Qwen/Qwen3.5-4B --port 8000 --tp-size 1 --mem-fraction-static 0.8 --context-length 262144 --reasoning-parser qwen3 --speculative-algo NEXTN --speculative-num-steps 3 --speculative-eagle-topk 1 --speculative-num-draft-tokens 4 + ``` + +#### vLLM + +[vLLM](https://github.com/vllm-project/vllm) is a high-throughput and memory-efficient inference and serving engine for LLMs. +vLLM from the main branch of the open-source repository is required for Qwen3.5, which can be installed using the following command in a fresh environment: +```shell +uv pip install vllm --torch-backend=auto --extra-index-url https://wheels.vllm.ai/nightly +``` +See [its documentation](https://docs.vllm.ai/en/stable/getting_started/installation/index.html) for more details. + +For detailed Qwen3.5 usage guide, see the [vLLM Qwen3.5 recipe](https://docs.vllm.ai/projects/recipes/en/latest/Qwen/Qwen3.5.html). + +The following will create API endpoints at `http://localhost:8000/v1`: + +- **Standard Version**: The following command can be used to create an API endpoint with maximum context length 262,144 tokens using tensor parallel on 8 GPUs. + + ```shell + vllm serve Qwen/Qwen3.5-4B --port 8000 --tensor-parallel-size 1 --max-model-len 262144 --reasoning-parser qwen3 + ``` + +- **Tool Call**: To support tool use, you can use the following command. + + ```shell + vllm serve Qwen/Qwen3.5-4B --port 8000 --tensor-parallel-size 1 --max-model-len 262144 --reasoning-parser qwen3 --enable-auto-tool-choice --tool-call-parser qwen3_coder + ``` + +- **Multi-Token Prediction (MTP)**: The following command is recommended for MTP: + + ```shell + vllm serve Qwen/Qwen3.5-4B --port 8000 --tensor-parallel-size 1 --max-model-len 262144 --reasoning-parser qwen3 --speculative-config '{"method":"qwen3_next_mtp","num_speculative_tokens":2}' + ``` + +- **Text-Only**: The following command skips the vision encoder and multimodal profiling to free up memory for additional KV cache: + + ```shell + vllm serve Qwen/Qwen3.5-4B --port 8000 --tensor-parallel-size 1 --max-model-len 262144 --reasoning-parser qwen3 --language-model-only + ``` + +#### KTransformers + +[KTransformers](https://github.com/kvcache-ai/ktransformers) is a flexible framework for experiencing cutting-edge LLM inference optimizations with CPU-GPU heterogeneous computing. +For running Qwen3.5 with KTransformers, see the [KTransformers Deployment Guide](https://github.com/kvcache-ai/ktransformers/blob/main/doc/en/Qwen3.5.md). + +#### Hugging Face Transformers + +Hugging Face Transformers contains a _lightweight_ server which can be used for quick testing and moderate load deployment. +The latest `transformers` is required for Qwen3.5: +```shell +pip install "transformers[serving] @ git+https://github.com/huggingface/transformers.git@main" +``` +See [its documentation](https://huggingface.co/docs/transformers/main/serving) for more details. Please also make sure torchvision and pillow are installed. + +Then, run `transformers serve` to launch a server with API endpoints at `http://localhost:8000/v1`; it will place the model on accelerators if available: +```shell +transformers serve --force-model Qwen/Qwen3.5-4B --port 8000 --continuous-batching +``` + +### Using Qwen3.5 via the Chat Completions API + +The chat completions API is accessible via standard HTTP requests or OpenAI SDKs. +Here, we show examples using the OpenAI Python SDK. + +Before starting, make sure it is installed and the API key and the API base URL is configured, e.g.: +```shell +pip install -U openai + +# Set the following accordingly +export OPENAI_BASE_URL="http://localhost:8000/v1" +export OPENAI_API_KEY="EMPTY" +``` + +> [!Tip] +> We recommend using the following set of sampling parameters for generation +> - Thinking mode for general tasks: `temperature=1.0, top_p=0.95, top_k=20, min_p=0.0, presence_penalty=1.5, repetition_penalty=1.0` +> - Thinking mode for precise coding tasks (e.g. WebDev): `temperature=0.6, top_p=0.95, top_k=20, min_p=0.0, presence_penalty=0.0, repetition_penalty=1.0` +> - Instruct (or non-thinking) mode for general tasks: `temperature=0.7, top_p=0.8, top_k=20, min_p=0.0, presence_penalty=1.5, repetition_penalty=1.0` +> - Instruct (or non-thinking) mode for reasoning tasks: `temperature=1.0, top_p=0.95, top_k=20, min_p=0.0, presence_penalty=1.5, repetition_penalty=1.0` +> +> Please note that the support for sampling parameters varies according to inference frameworks. + +#### Text-Only Input + +```python +from openai import OpenAI +# Configured by environment variables +client = OpenAI() + +messages = [ + {"role": "user", "content": "Type \"I love Qwen3.5\" backwards"}, +] + +chat_response = client.chat.completions.create( + model="Qwen/Qwen3.5-4B", + messages=messages, + max_tokens=81920, + temperature=1.0, + top_p=0.95, + presence_penalty=1.5, + extra_body={ + "top_k": 20, + }, +) +print("Chat response:", chat_response) +``` + + +#### Image Input + +```python +from openai import OpenAI +# Configured by environment variables +client = OpenAI() + +messages = [ + { + "role": "user", + "content": [ + { + "type": "image_url", + "image_url": { + "url": "https://qianwen-res.oss-accelerate.aliyuncs.com/Qwen3.5/demo/CI_Demo/mathv-1327.jpg" + } + }, + { + "type": "text", + "text": "The centres of the four illustrated circles are in the corners of the square. The two big circles touch each other and also the two little circles. With which factor do you have to multiply the radii of the little circles to obtain the radius of the big circles?\nChoices:\n(A) $\\frac{2}{9}$\n(B) $\\sqrt{5}$\n(C) $0.8 \\cdot \\pi$\n(D) 2.5\n(E) $1+\\sqrt{2}$" + } + ] + } +] + +chat_response = client.chat.completions.create( + model="Qwen/Qwen3.5-4B", + messages=messages, + max_tokens=81920, + temperature=1.0, + top_p=0.95, + presence_penalty=1.5, + extra_body={ + "top_k": 20, + }, +) +print("Chat response:", chat_response) +``` + +#### Video Input + +```python +from openai import OpenAI +# Configured by environment variables +client = OpenAI() + +messages = [ + { + "role": "user", + "content": [ + { + "type": "video_url", + "video_url": { + "url": "https://qianwen-res.oss-accelerate.aliyuncs.com/Qwen3.5/demo/video/N1cdUjctpG8.mp4" + } + }, + { + "type": "text", + "text": "Summarize the video content." + } + ] + } +] + +# When vLLM is launched with `--media-io-kwargs '{"video": {"num_frames": -1}}'`, +# video frame sampling can be configured via `extra_body` (e.g., by setting `fps`). +# This feature is currently supported only in vLLM. +# +# By default, `fps=2` and `do_sample_frames=True`. +# With `do_sample_frames=True`, you can customize the `fps` value to set your desired video sampling rate. +chat_response = client.chat.completions.create( + model="Qwen/Qwen3.5-4B", + messages=messages, + max_tokens=81920, + temperature=1.0, + top_p=0.95, + presence_penalty=1.5, + extra_body={ + "top_k": 20, + "mm_processor_kwargs": {"fps": 2, "do_sample_frames": True}, + }, +) + +print("Chat response:", chat_response) +``` + +#### Instruct (or Non-Thinking) Mode + +> [!Important] +> Qwen3.5 does not officially support the soft switch of Qwen3, i.e., `/think` and `/nothink`. + +Qwen3.5 will think by default before response. +You can obtain direct response from the model without thinking by configuring the API parameters. +For example, +```python +from openai import OpenAI +# Configured by environment variables +client = OpenAI() + +messages = [ + { + "role": "user", + "content": [ + { + "type": "image_url", + "image_url": { + "url": "https://qianwen-res.oss-accelerate.aliyuncs.com/Qwen3.5/demo/RealWorld/RealWorld-04.png" + } + }, + { + "type": "text", + "text": "Where is this?" + } + ] + } +] + +chat_response = client.chat.completions.create( + model="Qwen/Qwen3.5-4B", + messages=messages, + max_tokens=32768, + temperature=0.7, + top_p=0.8, + presence_penalty=1.5, + extra_body={ + "top_k": 20, + "chat_template_kwargs": {"enable_thinking": False}, + }, +) +print("Chat response:", chat_response) +``` + +> [!Note] +> If you are using APIs from Alibaba Cloud Model Studio, in addition to changing `model`, please use `"enable_thinking": False` instead of `"chat_template_kwargs": {"enable_thinking": False}`. + + +## Agentic Usage + +Qwen3.5 excels in tool calling capabilities. + +### Qwen-Agent + +We recommend using [Qwen-Agent](https://github.com/QwenLM/Qwen-Agent) to quickly build Agent applications with Qwen3.5. + +To define the available tools, you can use the MCP configuration file, use the integrated tool of Qwen-Agent, or integrate other tools by yourself. +```python +import os +from qwen_agent.agents import Assistant + +# Define LLM +# Using Alibaba Cloud Model Studio +llm_cfg = { + # Use the OpenAI-compatible model service provided by DashScope: + 'model': 'Qwen3.5-4B', + 'model_type': 'qwenvl_oai', + 'model_server': 'https://dashscope.aliyuncs.com/compatible-mode/v1', + 'api_key': os.getenv('DASHSCOPE_API_KEY'), + + 'generate_cfg': { + 'use_raw_api': True, + # When using Dash Scope OAI API, pass the parameter of whether to enable thinking mode in this way + 'extra_body': { + 'enable_thinking': True + }, + }, +} + +# Using OpenAI-compatible API endpoint. +# functionality of the deployment frameworks and let Qwen-Agent automate the related operations. +# +# llm_cfg = { +# # Use your own model service compatible with OpenAI API by vLLM/SGLang: +# 'model': 'Qwen/Qwen3.5-4B', +# 'model_type': 'qwenvl_oai', +# 'model_server': 'http://localhost:8000/v1', # api_base +# 'api_key': 'EMPTY', +# +# 'generate_cfg': { +# 'use_raw_api': True, +# # When using vLLM/SGLang OAI API, pass the parameter of whether to enable thinking mode in this way +# 'extra_body': { +# 'chat_template_kwargs': {'enable_thinking': True} +# }, +# }, +# } + +# Define Tools +tools = [ + {'mcpServers': { # You can specify the MCP configuration file + "filesystem": { + "command": "npx", + "args": ["-y", "@modelcontextprotocol/server-filesystem", "/Users/xxxx/Desktop"] + } + } + } +] + +# Define Agent +bot = Assistant(llm=llm_cfg, function_list=tools) + +# Streaming generation +messages = [{'role': 'user', 'content': 'Help me organize my desktop.'}] +for responses in bot.run(messages=messages): + pass +print(responses) + +# Streaming generation +messages = [{'role': 'user', 'content': 'Develop a dog website and save it on the desktop'}] +for responses in bot.run(messages=messages): + pass +print(responses) +``` + +### Qwen Code + + +[Qwen Code](https://github.com/QwenLM/qwen-code) is an open-source AI agent for the terminal, optimized for Qwen models. It helps you understand large codebases, automate tedious work, and ship faster. + +For more information, please refer to [Qwen Code](https://qwenlm.github.io/qwen-code-docs/). + +## Processing Ultra-Long Texts + +Qwen3.5 natively supports context lengths of up to 262,144 tokens. +For long-horizon tasks where the total length (including both input and output) exceeds this limit, we recommend using RoPE scaling techniques to handle long texts effectively., e.g., YaRN. + +YaRN is currently supported by several inference frameworks, e.g., `transformers`, `vllm`, `ktransformers` and `sglang`. +In general, there are two approaches to enabling YaRN for supported frameworks: + +- Modifying the model configuration file: + In the `config.json` file, change the `rope_parameters` fields in `text_config` to: + ```json + { + "mrope_interleaved": true, + "mrope_section": [ + 11, + 11, + 10 + ], + "rope_type": "yarn", + "rope_theta": 10000000, + "partial_rotary_factor": 0.25, + "factor": 4.0, + "original_max_position_embeddings": 262144, + } + ``` + +- Passing command line arguments: + + For `vllm`, you can use + ```shell + VLLM_ALLOW_LONG_MAX_MODEL_LEN=1 vllm serve ... --hf-overrides '{"text_config": {"rope_parameters": {"mrope_interleaved": true, "mrope_section": [11, 11, 10], "rope_type": "yarn", "rope_theta": 10000000, "partial_rotary_factor": 0.25, "factor": 4.0, "original_max_position_embeddings": 262144}}}' --max-model-len 1010000 + ``` + + For `sglang` and `ktransformers`, you can use + ```shell + SGLANG_ALLOW_OVERWRITE_LONGER_CONTEXT_LEN=1 python -m sglang.launch_server ... --json-model-override-args '{"text_config": {"rope_parameters": {"mrope_interleaved": true, "mrope_section": [11, 11, 10], "rope_type": "yarn", "rope_theta": 10000000, "partial_rotary_factor": 0.25, "factor": 4.0, "original_max_position_embeddings": 262144}}}' --context-length 1010000 + ``` + +> [!NOTE] +> All the notable open-source frameworks implement static YaRN, which means the scaling factor remains constant regardless of input length, **potentially impacting performance on shorter texts.** +> We advise modifying the `rope_parameters` configuration only when processing long contexts is required. +> It is also recommended to modify the `factor` as needed. For example, if the typical context length for your application is 524,288 tokens, it would be better to set `factor` as 2.0. + +## Best Practices + +To achieve optimal performance, we recommend the following settings: + +1. **Sampling Parameters**: + - We suggest using the following sets of sampling parameters depending on the mode and task type: + - **Thinking mode for general tasks**: + `temperature=1.0`, `top_p=0.95`, `top_k=20`, `min_p=0.0`, `presence_penalty=1.5`, `repetition_penalty=1.0` + - **Thinking mode for precise coding tasks (e.g., WebDev)**: + `temperature=0.6`, `top_p=0.95`, `top_k=20`, `min_p=0.0`, `presence_penalty=0.0`, `repetition_penalty=1.0` + - **Instruct (or non-thinking) mode for general tasks**: + `temperature=0.7`, `top_p=0.8`, `top_k=20`, `min_p=0.0`, `presence_penalty=1.5`, `repetition_penalty=1.0` + - **Instruct (or non-thinking) mode for reasoning tasks**: + `temperature=1.0`, `top_p=1.0`, `top_k=40`, `min_p=0.0`, `presence_penalty=2.0`, `repetition_penalty=1.0` + - For supported frameworks, you can adjust the `presence_penalty` parameter between 0 and 2 to reduce endless repetitions. However, using a higher value may occasionally result in language mixing and a slight decrease in model performance. + +2. **Adequate Output Length**: We recommend using an output length of 32,768 tokens for most queries. For benchmarking on highly complex problems, such as those found in math and programming competitions, we suggest setting the max output length to 81,920 tokens. This provides the model with sufficient space to generate detailed and comprehensive responses, thereby enhancing its overall performance. + +3. **Standardize Output Format**: We recommend using prompts to standardize model outputs when benchmarking. + - **Math Problems**: Include "Please reason step by step, and put your final answer within \boxed{}." in the prompt. + - **Multiple-Choice Questions**: Add the following JSON structure to the prompt to standardize responses: "Please show your choice in the `answer` field with only the choice letter, e.g., `"answer": "C"`." + +4. **No Thinking Content in History**: In multi-turn conversations, the historical model output should only include the final output part and does not need to include the thinking content. It is implemented in the provided chat template in Jinja2. However, for frameworks that do not directly use the Jinja2 chat template, it is up to the developers to ensure that the best practice is followed. + +5. **Long Video Understanding**: To optimize inference efficiency for plain text and images, the `size` parameter in the released `video_preprocessor_config.json` is conservatively configured. It is recommended to set the `longest_edge` parameter in the video_preprocessor_config file to 469,762,048 (corresponding to 224k video tokens) to enable higher frame-rate sampling for hour-scale videos and thereby achieve superior performance. For example, + ```json + {"longest_edge": 469762048, "shortest_edge": 4096} + ``` + + Alternatively, override the default values via engine startup parameters. For implementation details, refer to: [vLLM](https://github.com/vllm-project/vllm/pull/34330) / [SGLang](https://github.com/sgl-project/sglang/pull/18467). + + +### Citation + +If you find our work helpful, feel free to give us a cite. + +```bibtex +@misc{qwen3.5, + title = {{Qwen3.5}: Towards Native Multimodal Agents}, + author = {{Qwen Team}}, + month = {February}, + year = {2026}, + url = {https://qwen.ai/blog?id=qwen3.5} +} +``` \ No newline at end of file diff --git a/chat/gguf/unsloth/Qwen3.5-4B-GGUF/mmproj-F16.gguf b/chat/gguf/unsloth/Qwen3.5-4B-GGUF/mmproj-F16.gguf new file mode 100644 index 0000000..df5eff1 --- /dev/null +++ b/chat/gguf/unsloth/Qwen3.5-4B-GGUF/mmproj-F16.gguf @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:cd88edcf8d031894960bb0c9c5b9b7e1fea6ebee02b9f7ce925a00d12891f864 +size 672423616 diff --git a/chat/gguf/unsloth/Qwen3.5-9B-GGUF/Qwen3.5-9B-Q4_K_M.gguf b/chat/gguf/unsloth/Qwen3.5-9B-GGUF/Qwen3.5-9B-Q4_K_M.gguf new file mode 100644 index 0000000..111d918 --- /dev/null +++ b/chat/gguf/unsloth/Qwen3.5-9B-GGUF/Qwen3.5-9B-Q4_K_M.gguf @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:03b74727a860a56338e042c4420bb3f04b2fec5734175f4cb9fa853daf52b7e8 +size 5680522464 diff --git a/chat/gguf/unsloth/Qwen3.5-9B-GGUF/README.md b/chat/gguf/unsloth/Qwen3.5-9B-GGUF/README.md new file mode 100644 index 0000000..b876513 --- /dev/null +++ b/chat/gguf/unsloth/Qwen3.5-9B-GGUF/README.md @@ -0,0 +1,1199 @@ +--- +tags: +- unsloth +library_name: transformers +license: apache-2.0 +license_link: https://huggingface.co/Qwen/Qwen3.5-9B/blob/main/LICENSE +pipeline_tag: image-text-to-text +base_model: +- Qwen/Qwen3.5-9B +--- +
+

+

To run Qwen3.5 locally - Read our Guide!

+

+

+ Unsloth Dynamic 2.0 achieves superior accuracy & outperforms other leading quants. +

+
+ + + + + + + + + +
+
+ +- You can now also fine-tune the model locally with [Unsloth](https://github.com/unslothai/unsloth). +- Read our [Qwen3.5 fine-tuning guide here](https://unsloth.ai/docs/models/qwen3.5/fine-tune). + +--- + +# Qwen3.5-9B + + + +[![Qwen Chat](https://img.shields.io/badge/%F0%9F%92%9C%EF%B8%8F%20Qwen%20Chat%20-536af5)](https://chat.qwen.ai) + +> [!Note] +> This repository contains model weights and configuration files for the post-trained model in the Hugging Face Transformers format. +> +> These artifacts are compatible with Hugging Face Transformers, vLLM, SGLang, KTransformers, etc. + +Over recent months, we have intensified our focus on developing foundation models that deliver exceptional utility and performance. Qwen3.5 represents a significant leap forward, integrating breakthroughs in multimodal learning, architectural efficiency, reinforcement learning scale, and global accessibility to empower developers and enterprises with unprecedented capability and efficiency. + +## Qwen3.5 Highlights + +Qwen3.5 features the following enhancement: + +- **Unified Vision-Language Foundation**: Early fusion training on multimodal tokens achieves cross-generational parity with Qwen3 and outperforms Qwen3-VL models across reasoning, coding, agents, and visual understanding benchmarks. + +- **Efficient Hybrid Architecture**: Gated Delta Networks combined with sparse Mixture-of-Experts deliver high-throughput inference with minimal latency and cost overhead. + +- **Scalable RL Generalization**: Reinforcement learning scaled across million-agent environments with progressively complex task distributions for robust real-world adaptability. + +- **Global Linguistic Coverage**: Expanded support to 201 languages and dialects, enabling inclusive, worldwide deployment with nuanced cultural and regional understanding. + +- **Next-Generation Training Infrastructure**: Near-100% multimodal training efficiency compared to text-only training and asynchronous RL frameworks supporting massive-scale agent scaffolds and environment orchestration. + + +![Benchmark Results](https://qianwen-res.oss-accelerate-overseas.aliyuncs.com/Qwen3.5/Figures/qwen3.5_small_size_score.png) + +For more details, please refer to our blog post [Qwen3.5](https://qwen.ai/blog?id=qwen3.5). + + +## Model Overview + +- Type: Causal Language Model with Vision Encoder +- Training Stage: Pre-training & Post-training +- Language Model + - Number of Parameters: 9B + - Hidden Dimension: 4096 + - Token Embedding: 248320 (Padded) + - Number of Layers: 32 + - Hidden Layout: 8 × (3 × (Gated DeltaNet → FFN) → 1 × (Gated Attention → FFN)) + - Gated DeltaNet: + - Number of Linear Attention Heads: 32 for V and 16 for QK + - Head Dimension: 128 + - Gated Attention: + - Number of Attention Heads: 16 for Q and 4 for KV + - Head Dimension: 256 + - Rotary Position Embedding Dimension: 64 + - Feed Forward Network: + - Intermediate Dimension: 12288 + - LM Output: 248320 (Padded) + - MTP: trained with multi-steps +- Context Length: 262,144 natively and extensible up to 1,010,000 tokens. + +## Benchmark Results + +### Language + +
+ + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + +
GPT-OSS-120BGPT-OSS-20BQwen3-Next-80B-A3B-ThinkingQwen3-30BA3B-Thinking-2507Qwen3.5-9BQwen3.5-4B
Knowledge & STEM
MMLU-Pro80.874.882.780.982.579.1
MMLU-Redux91.087.892.591.491.188.8
C-Eval76.271.489.787.488.285.1
SuperGPQA54.648.560.856.858.252.9
GPQA Diamond80.171.577.273.481.776.2
Instruction Following
IFEval88.988.288.988.991.589.8
IFBench69.065.161.551.564.559.2
MultiChallenge45.340.151.346.554.549.0
Long Context
AA-LCR50.730.751.749.063.057.0
LongBench v248.245.648.044.855.250.0
Reasoning & Coding
HMMT Feb 2590.076.773.763.183.274.0
HMMT Nov 2590.081.881.273.882.976.8
LiveCodeBench v682.774.668.766.065.655.8
OJBench41.536.329.725.129.224.1
General Agent
BFCL-V4----49.742.466.150.3
TAU2-Bench----57.441.979.179.9
VITA-Bench----29.514.129.822.0
DeepPlanning----0.44.918.017.6
Multilingualism
MMMLU78.269.781.378.481.276.1
MMLU-ProX74.567.373.669.176.371.5
NOVA-6351.148.753.352.555.954.3
INCLUDE74.065.378.374.475.671.0
Global PIQA84.179.883.580.283.278.9
PolyMATH54.030.962.452.657.351.1
WMT24++74.467.857.469.372.666.6
MAXIFE83.780.179.977.483.478.0
+

+* TAU2-Bench: we follow the official setup except for the airline domain, where all models are evaluated by applying the fixes proposed in the Claude Opus 4.5 system card.
+
+* MMLU-ProX: we report the averaged accuracy on 29 languages.
+* WMT24++: a harder subset of WMT24 after difficulty labeling and rebalancing; we report the averaged scores on 55 languages using XCOMET-XXL.
+* MAXIFE: we report the accuracy on English + multilingual original prompts (totally 23 settings).
+* Empty cells (--) indicate scores not yet available or not applicable. +

+
+ + +### Vision Language + +
+ + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + +
GPT-5-Nano-2025-08-07Gemini-2.5-Flash-LiteQwen3-VL-30B-A3BQwen3.5-9BQwen3.5-4B
STEM and Puzzle
MMMU75.873.476.078.477.6
MMMU-Pro57.259.763.070.166.3
MathVision62.252.165.778.974.6
Mathvista(mini)71.572.881.985.785.1
We-Math62.532.170.075.275.4
DynaMath78.069.980.183.683.3
ZEROBench1.01.00.03.03.0
ZEROBench_sub22.219.223.731.126.3
VlmsAreBlind66.768.472.593.792.6
BabyVision14.417.518.628.6/25.816.0/19.1
General VQA
RealWorldQA71.872.277.480.379.5
MMStar68.669.175.579.778.3
MMBenchEN-DEV-v1.180.382.788.990.189.4
SimpleVQA46.054.154.351.243.4
HallusionBench58.464.566.069.365.0
Text Recognition and Document Understanding
OmniDocBench1.555.979.486.887.786.2
CharXiv(RQ)50.156.156.673.070.8
MMLongBench-Doc31.846.547.457.754.2
CC-OCR58.972.977.879.376.7
AI2D_TEST81.985.786.990.289.6
OCRBench75.382.583.989.285.0
Spatial Intelligence
ERQA45.844.345.355.554.0
CountBench80.079.290.097.296.3
RefCOCO(avg)----89.389.788.1
EmbSpatialBench74.266.180.683.081.3
RefSpatialBench12.611.254.258.554.6
LingoQA57.017.862.080.474.4
Hypersim----11.413.512.5
Nuscene----10.311.89.9
Video Understanding
VideoMME(w sub.)71.774.679.984.583.5
VideoMME(w/o sub.)66.272.773.378.476.9
VideoMMMU63.069.275.078.974.1
MLVU69.278.578.984.482.8
MVBench----72.074.471.2
LVBench--60.959.270.066.4
MMVU63.165.366.167.864.9
Visual Agent
ScreenSpot Pro----60.565.260.3
OSWorld-Verified----30.641.835.6
AndroidWorld----55.057.858.6
Tool Calling
TIR-Bench18.521.522.545.6/31.938.9/29.9
V*68.169.683.290.1/88.584.3/86.4
Medical VQA
SLAKE57.065.068.879.076.1
PMC-VQA37.848.851.557.955.5
MedXpertQA-MM26.735.335.549.942.9
+ +

+* MathVision: our model’s score is evaluated using a fixed prompt, e.g., “Please reason step by step, and put your final answer within \boxed{}.” For other models, we report the higher score between runs with and without the \boxed{} formatting.
+* BabyVision: scores reported as "with CI / without CI".
+* TIR-Bench and V*: scores reported as "with CI / without CI".
+* Empty cells (--) indicate scores not yet available or not applicable. +

+ +
+ +## Quickstart + +> [!Important] +> Qwen3.5 models operate in thinking mode by default, generating thinking content signified by `\n...\n\n` before producing the final responses. +> To disable thinking content and obtain direct response, refer to the examples [here](#instruct-or-non-thinking-mode). + + +For streamlined integration, we recommend using Qwen3.5 via APIs. Below is a guide to use Qwen3.5 via OpenAI-compatible API. + +### Serving Qwen3.5 + +Qwen3.5 can be served via APIs with popular inference frameworks. +In the following, we show example commands to launch OpenAI-Compatible API servers for Qwen3.5 models. + + +> [!Important] +> Inference efficiency and throughput vary significantly across frameworks. +> We recommend using the latest framework versions to ensure optimal performance and compatibility. +> For production workloads or high-throughput scenarios, dedicated serving engines such as SGLang, KTransformers or vLLM are strongly recommended. + +> [!Important] +> The model has a default context length of 262,144 tokens. +> If you encounter out-of-memory (OOM) errors, consider reducing the context window. +> However, because Qwen3.5 leverages extended context for complex tasks, we advise maintaining a context length of at least 128K tokens to preserve thinking capabilities. + +#### SGLang + +[SGLang](https://github.com/sgl-project/sglang) is a fast serving framework for large language models and vision language models. +SGLang from the main branch of the open-source repository is required for Qwen3.5, which can be installed using the following command in a fresh environment: +```shell +uv pip install 'git+https://github.com/sgl-project/sglang.git#subdirectory=python&egg=sglang[all]' +``` +See [its documentation](https://docs.sglang.ai/get_started/install.html) for more details. + +The following will create API endpoints at `http://localhost:8000/v1`: + +- **Standard Version**: The following command can be used to create an API endpoint with maximum context length 262,144 tokens using tensor parallel on 8 GPUs. + + ```shell + python -m sglang.launch_server --model-path Qwen/Qwen3.5-9B --port 8000 --tp-size 1 --mem-fraction-static 0.8 --context-length 262144 --reasoning-parser qwen3 + ``` + +- **Tool Use**: To support tool use, you can use the following command. + + ```shell + python -m sglang.launch_server --model-path Qwen/Qwen3.5-9B --port 8000 --tp-size 1 --mem-fraction-static 0.8 --context-length 262144 --reasoning-parser qwen3 --tool-call-parser qwen3_coder + ``` + +- **Multi-Token Prediction (MTP)**: The following command is recommended for MTP: + + ```shell + python -m sglang.launch_server --model-path Qwen/Qwen3.5-9B --port 8000 --tp-size 1 --mem-fraction-static 0.8 --context-length 262144 --reasoning-parser qwen3 --speculative-algo NEXTN --speculative-num-steps 3 --speculative-eagle-topk 1 --speculative-num-draft-tokens 4 + ``` + +#### vLLM + +[vLLM](https://github.com/vllm-project/vllm) is a high-throughput and memory-efficient inference and serving engine for LLMs. +vLLM from the main branch of the open-source repository is required for Qwen3.5, which can be installed using the following command in a fresh environment: +```shell +uv pip install vllm --torch-backend=auto --extra-index-url https://wheels.vllm.ai/nightly +``` +See [its documentation](https://docs.vllm.ai/en/stable/getting_started/installation/index.html) for more details. + +For detailed Qwen3.5 usage guide, see the [vLLM Qwen3.5 recipe](https://docs.vllm.ai/projects/recipes/en/latest/Qwen/Qwen3.5.html). + +The following will create API endpoints at `http://localhost:8000/v1`: + +- **Standard Version**: The following command can be used to create an API endpoint with maximum context length 262,144 tokens using tensor parallel on 8 GPUs. + + ```shell + vllm serve Qwen/Qwen3.5-9B --port 8000 --tensor-parallel-size 1 --max-model-len 262144 --reasoning-parser qwen3 + ``` + +- **Tool Call**: To support tool use, you can use the following command. + + ```shell + vllm serve Qwen/Qwen3.5-9B --port 8000 --tensor-parallel-size 1 --max-model-len 262144 --reasoning-parser qwen3 --enable-auto-tool-choice --tool-call-parser qwen3_coder + ``` + +- **Multi-Token Prediction (MTP)**: The following command is recommended for MTP: + + ```shell + vllm serve Qwen/Qwen3.5-9B --port 8000 --tensor-parallel-size 1 --max-model-len 262144 --reasoning-parser qwen3 --speculative-config '{"method":"qwen3_next_mtp","num_speculative_tokens":2}' + ``` + +- **Text-Only**: The following command skips the vision encoder and multimodal profiling to free up memory for additional KV cache: + + ```shell + vllm serve Qwen/Qwen3.5-9B --port 8000 --tensor-parallel-size 1 --max-model-len 262144 --reasoning-parser qwen3 --language-model-only + ``` + +#### KTransformers + +[KTransformers](https://github.com/kvcache-ai/ktransformers) is a flexible framework for experiencing cutting-edge LLM inference optimizations with CPU-GPU heterogeneous computing. +For running Qwen3.5 with KTransformers, see the [KTransformers Deployment Guide](https://github.com/kvcache-ai/ktransformers/blob/main/doc/en/Qwen3.5.md). + +#### Hugging Face Transformers + +Hugging Face Transformers contains a _lightweight_ server which can be used for quick testing and moderate load deployment. +The latest `transformers` is required for Qwen3.5: +```shell +pip install "transformers[serving] @ git+https://github.com/huggingface/transformers.git@main" +``` +See [its documentation](https://huggingface.co/docs/transformers/main/serving) for more details. Please also make sure torchvision and pillow are installed. + +Then, run `transformers serve` to launch a server with API endpoints at `http://localhost:8000/v1`; it will place the model on accelerators if available: +```shell +transformers serve --force-model Qwen/Qwen3.5-9B --port 8000 --continuous-batching +``` + +### Using Qwen3.5 via the Chat Completions API + +The chat completions API is accessible via standard HTTP requests or OpenAI SDKs. +Here, we show examples using the OpenAI Python SDK. + +Before starting, make sure it is installed and the API key and the API base URL is configured, e.g.: +```shell +pip install -U openai + +# Set the following accordingly +export OPENAI_BASE_URL="http://localhost:8000/v1" +export OPENAI_API_KEY="EMPTY" +``` + +> [!Tip] +> We recommend using the following set of sampling parameters for generation +> - Thinking mode for general tasks: `temperature=1.0, top_p=0.95, top_k=20, min_p=0.0, presence_penalty=1.5, repetition_penalty=1.0` +> - Thinking mode for precise coding tasks (e.g. WebDev): `temperature=0.6, top_p=0.95, top_k=20, min_p=0.0, presence_penalty=0.0, repetition_penalty=1.0` +> - Instruct (or non-thinking) mode for general tasks: `temperature=0.7, top_p=0.8, top_k=20, min_p=0.0, presence_penalty=1.5, repetition_penalty=1.0` +> - Instruct (or non-thinking) mode for reasoning tasks: `temperature=1.0, top_p=0.95, top_k=20, min_p=0.0, presence_penalty=1.5, repetition_penalty=1.0` +> +> Please note that the support for sampling parameters varies according to inference frameworks. + +#### Text-Only Input + +```python +from openai import OpenAI +# Configured by environment variables +client = OpenAI() + +messages = [ + {"role": "user", "content": "Type \"I love Qwen3.5\" backwards"}, +] + +chat_response = client.chat.completions.create( + model="Qwen/Qwen3.5-9B", + messages=messages, + max_tokens=81920, + temperature=1.0, + top_p=0.95, + presence_penalty=1.5, + extra_body={ + "top_k": 20, + }, +) +print("Chat response:", chat_response) +``` + + +#### Image Input + +```python +from openai import OpenAI +# Configured by environment variables +client = OpenAI() + +messages = [ + { + "role": "user", + "content": [ + { + "type": "image_url", + "image_url": { + "url": "https://qianwen-res.oss-accelerate.aliyuncs.com/Qwen3.5/demo/CI_Demo/mathv-1327.jpg" + } + }, + { + "type": "text", + "text": "The centres of the four illustrated circles are in the corners of the square. The two big circles touch each other and also the two little circles. With which factor do you have to multiply the radii of the little circles to obtain the radius of the big circles?\nChoices:\n(A) $\\frac{2}{9}$\n(B) $\\sqrt{5}$\n(C) $0.8 \\cdot \\pi$\n(D) 2.5\n(E) $1+\\sqrt{2}$" + } + ] + } +] + +chat_response = client.chat.completions.create( + model="Qwen/Qwen3.5-9B", + messages=messages, + max_tokens=81920, + temperature=1.0, + top_p=0.95, + presence_penalty=1.5, + extra_body={ + "top_k": 20, + }, +) +print("Chat response:", chat_response) +``` + +#### Video Input + +```python +from openai import OpenAI +# Configured by environment variables +client = OpenAI() + +messages = [ + { + "role": "user", + "content": [ + { + "type": "video_url", + "video_url": { + "url": "https://qianwen-res.oss-accelerate.aliyuncs.com/Qwen3.5/demo/video/N1cdUjctpG8.mp4" + } + }, + { + "type": "text", + "text": "Summarize the video content." + } + ] + } +] + +# When vLLM is launched with `--media-io-kwargs '{"video": {"num_frames": -1}}'`, +# video frame sampling can be configured via `extra_body` (e.g., by setting `fps`). +# This feature is currently supported only in vLLM. +# +# By default, `fps=2` and `do_sample_frames=True`. +# With `do_sample_frames=True`, you can customize the `fps` value to set your desired video sampling rate. +chat_response = client.chat.completions.create( + model="Qwen/Qwen3.5-9B", + messages=messages, + max_tokens=81920, + temperature=1.0, + top_p=0.95, + presence_penalty=1.5, + extra_body={ + "top_k": 20, + "mm_processor_kwargs": {"fps": 2, "do_sample_frames": True}, + }, +) + +print("Chat response:", chat_response) +``` + +#### Instruct (or Non-Thinking) Mode + +> [!Important] +> Qwen3.5 does not officially support the soft switch of Qwen3, i.e., `/think` and `/nothink`. + +Qwen3.5 will think by default before response. +You can obtain direct response from the model without thinking by configuring the API parameters. +For example, +```python +from openai import OpenAI +# Configured by environment variables +client = OpenAI() + +messages = [ + { + "role": "user", + "content": [ + { + "type": "image_url", + "image_url": { + "url": "https://qianwen-res.oss-accelerate.aliyuncs.com/Qwen3.5/demo/RealWorld/RealWorld-04.png" + } + }, + { + "type": "text", + "text": "Where is this?" + } + ] + } +] + +chat_response = client.chat.completions.create( + model="Qwen/Qwen3.5-9B", + messages=messages, + max_tokens=32768, + temperature=0.7, + top_p=0.8, + presence_penalty=1.5, + extra_body={ + "top_k": 20, + "chat_template_kwargs": {"enable_thinking": False}, + }, +) +print("Chat response:", chat_response) +``` + +> [!Note] +> If you are using APIs from Alibaba Cloud Model Studio, in addition to changing `model`, please use `"enable_thinking": False` instead of `"chat_template_kwargs": {"enable_thinking": False}`. + + +## Agentic Usage + +Qwen3.5 excels in tool calling capabilities. + +### Qwen-Agent + +We recommend using [Qwen-Agent](https://github.com/QwenLM/Qwen-Agent) to quickly build Agent applications with Qwen3.5. + +To define the available tools, you can use the MCP configuration file, use the integrated tool of Qwen-Agent, or integrate other tools by yourself. +```python +import os +from qwen_agent.agents import Assistant + +# Define LLM +# Using Alibaba Cloud Model Studio +llm_cfg = { + # Use the OpenAI-compatible model service provided by DashScope: + 'model': 'Qwen3.5-9B', + 'model_type': 'qwenvl_oai', + 'model_server': 'https://dashscope.aliyuncs.com/compatible-mode/v1', + 'api_key': os.getenv('DASHSCOPE_API_KEY'), + + 'generate_cfg': { + 'use_raw_api': True, + # When using Dash Scope OAI API, pass the parameter of whether to enable thinking mode in this way + 'extra_body': { + 'enable_thinking': True + }, + }, +} + +# Using OpenAI-compatible API endpoint. +# functionality of the deployment frameworks and let Qwen-Agent automate the related operations. +# +# llm_cfg = { +# # Use your own model service compatible with OpenAI API by vLLM/SGLang: +# 'model': 'Qwen/Qwen3.5-9B', +# 'model_type': 'qwenvl_oai', +# 'model_server': 'http://localhost:8000/v1', # api_base +# 'api_key': 'EMPTY', +# +# 'generate_cfg': { +# 'use_raw_api': True, +# # When using vLLM/SGLang OAI API, pass the parameter of whether to enable thinking mode in this way +# 'extra_body': { +# 'chat_template_kwargs': {'enable_thinking': True} +# }, +# }, +# } + +# Define Tools +tools = [ + {'mcpServers': { # You can specify the MCP configuration file + "filesystem": { + "command": "npx", + "args": ["-y", "@modelcontextprotocol/server-filesystem", "/Users/xxxx/Desktop"] + } + } + } +] + +# Define Agent +bot = Assistant(llm=llm_cfg, function_list=tools) + +# Streaming generation +messages = [{'role': 'user', 'content': 'Help me organize my desktop.'}] +for responses in bot.run(messages=messages): + pass +print(responses) + +# Streaming generation +messages = [{'role': 'user', 'content': 'Develop a dog website and save it on the desktop'}] +for responses in bot.run(messages=messages): + pass +print(responses) +``` + +### Qwen Code + + +[Qwen Code](https://github.com/QwenLM/qwen-code) is an open-source AI agent for the terminal, optimized for Qwen models. It helps you understand large codebases, automate tedious work, and ship faster. + +For more information, please refer to [Qwen Code](https://qwenlm.github.io/qwen-code-docs/). + +## Processing Ultra-Long Texts + +Qwen3.5 natively supports context lengths of up to 262,144 tokens. +For long-horizon tasks where the total length (including both input and output) exceeds this limit, we recommend using RoPE scaling techniques to handle long texts effectively., e.g., YaRN. + +YaRN is currently supported by several inference frameworks, e.g., `transformers`, `vllm`, `ktransformers` and `sglang`. +In general, there are two approaches to enabling YaRN for supported frameworks: + +- Modifying the model configuration file: + In the `config.json` file, change the `rope_parameters` fields in `text_config` to: + ```json + { + "mrope_interleaved": true, + "mrope_section": [ + 11, + 11, + 10 + ], + "rope_type": "yarn", + "rope_theta": 10000000, + "partial_rotary_factor": 0.25, + "factor": 4.0, + "original_max_position_embeddings": 262144, + } + ``` + +- Passing command line arguments: + + For `vllm`, you can use + ```shell + VLLM_ALLOW_LONG_MAX_MODEL_LEN=1 vllm serve ... --hf-overrides '{"text_config": {"rope_parameters": {"mrope_interleaved": true, "mrope_section": [11, 11, 10], "rope_type": "yarn", "rope_theta": 10000000, "partial_rotary_factor": 0.25, "factor": 4.0, "original_max_position_embeddings": 262144}}}' --max-model-len 1010000 + ``` + + For `sglang` and `ktransformers`, you can use + ```shell + SGLANG_ALLOW_OVERWRITE_LONGER_CONTEXT_LEN=1 python -m sglang.launch_server ... --json-model-override-args '{"text_config": {"rope_parameters": {"mrope_interleaved": true, "mrope_section": [11, 11, 10], "rope_type": "yarn", "rope_theta": 10000000, "partial_rotary_factor": 0.25, "factor": 4.0, "original_max_position_embeddings": 262144}}}' --context-length 1010000 + ``` + +> [!NOTE] +> All the notable open-source frameworks implement static YaRN, which means the scaling factor remains constant regardless of input length, **potentially impacting performance on shorter texts.** +> We advise modifying the `rope_parameters` configuration only when processing long contexts is required. +> It is also recommended to modify the `factor` as needed. For example, if the typical context length for your application is 524,288 tokens, it would be better to set `factor` as 2.0. + +## Best Practices + +To achieve optimal performance, we recommend the following settings: + +1. **Sampling Parameters**: + - We suggest using the following sets of sampling parameters depending on the mode and task type: + - **Thinking mode for general tasks**: + `temperature=1.0`, `top_p=0.95`, `top_k=20`, `min_p=0.0`, `presence_penalty=1.5`, `repetition_penalty=1.0` + - **Thinking mode for precise coding tasks (e.g., WebDev)**: + `temperature=0.6`, `top_p=0.95`, `top_k=20`, `min_p=0.0`, `presence_penalty=0.0`, `repetition_penalty=1.0` + - **Instruct (or non-thinking) mode for general tasks**: + `temperature=0.7`, `top_p=0.8`, `top_k=20`, `min_p=0.0`, `presence_penalty=1.5`, `repetition_penalty=1.0` + - **Instruct (or non-thinking) mode for reasoning tasks**: + `temperature=1.0`, `top_p=1.0`, `top_k=40`, `min_p=0.0`, `presence_penalty=2.0`, `repetition_penalty=1.0` + - For supported frameworks, you can adjust the `presence_penalty` parameter between 0 and 2 to reduce endless repetitions. However, using a higher value may occasionally result in language mixing and a slight decrease in model performance. + +2. **Adequate Output Length**: We recommend using an output length of 32,768 tokens for most queries. For benchmarking on highly complex problems, such as those found in math and programming competitions, we suggest setting the max output length to 81,920 tokens. This provides the model with sufficient space to generate detailed and comprehensive responses, thereby enhancing its overall performance. + +3. **Standardize Output Format**: We recommend using prompts to standardize model outputs when benchmarking. + - **Math Problems**: Include "Please reason step by step, and put your final answer within \boxed{}." in the prompt. + - **Multiple-Choice Questions**: Add the following JSON structure to the prompt to standardize responses: "Please show your choice in the `answer` field with only the choice letter, e.g., `"answer": "C"`." + +4. **No Thinking Content in History**: In multi-turn conversations, the historical model output should only include the final output part and does not need to include the thinking content. It is implemented in the provided chat template in Jinja2. However, for frameworks that do not directly use the Jinja2 chat template, it is up to the developers to ensure that the best practice is followed. + +5. **Long Video Understanding**: To optimize inference efficiency for plain text and images, the `size` parameter in the released `video_preprocessor_config.json` is conservatively configured. It is recommended to set the `longest_edge` parameter in the video_preprocessor_config file to 469,762,048 (corresponding to 224k video tokens) to enable higher frame-rate sampling for hour-scale videos and thereby achieve superior performance. For example, + ```json + {"longest_edge": 469762048, "shortest_edge": 4096} + ``` + + Alternatively, override the default values via engine startup parameters. For implementation details, refer to: [vLLM](https://github.com/vllm-project/vllm/pull/34330) / [SGLang](https://github.com/sgl-project/sglang/pull/18467). + + +### Citation + +If you find our work helpful, feel free to give us a cite. + +```bibtex +@misc{qwen3.5, + title = {{Qwen3.5}: Towards Native Multimodal Agents}, + author = {{Qwen Team}}, + month = {February}, + year = {2026}, + url = {https://qwen.ai/blog?id=qwen3.5} +} +``` \ No newline at end of file diff --git a/chat/gguf/unsloth/Qwen3.5-9B-GGUF/mmproj-F16.gguf b/chat/gguf/unsloth/Qwen3.5-9B-GGUF/mmproj-F16.gguf new file mode 100644 index 0000000..61292b5 --- /dev/null +++ b/chat/gguf/unsloth/Qwen3.5-9B-GGUF/mmproj-F16.gguf @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:f70dc3509053962b0d0d3ee8a7eacebf5d60aa560cad78254ae8698516ae029f +size 918166080 diff --git a/chat/gguf/unsloth/Qwen3.6-35B-A3B-GGUF/Qwen3.6-35B-A3B-UD-Q4_K_M.gguf b/chat/gguf/unsloth/Qwen3.6-35B-A3B-GGUF/Qwen3.6-35B-A3B-UD-Q4_K_M.gguf new file mode 100644 index 0000000..c5100a3 --- /dev/null +++ b/chat/gguf/unsloth/Qwen3.6-35B-A3B-GGUF/Qwen3.6-35B-A3B-UD-Q4_K_M.gguf @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:ac0e2c1189e055faa36eff361580e79c5bd6f8e76bffb4ce547f167d53e31a61 +size 22134528992 diff --git a/chat/gguf/unsloth/Qwen3.6-35B-A3B-GGUF/README.md b/chat/gguf/unsloth/Qwen3.6-35B-A3B-GGUF/README.md new file mode 100644 index 0000000..166561e --- /dev/null +++ b/chat/gguf/unsloth/Qwen3.6-35B-A3B-GGUF/README.md @@ -0,0 +1,1073 @@ +--- +library_name: transformers +license: apache-2.0 +license_link: https://huggingface.co/Qwen/Qwen3.6-35B-A3B/blob/main/LICENSE +pipeline_tag: image-text-to-text +base_model: +- Qwen/Qwen3.6-35B-A3B +tags: +- unsloth +- qwen +- qwen3_5_moe +--- +# Read our How to [Run Qwen3.6 Guide!](https://docs.unsloth.ai/models/qwen3.6) +
+

+ See Unsloth Dynamic 2.0 GGUFs for our quantization benchmarks. +

+
+ + + + + + + + + +
+ +
+qwen3.6 in unsloth studio + +--- + +# Qwen3.6-35B-A3B + + + +[![Qwen Chat](https://img.shields.io/badge/%F0%9F%92%9C%EF%B8%8F%20Qwen%20Chat%20-536af5)](https://chat.qwen.ai) + +> [!Note] +> This repository contains model weights and configuration files for the post-trained model in the Hugging Face Transformers format. +> +> These artifacts are compatible with Hugging Face Transformers, vLLM, SGLang, KTransformers, etc. + +Following the February release of the Qwen3.5 series, we're pleased to share the first open-weight variant of Qwen3.6. Built on direct feedback from the community, Qwen3.6 prioritizes stability and real-world utility, offering developers a more intuitive, responsive, and genuinely productive coding experience. + +## Qwen3.6 Highlights + +This release delivers substantial upgrades, particularly in + +- **Agentic Coding:** the model now handles frontend workflows and repository-level reasoning with greater fluency and precision. +- **Thinking Preservation:** we've introduced a new option to retain reasoning context from historical messages, streamlining iterative development and reducing overhead. + +![Benchmark Results](https://qianwen-res.oss-cn-beijing.aliyuncs.com/Qwen3.6/Figures/qwen3.6_35b_a3b_score.png) + +For more details, please refer to our blog post [Qwen3.6-35B-A3B](https://qwen.ai/blog?id=qwen3.6-35b-a3b). + +## Model Overview + +- Type: Causal Language Model with Vision Encoder +- Training Stage: Pre-training & Post-training +- Language Model + - Number of Parameters: 35B in total and 3B activated + - Hidden Dimension: 2048 + - Token Embedding: 248320 (Padded) + - Number of Layers: 40 + - Hidden Layout: 10 × (3 × (Gated DeltaNet → MoE) → 1 × (Gated Attention → MoE)) + - Gated DeltaNet: + - Number of Linear Attention Heads: 32 for V and 16 for QK + - Head Dimension: 128 + - Gated Attention: + - Number of Attention Heads: 16 for Q and 2 for KV + - Head Dimension: 256 + - Rotary Position Embedding Dimension: 64 + - Mixture Of Experts + - Number of Experts: 256 + - Number of Activated Experts: 8 Routed + 1 Shared + - Expert Intermediate Dimension: 512 + - LM Output: 248320 (Padded) + - MTP: trained with multi-steps +- Context Length: 262,144 natively and extensible up to 1,010,000 tokens. + + +## Benchmark Results + +### Language + +
+ + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + +
Qwen3.5-27BGemma4-31BQwen3.5-35BA3BGemma4-26BA4BQwen3.6-35BA3B
Coding Agent
SWE-bench Verified75.052.070.017.473.4
SWE-bench Multilingual69.351.760.317.367.2
SWE-bench Pro51.235.744.613.849.5
Terminal-Bench 2.041.642.940.534.251.5
Claw-Eval Avg64.348.565.458.868.7
Claw-Eval Pass^346.225.051.028.050.0
SkillsBench Avg527.223.64.412.328.7
QwenClawBench52.241.747.738.752.6
NL2Repo27.315.520.511.629.4
QwenWebBench1068119797811781397
General Agent
TAU3-Bench68.467.568.959.067.2
VITA-Bench41.843.029.136.935.6
DeepPlanning22.624.022.816.225.9
Tool Decathlon31.521.228.712.026.9
MCPMark36.318.127.014.237.0
MCP-Atlas68.457.262.450.062.8
WideSearch66.435.259.138.360.1
Knowledge
MMLU-Pro86.185.285.382.685.2
MMLU-Redux93.293.793.392.793.3
SuperGPQA65.665.763.461.464.7
C-Eval90.582.690.282.590.0
STEM & Reasoning
GPQA85.584.384.282.386.0
HLE24.319.522.48.721.4
LiveCodeBench v680.780.074.677.180.4
HMMT Feb 2592.088.789.091.790.7
HMMT Nov 2589.887.589.287.589.1
HMMT Feb 2684.377.278.779.083.6
IMOAnswerBench79.974.576.874.378.9
AIME26 92.689.291.088.392.7
+ +

+* SWE-Bench Series: Internal agent scaffold (bash + file-edit tools); temp=1.0, top_p=0.95, 200K context window. We correct some problematic tasks in the public set of SWE-bench Pro and evaluate all baselines on the refined benchmark.
+* Terminal-Bench 2.0: Harbor/Terminus-2 harness; 3h timeout, 32 CPU/48 GB RAM; temp=1.0, top_p=0.95, top_k=20, max_tokens=80K, 256K ctx; avg of 5 runs.
+* SkillsBench: Evaluated via OpenCode on 78 tasks (self-contained subset, excluding API-dependent tasks); avg of 5 runs.
+* NL2Repo: Others are evaluated via Claude Code (temp=1.0, top_p=0.95, max_turns=900).
+* QwenClawBench: An internal real-user-distribution Claw agent benchmark (open-sourcing soon); temp=0.6, 256K ctx.
+* QwenWebBench: An internal front-end code generation benchmark; bilingual (EN/CN), 7 categories (Web Design, Web Apps, Games, SVG, Data Visualization, Animation, and 3D); auto-render + multimodal judge (code/visual correctness); BT/Elo rating system.
+* TAU3-Bench: We use the official user model (gpt-5.2, low reasoning effort) + default BM25 retrieval.
+* VITA-Bench: Avg subdomain scores; using claude-4-sonnet as judger, as the official judger (claude-3.7-sonnet) is no longer available.
+* MCPMark: GitHub MCP v0.30.3; Playwright responses truncated at 32K tokens.
+* MCP-Atlas: Public set score; gemini-2.5-pro judger.
+* AIME 26: We use the full AIME 2026 (I & II), where the scores may differ from Qwen 3.5 notes.
+

+ +
+ + +### Vision Language + +
+ + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + + +
Qwen3.5-27BClaude-Sonnet-4.5Gemma4-31BGemma4-26BA4BQwen3.5-35B-A3BQwen3.6-35B-A3B
STEM and Puzzle
MMMU82.379.680.478.481.481.7
MMMU-Pro75.068.476.9*73.8*75.175.3
Mathvista(mini)87.879.879.379.486.286.4
ZEROBench_sub36.226.326.026.334.134.4
General VQA
RealWorldQA83.770.372.372.284.185.3
MMBenchEN-DEV-v1.192.688.390.989.091.592.8
SimpleVQA56.057.652.952.258.358.9
HallusionBench70.059.967.466.167.969.8
Text Recognition and Document Understanding
OmniDocBench1.588.985.880.174.489.389.9
CharXiv(RQ)79.567.267.969.077.578.0
CC-OCR81.068.175.774.580.781.9
AI2D_TEST92.987.089.088.392.692.7
Spatial Intelligence
RefCOCO(avg)90.9------89.292.0
ODInW1341.1------42.650.8
EmbSpatialBench84.571.8----83.184.3
RefSpatialBench67.7------63.564.3
Video Understanding
VideoMME(w sub.)87.081.1----86.686.6
VideoMME(w/o sub.)82.875.3----82.582.5
VideoMMMU82.377.681.676.080.483.7
MLVU85.972.8----85.686.2
MVBench74.6------74.874.6
LVBench73.6------71.471.4
+

+* Empty cells (--) indicate scores not available or not applicable. +

+
+ +## Quickstart + +For streamlined integration, we recommend using Qwen3.6 via APIs. Below is a guide to use Qwen3.6 via OpenAI-compatible API. + +### Serving Qwen3.6 + +Qwen3.6 can be served via APIs with popular inference frameworks. +In the following, we show example commands to launch OpenAI-Compatible API servers for Qwen3.6 models. + +> [!Important] +> Inference efficiency and throughput vary significantly across frameworks. +> We recommend using the latest framework versions to ensure optimal performance and compatibility. +> For production workloads or high-throughput scenarios, dedicated serving engines such as SGLang, KTransformers or vLLM are strongly recommended. + +> [!Important] +> The model has a default context length of 262,144 tokens. +> If you encounter out-of-memory (OOM) errors, consider reducing the context window. +> However, because Qwen3.6 leverages extended context for complex tasks, we advise maintaining a context length of at least 128K tokens to preserve thinking capabilities. + +#### SGLang + +[SGLang](https://github.com/sgl-project/sglang) is a fast serving framework for large language models and vision language models. +`sglang>=0.5.10` is recommended for Qwen3.6, which can be installed using the following command in a fresh environment: +```shell +uv pip install sglang[all] +``` +See [its documentation](https://docs.sglang.ai/get_started/install.html) for more details. + +The following will create API endpoints at `http://localhost:8000/v1`: + +- **Standard Version**: The following command can be used to create an API endpoint with maximum context length 262,144 tokens using tensor parallel on 8 GPUs. + + ```shell + python -m sglang.launch_server --model-path Qwen/Qwen3.6-35B-A3B --port 8000 --tp-size 8 --mem-fraction-static 0.8 --context-length 262144 --reasoning-parser qwen3 + ``` + +- **Tool Use**: To support tool use, you can use the following command. + + ```shell + python -m sglang.launch_server --model-path Qwen/Qwen3.6-35B-A3B --port 8000 --tp-size 8 --mem-fraction-static 0.8 --context-length 262144 --reasoning-parser qwen3 --tool-call-parser qwen3_coder + ``` + +- **Multi-Token Prediction (MTP)**: The following command is recommended for MTP: + + ```shell + python -m sglang.launch_server --model-path Qwen/Qwen3.6-35B-A3B --port 8000 --tp-size 8 --mem-fraction-static 0.8 --context-length 262144 --reasoning-parser qwen3 --speculative-algo NEXTN --speculative-num-steps 3 --speculative-eagle-topk 1 --speculative-num-draft-tokens 4 + ``` + +For detailed deployment guide, see the [SGLang Qwen3.5 Cookbook](https://lmsysorg.mintlify.app/cookbook/llm/Qwen/Qwen3.5). + +#### vLLM + +[vLLM](https://github.com/vllm-project/vllm) is a high-throughput and memory-efficient inference and serving engine for LLMs. +`vllm>=0.19.0` is recommended for Qwen3.6, which can be installed using the following command in a fresh environment: +```shell +uv pip install vllm --torch-backend=auto +``` +See [its documentation](https://docs.vllm.ai/en/stable/getting_started/installation/index.html) for more details. + + +The following will create API endpoints at `http://localhost:8000/v1`: + +- **Standard Version**: The following command can be used to create an API endpoint with maximum context length 262,144 tokens using tensor parallel on 8 GPUs. + + ```shell + vllm serve Qwen/Qwen3.6-35B-A3B --port 8000 --tensor-parallel-size 8 --max-model-len 262144 --reasoning-parser qwen3 + ``` + +- **Tool Call**: To support tool use, you can use the following command. + + ```shell + vllm serve Qwen/Qwen3.6-35B-A3B --port 8000 --tensor-parallel-size 8 --max-model-len 262144 --reasoning-parser qwen3 --enable-auto-tool-choice --tool-call-parser qwen3_coder + ``` + +- **Multi-Token Prediction (MTP)**: The following command is recommended for MTP: + + ```shell + vllm serve Qwen/Qwen3.6-35B-A3B --port 8000 --tensor-parallel-size 8 --max-model-len 262144 --reasoning-parser qwen3 --speculative-config '{"method":"qwen3_next_mtp","num_speculative_tokens":2}' + ``` + +- **Text-Only**: The following command skips the vision encoder and multimodal profiling to free up memory for additional KV cache: + + ```shell + vllm serve Qwen/Qwen3.6-35B-A3B --port 8000 --tensor-parallel-size 8 --max-model-len 262144 --reasoning-parser qwen3 --language-model-only + ``` + +For detailed deployment guide, see the [vLLM Qwen3.5 Recipe](https://docs.vllm.ai/projects/recipes/en/latest/Qwen/Qwen3.5.html). + +#### KTransformers + +[KTransformers](https://github.com/kvcache-ai/ktransformers) is a flexible framework for experiencing cutting-edge LLM inference optimizations with CPU-GPU heterogeneous computing. +For running Qwen3.6 with KTransformers, see the [KTransformers Deployment Guide](https://github.com/kvcache-ai/ktransformers/blob/main/doc/en/Qwen3.5.md). + +#### Hugging Face Transformers + +Hugging Face Transformers contains a _lightweight_ server which can be used for quick testing and moderate load deployment. +The latest `transformers` is required for Qwen3.6: +```shell +pip install "transformers[serving]" +``` +See [its documentation](https://huggingface.co/docs/transformers/main/serving) for more details. Please also make sure torchvision and pillow are installed. + +Then, run `transformers serve` to launch a server with API endpoints at `http://localhost:8000/v1`; it will place the model on accelerators if available: +```shell +transformers serve Qwen/Qwen3.6-35B-A3B --port 8000 --continuous-batching +``` + +### Using Qwen3.6 via the Chat Completions API + +The chat completions API is accessible via standard HTTP requests or OpenAI SDKs. +Here, we show examples using the OpenAI Python SDK. + +Before starting, make sure it is installed and the API key and the API base URL is configured, e.g.: +```shell +pip install -U openai + +# Set the following accordingly +export OPENAI_BASE_URL="http://localhost:8000/v1" +export OPENAI_API_KEY="EMPTY" +``` + +> [!Tip] +> We recommend using the following set of sampling parameters for generation +> - Thinking mode for general tasks: `temperature=1.0, top_p=0.95, top_k=20, min_p=0.0, presence_penalty=1.5, repetition_penalty=1.0` +> - Thinking mode for precise coding tasks (e.g. WebDev): `temperature=0.6, top_p=0.95, top_k=20, min_p=0.0, presence_penalty=0.0, repetition_penalty=1.0` +> - Instruct (or non-thinking) mode for general tasks: `temperature=0.7, top_p=0.8, top_k=20, min_p=0.0, presence_penalty=1.5, repetition_penalty=1.0` +> - Instruct (or non-thinking) mode for reasoning tasks: `temperature=1.0, top_p=0.95, top_k=20, min_p=0.0, presence_penalty=1.5, repetition_penalty=1.0` +> +> Please note that the support for sampling parameters varies according to inference frameworks. + +> [!Important] +> Qwen3.6 models operate in thinking mode by default, generating thinking content signified by `\n...\n\n` before producing the final responses. +> To disable thinking content and obtain direct response, refer to the examples [here](#instruct-or-non-thinking-mode). + + +#### Text-Only Input + +```python +from openai import OpenAI +# Configured by environment variables +client = OpenAI() + +messages = [ + {"role": "user", "content": "Type \"I love Qwen3.6\" backwards"}, +] + +chat_response = client.chat.completions.create( + model="Qwen/Qwen3.6-35B-A3B", + messages=messages, + max_tokens=81920, + temperature=1.0, + top_p=0.95, + presence_penalty=1.5, + extra_body={ + "top_k": 20, + }, +) +print("Chat response:", chat_response) +``` + + +#### Image Input + +```python +from openai import OpenAI +# Configured by environment variables +client = OpenAI() + +messages = [ + { + "role": "user", + "content": [ + { + "type": "image_url", + "image_url": { + "url": "https://qianwen-res.oss-accelerate.aliyuncs.com/Qwen3.5/demo/CI_Demo/mathv-1327.jpg" + } + }, + { + "type": "text", + "text": "The centres of the four illustrated circles are in the corners of the square. The two big circles touch each other and also the two little circles. With which factor do you have to multiply the radii of the little circles to obtain the radius of the big circles?\nChoices:\n(A) $\\frac{2}{9}$\n(B) $\\sqrt{5}$\n(C) $0.8 \\cdot \\pi$\n(D) 2.5\n(E) $1+\\sqrt{2}$" + } + ] + } +] + +response = client.chat.completions.create( + model="Qwen/Qwen3.6-35B-A3B", + messages=messages, + max_tokens=81920, + temperature=1.0, + top_p=0.95, + presence_penalty=1.5, + extra_body={ + "top_k": 20, + }, +) +print("Chat response:", chat_response) +``` + +#### Video Input + +```python +from openai import OpenAI +# Configured by environment variables +client = OpenAI() + +messages = [ + { + "role": "user", + "content": [ + { + "type": "video_url", + "video_url": { + "url": "https://qianwen-res.oss-accelerate.aliyuncs.com/Qwen3.5/demo/video/N1cdUjctpG8.mp4" + } + }, + { + "type": "text", + "text": "How many porcelain jars were discovered in the niches located in the primary chamber of the tomb?" + } + ] + } +] + +# When vLLM is launched with `--media-io-kwargs '{"video": {"num_frames": -1}}'`, +# video frame sampling can be configured via `extra_body` (e.g., by setting `fps`). +# This feature is currently supported only in vLLM. +# +# By default, `fps=2` and `do_sample_frames=True`. +# With `do_sample_frames=True`, you can customize the `fps` value to set your desired video sampling rate. +response = client.chat.completions.create( + model="Qwen/Qwen3.6-35B-A3B", + messages=messages, + max_tokens=81920, + temperature=1.0, + top_p=0.95, + presence_penalty=1.5, + extra_body={ + "top_k": 20, + "mm_processor_kwargs": {"fps": 2, "do_sample_frames": True}, + }, +) + +print("Chat response:", chat_response) +``` + + +#### Instruct (or Non-Thinking) Mode + +> [!Important] +> Qwen3.6 does not officially support the soft switch of Qwen3, i.e., `/think` and `/nothink`. + +Qwen3.6 will think by default before response. +You can obtain direct response from the model without thinking by configuring the API parameters. +For example, +```python +from openai import OpenAI +# Configured by environment variables +client = OpenAI() + +messages = [ + { + "role": "user", + "content": [ + { + "type": "image_url", + "image_url": { + "url": "https://qianwen-res.oss-accelerate.aliyuncs.com/Qwen3.6/demo/RealWorld/RealWorld-04.png" + } + }, + { + "type": "text", + "text": "Where is this?" + } + ] + } +] + +chat_response = client.chat.completions.create( + model="Qwen/Qwen3.6-35B-A3B", + messages=messages, + max_tokens=32768, + temperature=0.7, + top_p=0.8, + presence_penalty=1.5, + extra_body={ + "top_k": 20, + "chat_template_kwargs": {"enable_thinking": False}, + }, +) +print("Chat response:", chat_response) +``` + +> [!Note] +> If you are using APIs from Alibaba Cloud Model Studio, in addition to changing `model`, please use `"enable_thinking": False` instead of `"chat_template_kwargs": {"enable_thinking": False}`. + +#### Preserve Thinking + +By default, only the thinking blocks generated in handling the latest user message is retained, resulting in a pattern commonly as interleaved thinking. +Qwen3.6 has been additionally trained to preserve and leverage thinking traces from historical messages. +You can enable this behavior by setting the `preserve_thinking` option: +```python +from openai import OpenAI +# Configured by environment variables +client = OpenAI() + +messages = [...] + +chat_response = client.chat.completions.create( + model="Qwen/Qwen3.6-35B-A3B", + messages=messages, + max_tokens=32768, + temperature=0.7, + top_p=0.8, + presence_penalty=1.5, + extra_body={ + "top_k": 20, + "chat_template_kwargs": {"preserve_thinking": True}, + }, +) +print("Chat response:", chat_response) +``` + +> [!Note] +> If you are using APIs from Alibaba Cloud Model Studio, in addition to changing `model`, please use `"preserve_thinking": True` instead of `"chat_template_kwargs": {"preserve_thinking": False}`. + + +This capability is particularly beneficial for agent scenarios, where maintaining full reasoning context can enhance decision consistency and, in many cases, reduce overall token consumption by minimizing redundant reasoning. Additionally, it can improve KV cache utilization, optimizing inference efficiency in both thinking and non-thinking modes. + + +## Agentic Usage + +Qwen3.6 excels in tool calling capabilities. + +### Qwen-Agent + +We recommend using [Qwen-Agent](https://github.com/QwenLM/Qwen-Agent) to quickly build Agent applications with Qwen3.6. + +To define the available tools, you can use the MCP configuration file, use the integrated tool of Qwen-Agent, or integrate other tools by yourself. +```python +import os +from qwen_agent.agents import Assistant + +# Define LLM +# Using Alibaba Cloud Model Studio +llm_cfg = { + # Use the OpenAI-compatible model service provided by DashScope: + 'model': 'Qwen3.6-35B-A3B', + 'model_type': 'qwenvl_oai', + 'model_server': 'https://dashscope.aliyuncs.com/compatible-mode/v1', + 'api_key': os.getenv('DASHSCOPE_API_KEY'), + + 'generate_cfg': { + 'use_raw_api': True, + # When using Dash Scope OAI API, pass the parameter of whether to enable thinking mode in this way + 'extra_body': { + 'enable_thinking': True, + 'preserve_thinking': True, + }, + }, +} + +# Using OpenAI-compatible API endpoint. +# functionality of the deployment frameworks and let Qwen-Agent automate the related operations. +# +# llm_cfg = { +# # Use your own model service compatible with OpenAI API by vLLM/SGLang: +# 'model': 'Qwen/Qwen3.6-35B-A3B', +# 'model_type': 'qwenvl_oai', +# 'model_server': 'http://localhost:8000/v1', # api_base +# 'api_key': 'EMPTY', +# +# 'generate_cfg': { +# 'use_raw_api': True, +# # When using vLLM/SGLang OAI API, pass the parameter of whether to enable thinking mode in this way +# 'extra_body': { +# 'chat_template_kwargs': {'enable_thinking': True, 'preserve_thinking': True} +# }, +# }, +# } + +# Define Tools +tools = [ + {'mcpServers': { # You can specify the MCP configuration file + "filesystem": { + "command": "npx", + "args": ["-y", "@modelcontextprotocol/server-filesystem", "/Users/xxxx/Desktop"] + } + } + } +] + +# Define Agent +bot = Assistant(llm=llm_cfg, function_list=tools) + +# Streaming generation +messages = [{'role': 'user', 'content': 'Help me organize my desktop.'}] +for responses in bot.run(messages=messages): + pass +print(responses) + +# Streaming generation +messages = [{'role': 'user', 'content': 'Develop a dog website and save it on the desktop'}] +for responses in bot.run(messages=messages): + pass +print(responses) +``` + +### Qwen Code + + +[Qwen Code](https://github.com/QwenLM/qwen-code) is an open-source AI agent for the terminal, optimized for Qwen models. It helps you understand large codebases, automate tedious work, and ship faster. + +For more information, please refer to [Qwen Code](https://qwenlm.github.io/qwen-code-docs/). + +## Processing Ultra-Long Texts + +Qwen3.6 natively supports context lengths of up to 262,144 tokens. +For long-horizon tasks where the total length (including both input and output) exceeds this limit, we recommend using RoPE scaling techniques to handle long texts effectively., e.g., YaRN. + +YaRN is currently supported by several inference frameworks, e.g., `transformers`, `vllm`, `ktransformers` and `sglang`. +In general, there are two approaches to enabling YaRN for supported frameworks: + +- Modifying the model configuration file: + In the `config.json` file, change the `rope_parameters` fields in `text_config` to: + ```json + { + "mrope_interleaved": true, + "mrope_section": [ + 11, + 11, + 10 + ], + "rope_type": "yarn", + "rope_theta": 10000000, + "partial_rotary_factor": 0.25, + "factor": 4.0, + "original_max_position_embeddings": 262144, + } + ``` + +- Passing command line arguments: + + For `vllm`, you can use + ```shell + VLLM_ALLOW_LONG_MAX_MODEL_LEN=1 vllm serve ... --hf-overrides '{"text_config": {"rope_parameters": {"mrope_interleaved": true, "mrope_section": [11, 11, 10], "rope_type": "yarn", "rope_theta": 10000000, "partial_rotary_factor": 0.25, "factor": 4.0, "original_max_position_embeddings": 262144}}}' --max-model-len 1010000 + ``` + + For `sglang` and `ktransformers`, you can use + ```shell + SGLANG_ALLOW_OVERWRITE_LONGER_CONTEXT_LEN=1 python -m sglang.launch_server ... --json-model-override-args '{"text_config": {"rope_parameters": {"mrope_interleaved": true, "mrope_section": [11, 11, 10], "rope_type": "yarn", "rope_theta": 10000000, "partial_rotary_factor": 0.25, "factor": 4.0, "original_max_position_embeddings": 262144}}}' --context-length 1010000 + ``` + +> [!NOTE] +> All the notable open-source frameworks implement static YaRN, which means the scaling factor remains constant regardless of input length, **potentially impacting performance on shorter texts.** +> We advise modifying the `rope_parameters` configuration only when processing long contexts is required. +> It is also recommended to modify the `factor` as needed. For example, if the typical context length for your application is 524,288 tokens, it would be better to set `factor` as 2.0. + +## Best Practices + +To achieve optimal performance, we recommend the following settings: + +1. **Sampling Parameters**: + - We suggest using the following sets of sampling parameters depending on the mode and task type: + - **Thinking mode for general tasks**: + `temperature=1.0`, `top_p=0.95`, `top_k=20`, `min_p=0.0`, `presence_penalty=1.5`, `repetition_penalty=1.0` + - **Thinking mode for precise coding tasks (e.g., WebDev)**: + `temperature=0.6`, `top_p=0.95`, `top_k=20`, `min_p=0.0`, `presence_penalty=0.0`, `repetition_penalty=1.0` + - **Instruct (or non-thinking) mode for general tasks**: + `temperature=0.7`, `top_p=0.8`, `top_k=20`, `min_p=0.0`, `presence_penalty=1.5`, `repetition_penalty=1.0` + - **Instruct (or non-thinking) mode for reasoning tasks**: + `temperature=1.0`, `top_p=1.0`, `top_k=40`, `min_p=0.0`, `presence_penalty=2.0`, `repetition_penalty=1.0` + - For supported frameworks, you can adjust the `presence_penalty` parameter between 0 and 2 to reduce endless repetitions. However, using a higher value may occasionally result in language mixing and a slight decrease in model performance. + +2. **Adequate Output Length**: We recommend using an output length of 32,768 tokens for most queries. For benchmarking on highly complex problems, such as those found in math and programming competitions, we suggest setting the max output length to 81,920 tokens. This provides the model with sufficient space to generate detailed and comprehensive responses, thereby enhancing its overall performance. + +3. **Standardize Output Format**: We recommend using prompts to standardize model outputs when benchmarking. + - **Math Problems**: Include "Please reason step by step, and put your final answer within \boxed{}." in the prompt. + - **Multiple-Choice Questions**: Add the following JSON structure to the prompt to standardize responses: "Please show your choice in the `answer` field with only the choice letter, e.g., `"answer": "C"`." + +4. **Long Video Understanding**: To optimize inference efficiency for plain text and images, the `size` parameter in the released `video_preprocessor_config.json` is conservatively configured. It is recommended to set the `longest_edge` parameter in the video_preprocessor_config file to 469,762,048 (corresponding to 224k video tokens) to enable higher frame-rate sampling for hour-scale videos and thereby achieve superior performance. For example, + ```json + {"longest_edge": 469762048, "shortest_edge": 4096} + ``` + + Alternatively, override the default values via engine startup parameters. For implementation details, refer to: [vLLM](https://github.com/vllm-project/vllm/pull/34330) / [SGLang](https://github.com/sgl-project/sglang/pull/18467). + + +### Citation + +If you find our work helpful, feel free to give us a cite. + +```bibtex +@misc{qwen36_35b_a3b, + title = {{Qwen3.6-35B-A3B}: Agentic Coding Power, Now Open to All}, + url = {https://qwen.ai/blog?id=qwen3.6-35b-a3b}, + author = {{Qwen Team}}, + month = {April}, + year = {2026} +} +``` \ No newline at end of file diff --git a/chat/gguf/unsloth/Qwen3.6-35B-A3B-GGUF/mmproj-F16.gguf b/chat/gguf/unsloth/Qwen3.6-35B-A3B-GGUF/mmproj-F16.gguf new file mode 100644 index 0000000..feb8852 --- /dev/null +++ b/chat/gguf/unsloth/Qwen3.6-35B-A3B-GGUF/mmproj-F16.gguf @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:8971ee4f331ff0a4c609374f32984b3d4e6dc086c0aa35f1d637fad1829e887f +size 899283680 diff --git a/chat/gguf/unsloth/gemma-4-12b-it-GGUF/README.md b/chat/gguf/unsloth/gemma-4-12b-it-GGUF/README.md new file mode 100644 index 0000000..3b275b7 --- /dev/null +++ b/chat/gguf/unsloth/gemma-4-12b-it-GGUF/README.md @@ -0,0 +1,609 @@ +--- +license: apache-2.0 +license_link: https://ai.google.dev/gemma/docs/gemma_4_license +pipeline_tag: image-text-to-text +base_model: google/gemma-4-12B-it +tags: +- gemma4 +- unsloth +- gemma +- google +- gemma4_unified +--- +# Read our How to [Run Gemma 4 12B Guide!](https://docs.unsloth.ai/models/gemma-4) +
+

+ See Unsloth Dynamic 2.0 GGUFs for our quantization benchmarks. +

+
+ + + + + + + + + +
+ + +
+gemma 4 in unsloth studio + +--- + +
+ +
+ + +

+ Hugging Face | + GitHub | + Launch Blog | + Documentation +
+ License: Apache 2.0 | Authors: Google DeepMind +

+ +> [!Note] +> This model card is for the Gemma 4 12B Unified model, which is part of the Gemma 4 family of open models. Built with the same multimodal functionality as Gemma 4 E2B and E4B (text, audio, image, and video inputs), it brings native audio and vision understanding directly to local environments without the need for separate encoders. This unified approach to multimodality makes the model encoder-free, offering a deployment size that is perfect for consumer devices and streamlined local execution. + +Gemma is a family of open models built by Google DeepMind. Gemma 4 models are multimodal, handling text and image input (with audio supported on E2B, E4B, and 12B) and generating text output. This release includes open-weights models in both pre-trained and instruction-tuned variants. Gemma 4 features a context window of up to 256K tokens and maintains multilingual support in over 140 languages. + +Featuring both Dense and Mixture-of-Experts (MoE) architectures, Gemma 4 is well-suited for tasks like text generation, coding, and reasoning. The models are available in five distinct sizes: **E2B**, **E4B**, **12B**, **26B A4B**, and **31B**. Their diverse sizes make them deployable in environments ranging from high-end phones to laptops and servers, democratizing access to state-of-the-art AI. + +Gemma 4 introduces key **capability and architectural advancements**: + +* **Reasoning** – All models in the family are designed as highly capable reasoners, with configurable thinking modes. + +* **Extended Multimodalities** – Processes Text, Image with variable aspect ratio and resolution support (all models), Video, and Audio (featured natively on the E2B, E4B, and 12B models). + +* **Diverse & Efficient Architectures** – Offers Dense and Mixture-of-Experts (MoE) variants of different sizes for scalable deployment. + +* **Optimized for On-Device** – Smaller models are specifically designed for efficient local execution on laptops and mobile devices. + +* **Increased Context Window** – The small models feature a 128K context window, while the medium models support 256K. + +* **Enhanced Coding & Agentic Capabilities** – Achieves notable improvements in coding benchmarks alongside native function-calling support, powering highly capable autonomous agents. + +* **Native System Prompt Support** – Gemma 4 introduces native support for the `system` role, enabling more structured and controllable conversations. + +## **Models Overview** + +Gemma 4 models are designed to deliver frontier-level performance at each size, targeting deployment scenarios from mobile and edge devices (E2B, E4B) to consumer GPUs and workstations (12B, 26B A4B, 31B). They are well-suited for reasoning, agentic workflows, coding, and multimodal understanding. + +The models employ a hybrid attention mechanism that interleaves local sliding window attention with full global attention, ensuring the final layer is always global. This hybrid design delivers the processing speed and low memory footprint of a lightweight model without sacrificing the deep awareness required for complex, long-context tasks. To optimize memory for long contexts, global layers feature unified Keys and Values, and apply Proportional RoPE (p-RoPE). + +### Dense Models + +| Property | E2B | E4B | 12B Unified | 31B Dense | +| :---- | :---- | :---- | :---- | :---- | +| **Total Parameters** | 2.3B effective
(5.1B with embeddings) | 4.5B effective
(8B with embeddings) | 11.95B | 30.7B | +| **Layers** | 35 | 42 | 48 | 60 | +| **Sliding Window** | 512 tokens | 512 tokens | 1024 tokens | 1024 tokens | +| **Context Length** | 128K tokens | 128K tokens | 256K tokens | 256K tokens | +| **Vocabulary Size** | 262K | 262K | 262K | 262K | +| **Supported Modalities** | Text, Image, Audio | Text, Image, Audio | Text, Image, Audio | Text, Image | +| **Vision Encoder Parameters** | *~150M* | *~150M* | - | *~550M* | +| **Audio Encoder Parameters** | *~300M* | *~300M* | - | No Audio | + +The "E" in E2B and E4B stands for "effective" parameters. The smaller models incorporate Per-Layer Embeddings (PLE) to maximize parameter efficiency in on-device deployments. Rather than adding more layers or parameters to the model, PLE gives each decoder layer its own small embedding for every token. These embedding tables are large but are only used for quick lookups, which is why the effective parameter count is much smaller than the total. + +The "Unified" in Gemma 4 12B Unified refers to its encoder-free architecture. Other Gemma 4 models use dedicated encoders to process multimodal data before passing it to the LLM. Gemma 4 12B eliminates these encoders entirely, projecting raw image patches and audio waveforms directly into the LLM's embedding space through lightweight linear layers. This unified approach means all modalities flow straight into a single decoder-only transformer, reducing multimodal latency and allowing the entire model to be fine-tuned in one pass. + +### Mixture-of-Experts (MoE) Model + +| Property | 26B A4B MoE | +| :---- | :---- | +| **Total Parameters** | 25.2B | +| **Active Parameters** | 3.8B | +| **Layers** | 30 | +| **Sliding Window** | 1024 tokens | +| **Context Length** | 256K tokens | +| **Vocabulary Size** | 262K | +| **Expert Count** | 8 active / 128 total and 1 shared | +| **Supported Modalities** | Text, Image | +| **Vision Encoder Parameters** | *~550M* | + +The "A" in 26B A4B stands for "active parameters" in contrast to the total number of parameters the model contains. By only activating a 4B subset of parameters during inference, the Mixture-of-Experts model runs much faster than its 26B total might suggest. This makes it an excellent choice for fast inference compared to the dense 31B model since it runs almost as fast as a 4B-parameter model. + +## **Benchmark Results** + +These models were evaluated against a large collection of different datasets and metrics to cover different aspects of text generation. Evaluation results marked in the table are for instruction-tuned models. + +| | Gemma 4 31B | Gemma 4 26B A4B | Gemma 4 12B Unified | Gemma 4 E4B | Gemma 4 E2B | Gemma 3 27B (no think) | +| :---- | :---- | :---- | :---- | :---- | :---- | :---- | +| MMLU Pro | 85.2% | 82.6% | 77.2% | 69.4% | 60.0% | 67.6% | +| AIME 2026 no tools | 89.2% | 88.3% | 77.5% | 42.5% | 37.5% | 20.8% | +| LiveCodeBench v6 | 80.0% | 77.1% | 72.0% | 52.0% | 44.0% | 29.1% | +| Codeforces ELO | 2150 | 1718 | 1659 | 940 | 633 | 110 | +| GPQA Diamond | 84.3% | 82.3% | 78.8% | 58.6% | 43.4% | 42.4% | +| Tau2 (average over 3) | 76.9% | 68.2% | 69.0% | 42.2% | 24.5% | 16.2% | +| HLE no tools | 19.5% | 8.7% | 5.2% | - | - | - | +| HLE with search | 26.5% | 17.2% | - | - | - | - | +| BigBench Extra Hard | 74.4% | 64.8% | 53.0% | 33.1% | 21.9% | 19.3% | +| MMMLU | 88.4% | 86.3% | 83.4% | 76.6% | 67.4% | 70.7% | +| **Vision** | | | | | | | +| MMMU Pro | 76.9% | 73.8% | 69.1% | 52.6% | 44.2% | 49.7% | +| OmniDocBench 1.5 (average edit distance, lower is better) | 0.131 | 0.149 | 0.164 | 0.181 | 0.290 | 0.365 | +| MATH-Vision | 85.6% | 82.4% | 79.7% | 59.5% | 52.4% | 46.0% | +| MedXPertQA MM | 61.3% | 58.1% | 48.7% | 28.7% | 23.5% | - | +| **Audio** | | | | | | | +| CoVoST | - | - | 38.5* | 35.54 | 33.47 | - | +| FLEURS (lower is better) | - | - | 0.069* | 0.08 | 0.09 | - | +| **Long Context** | | | | | | | +| MRCR v2 8 needle 128k (average) | 66.4% | 44.1% | 43.4% | 25.4% | 19.1% | 13.5% | + +*Excluding Chinese language. + +## **Core Capabilities** + +Gemma 4 models handle a broad range of tasks across text, vision, and audio. Key capabilities include: + +* **Thinking** – Built-in reasoning mode that lets the model think step-by-step before answering. +* **Long Context** – Context windows of up to 128K tokens (E2B/E4B) and 256K tokens (12B, 26B A4B/31B). +* **Image Understanding** – Object detection, Document/PDF parsing, screen and UI understanding, chart comprehension, OCR (including multilingual), handwriting recognition, and pointing. Images can be processed at variable aspect ratios and resolutions. +* **Video Understanding** – Analyze video by processing sequences of frames. +* **Interleaved Multimodal Input** – Freely mix text and images in any order within a single prompt. +* **Function Calling** – Native support for structured tool use, enabling agentic workflows. +* **Coding** – Code generation, completion, and correction. +* **Multilingual** – Out-of-the-box support for 35+ languages, pre-trained on 140+ languages. +* **Audio** (E2B, E4B, and 12B only) – Automatic speech recognition (ASR) and speech-to-translated-text translation across multiple languages. + + +## Getting Started + +You can use all Gemma 4 models with the latest version of Transformers. To get started, install the necessary dependencies in your environment: + +`pip install -U transformers torch accelerate` + +Once you have everything installed, you can proceed to load the model with the code below: + +```python +from transformers import AutoProcessor, AutoModelForMultimodalLM + +MODEL_ID = "google/gemma-4-12B-it" + +# Load model +processor = AutoProcessor.from_pretrained(MODEL_ID) +model = AutoModelForMultimodalLM.from_pretrained( + MODEL_ID, + dtype="auto", + device_map="auto" +) +``` + +Once the model is loaded, you can start generating output: + +```python +# Prompt +messages = [ + {"role": "system", "content": "You are a helpful assistant."}, + {"role": "user", "content": "Write a short joke about saving RAM."}, +] + +# Process input +inputs = processor.apply_chat_template( + messages, + tokenize=True, + return_dict=True, + return_tensors="pt", + add_generation_prompt=True, + enable_thinking=False +).to(model.device) +input_len = inputs["input_ids"].shape[-1] + +# Generate output +outputs = model.generate(**inputs, max_new_tokens=1024) +response = processor.decode(outputs[0][input_len:], skip_special_tokens=False) + +# Parse output +processor.parse_response(response) +``` + +To enable reasoning, set `enable_thinking=True` and the `parse_response` function will take care of parsing the thinking output. + +Below, you will also find snippets for processing audio (E2B, E4B, 12B only), images, and video alongside text: + +
+Code for processing Audio + +Make sure to install the following packages: + + +`pip install -U transformers torch torchvision librosa accelerate` + +You can then load the model with the code below: + +```python +from transformers import AutoProcessor, AutoModelForMultimodalLM + +MODEL_ID = "google/gemma-4-12B-it" + +# Load model +processor = AutoProcessor.from_pretrained(MODEL_ID) +model = AutoModelForMultimodalLM.from_pretrained( + MODEL_ID, + dtype="auto", + device_map="auto" +) +``` + +Once the model is loaded, you can start generating output by directly referencing the audio URL in the prompt: + + +```python +# Prompt - add audio after text +messages = [ + { + "role": "user", + "content": [ + {"type": "text", "text": "Transcribe the following speech segment in its original language. Follow these specific instructions for formatting the answer:\n* Only output the transcription, with no newlines.\n* When transcribing numbers, write the digits, i.e. write 1.7 and not one point seven, and write 3 instead of three."}, + {"type": "audio", "audio": "https://raw.githubusercontent.com/google-gemma/cookbook/refs/heads/main/apps/sample-data/journal1.wav"}, + ] + } +] + +# Process input +inputs = processor.apply_chat_template( + messages, + tokenize=True, + return_dict=True, + return_tensors="pt", + add_generation_prompt=True, +).to(model.device) +input_len = inputs["input_ids"].shape[-1] + +# Generate output +outputs = model.generate(**inputs, max_new_tokens=512) +response = processor.decode(outputs[0][input_len:], skip_special_tokens=False) + +# Parse output +processor.parse_response(response) +``` + +
+ +
+Code for processing Images + +Make sure to install the following packages: + + +`pip install -U transformers torch torchvision accelerate` + +You can then load the model with the code below: + +```python +from transformers import AutoProcessor, AutoModelForMultimodalLM + +MODEL_ID = "google/gemma-4-12B-it" + +# Load model +processor = AutoProcessor.from_pretrained(MODEL_ID) +model = AutoModelForMultimodalLM.from_pretrained( + MODEL_ID, + dtype="auto", + device_map="auto" +) +``` + +Once the model is loaded, you can start generating output by directly referencing the image URL in the prompt: + + +```python +# Prompt - add image before text +messages = [ + { + "role": "user", "content": [ + {"type": "image", "url": "https://raw.githubusercontent.com/google-gemma/cookbook/refs/heads/main/apps/sample-data/GoldenGate.png"}, + {"type": "text", "text": "What is shown in this image?"} + ] + } +] + +# Process input +inputs = processor.apply_chat_template( + messages, + tokenize=True, + return_dict=True, + return_tensors="pt", + add_generation_prompt=True, +).to(model.device) +input_len = inputs["input_ids"].shape[-1] + +# Generate output +outputs = model.generate(**inputs, max_new_tokens=512) +response = processor.decode(outputs[0][input_len:], skip_special_tokens=False) + +# Parse output +processor.parse_response(response) +``` + +
+ + +
+Code for processing Videos + +Make sure to install the following packages: + +`pip install -U transformers torch torchvision librosa accelerate` + +You can then load the model with the code below: + +```python +from transformers import AutoProcessor, AutoModelForMultimodalLM + +MODEL_ID = "google/gemma-4-12B-it" + +# Load model +processor = AutoProcessor.from_pretrained(MODEL_ID) +model = AutoModelForMultimodalLM.from_pretrained( + MODEL_ID, + dtype="auto", + device_map="auto" +) +``` + +Once the model is loaded, you can start generating output by directly referencing the video URL in the prompt: + + +```python +# Prompt - add video before text +messages = [ + { + 'role': 'user', + 'content': [ + {"type": "video", "video": "https://github.com/bebechien/gemma/raw/refs/heads/main/videos/ForBiggerBlazes.mp4"}, + {'type': 'text', 'text': 'Describe this video.'} + ] + } +] + +# Process input +inputs = processor.apply_chat_template( + messages, + tokenize=True, + return_dict=True, + return_tensors="pt", + add_generation_prompt=True, +).to(model.device) +input_len = inputs["input_ids"].shape[-1] + +# Generate output +outputs = model.generate(**inputs, max_new_tokens=512) +response = processor.decode(outputs[0][input_len:], skip_special_tokens=False) + +# Parse output +processor.parse_response(response) +``` + +
+ + + +## **Best Practices** + +For the best performance, use these configurations and best practices: + +### 1. Sampling Parameters + +Use the following standardized sampling configuration across all use cases: + +* `temperature=1.0` +* `top_p=0.95` +* `top_k=64` + +### 2. Thinking Mode Configuration + +Compared to Gemma 3, the models use standard `system`, `assistant`, and `user` roles. To properly manage the thinking process, use the following control tokens: + +* **Trigger Thinking:** Thinking is enabled by including the `<|think|>` token at the start of the system prompt. To disable thinking, remove the token. +* **Standard Generation:** When thinking is enabled, the model will output its internal reasoning followed by the final answer using this structure: + `<|channel>thought\n`**[Internal reasoning]**`` +* **Disabled Thinking Behavior:** For all models except for the E2B and E4B variants, if thinking is disabled, the model will still generate the tags but with an empty thought block: + `<|channel>thought\n`**[Final answer]** + +> [!Note] +> Note that many libraries like Transformers and llama.cpp handle the complexities of the chat template for you. + +### 3. Multi-Turn Conversations + +* **No Thinking Content in History**: In multi-turn conversations, the historical model output should only include the final response. Thoughts from previous model turns must *not be added* before the next user turn begins. + +### 4. Modality order + +For optimal performance with multimodal inputs, place: + +* Image content **before** the text in your prompt. +* Audio content **after** the text in your prompt. + +### 5. Variable Image Resolution + +Aside from variable aspect ratios, Gemma 4 supports variable image resolution through a configurable visual token budget, which controls how many tokens are used to represent an image. A higher token budget preserves more visual detail at the cost of additional compute, while a lower budget enables faster inference for tasks that don't require fine-grained understanding. + +* The supported token budgets are: **70**, **140**, **280**, **560**, and **1120**. + * Use *lower budgets* for classification, captioning, or video understanding, where faster inference and processing many frames outweigh fine-grained detail. + * Use *higher budgets* for tasks like OCR, document parsing, or reading small text. + +### 6. Audio + +Use the following prompt structures for audio processing: + +* **Audio Speech Recognition (ASR)** + +```text +Transcribe the following speech segment in {LANGUAGE} into {LANGUAGE} text. + +Follow these specific instructions for formatting the answer: +* Only output the transcription, with no newlines. +* When transcribing numbers, write the digits, i.e. write 1.7 and not one point seven, and write 3 instead of three. +``` + +* **Automatic Speech Translation (AST)** + +```text +Transcribe the following speech segment in {SOURCE_LANGUAGE}, then translate it into {TARGET_LANGUAGE}. +When formatting the answer, first output the transcription in {SOURCE_LANGUAGE}, then one newline, then output the string '{TARGET_LANGUAGE}: ', then the translation in {TARGET_LANGUAGE}. +``` + +### 7. Audio and Video Length + +All models support image inputs and can process videos as frames whereas the E2B, E4B, and 12B models also support audio inputs. Audio supports a maximum length of 30 seconds. Video supports a maximum of 60 seconds assuming the images are processed at one frame per second. + +## **Model Data** + +Data used for model training and how the data was processed. + +### **Training Dataset** + +Our pre-training dataset is a large-scale, diverse collection of data encompassing a wide range of domains and modalities, which includes web documents, code, images, audio, with a cutoff date of January 2025. Here are the key components: + +* **Web Documents**: A diverse collection of web text ensures the model is exposed to a broad range of linguistic styles, topics, and vocabulary. The training dataset includes content in over 140 languages. +* **Code**: Exposing the model to code helps it to learn the syntax and patterns of programming languages, which improves its ability to generate code and understand code-related questions. +* **Mathematics**: Training on mathematical text helps the model learn logical reasoning, symbolic representation, and to address mathematical queries. +* **Images**: A wide range of images enables the model to perform image analysis and visual data extraction tasks. + +The combination of these diverse data sources is crucial for training a powerful multimodal model that can handle a wide variety of different tasks and data formats. + +### **Data Preprocessing** + +Here are the key data cleaning and filtering methods applied to the training data: + +* **CSAM Filtering**: Rigorous CSAM (Child Sexual Abuse Material) filtering was applied at multiple stages in the data preparation process to ensure the exclusion of harmful and illegal content. +* **Sensitive Data Filtering**: As part of making Gemma pre-trained models safe and reliable, automated techniques were used to filter out certain personal information and other sensitive data from training sets. +* **Additional methods**: Filtering based on content quality and safety in line with [our policies](https://ai.google/static/documents/ai-responsibility-update-published-february-2025.pdf). + +## **Ethics and Safety** + +As open models become central to enterprise infrastructure, provenance and security are paramount. Developed by Google DeepMind, Gemma 4 undergoes the same rigorous safety evaluations as our proprietary Gemini models. + +### **Evaluation Approach** + +Gemma 4 models were developed in partnership with internal safety and responsible AI teams. A range of automated as well as human evaluations were conducted to help improve model safety. These evaluations align with [Google’s AI principles](https://ai.google/principles/), as well as safety policies, which aim to prevent our generative AI models from generating harmful content, including: + +* Content related to child sexual abuse material and exploitation +* Dangerous content (e.g., promoting suicide, or instructing in activities that could cause real-world harm) +* Sexually explicit content +* Hate speech (e.g., dehumanizing members of protected groups) +* Harassment (e.g., encouraging violence against people) + +### **Evaluation Results** + +For all areas of safety testing, we saw major improvements in all categories of content safety relative to previous Gemma models. Overall, Gemma 4 models significantly outperform Gemma 3 and 3n models in improving safety, while keeping unjustified refusals low. All testing was conducted without safety filters to evaluate the model capabilities and behaviors. For both text-to-text and image-to-text, and across all model sizes, the model produced minimal policy violations, and showed significant improvements over previous Gemma models' performance. + +## **Usage and Limitations** + +These models have certain limitations that users should be aware of. + +### **Intended Usage** + +Multimodal models (capable of processing vision, language, and/or audio) have a wide range of applications across various industries and domains. The following list of potential uses is not comprehensive. The purpose of this list is to provide contextual information about the possible use-cases that the model creators considered as part of model training and development. + +* **Content Creation and Communication** + * **Text Generation**: These models can be used to generate creative text formats such as poems, scripts, code, marketing copy, and email drafts. + * **Chatbots and Conversational AI**: Power conversational interfaces for customer service, virtual assistants, or interactive applications. + * **Text Summarization**: Generate concise summaries of a text corpus, research papers, or reports. + * **Image Data Extraction**: These models can be used to extract, interpret, and summarize visual data for text communications. + * **Audio Processing and Interaction**: The E2B, E4B, and 12B models can analyze and interpret audio inputs, enabling voice-driven interactions and transcriptions. +* **Research and Education** + * **Natural Language Processing (NLP) and VLM Research**: These models can serve as a foundation for researchers to experiment with VLM and NLP techniques, develop algorithms, and contribute to the advancement of the field. + * **Language Learning Tools**: Support interactive language learning experiences, aiding in grammar correction or providing writing practice. + * **Knowledge Exploration**: Assist researchers in exploring large bodies of text by generating summaries or answering questions about specific topics. + +### **Limitations** + +* **Training Data** + * The quality and diversity of the training data significantly influence the model's capabilities. Biases or gaps in the training data can lead to limitations in the model's responses. + * The scope of the training dataset determines the subject areas the model can handle effectively. +* **Context and Task Complexity** + * Models perform well on tasks that can be framed with clear prompts and instructions. Open-ended or highly complex tasks might be challenging. + * A model's performance can be influenced by the amount of context provided (longer context generally leads to better outputs, up to a certain point). +* **Language Ambiguity and Nuance** + * Natural language is inherently complex. Models might struggle to grasp subtle nuances, sarcasm, or figurative language. +* **Factual Accuracy** + * Models generate responses based on information they learned from their training datasets, but they are not knowledge bases. They may generate incorrect or outdated factual statements. +* **Common Sense** + * Models rely on statistical patterns in language. They might lack the ability to apply common sense reasoning in certain situations. + +### **Ethical Considerations and Risks** + +The development of vision-language models (VLMs) raises several ethical concerns. In creating an open model, we have carefully considered the following: + +* **Bias and Fairness** + * VLMs trained on large-scale, real-world text and image data can reflect socio-cultural biases embedded in the training material. Gemma 4 models underwent careful scrutiny, input data pre-processing, and post-training evaluations as reported in this card to help mitigate the risk of these biases. +* **Misinformation and Misuse** + * VLMs can be misused to generate text that is false, misleading, or harmful. + * Guidelines are provided for responsible use with the model, see the [Responsible Generative AI Toolkit](https://ai.google.dev/responsible). +* **Transparency and Accountability** + * This model card summarizes details on the models' architecture, capabilities, limitations, and evaluation processes. + * A responsibly developed open model offers the opportunity to share innovation by making VLM technology accessible to developers and researchers across the AI ecosystem. + +**Risks identified and mitigations**: + +* **Generation of harmful content**: Mechanisms and guidelines for content safety are essential. Developers are encouraged to exercise caution and implement appropriate content safety safeguards based on their specific product policies and application use cases. +* **Misuse for malicious purposes**: Technical limitations and developer and end-user education can help mitigate against malicious applications of VLMs. Educational resources and reporting mechanisms for users to flag misuse are provided. +* **Privacy violations**: Models were trained on data filtered for removal of certain personal information and other sensitive data. Developers are encouraged to adhere to privacy regulations with privacy-preserving techniques. +* **Perpetuation of biases**: It's encouraged to perform continuous monitoring (using evaluation metrics, human review) and the exploration of de-biasing techniques during model training, fine-tuning, and other use cases. + +### **Benefits** + +At the time of release, this family of models provides high-performance open vision-language model implementations designed from the ground up for responsible AI development compared to similarly sized models. + +## Running with llama.cpp (text, vision, and audio) + +This is an omni GGUF, so the same files handle text, images, and audio. Grab any recent stock [llama.cpp](https://github.com/ggml-org/llama.cpp/releases) build and start the server. The multimodal projector (mmproj) is downloaded automatically when you use `-hf`, so you do not need to pass it yourself: + +```bash +llama-server -hf unsloth/gemma-4-12b-it-GGUF:UD-Q4_K_XL --jinja -c 8192 +# add -ngl 999 if you have a GPU build +``` + +Then query it through the OpenAI compatible API: + +```python +import json, base64, urllib.request + +def ask(content, max_tokens=256): + body = { + "messages": [{"role": "user", "content": content}], + "max_tokens": max_tokens, + # Gemma 4 is a thinking model. Set this to False (or raise max_tokens), + # otherwise the reply lands in reasoning_content and "content" is empty. + "chat_template_kwargs": {"enable_thinking": False}, + } + req = urllib.request.Request("http://127.0.0.1:8080/v1/chat/completions", + json.dumps(body).encode(), + {"Content-Type": "application/json"}) + return json.loads(urllib.request.urlopen(req).read())["choices"][0]["message"]["content"] + +b64 = lambda p: base64.b64encode(open(p, "rb").read()).decode() + +# Text +print(ask("What is 1+1?")) + +# Vision (any image file) +print(ask([ + {"type": "text", "text": "What is in this image?"}, + {"type": "image_url", "image_url": {"url": "data:image/jpeg;base64," + b64("image.jpg")}}, +])) + +# Audio (16 kHz mono WAV works best) +print(ask([ + {"type": "text", "text": "Transcribe this audio."}, + {"type": "input_audio", "input_audio": {"data": b64("audio.wav"), "format": "wav"}}, +])) +``` + +Tips: +- Pass `--jinja` so the Gemma 4 chat template is applied. +- For audio, feed a 16 kHz mono WAV (convert with `ffmpeg -i in.mp3 -ar 16000 -ac 1 out.wav`). Clean speech transcribes best. +- To force a specific projector precision add `--mmproj-url .../mmproj-F16.gguf`, or pass `--no-mmproj` to disable multimodal. diff --git a/chat/gguf/unsloth/gemma-4-12b-it-GGUF/gemma-4-12b-it-Q4_K_M.gguf b/chat/gguf/unsloth/gemma-4-12b-it-GGUF/gemma-4-12b-it-Q4_K_M.gguf new file mode 100644 index 0000000..b9a3a6c --- /dev/null +++ b/chat/gguf/unsloth/gemma-4-12b-it-GGUF/gemma-4-12b-it-Q4_K_M.gguf @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:43fec98c5102b1c446b4ddd0a9439f1db3a2e1f2e0b8cd143ce1ea619a9403d6 +size 7121860000 diff --git a/chat/gguf/unsloth/gemma-4-12b-it-GGUF/mmproj-F16.gguf b/chat/gguf/unsloth/gemma-4-12b-it-GGUF/mmproj-F16.gguf new file mode 100644 index 0000000..f9b5d2a --- /dev/null +++ b/chat/gguf/unsloth/gemma-4-12b-it-GGUF/mmproj-F16.gguf @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:91f086971e56d7a7d8d39e271873fccdb49541bd259d6e02c401a4f1cb7a219e +size 175115840 diff --git a/chat/gguf/unsloth/gemma-4-26B-A4B-it-GGUF/README.md b/chat/gguf/unsloth/gemma-4-26B-A4B-it-GGUF/README.md new file mode 100644 index 0000000..4a9834f --- /dev/null +++ b/chat/gguf/unsloth/gemma-4-26B-A4B-it-GGUF/README.md @@ -0,0 +1,546 @@ +--- +license: apache-2.0 +license_link: https://ai.google.dev/gemma/docs/gemma_4_license +pipeline_tag: image-text-to-text +base_model: google/gemma-4-26B-A4B-it +tags: +- gemma4 +- unsloth +- gemma +- google +--- +# Read our How to [Run Gemma 4 Guide!](https://docs.unsloth.ai/models/gemma-4) +
+

+ See Unsloth Dynamic 2.0 GGUFs for our quantization benchmarks. +

+
+ + + + + + + + + +
+ +
    +
  • Jun 9 Update: Added MTP support. See our MTP Guide.
  • +
  • Apr 11 Update: Re-download for Google's latest chat template and llama.cpp fixes.
  • +
  • Gemma 4 can now be run and fine-tuned in Unsloth Studio. Read our guide.
  • +
  • See all versions of Gemma 4 (GGUF, 16-bit etc.) in our collection.
  • +
  • Example of Gemma 4 E4B (4-bit GGUF) running in Unsloth Studio with tool-calling:
  • +
+
+gemma 4 in unsloth studio + +--- + +
+ +
+ + +

+ Hugging Face | + GitHub | + Launch Blog | + Documentation +
+ License: Apache 2.0 | Authors: Google DeepMind +

+ +Gemma is a family of open models built by Google DeepMind. Gemma 4 models are multimodal, handling text and image input (with audio supported on small models) and generating text output. This release includes open-weights models in both pre-trained and instruction-tuned variants. Gemma 4 features a context window of up to 256K tokens and maintains multilingual support in over 140 languages. + +Featuring both Dense and Mixture-of-Experts (MoE) architectures, Gemma 4 is well-suited for tasks like text generation, coding, and reasoning. The models are available in four distinct sizes: **E2B**, **E4B**, **26B A4B**, and **31B**. Their diverse sizes make them deployable in environments ranging from high-end phones to laptops and servers, democratizing access to state-of-the-art AI. + +Gemma 4 introduces key **capability and architectural advancements**: + +* **Reasoning** – All models in the family are designed as highly capable reasoners, with configurable thinking modes. + +* **Extended Multimodalities** – Processes Text, Image with variable aspect ratio and resolution support (all models), Video, and Audio (featured natively on the E2B and E4B models). + +* **Diverse & Efficient Architectures** – Offers Dense and Mixture-of-Experts (MoE) variants of different sizes for scalable deployment. + +* **Optimized for On-Device** – Smaller models are specifically designed for efficient local execution on laptops and mobile devices. + +* **Increased Context Window** – The small models feature a 128K context window, while the medium models support 256K. + +* **Enhanced Coding & Agentic Capabilities** – Achieves notable improvements in coding benchmarks alongside native function-calling support, powering highly capable autonomous agents. + +* **Native System Prompt Support** – Gemma 4 introduces native support for the `system` role, enabling more structured and controllable conversations. + +## **Models Overview** + +Gemma 4 models are designed to deliver frontier-level performance at each size, targeting deployment scenarios from mobile and edge devices (E2B, E4B) to consumer GPUs and workstations (26B A4B, 31B). They are well-suited for reasoning, agentic workflows, coding, and multimodal understanding. + +The models employ a hybrid attention mechanism that interleaves local sliding window attention with full global attention, ensuring the final layer is always global. This hybrid design delivers the processing speed and low memory footprint of a lightweight model without sacrificing the deep awareness required for complex, long-context tasks. To optimize memory for long contexts, global layers feature unified Keys and Values, and apply Proportional RoPE (p-RoPE). + +### Dense Models + +| Property | E2B | E4B | 31B Dense | +| :---- | :---- | :---- | :---- | +| **Total Parameters** | 2.3B effective (5.1B with embeddings) | 4.5B effective (8B with embeddings) | 30.7B | +| **Layers** | 35 | 42 | 60 | +| **Sliding Window** | 512 tokens | 512 tokens | 1024 tokens | +| **Context Length** | 128K tokens | 128K tokens | 256K tokens | +| **Vocabulary Size** | 262K | 262K | 262K | +| **Supported Modalities** | Text, Image, Audio | Text, Image, Audio | Text, Image | +| **Vision Encoder Parameters** | *~150M* | *~150M* | *~550M* | +| **Audio Encoder Parameters** | *~300M* | *~300M* | No Audio | + +The "E" in E2B and E4B stands for "effective" parameters. The smaller models incorporate Per-Layer Embeddings (PLE) to maximize parameter efficiency in on-device deployments. Rather than adding more layers or parameters to the model, PLE gives each decoder layer its own small embedding for every token. These embedding tables are large but are only used for quick lookups, which is why the effective parameter count is much smaller than the total. + +### Mixture-of-Experts (MoE) Model + +| Property | 26B A4B MoE | +| :---- | :---- | +| **Total Parameters** | 25.2B | +| **Active Parameters** | 3.8B | +| **Layers** | 30 | +| **Sliding Window** | 1024 tokens | +| **Context Length** | 256K tokens | +| **Vocabulary Size** | 262K | +| **Expert Count** | 8 active / 128 total and 1 shared | +| **Supported Modalities** | Text, Image | +| **Vision Encoder Parameters** | *~550M* | + +The "A" in 26B A4B stands for "active parameters" in contrast to the total number of parameters the model contains. By only activating a 4B subset of parameters during inference, the Mixture-of-Experts model runs much faster than its 26B total might suggest. This makes it an excellent choice for fast inference compared to the dense 31B model since it runs almost as fast as a 4B-parameter model. + +## **Benchmark Results** + +These models were evaluated against a large collection of different datasets and metrics to cover different aspects of text generation. Evaluation results marked in the table are for instruction-tuned models. + +| | Gemma 4 31B | Gemma 4 26B A4B | Gemma 4 E4B | Gemma 4 E2B | Gemma 3 27B (no think) | +| :---- | :---- | :---- | :---- | :---- | :---- | +| MMLU Pro | 85.2% | 82.6% | 69.4% | 60.0% | 67.6% | +| AIME 2026 no tools | 89.2% | 88.3% | 42.5% | 37.5% | 20.8% | +| LiveCodeBench v6 | 80.0% | 77.1% | 52.0% | 44.0% | 29.1% | +| Codeforces ELO | 2150 | 1718 | 940 | 633 | 110 | +| GPQA Diamond | 84.3% | 82.3% | 58.6% | 43.4% | 42.4% | +| Tau2 (average over 3) | 76.9% | 68.2% | 42.2% | 24.5% | 16.2% | +| HLE no tools | 19.5% | 8.7% | - | - | - | +| HLE with search | 26.5% | 17.2% | - | - | - | +| BigBench Extra Hard | 74.4% | 64.8% | 33.1% | 21.9% | 19.3% | +| MMMLU | 88.4% | 86.3% | 76.6% | 67.4% | 70.7% | +| **Vision** | | | | | | +| MMMU Pro | 76.9% | 73.8% | 52.6% | 44.2% | 49.7% | +| OmniDocBench 1.5 (average edit distance, lower is better) | 0.131 | 0.149 | 0.181 | 0.290 | 0.365 | +| MATH-Vision | 85.6% | 82.4% | 59.5% | 52.4% | 46.0% | +| MedXPertQA MM | 61.3% | 58.1% | 28.7% | 23.5% | - | +| **Audio** | | | | | | +| CoVoST | - | - | 35.54 | 33.47 | - | +| FLEURS (lower is better) | - | - | 0.08 | 0.09 | - | +| **Long Context** | | | | | | +| MRCR v2 8 needle 128k (average) | 66.4% | 44.1% | 25.4% | 19.1% | 13.5% | + +## **Core Capabilities** + +Gemma 4 models handle a broad range of tasks across text, vision, and audio. Key capabilities include: + +* **Thinking** – Built-in reasoning mode that lets the model think step-by-step before answering. +* **Long Context** – Context windows of up to 128K tokens (E2B/E4B) and 256K tokens (26B A4B/31B). +* **Image Understanding** – Object detection, Document/PDF parsing, screen and UI understanding, chart comprehension, OCR (including multilingual), handwriting recognition, and pointing. Images can be processed at variable aspect ratios and resolutions. +* **Video Understanding** – Analyze video by processing sequences of frames. +* **Interleaved Multimodal Input** – Freely mix text and images in any order within a single prompt. +* **Function Calling** – Native support for structured tool use, enabling agentic workflows. +* **Coding** – Code generation, completion, and correction. +* **Multilingual** – Out-of-the-box support for 35+ languages, pre-trained on 140+ languages. +* **Audio** (E2B and E4B only) – Automatic speech recognition (ASR) and speech-to-translated-text translation across multiple languages. + +## Getting Started + +You can use all Gemma 4 models with the latest version of Transformers. To get started, install the necessary dependencies in your environment: + +`pip install -U transformers torch accelerate` + +Once you have everything installed, you can proceed to load the model with the code below: + +```python +from transformers import AutoProcessor, AutoModelForCausalLM + +MODEL_ID = "google/gemma-4-26B-A4B-it" + +# Load model +processor = AutoProcessor.from_pretrained(MODEL_ID) +model = AutoModelForCausalLM.from_pretrained( + MODEL_ID, + dtype="auto", + device_map="auto" +) +``` + +Once the model is loaded, you can start generating output: + +```python +# Prompt +messages = [ + {"role": "system", "content": "You are a helpful assistant."}, + {"role": "user", "content": "Write a short joke about saving RAM."}, +] + +# Process input +text = processor.apply_chat_template( + messages, + tokenize=False, + add_generation_prompt=True, + enable_thinking=False +) +inputs = processor(text=text, return_tensors="pt").to(model.device) +input_len = inputs["input_ids"].shape[-1] + +# Generate output +outputs = model.generate(**inputs, max_new_tokens=1024) +response = processor.decode(outputs[0][input_len:], skip_special_tokens=False) + +# Parse output +processor.parse_response(response) +``` + +To enable reasoning, set `enable_thinking=True` and the `parse_response` function will take care of parsing the thinking output. + +Below, you will also find snippets for processing audio (E2B and E4B only), images, and video alongside text: + +
+Code for processing Audio + +Instead of using `AutoModelForCausalLM`, you can use `AutoModelForMultimodalLM` to process audio. To use it, make sure to install the following packages: + + +`pip install -U transformers torch librosa accelerate` + +You can then load the model with the code below: + +```python +from transformers import AutoProcessor, AutoModelForMultimodalLM + +MODEL_ID = "google/gemma-4-E2B-it" + +# Load model +processor = AutoProcessor.from_pretrained(MODEL_ID) +model = AutoModelForMultimodalLM.from_pretrained( + MODEL_ID, + dtype="auto", + device_map="auto" +) +``` + +Once the model is loaded, you can start generating output by directly referencing the audio URL in the prompt: + + +```python +# Prompt - add audio before text +messages = [ + { + "role": "user", + "content": [ + {"type": "audio", "audio": "https://raw.githubusercontent.com/google-gemma/cookbook/refs/heads/main/Demos/sample-data/journal1.wav"}, + {"type": "text", "text": "Transcribe the following speech segment in its original language. Follow these specific instructions for formatting the answer:\n* Only output the transcription, with no newlines.\n* When transcribing numbers, write the digits, i.e. write 1.7 and not one point seven, and write 3 instead of three."}, + ] + } +] + +# Process input +inputs = processor.apply_chat_template( + messages, + tokenize=True, + return_dict=True, + return_tensors="pt", + add_generation_prompt=True, +).to(model.device) +input_len = inputs["input_ids"].shape[-1] + +# Generate output +outputs = model.generate(**inputs, max_new_tokens=512) +response = processor.decode(outputs[0][input_len:], skip_special_tokens=False) + +# Parse output +processor.parse_response(response) +``` + +
+ +
+Code for processing Images + +Instead of using `AutoModelForCausalLM`, you can use `AutoModelForMultimodalLM` to process images. To use it, make sure to install the following packages: + + +`pip install -U transformers torch torchvision accelerate` + +You can then load the model with the code below: + +```python +from transformers import AutoProcessor, AutoModelForMultimodalLM + +MODEL_ID = "google/gemma-4-26B-A4B-it" + +# Load model +processor = AutoProcessor.from_pretrained(MODEL_ID) +model = AutoModelForMultimodalLM.from_pretrained( + MODEL_ID, + dtype="auto", + device_map="auto" +) +``` + +Once the model is loaded, you can start generating output by directly referencing the image URL in the prompt: + + +```python +# Prompt - add image before text +messages = [ + { + "role": "user", "content": [ + {"type": "image", "url": "https://raw.githubusercontent.com/google-gemma/cookbook/refs/heads/main/Demos/sample-data/GoldenGate.png"}, + {"type": "text", "text": "What is shown in this image?"} + ] + } +] + +# Process input +inputs = processor.apply_chat_template( + messages, + tokenize=True, + return_dict=True, + return_tensors="pt", + add_generation_prompt=True, +).to(model.device) +input_len = inputs["input_ids"].shape[-1] + +# Generate output +outputs = model.generate(**inputs, max_new_tokens=512) +response = processor.decode(outputs[0][input_len:], skip_special_tokens=False) + +# Parse output +processor.parse_response(response) +``` + +
+ + +
+Code for processing Videos + +Instead of using `AutoModelForCausalLM`, you can use `AutoModelForMultimodalLM` to process videos. To use it, make sure to install the following packages: + +`pip install -U transformers torch torchvision torchcodec librosa accelerate` + +You can then load the model with the code below: + +```python +from transformers import AutoProcessor, AutoModelForMultimodalLM + +MODEL_ID = "google/gemma-4-26B-A4B-it" + +# Load model +processor = AutoProcessor.from_pretrained(MODEL_ID) +model = AutoModelForMultimodalLM.from_pretrained( + MODEL_ID, + dtype="auto", + device_map="auto" +) +``` + +Once the model is loaded, you can start generating output by directly referencing the video URL in the prompt: + + +```python +# Prompt - add video before text +messages = [ + { + 'role': 'user', + 'content': [ + {"type": "video", "video": "https://github.com/bebechien/gemma/raw/refs/heads/main/videos/ForBiggerBlazes.mp4"}, + {'type': 'text', 'text': 'Describe this video.'} + ] + } +] + +# Process input +inputs = processor.apply_chat_template( + messages, + tokenize=True, + return_dict=True, + return_tensors="pt", + add_generation_prompt=True, +).to(model.device) +input_len = inputs["input_ids"].shape[-1] + +# Generate output +outputs = model.generate(**inputs, max_new_tokens=512) +response = processor.decode(outputs[0][input_len:], skip_special_tokens=False) + +# Parse output +processor.parse_response(response) +``` + +
+ + +## **Best Practices** + +For the best performance, use these configurations and best practices: + +### 1. Sampling Parameters + +Use the following standardized sampling configuration across all use cases: + +* `temperature=1.0` +* `top_p=0.95` +* `top_k=64` + +### 2. Thinking Mode Configuration + +Compared to Gemma 3, the models use standard `system`, `assistant`, and `user` roles. To properly manage the thinking process, use the following control tokens: + +* **Trigger Thinking:** Thinking is enabled by including the `<|think|>` token at the start of the system prompt. To disable thinking, remove the token. +* **Standard Generation:** When thinking is enabled, the model will output its internal reasoning followed by the final answer using this structure: + `<|channel>thought\n`**[Internal reasoning]**`` +* **Disabled Thinking Behavior:** For all models except for the E2B and E4B variants, if thinking is disabled, the model will still generate the tags but with an empty thought block: + `<|channel>thought\n`**[Final answer]** + +> [!Note] +> Note that many libraries like Transformers and llama.cpp handle the complexities of the chat template for you. + +### 3. Multi-Turn Conversations + +* **No Thinking Content in History**: In multi-turn conversations, the historical model output should only include the final response. Thoughts from previous model turns must *not be added* before the next user turn begins. + +### 4. Modality order + +* For optimal performance with multimodal inputs, place image and/or audio content **before** the text in your prompt. + +### 5. Variable Image Resolution + +Aside from variable aspect ratios, Gemma 4 supports variable image resolution through a configurable visual token budget, which controls how many tokens are used to represent an image. A higher token budget preserves more visual detail at the cost of additional compute, while a lower budget enables faster inference for tasks that don't require fine-grained understanding. + +* The supported token budgets are: **70**, **140**, **280**, **560**, and **1120**. + * Use *lower budgets* for classification, captioning, or video understanding, where faster inference and processing many frames outweigh fine-grained detail. + * Use *higher budgets* for tasks like OCR, document parsing, or reading small text. + +### 6. Audio + +Use the following prompt structures for audio processing: + +* **Audio Speech Recognition (ASR)** + +```text +Transcribe the following speech segment in {LANGUAGE} into {LANGUAGE} text. + +Follow these specific instructions for formatting the answer: +* Only output the transcription, with no newlines. +* When transcribing numbers, write the digits, i.e. write 1.7 and not one point seven, and write 3 instead of three. +``` + +* **Automatic Speech Translation (AST)** + +```text +Transcribe the following speech segment in {SOURCE_LANGUAGE}, then translate it into {TARGET_LANGUAGE}. +When formatting the answer, first output the transcription in {SOURCE_LANGUAGE}, then one newline, then output the string '{TARGET_LANGUAGE}: ', then the translation in {TARGET_LANGUAGE}. +``` + +### 7. Audio and Video Length + +All models support image inputs and can process videos as frames whereas the E2B and E4B models also support audio inputs. Audio supports a maximum length of 30 seconds. Video supports a maximum of 60 seconds assuming the images are processed at one frame per second. + +## **Model Data** + +Data used for model training and how the data was processed. + +### **Training Dataset** + +Our pre-training dataset is a large-scale, diverse collection of data encompassing a wide range of domains and modalities, which includes web documents, code, images, audio, with a cutoff date of January 2025. Here are the key components: + +* **Web Documents**: A diverse collection of web text ensures the model is exposed to a broad range of linguistic styles, topics, and vocabulary. The training dataset includes content in over 140 languages. +* **Code**: Exposing the model to code helps it to learn the syntax and patterns of programming languages, which improves its ability to generate code and understand code-related questions. +* **Mathematics**: Training on mathematical text helps the model learn logical reasoning, symbolic representation, and to address mathematical queries. +* **Images**: A wide range of images enables the model to perform image analysis and visual data extraction tasks. + +The combination of these diverse data sources is crucial for training a powerful multimodal model that can handle a wide variety of different tasks and data formats. + +### **Data Preprocessing** + +Here are the key data cleaning and filtering methods applied to the training data: + +* **CSAM Filtering**: Rigorous CSAM (Child Sexual Abuse Material) filtering was applied at multiple stages in the data preparation process to ensure the exclusion of harmful and illegal content. +* **Sensitive Data Filtering**: As part of making Gemma pre-trained models safe and reliable, automated techniques were used to filter out certain personal information and other sensitive data from training sets. +* **Additional methods**: Filtering based on content quality and safety in line with [our policies](https://ai.google/static/documents/ai-responsibility-update-published-february-2025.pdf). + +## **Ethics and Safety** + +As open models become central to enterprise infrastructure, provenance and security are paramount. Developed by Google DeepMind, Gemma 4 undergoes the same rigorous safety evaluations as our proprietary Gemini models. + +### **Evaluation Approach** + +Gemma 4 models were developed in partnership with internal safety and responsible AI teams. A range of automated as well as human evaluations were conducted to help improve model safety. These evaluations align with [Google’s AI principles](https://ai.google/principles/), as well as safety policies, which aim to prevent our generative AI models from generating harmful content, including: + +* Content related to child sexual abuse material and exploitation +* Dangerous content (e.g., promoting suicide, or instructing in activities that could cause real-world harm) +* Sexually explicit content +* Hate speech (e.g., dehumanizing members of protected groups) +* Harassment (e.g., encouraging violence against people) + +### **Evaluation Results** + +For all areas of safety testing, we saw major improvements in all categories of content safety relative to previous Gemma models. Overall, Gemma 4 models significantly outperform Gemma 3 and 3n models in improving safety, while keeping unjustified refusals low. All testing was conducted without safety filters to evaluate the model capabilities and behaviors. For both text-to-text and image-to-text, and across all model sizes, the model produced minimal policy violations, and showed significant improvements over previous Gemma models' performance. + +## **Usage and Limitations** + +These models have certain limitations that users should be aware of. + +### **Intended Usage** + +Multimodal models (capable of processing vision, language, and/or audio) have a wide range of applications across various industries and domains. The following list of potential uses is not comprehensive. The purpose of this list is to provide contextual information about the possible use-cases that the model creators considered as part of model training and development. + +* **Content Creation and Communication** + * **Text Generation**: These models can be used to generate creative text formats such as poems, scripts, code, marketing copy, and email drafts. + * **Chatbots and Conversational AI**: Power conversational interfaces for customer service, virtual assistants, or interactive applications. + * **Text Summarization**: Generate concise summaries of a text corpus, research papers, or reports. + * **Image Data Extraction**: These models can be used to extract, interpret, and summarize visual data for text communications. + * **Audio Processing and Interaction**: The smaller models (E2B and E4B) can analyze and interpret audio inputs, enabling voice-driven interactions and transcriptions. +* **Research and Education** + * **Natural Language Processing (NLP) and VLM Research**: These models can serve as a foundation for researchers to experiment with VLM and NLP techniques, develop algorithms, and contribute to the advancement of the field. + * **Language Learning Tools**: Support interactive language learning experiences, aiding in grammar correction or providing writing practice. + * **Knowledge Exploration**: Assist researchers in exploring large bodies of text by generating summaries or answering questions about specific topics. + +### **Limitations** + +* **Training Data** + * The quality and diversity of the training data significantly influence the model's capabilities. Biases or gaps in the training data can lead to limitations in the model's responses. + * The scope of the training dataset determines the subject areas the model can handle effectively. +* **Context and Task Complexity** + * Models perform well on tasks that can be framed with clear prompts and instructions. Open-ended or highly complex tasks might be challenging. + * A model's performance can be influenced by the amount of context provided (longer context generally leads to better outputs, up to a certain point). +* **Language Ambiguity and Nuance** + * Natural language is inherently complex. Models might struggle to grasp subtle nuances, sarcasm, or figurative language. +* **Factual Accuracy** + * Models generate responses based on information they learned from their training datasets, but they are not knowledge bases. They may generate incorrect or outdated factual statements. +* **Common Sense** + * Models rely on statistical patterns in language. They might lack the ability to apply common sense reasoning in certain situations. + +### **Ethical Considerations and Risks** + +The development of vision-language models (VLMs) raises several ethical concerns. In creating an open model, we have carefully considered the following: + +* **Bias and Fairness** + * VLMs trained on large-scale, real-world text and image data can reflect socio-cultural biases embedded in the training material. Gemma 4 models underwent careful scrutiny, input data pre-processing, and post-training evaluations as reported in this card to help mitigate the risk of these biases. +* **Misinformation and Misuse** + * VLMs can be misused to generate text that is false, misleading, or harmful. + * Guidelines are provided for responsible use with the model, see the [Responsible Generative AI Toolkit](https://ai.google.dev/responsible). +* **Transparency and Accountability** + * This model card summarizes details on the models' architecture, capabilities, limitations, and evaluation processes. + * A responsibly developed open model offers the opportunity to share innovation by making VLM technology accessible to developers and researchers across the AI ecosystem. + +**Risks identified and mitigations**: + +* **Generation of harmful content**: Mechanisms and guidelines for content safety are essential. Developers are encouraged to exercise caution and implement appropriate content safety safeguards based on their specific product policies and application use cases. +* **Misuse for malicious purposes**: Technical limitations and developer and end-user education can help mitigate against malicious applications of VLMs. Educational resources and reporting mechanisms for users to flag misuse are provided. +* **Privacy violations**: Models were trained on data filtered for removal of certain personal information and other sensitive data. Developers are encouraged to adhere to privacy regulations with privacy-preserving techniques. +* **Perpetuation of biases**: It's encouraged to perform continuous monitoring (using evaluation metrics, human review) and the exploration of de-biasing techniques during model training, fine-tuning, and other use cases. + +### **Benefits** + +At the time of release, this family of models provides high-performance open vision-language model implementations designed from the ground up for responsible AI development compared to similarly sized models. diff --git a/chat/gguf/unsloth/gemma-4-26B-A4B-it-GGUF/config.json b/chat/gguf/unsloth/gemma-4-26B-A4B-it-GGUF/config.json new file mode 100644 index 0000000..4e3ad9a --- /dev/null +++ b/chat/gguf/unsloth/gemma-4-26B-A4B-it-GGUF/config.json @@ -0,0 +1,145 @@ +{ + "architectures": [ + "Gemma4ForConditionalGeneration" + ], + "audio_config": null, + "audio_token_id": 258881, + "boa_token_id": 256000, + "boi_token_id": 255999, + "torch_dtype": "bfloat16", + "eoa_token_id": 258883, + "eoa_token_index": 258883, + "eoi_token_id": 258882, + "eos_token_id": 106, + "image_token_id": 258880, + "initializer_range": 0.02, + "model_type": "gemma4", + "pad_token_id": 0, + "text_config": { + "attention_bias": false, + "attention_dropout": 0.0, + "attention_k_eq_v": true, + "bos_token_id": 2, + "torch_dtype": "bfloat16", + "enable_moe_block": true, + "eos_token_id": 1, + "final_logit_softcapping": 30.0, + "global_head_dim": 512, + "head_dim": 256, + "hidden_activation": "gelu_pytorch_tanh", + "hidden_size": 2816, + "hidden_size_per_layer_input": 0, + "initializer_range": 0.02, + "intermediate_size": 2112, + "layer_types": [ + "sliding_attention", + "sliding_attention", + "sliding_attention", + "sliding_attention", + "sliding_attention", + "full_attention", + "sliding_attention", + "sliding_attention", + "sliding_attention", + "sliding_attention", + "sliding_attention", + "full_attention", + "sliding_attention", + "sliding_attention", + "sliding_attention", + "sliding_attention", + "sliding_attention", + "full_attention", + "sliding_attention", + "sliding_attention", + "sliding_attention", + "sliding_attention", + "sliding_attention", + "full_attention", + "sliding_attention", + "sliding_attention", + "sliding_attention", + "sliding_attention", + "sliding_attention", + "full_attention" + ], + "max_position_embeddings": 262144, + "model_type": "gemma4_text", + "moe_intermediate_size": 704, + "num_attention_heads": 16, + "num_experts": 128, + "num_global_key_value_heads": 2, + "num_hidden_layers": 30, + "num_key_value_heads": 8, + "num_kv_shared_layers": 0, + "pad_token_id": 0, + "rms_norm_eps": 1e-06, + "rope_parameters": { + "full_attention": { + "partial_rotary_factor": 0.25, + "rope_theta": 1000000.0, + "rope_type": "proportional" + }, + "sliding_attention": { + "rope_theta": 10000.0, + "rope_type": "default" + } + }, + "sliding_window": 1024, + "tie_word_embeddings": true, + "top_k_experts": 8, + "use_bidirectional_attention": "vision", + "use_cache": true, + "use_double_wide_mlp": false, + "vocab_size": 262144, + "vocab_size_per_layer_input": 262144 + }, + "tie_word_embeddings": true, + "transformers_version": "5.5.0.dev0", + "unsloth_fixed": true, + "video_token_id": 258884, + "vision_config": { + "_name_or_path": "", + "architectures": null, + "attention_bias": false, + "attention_dropout": 0.0, + "chunk_size_feed_forward": 0, + "default_output_length": 280, + "torch_dtype": "bfloat16", + "global_head_dim": 72, + "head_dim": 72, + "hidden_activation": "gelu_pytorch_tanh", + "hidden_size": 1152, + "id2label": { + "0": "LABEL_0", + "1": "LABEL_1" + }, + "initializer_range": 0.02, + "intermediate_size": 4304, + "is_encoder_decoder": false, + "label2id": { + "LABEL_0": 0, + "LABEL_1": 1 + }, + "max_position_embeddings": 131072, + "model_type": "gemma4_vision", + "num_attention_heads": 16, + "num_hidden_layers": 27, + "num_key_value_heads": 16, + "output_attentions": false, + "output_hidden_states": false, + "patch_size": 16, + "pooling_kernel_size": 3, + "position_embedding_size": 10240, + "problem_type": null, + "return_dict": true, + "rms_norm_eps": 1e-06, + "rope_parameters": { + "rope_theta": 100.0, + "rope_type": "default" + }, + "standardize": true, + "use_clipped_linears": false + }, + "vision_soft_tokens_per_image": 280 +} \ No newline at end of file diff --git a/chat/gguf/unsloth/gemma-4-26B-A4B-it-GGUF/gemma-4-26B-A4B-it-UD-Q4_K_M.gguf b/chat/gguf/unsloth/gemma-4-26B-A4B-it-GGUF/gemma-4-26B-A4B-it-UD-Q4_K_M.gguf new file mode 100644 index 0000000..bb1f42a --- /dev/null +++ b/chat/gguf/unsloth/gemma-4-26B-A4B-it-GGUF/gemma-4-26B-A4B-it-UD-Q4_K_M.gguf @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:34c746b1d50ab813e29cd46c4796e3f43c741901a582f93a67b55b9fc9687b35 +size 16947539744 diff --git a/chat/gguf/unsloth/gemma-4-26B-A4B-it-GGUF/mmproj-F16.gguf b/chat/gguf/unsloth/gemma-4-26B-A4B-it-GGUF/mmproj-F16.gguf new file mode 100644 index 0000000..2eaa43f --- /dev/null +++ b/chat/gguf/unsloth/gemma-4-26B-A4B-it-GGUF/mmproj-F16.gguf @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:418a6d8723067cd712235facbbc5cba6c8fbbd413fc1292d2aace5a027d5a42f +size 1193058784 diff --git a/chat/gguf/unsloth/gemma-4-E2B-it-qat-mobile-GGUF/README.md b/chat/gguf/unsloth/gemma-4-E2B-it-qat-mobile-GGUF/README.md new file mode 100644 index 0000000..95ed566 --- /dev/null +++ b/chat/gguf/unsloth/gemma-4-E2B-it-qat-mobile-GGUF/README.md @@ -0,0 +1,578 @@ +--- +library_name: transformers +license: apache-2.0 +license_link: https://ai.google.dev/gemma/docs/gemma_4_license +pipeline_tag: any-to-any +base_model: google/gemma-4-E2B-it-qat-mobile-transformers +tags: +- gemma4 +- unsloth +- gemma +- google +--- +# Read our How to [Run Gemma 4 QAT Guide!](https://unsloth.ai/docs/models/gemma-4/qat) +
+

+ See Unsloth Dynamic 2.0 GGUFs for our quantization benchmarks. +

+ + +
    +
  • Jun 9 Update: Added MTP support. See our MTP Guide.
  • +
  • Gemma 4 can now be run and fine-tuned in Unsloth Studio. Read our guide.
  • +
  • See all versions of Gemma 4 QAT (GGUF, 16-bit etc.) in our collection.
  • +
  • Example of Gemma 4 E4B (4-bit GGUF) running in Unsloth Studio with tool-calling:
  • +
+
+gemma 4 in unsloth studio + + +![image](https://cdn-uploads.huggingface.co/production/uploads/62ecdc18b72a69615d6bd857/2zCR4ZmVXSTqKaj7vNIYo.png) + +## Run with MTP (speculative decoding) + +This model ships a Multi-Token Prediction drafter at the repo root (`mtp-gemma-4-E2B-it.gguf`, a near-lossless smart Q4_0). A recent llama.cpp auto-discovers it from `-hf`, so you do not pass `--model-draft`: + +```bash +./build/bin/llama-server \ + -hf unsloth/gemma-4-E2B-it-qat-mobile-GGUF:UD-Q2_K_XL \ + --spec-type draft-mtp --spec-draft-n-max 4 \ + -ngl 999 -fa on +``` + +The drafter shares the target's KV cache and does not change the output (the target verifies every drafted token). See the `MTP/` folder for the other precisions and explicit usage. + + +
+ +
+ + +

+ Hugging Face | + GitHub | + Launch Blog | + Documentation +
+ License: Apache 2.0 | Authors: Google DeepMind +

+ +> [!Note] +> This model card is for the new versions of the Gemma 4 family optimized with Quantization-Aware Training (QAT), which allows preserving similar quality to bfloat16 while dramatically reducing the memory requirements to load the model. +> Four versions of the QAT checkpoints are available: +> * **Unquantized QAT checkpoints** (Q4_0): Half-precision weights extracted from the QAT pipeline, ideal for custom downstream compilation and research. Available for Gemma 4 E2B, E4B, 12B, 26B A4B, and 31B, and their drafter models. +> * **GGUF** (Q4_0): Ready-to-deploy formats for broad ecosystem compatibility. Available for Gemma 4 E2B, E4B, 12B, 26B A4B, and 31B. +> * **Mobile-optimized** (wNa8o8): A custom schema engineered explicitly for mobile hardware efficiency. It features targeted 2-bit decoding layers, optimized KV caches, and static activations to maximize VRAM savings. Available for Gemma 4 E2B and E4B. +> * **Compressed Tensors** (w4a16): QAT checkpoints serialized in the compressed-tensors format for native, optimized inference with vLLM. Available for Gemma 4 E2B, E4B, 12B, and 31B. + +Gemma is a family of open models built by Google DeepMind. Gemma 4 models are multimodal, handling text and image input (with audio supported on E2B, E4B, and 12B) and generating text output. This release includes open-weights models in both pre-trained and instruction-tuned variants. Gemma 4 features a context window of up to 256K tokens and maintains multilingual support in over 140 languages. + +Featuring both Dense and Mixture-of-Experts (MoE) architectures, Gemma 4 is well-suited for tasks like text generation, coding, and reasoning. The models are available in five distinct sizes: **E2B**, **E4B**, **12B**, **26B A4B**, and **31B**. Their diverse sizes make them deployable in environments ranging from high-end phones to laptops and servers, democratizing access to state-of-the-art AI. + +Gemma 4 introduces key **capability and architectural advancements**: + +* **Reasoning** – All models in the family are designed as highly capable reasoners, with configurable thinking modes. + +* **Extended Multimodalities** – Processes Text, Image with variable aspect ratio and resolution support (all models), Video, and Audio (featured natively on the E2B, E4B, and 12B models). + +* **Diverse & Efficient Architectures** – Offers Dense and Mixture-of-Experts (MoE) variants of different sizes for scalable deployment. + +* **Optimized for On-Device** – Smaller models are specifically designed for efficient local execution on laptops and mobile devices. + +* **Increased Context Window** – The small models feature a 128K context window, while the medium models support 256K. + +* **Enhanced Coding & Agentic Capabilities** – Achieves notable improvements in coding benchmarks alongside native function-calling support, powering highly capable autonomous agents. + +* **Native System Prompt Support** – Gemma 4 introduces native support for the `system` role, enabling more structured and controllable conversations. + +## **Models Overview** + +Gemma 4 models are designed to deliver frontier-level performance at each size, targeting deployment scenarios from mobile and edge devices (E2B, E4B) to consumer GPUs and workstations (12B, 26B A4B, 31B). They are well-suited for reasoning, agentic workflows, coding, and multimodal understanding. + +The models employ a hybrid attention mechanism that interleaves local sliding window attention with full global attention, ensuring the final layer is always global. This hybrid design delivers the processing speed and low memory footprint of a lightweight model without sacrificing the deep awareness required for complex, long-context tasks. To optimize memory for long contexts, global layers feature unified Keys and Values, and apply Proportional RoPE (p-RoPE). + +### Dense Models + +| Property | E2B | E4B | 12B Unified | 31B Dense | +| :---- | :---- | :---- | :---- | :---- | +| **Total Parameters** | 2.3B effective
(5.1B with embeddings) | 4.5B effective
(8B with embeddings) | 11.95B | 30.7B | +| **Layers** | 35 | 42 | 48 | 60 | +| **Sliding Window** | 512 tokens | 512 tokens | 1024 tokens | 1024 tokens | +| **Context Length** | 128K tokens | 128K tokens | 256K tokens | 256K tokens | +| **Vocabulary Size** | 262K | 262K | 262K | 262K | +| **Supported Modalities** | Text, Image, Audio | Text, Image, Audio | Text, Image, Audio | Text, Image | +| **Vision Encoder Parameters** | *~150M* | *~150M* | - | *~550M* | +| **Audio Encoder Parameters** | *~300M* | *~300M* | - | No Audio | + +The "E" in E2B and E4B stands for "effective" parameters. The smaller models incorporate Per-Layer Embeddings (PLE) to maximize parameter efficiency in on-device deployments. Rather than adding more layers or parameters to the model, PLE gives each decoder layer its own small embedding for every token. These embedding tables are large but are only used for quick lookups, which is why the effective parameter count is much smaller than the total. + +The "Unified" in Gemma 4 12B Unified refers to its encoder-free architecture. Other Gemma 4 models use dedicated encoders to process multimodal data before passing it to the LLM. Gemma 4 12B eliminates these encoders entirely, projecting raw image patches and audio waveforms directly into the LLM's embedding space through lightweight linear layers. This unified approach means all modalities flow straight into a single decoder-only transformer, reducing multimodal latency and allowing the entire model to be fine-tuned in one pass. + +### Mixture-of-Experts (MoE) Model + +| Property | 26B A4B MoE | +| :---- | :---- | +| **Total Parameters** | 25.2B | +| **Active Parameters** | 3.8B | +| **Layers** | 30 | +| **Sliding Window** | 1024 tokens | +| **Context Length** | 256K tokens | +| **Vocabulary Size** | 262K | +| **Expert Count** | 8 active / 128 total and 1 shared | +| **Supported Modalities** | Text, Image | +| **Vision Encoder Parameters** | *~550M* | + +The "A" in 26B A4B stands for "active parameters" in contrast to the total number of parameters the model contains. By only activating a 4B subset of parameters during inference, the Mixture-of-Experts model runs much faster than its 26B total might suggest. This makes it an excellent choice for fast inference compared to the dense 31B model since it runs almost as fast as a 4B-parameter model. + +## **Benchmark Results** + +These models were evaluated against a large collection of different datasets and metrics to cover different aspects of text generation. Evaluation results marked in the table are for instruction-tuned models. + +| | Gemma 4 31B | Gemma 4 26B A4B | Gemma 4 12B Unified | Gemma 4 E4B | Gemma 4 E2B | Gemma 3 27B (no think) | +| :---- | :---- | :---- | :---- | :---- | :---- | :---- | +| MMLU Pro | 85.2% | 82.6% | 77.2% | 69.4% | 60.0% | 67.6% | +| AIME 2026 no tools | 89.2% | 88.3% | 77.5% | 42.5% | 37.5% | 20.8% | +| LiveCodeBench v6 | 80.0% | 77.1% | 72.0% | 52.0% | 44.0% | 29.1% | +| Codeforces ELO | 2150 | 1718 | 1659 | 940 | 633 | 110 | +| GPQA Diamond | 84.3% | 82.3% | 78.8% | 58.6% | 43.4% | 42.4% | +| Tau2 (average over 3) | 76.9% | 68.2% | 69.0% | 42.2% | 24.5% | 16.2% | +| HLE no tools | 19.5% | 8.7% | 5.2% | - | - | - | +| HLE with search | 26.5% | 17.2% | - | - | - | - | +| BigBench Extra Hard | 74.4% | 64.8% | 53.0% | 33.1% | 21.9% | 19.3% | +| MMMLU | 88.4% | 86.3% | 83.4% | 76.6% | 67.4% | 70.7% | +| **Vision** | | | | | | | +| MMMU Pro | 76.9% | 73.8% | 69.1% | 52.6% | 44.2% | 49.7% | +| OmniDocBench 1.5 (average edit distance, lower is better) | 0.131 | 0.149 | 0.164 | 0.181 | 0.290 | 0.365 | +| MATH-Vision | 85.6% | 82.4% | 79.7% | 59.5% | 52.4% | 46.0% | +| MedXPertQA MM | 61.3% | 58.1% | 48.7% | 28.7% | 23.5% | - | +| **Audio** | | | | | | | +| CoVoST | - | - | 38.5* | 35.54 | 33.47 | - | +| FLEURS (lower is better) | - | - | 0.069* | 0.08 | 0.09 | - | +| **Long Context** | | | | | | | +| MRCR v2 8 needle 128k (average) | 66.4% | 44.1% | 43.4% | 25.4% | 19.1% | 13.5% | + +*Excluding Chinese language. + +## **Core Capabilities** + +Gemma 4 models handle a broad range of tasks across text, vision, and audio. Key capabilities include: + +* **Thinking** – Built-in reasoning mode that lets the model think step-by-step before answering. +* **Long Context** – Context windows of up to 128K tokens (E2B/E4B) and 256K tokens (12B, 26B A4B/31B). +* **Image Understanding** – Object detection, Document/PDF parsing, screen and UI understanding, chart comprehension, OCR (including multilingual), handwriting recognition, and pointing. Images can be processed at variable aspect ratios and resolutions. +* **Video Understanding** – Analyze video by processing sequences of frames. +* **Interleaved Multimodal Input** – Freely mix text and images in any order within a single prompt. +* **Function Calling** – Native support for structured tool use, enabling agentic workflows. +* **Coding** – Code generation, completion, and correction. +* **Multilingual** – Out-of-the-box support for 35+ languages, pre-trained on 140+ languages. +* **Audio** (E2B, E4B, and 12B only) – Automatic speech recognition (ASR) and speech-to-translated-text translation across multiple languages. + + +## Getting Started + +You can use all Gemma 4 models with the latest version of Transformers. To get started, install the necessary dependencies in your environment: + +`pip install -U transformers torch accelerate` + +Once you have everything installed, you can proceed to load the model with the code below: + +```python +from transformers import AutoProcessor, AutoModelForMultimodalLM + +MODEL_ID = "google/gemma-4-12B-it" + +# Load model +processor = AutoProcessor.from_pretrained(MODEL_ID) +model = AutoModelForMultimodalLM.from_pretrained( + MODEL_ID, + dtype="auto", + device_map="auto" +) +``` + +Once the model is loaded, you can start generating output: + +```python +# Prompt +messages = [ + {"role": "system", "content": "You are a helpful assistant."}, + {"role": "user", "content": "Write a short joke about saving RAM."}, +] + +# Process input +inputs = processor.apply_chat_template( + messages, + tokenize=True, + return_dict=True, + return_tensors="pt", + add_generation_prompt=True, + enable_thinking=False +).to(model.device) +input_len = inputs["input_ids"].shape[-1] + +# Generate output +outputs = model.generate(**inputs, max_new_tokens=1024) +response = processor.decode(outputs[0][input_len:], skip_special_tokens=False) + +# Parse output +processor.parse_response(response) +``` + +To enable reasoning, set `enable_thinking=True` and the `parse_response` function will take care of parsing the thinking output. + +Below, you will also find snippets for processing audio (E2B, E4B, 12B only), images, and video alongside text: + +
+Code for processing Audio + +Make sure to install the following packages: + +`pip install -U transformers torch torchvision librosa accelerate` + +You can then load the model with the code below: + +```python +from transformers import AutoProcessor, AutoModelForMultimodalLM + +MODEL_ID = "google/gemma-4-12B-it" + +# Load model +processor = AutoProcessor.from_pretrained(MODEL_ID) +model = AutoModelForMultimodalLM.from_pretrained( + MODEL_ID, + dtype="auto", + device_map="auto" +) +``` + +Once the model is loaded, you can start generating output by directly referencing the audio URL in the prompt: + + +```python +# Prompt - add audio after text +messages = [ + { + "role": "user", + "content": [ + {"type": "text", "text": "Transcribe the following speech segment in its original language. Follow these specific instructions for formatting the answer:\n* Only output the transcription, with no newlines.\n* When transcribing numbers, write the digits, i.e. write 1.7 and not one point seven, and write 3 instead of three."}, + {"type": "audio", "audio": "https://raw.githubusercontent.com/google-gemma/cookbook/refs/heads/main/apps/sample-data/journal1.wav"}, + ] + } +] + +# Process input +inputs = processor.apply_chat_template( + messages, + tokenize=True, + return_dict=True, + return_tensors="pt", + add_generation_prompt=True, +).to(model.device) +input_len = inputs["input_ids"].shape[-1] + +# Generate output +outputs = model.generate(**inputs, max_new_tokens=512) +response = processor.decode(outputs[0][input_len:], skip_special_tokens=False) + +# Parse output +processor.parse_response(response) +``` + +
+ +
+Code for processing Images + +Make sure to install the following packages: + + +`pip install -U transformers torch torchvision accelerate` + +You can then load the model with the code below: + +```python +from transformers import AutoProcessor, AutoModelForMultimodalLM + +MODEL_ID = "google/gemma-4-12B-it" + +# Load model +processor = AutoProcessor.from_pretrained(MODEL_ID) +model = AutoModelForMultimodalLM.from_pretrained( + MODEL_ID, + dtype="auto", + device_map="auto" +) +``` + +Once the model is loaded, you can start generating output by directly referencing the image URL in the prompt: + + +```python +# Prompt - add image before text +messages = [ + { + "role": "user", "content": [ + {"type": "image", "url": "https://raw.githubusercontent.com/google-gemma/cookbook/refs/heads/main/apps/sample-data/GoldenGate.png"}, + {"type": "text", "text": "What is shown in this image?"} + ] + } +] + +# Process input +inputs = processor.apply_chat_template( + messages, + tokenize=True, + return_dict=True, + return_tensors="pt", + add_generation_prompt=True, +).to(model.device) +input_len = inputs["input_ids"].shape[-1] + +# Generate output +outputs = model.generate(**inputs, max_new_tokens=512) +response = processor.decode(outputs[0][input_len:], skip_special_tokens=False) + +# Parse output +processor.parse_response(response) +``` + +
+ + +
+Code for processing Videos + +Make sure to install the following packages: + +`pip install -U transformers torch torchvision librosa accelerate` + +You can then load the model with the code below: + +```python +from transformers import AutoProcessor, AutoModelForMultimodalLM + +MODEL_ID = "google/gemma-4-12B-it" + +# Load model +processor = AutoProcessor.from_pretrained(MODEL_ID) +model = AutoModelForMultimodalLM.from_pretrained( + MODEL_ID, + dtype="auto", + device_map="auto" +) +``` + +Once the model is loaded, you can start generating output by directly referencing the video URL in the prompt: + + +```python +# Prompt - add video before text +messages = [ + { + 'role': 'user', + 'content': [ + {"type": "video", "video": "https://github.com/bebechien/gemma/raw/refs/heads/main/videos/ForBiggerBlazes.mp4"}, + {'type': 'text', 'text': 'Describe this video.'} + ] + } +] + +# Process input +inputs = processor.apply_chat_template( + messages, + tokenize=True, + return_dict=True, + return_tensors="pt", + add_generation_prompt=True, +).to(model.device) +input_len = inputs["input_ids"].shape[-1] + +# Generate output +outputs = model.generate(**inputs, max_new_tokens=512) +response = processor.decode(outputs[0][input_len:], skip_special_tokens=False) + +# Parse output +processor.parse_response(response) +``` + +
+ + + +## **Best Practices** + +For the best performance, use these configurations and best practices: + +### 1. Sampling Parameters + +Use the following standardized sampling configuration across all use cases: + +* `temperature=1.0` +* `top_p=0.95` +* `top_k=64` + +### 2. Thinking Mode Configuration + +Compared to Gemma 3, the models use standard `system`, `assistant`, and `user` roles. To properly manage the thinking process, use the following control tokens: + +* **Trigger Thinking:** Thinking is enabled by including the `<|think|>` token at the start of the system prompt. To disable thinking, remove the token. +* **Standard Generation:** When thinking is enabled, the model will output its internal reasoning followed by the final answer using this structure: + `<|channel>thought\n`**[Internal reasoning]**`` +* **Disabled Thinking Behavior:** For all models except for the E2B and E4B variants, if thinking is disabled, the model will still generate the tags but with an empty thought block: + `<|channel>thought\n`**[Final answer]** + +> [!Note] +> Note that many libraries like Transformers and llama.cpp handle the complexities of the chat template for you. + +### 3. Multi-Turn Conversations + +* **No Thinking Content in History**: In multi-turn conversations, the historical model output should only include the final response. Thoughts from previous model turns must *not be added* before the next user turn begins. + +### 4. Modality order + +For optimal performance with multimodal inputs, place: + +* Image content **before** the text in your prompt. +* Audio content **after** the text in your prompt. + +### 5. Variable Image Resolution + +Aside from variable aspect ratios, Gemma 4 supports variable image resolution through a configurable visual token budget, which controls how many tokens are used to represent an image. A higher token budget preserves more visual detail at the cost of additional compute, while a lower budget enables faster inference for tasks that don't require fine-grained understanding. + +* The supported token budgets are: **70**, **140**, **280**, **560**, and **1120**. + * Use *lower budgets* for classification, captioning, or video understanding, where faster inference and processing many frames outweigh fine-grained detail. + * Use *higher budgets* for tasks like OCR, document parsing, or reading small text. + +### 6. Audio + +Use the following prompt structures for audio processing: + +* **Audio Speech Recognition (ASR)** + +```text +Transcribe the following speech segment in {LANGUAGE} into {LANGUAGE} text. + +Follow these specific instructions for formatting the answer: +* Only output the transcription, with no newlines. +* When transcribing numbers, write the digits, i.e. write 1.7 and not one point seven, and write 3 instead of three. +``` + +* **Automatic Speech Translation (AST)** + +```text +Transcribe the following speech segment in {SOURCE_LANGUAGE}, then translate it into {TARGET_LANGUAGE}. +When formatting the answer, first output the transcription in {SOURCE_LANGUAGE}, then one newline, then output the string '{TARGET_LANGUAGE}: ', then the translation in {TARGET_LANGUAGE}. +``` + +### 7. Audio and Video Length + +All models support image inputs and can process videos as frames whereas the E2B, E4B, and 12B models also support audio inputs. Audio supports a maximum length of 30 seconds. Video supports a maximum of 60 seconds assuming the images are processed at one frame per second. + +## **Model Data** + +Data used for model training and how the data was processed. + +### **Training Dataset** + +Our pre-training dataset is a large-scale, diverse collection of data encompassing a wide range of domains and modalities, which includes web documents, code, images, audio, with a cutoff date of January 2025. Here are the key components: + +* **Web Documents**: A diverse collection of web text ensures the model is exposed to a broad range of linguistic styles, topics, and vocabulary. The training dataset includes content in over 140 languages. +* **Code**: Exposing the model to code helps it to learn the syntax and patterns of programming languages, which improves its ability to generate code and understand code-related questions. +* **Mathematics**: Training on mathematical text helps the model learn logical reasoning, symbolic representation, and to address mathematical queries. +* **Images**: A wide range of images enables the model to perform image analysis and visual data extraction tasks. + +The combination of these diverse data sources is crucial for training a powerful multimodal model that can handle a wide variety of different tasks and data formats. + +### **Data Preprocessing** + +Here are the key data cleaning and filtering methods applied to the training data: + +* **CSAM Filtering**: Rigorous CSAM (Child Sexual Abuse Material) filtering was applied at multiple stages in the data preparation process to ensure the exclusion of harmful and illegal content. +* **Sensitive Data Filtering**: As part of making Gemma pre-trained models safe and reliable, automated techniques were used to filter out certain personal information and other sensitive data from training sets. +* **Additional methods**: Filtering based on content quality and safety in line with [our policies](https://ai.google/static/documents/ai-responsibility-update-published-february-2025.pdf). + +## **Ethics and Safety** + +As open models become central to enterprise infrastructure, provenance and security are paramount. Developed by Google DeepMind, Gemma 4 undergoes the same rigorous safety evaluations as our proprietary Gemini models. + +### **Evaluation Approach** + +Gemma 4 models were developed in partnership with internal safety and responsible AI teams. A range of automated as well as human evaluations were conducted to help improve model safety. These evaluations align with [Google’s AI principles](https://ai.google/principles/), as well as safety policies, which aim to prevent our generative AI models from generating harmful content, including: + +* Content related to child sexual abuse material and exploitation +* Dangerous content (e.g., promoting suicide, or instructing in activities that could cause real-world harm) +* Sexually explicit content +* Hate speech (e.g., dehumanizing members of protected groups) +* Harassment (e.g., encouraging violence against people) + +### **Evaluation Results** + +For all areas of safety testing, we saw major improvements in all categories of content safety relative to previous Gemma models. Overall, Gemma 4 models significantly outperform Gemma 3 and 3n models in improving safety, while keeping unjustified refusals low. All testing was conducted without safety filters to evaluate the model capabilities and behaviors. For both text-to-text and image-to-text, and across all model sizes, the model produced minimal policy violations, and showed significant improvements over previous Gemma models' performance. + +## **Usage and Limitations** + +These models have certain limitations that users should be aware of. + +### **Intended Usage** + +Multimodal models (capable of processing vision, language, and/or audio) have a wide range of applications across various industries and domains. The following list of potential uses is not comprehensive. The purpose of this list is to provide contextual information about the possible use-cases that the model creators considered as part of model training and development. + +* **Content Creation and Communication** + * **Text Generation**: These models can be used to generate creative text formats such as poems, scripts, code, marketing copy, and email drafts. + * **Chatbots and Conversational AI**: Power conversational interfaces for customer service, virtual assistants, or interactive applications. + * **Text Summarization**: Generate concise summaries of a text corpus, research papers, or reports. + * **Image Data Extraction**: These models can be used to extract, interpret, and summarize visual data for text communications. + * **Audio Processing and Interaction**: The E2B, E4B, and 12B models can analyze and interpret audio inputs, enabling voice-driven interactions and transcriptions. +* **Research and Education** + * **Natural Language Processing (NLP) and VLM Research**: These models can serve as a foundation for researchers to experiment with VLM and NLP techniques, develop algorithms, and contribute to the advancement of the field. + * **Language Learning Tools**: Support interactive language learning experiences, aiding in grammar correction or providing writing practice. + * **Knowledge Exploration**: Assist researchers in exploring large bodies of text by generating summaries or answering questions about specific topics. + +### **Limitations** + +* **Training Data** + * The quality and diversity of the training data significantly influence the model's capabilities. Biases or gaps in the training data can lead to limitations in the model's responses. + * The scope of the training dataset determines the subject areas the model can handle effectively. +* **Context and Task Complexity** + * Models perform well on tasks that can be framed with clear prompts and instructions. Open-ended or highly complex tasks might be challenging. + * A model's performance can be influenced by the amount of context provided (longer context generally leads to better outputs, up to a certain point). +* **Language Ambiguity and Nuance** + * Natural language is inherently complex. Models might struggle to grasp subtle nuances, sarcasm, or figurative language. +* **Factual Accuracy** + * Models generate responses based on information they learned from their training datasets, but they are not knowledge bases. They may generate incorrect or outdated factual statements. +* **Common Sense** + * Models rely on statistical patterns in language. They might lack the ability to apply common sense reasoning in certain situations. + +### **Ethical Considerations and Risks** + +The development of vision-language models (VLMs) raises several ethical concerns. In creating an open model, we have carefully considered the following: + +* **Bias and Fairness** + * VLMs trained on large-scale, real-world text and image data can reflect socio-cultural biases embedded in the training material. Gemma 4 models underwent careful scrutiny, input data pre-processing, and post-training evaluations as reported in this card to help mitigate the risk of these biases. +* **Misinformation and Misuse** + * VLMs can be misused to generate text that is false, misleading, or harmful. + * Guidelines are provided for responsible use with the model, see the [Responsible Generative AI Toolkit](https://ai.google.dev/responsible). +* **Transparency and Accountability** + * This model card summarizes details on the models' architecture, capabilities, limitations, and evaluation processes. + * A responsibly developed open model offers the opportunity to share innovation by making VLM technology accessible to developers and researchers across the AI ecosystem. + +**Risks identified and mitigations**: + +* **Generation of harmful content**: Mechanisms and guidelines for content safety are essential. Developers are encouraged to exercise caution and implement appropriate content safety safeguards based on their specific product policies and application use cases. +* **Misuse for malicious purposes**: Technical limitations and developer and end-user education can help mitigate against malicious applications of VLMs. Educational resources and reporting mechanisms for users to flag misuse are provided. +* **Privacy violations**: Models were trained on data filtered for removal of certain personal information and other sensitive data. Developers are encouraged to adhere to privacy regulations with privacy-preserving techniques. +* **Perpetuation of biases**: It's encouraged to perform continuous monitoring (using evaluation metrics, human review) and the exploration of de-biasing techniques during model training, fine-tuning, and other use cases. + +### **Benefits** + +At the time of release, this family of models provides high-performance open vision-language model implementations designed from the ground up for responsible AI development compared to similarly sized models. \ No newline at end of file diff --git a/chat/gguf/unsloth/gemma-4-E2B-it-qat-mobile-GGUF/config.json b/chat/gguf/unsloth/gemma-4-E2B-it-qat-mobile-GGUF/config.json new file mode 100644 index 0000000..df45a92 --- /dev/null +++ b/chat/gguf/unsloth/gemma-4-E2B-it-qat-mobile-GGUF/config.json @@ -0,0 +1,190 @@ +{ + "architectures": [ + "Gemma4ForConditionalGeneration" + ], + "audio_config": { + "_name_or_path": "", + "architectures": null, + "attention_chunk_size": 12, + "attention_context_left": 13, + "attention_context_right": 0, + "attention_invalid_logits_value": -1000000000.0, + "attention_logit_cap": 50.0, + "chunk_size_feed_forward": 0, + "conv_kernel_size": 5, + "torch_dtype": "bfloat16", + "gradient_clipping": 10000000000.0, + "hidden_act": "silu", + "hidden_size": 1024, + "id2label": { + "0": "LABEL_0", + "1": "LABEL_1" + }, + "initializer_range": 0.02, + "is_encoder_decoder": false, + "label2id": { + "LABEL_0": 0, + "LABEL_1": 1 + }, + "model_type": "gemma4_audio", + "num_attention_heads": 8, + "num_hidden_layers": 12, + "output_attentions": false, + "output_hidden_states": false, + "output_proj_dims": 1536, + "problem_type": null, + "residual_weight": 0.5, + "return_dict": true, + "rms_norm_eps": 1e-06, + "subsampling_conv_channels": [ + 128, + 32 + ], + "use_clipped_linears": true + }, + "audio_token_id": 258881, + "boa_token_id": 256000, + "boi_token_id": 255999, + "torch_dtype": "bfloat16", + "eoa_token_id": 258883, + "eoa_token_index": 258883, + "eoi_token_id": 258882, + "eos_token_id": 106, + "image_token_id": 258880, + "initializer_range": 0.02, + "model_type": "gemma4", + "pad_token_id": 0, + "text_config": { + "attention_bias": false, + "attention_dropout": 0.0, + "attention_k_eq_v": false, + "bos_token_id": 2, + "torch_dtype": "bfloat16", + "enable_moe_block": false, + "eos_token_id": 1, + "expert_intermediate_size": null, + "final_logit_softcapping": 30.0, + "global_head_dim": 512, + "head_dim": 256, + "hidden_activation": "gelu_pytorch_tanh", + "hidden_size": 1536, + "hidden_size_per_layer_input": 256, + "initializer_range": 0.02, + "intermediate_size": 6144, + "layer_types": [ + "sliding_attention", + "sliding_attention", + "sliding_attention", + "sliding_attention", + "full_attention", + "sliding_attention", + "sliding_attention", + "sliding_attention", + "sliding_attention", + "full_attention", + "sliding_attention", + "sliding_attention", + "sliding_attention", + "sliding_attention", + "full_attention", + "sliding_attention", + "sliding_attention", + "sliding_attention", + "sliding_attention", + "full_attention", + "sliding_attention", + "sliding_attention", + "sliding_attention", + "sliding_attention", + "full_attention", + "sliding_attention", + "sliding_attention", + "sliding_attention", + "sliding_attention", + "full_attention", + "sliding_attention", + "sliding_attention", + "sliding_attention", + "sliding_attention", + "full_attention" + ], + "max_position_embeddings": 131072, + "model_type": "gemma4_text", + "moe_intermediate_size": null, + "num_attention_heads": 8, + "num_experts": null, + "num_global_key_value_heads": null, + "num_hidden_layers": 35, + "num_key_value_heads": 1, + "num_kv_shared_layers": 20, + "pad_token_id": 0, + "rms_norm_eps": 1e-06, + "rope_parameters": { + "full_attention": { + "partial_rotary_factor": 0.25, + "rope_theta": 1000000.0, + "rope_type": "proportional" + }, + "sliding_attention": { + "rope_theta": 10000.0, + "rope_type": "default" + } + }, + "sliding_window": 512, + "tie_word_embeddings": true, + "top_k_experts": null, + "use_bidirectional_attention": null, + "use_cache": true, + "use_double_wide_mlp": true, + "vocab_size": 262144, + "vocab_size_per_layer_input": 262144 + }, + "tie_word_embeddings": true, + "transformers_version": "5.5.0.dev0", + "unsloth_fixed": true, + "video_token_id": 258884, + "vision_config": { + "_name_or_path": "", + "architectures": null, + "attention_bias": false, + "attention_dropout": 0.0, + "chunk_size_feed_forward": 0, + "default_output_length": 280, + "torch_dtype": "bfloat16", + "global_head_dim": 64, + "head_dim": 64, + "hidden_activation": "gelu_pytorch_tanh", + "hidden_size": 768, + "id2label": { + "0": "LABEL_0", + "1": "LABEL_1" + }, + "initializer_range": 0.02, + "intermediate_size": 3072, + "is_encoder_decoder": false, + "label2id": { + "LABEL_0": 0, + "LABEL_1": 1 + }, + "max_position_embeddings": 131072, + "model_type": "gemma4_vision", + "num_attention_heads": 12, + "num_hidden_layers": 16, + "num_key_value_heads": 12, + "output_attentions": false, + "output_hidden_states": false, + "patch_size": 16, + "pooling_kernel_size": 3, + "position_embedding_size": 10240, + "problem_type": null, + "return_dict": true, + "rms_norm_eps": 1e-06, + "rope_parameters": { + "rope_theta": 100.0, + "rope_type": "default" + }, + "standardize": false, + "use_clipped_linears": true + }, + "vision_soft_tokens_per_image": 280 +} \ No newline at end of file diff --git a/chat/gguf/unsloth/gemma-4-E2B-it-qat-mobile-GGUF/gemma-4-E2B-it-qat-UD-Q2_K_XL.gguf b/chat/gguf/unsloth/gemma-4-E2B-it-qat-mobile-GGUF/gemma-4-E2B-it-qat-UD-Q2_K_XL.gguf new file mode 100644 index 0000000..73017be --- /dev/null +++ b/chat/gguf/unsloth/gemma-4-E2B-it-qat-mobile-GGUF/gemma-4-E2B-it-qat-UD-Q2_K_XL.gguf @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:8279c8b153490e400831e89fc8162348911dfbe3c70d22055c70abaa9b05a0b4 +size 2186184768 diff --git a/chat/gguf/unsloth/gemma-4-E2B-it-qat-mobile-GGUF/mmproj-F16.gguf b/chat/gguf/unsloth/gemma-4-E2B-it-qat-mobile-GGUF/mmproj-F16.gguf new file mode 100644 index 0000000..8967093 --- /dev/null +++ b/chat/gguf/unsloth/gemma-4-E2B-it-qat-mobile-GGUF/mmproj-F16.gguf @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:13c8966d1635d02e6727f27402880614906fa291850c07feda18dbcddf2291b6 +size 985654080 diff --git a/chat/gguf/unsloth/gemma-4-E4B-it-GGUF/README.md b/chat/gguf/unsloth/gemma-4-E4B-it-GGUF/README.md new file mode 100644 index 0000000..70091cc --- /dev/null +++ b/chat/gguf/unsloth/gemma-4-E4B-it-GGUF/README.md @@ -0,0 +1,548 @@ +--- +license: apache-2.0 +license_link: https://ai.google.dev/gemma/docs/gemma_4_license +pipeline_tag: image-text-to-text +base_model: google/gemma-4-E4B-it +tags: +- gemma4 +- unsloth +- gemma +- google +--- +# Read our How to [Run Gemma 4 Guide!](https://docs.unsloth.ai/models/gemma-4) +
+

+ See Unsloth Dynamic 2.0 GGUFs for our quantization benchmarks. +

+ + +
    +
  • Jun 9 Update: Added MTP support. See our MTP Guide.
  • +
  • Apr 11 Update: Re-download for Google's latest chat template and llama.cpp fixes.
  • +
  • Gemma 4 can now be run and fine-tuned in Unsloth Studio. Read our guide.
  • +
  • See all versions of Gemma 4 (GGUF, 16-bit etc.) in our collection.
  • +
  • Example of Gemma 4 E4B (4-bit GGUF) running in Unsloth Studio with tool-calling:
  • +
+
+gemma 4 in unsloth studio + +--- + +
+ +
+ + +

+ Hugging Face | + GitHub | + Launch Blog | + Documentation +
+ License: Apache 2.0 | Authors: Google DeepMind +

+ +Gemma is a family of open models built by Google DeepMind. Gemma 4 models are multimodal, handling text and image input (with audio supported on small models) and generating text output. This release includes open-weights models in both pre-trained and instruction-tuned variants. Gemma 4 features a context window of up to 256K tokens and maintains multilingual support in over 140 languages. + +Featuring both Dense and Mixture-of-Experts (MoE) architectures, Gemma 4 is well-suited for tasks like text generation, coding, and reasoning. The models are available in four distinct sizes: **E2B**, **E4B**, **26B A4B**, and **31B**. Their diverse sizes make them deployable in environments ranging from high-end phones to laptops and servers, democratizing access to state-of-the-art AI. + +Gemma 4 introduces key **capability and architectural advancements**: + +* **Reasoning** – All models in the family are designed as highly capable reasoners, with configurable thinking modes. + +* **Extended Multimodalities** – Processes Text, Image with variable aspect ratio and resolution support (all models), Video, and Audio (featured natively on the E2B and E4B models). + +* **Diverse & Efficient Architectures** – Offers Dense and Mixture-of-Experts (MoE) variants of different sizes for scalable deployment. + +* **Optimized for On-Device** – Smaller models are specifically designed for efficient local execution on laptops and mobile devices. + +* **Increased Context Window** – The small models feature a 128K context window, while the medium models support 256K. + +* **Enhanced Coding & Agentic Capabilities** – Achieves notable improvements in coding benchmarks alongside native function-calling support, powering highly capable autonomous agents. + +* **Native System Prompt Support** – Gemma 4 introduces native support for the `system` role, enabling more structured and controllable conversations. + +## **Models Overview** + +Gemma 4 models are designed to deliver frontier-level performance at each size, targeting deployment scenarios from mobile and edge devices (E2B, E4B) to consumer GPUs and workstations (26B A4B, 31B). They are well-suited for reasoning, agentic workflows, coding, and multimodal understanding. + +The models employ a hybrid attention mechanism that interleaves local sliding window attention with full global attention, ensuring the final layer is always global. This hybrid design delivers the processing speed and low memory footprint of a lightweight model without sacrificing the deep awareness required for complex, long-context tasks. To optimize memory for long contexts, global layers feature unified Keys and Values, and apply Proportional RoPE (p-RoPE). + +### Dense Models + +| Property | E2B | E4B | 31B Dense | +| :---- | :---- | :---- | :---- | +| **Total Parameters** | 2.3B effective (5.1B with embeddings) | 4.5B effective (8B with embeddings) | 30.7B | +| **Layers** | 35 | 42 | 60 | +| **Sliding Window** | 512 tokens | 512 tokens | 1024 tokens | +| **Context Length** | 128K tokens | 128K tokens | 256K tokens | +| **Vocabulary Size** | 262K | 262K | 262K | +| **Supported Modalities** | Text, Image, Audio | Text, Image, Audio | Text, Image | +| **Vision Encoder Parameters** | *~150M* | *~150M* | *~550M* | +| **Audio Encoder Parameters** | *~300M* | *~300M* | No Audio | + +The "E" in E2B and E4B stands for "effective" parameters. The smaller models incorporate Per-Layer Embeddings (PLE) to maximize parameter efficiency in on-device deployments. Rather than adding more layers or parameters to the model, PLE gives each decoder layer its own small embedding for every token. These embedding tables are large but are only used for quick lookups, which is why the effective parameter count is much smaller than the total. + +### Mixture-of-Experts (MoE) Model + +| Property | 26B A4B MoE | +| :---- | :---- | +| **Total Parameters** | 25.2B | +| **Active Parameters** | 3.8B | +| **Layers** | 30 | +| **Sliding Window** | 1024 tokens | +| **Context Length** | 256K tokens | +| **Vocabulary Size** | 262K | +| **Expert Count** | 8 active / 128 total and 1 shared | +| **Supported Modalities** | Text, Image | +| **Vision Encoder Parameters** | *~550M* | + +The "A" in 26B A4B stands for "active parameters" in contrast to the total number of parameters the model contains. By only activating a 4B subset of parameters during inference, the Mixture-of-Experts model runs much faster than its 26B total might suggest. This makes it an excellent choice for fast inference compared to the dense 31B model since it runs almost as fast as a 4B-parameter model. + +## **Benchmark Results** + +These models were evaluated against a large collection of different datasets and metrics to cover different aspects of text generation. Evaluation results marked in the table are for instruction-tuned models. + +| | Gemma 4 31B | Gemma 4 26B A4B | Gemma 4 E4B | Gemma 4 E2B | Gemma 3 27B (no think) | +| :---- | :---- | :---- | :---- | :---- | :---- | +| MMLU Pro | 85.2% | 82.6% | 69.4% | 60.0% | 67.6% | +| AIME 2026 no tools | 89.2% | 88.3% | 42.5% | 37.5% | 20.8% | +| LiveCodeBench v6 | 80.0% | 77.1% | 52.0% | 44.0% | 29.1% | +| Codeforces ELO | 2150 | 1718 | 940 | 633 | 110 | +| GPQA Diamond | 84.3% | 82.3% | 58.6% | 43.4% | 42.4% | +| Tau2 (average over 3) | 76.9% | 68.2% | 42.2% | 24.5% | 16.2% | +| HLE no tools | 19.5% | 8.7% | - | - | - | +| HLE with search | 26.5% | 17.2% | - | - | - | +| BigBench Extra Hard | 74.4% | 64.8% | 33.1% | 21.9% | 19.3% | +| MMMLU | 88.4% | 86.3% | 76.6% | 67.4% | 70.7% | +| **Vision** | | | | | | +| MMMU Pro | 76.9% | 73.8% | 52.6% | 44.2% | 49.7% | +| OmniDocBench 1.5 (average edit distance, lower is better) | 0.131 | 0.149 | 0.181 | 0.290 | 0.365 | +| MATH-Vision | 85.6% | 82.4% | 59.5% | 52.4% | 46.0% | +| MedXPertQA MM | 61.3% | 58.1% | 28.7% | 23.5% | - | +| **Audio** | | | | | | +| CoVoST | - | - | 35.54 | 33.47 | - | +| FLEURS (lower is better) | - | - | 0.08 | 0.09 | - | +| **Long Context** | | | | | | +| MRCR v2 8 needle 128k (average) | 66.4% | 44.1% | 25.4% | 19.1% | 13.5% | + +## **Core Capabilities** + +Gemma 4 models handle a broad range of tasks across text, vision, and audio. Key capabilities include: + +* **Thinking** – Built-in reasoning mode that lets the model think step-by-step before answering. +* **Long Context** – Context windows of up to 128K tokens (E2B/E4B) and 256K tokens (26B A4B/31B). +* **Image Understanding** – Object detection, Document/PDF parsing, screen and UI understanding, chart comprehension, OCR (including multilingual), handwriting recognition, and pointing. Images can be processed at variable aspect ratios and resolutions. +* **Video Understanding** – Analyze video by processing sequences of frames. +* **Interleaved Multimodal Input** – Freely mix text and images in any order within a single prompt. +* **Function Calling** – Native support for structured tool use, enabling agentic workflows. +* **Coding** – Code generation, completion, and correction. +* **Multilingual** – Out-of-the-box support for 35+ languages, pre-trained on 140+ languages. +* **Audio** (E2B and E4B only) – Automatic speech recognition (ASR) and speech-to-translated-text translation across multiple languages. + + +## Getting Started + +You can use all Gemma 4 models with the latest version of Transformers. To get started, install the necessary dependencies in your environment: + +`pip install -U transformers torch accelerate` + +Once you have everything installed, you can proceed to load the model with the code below: + +```python +from transformers import AutoProcessor, AutoModelForCausalLM + +MODEL_ID = "google/gemma-4-E4B-it" + +# Load model +processor = AutoProcessor.from_pretrained(MODEL_ID) +model = AutoModelForCausalLM.from_pretrained( + MODEL_ID, + dtype="auto", + device_map="auto" +) +``` + +Once the model is loaded, you can start generating output: + +```python +# Prompt +messages = [ + {"role": "system", "content": "You are a helpful assistant."}, + {"role": "user", "content": "Write a short joke about saving RAM."}, +] + +# Process input +text = processor.apply_chat_template( + messages, + tokenize=False, + add_generation_prompt=True, + enable_thinking=False +) +inputs = processor(text=text, return_tensors="pt").to(model.device) +input_len = inputs["input_ids"].shape[-1] + +# Generate output +outputs = model.generate(**inputs, max_new_tokens=1024) +response = processor.decode(outputs[0][input_len:], skip_special_tokens=False) + +# Parse output +processor.parse_response(response) +``` + +To enable reasoning, set `enable_thinking=True` and the `parse_response` function will take care of parsing the thinking output. + +Below, you will also find snippets for processing audio (E2B and E4B only), images, and video alongside text: + +
+Code for processing Audio + +Instead of using `AutoModelForCausalLM`, you can use `AutoModelForMultimodalLM` to process audio. To use it, make sure to install the following packages: + + +`pip install -U transformers torch torchvision librosa accelerate` + +You can then load the model with the code below: + +```python +from transformers import AutoProcessor, AutoModelForMultimodalLM + +MODEL_ID = "google/gemma-4-E4B-it" + +# Load model +processor = AutoProcessor.from_pretrained(MODEL_ID) +model = AutoModelForMultimodalLM.from_pretrained( + MODEL_ID, + dtype="auto", + device_map="auto" +) +``` + +Once the model is loaded, you can start generating output by directly referencing the audio URL in the prompt: + + +```python +# Prompt - add audio before text +messages = [ + { + "role": "user", + "content": [ + {"type": "audio", "audio": "https://raw.githubusercontent.com/google-gemma/cookbook/refs/heads/main/Demos/sample-data/journal1.wav"}, + {"type": "text", "text": "Transcribe the following speech segment in its original language. Follow these specific instructions for formatting the answer:\n* Only output the transcription, with no newlines.\n* When transcribing numbers, write the digits, i.e. write 1.7 and not one point seven, and write 3 instead of three."}, + ] + } +] + +# Process input +inputs = processor.apply_chat_template( + messages, + tokenize=True, + return_dict=True, + return_tensors="pt", + add_generation_prompt=True, +).to(model.device) +input_len = inputs["input_ids"].shape[-1] + +# Generate output +outputs = model.generate(**inputs, max_new_tokens=512) +response = processor.decode(outputs[0][input_len:], skip_special_tokens=False) + +# Parse output +processor.parse_response(response) +``` + +
+ +
+Code for processing Images + +Instead of using `AutoModelForCausalLM`, you can use `AutoModelForMultimodalLM` to process images. To use it, make sure to install the following packages: + + +`pip install -U transformers torch torchvision accelerate` + +You can then load the model with the code below: + +```python +from transformers import AutoProcessor, AutoModelForMultimodalLM + +MODEL_ID = "google/gemma-4-E4B-it" + +# Load model +processor = AutoProcessor.from_pretrained(MODEL_ID) +model = AutoModelForMultimodalLM.from_pretrained( + MODEL_ID, + dtype="auto", + device_map="auto" +) +``` + +Once the model is loaded, you can start generating output by directly referencing the image URL in the prompt: + + +```python +# Prompt - add image before text +messages = [ + { + "role": "user", "content": [ + {"type": "image", "url": "https://raw.githubusercontent.com/google-gemma/cookbook/refs/heads/main/Demos/sample-data/GoldenGate.png"}, + {"type": "text", "text": "What is shown in this image?"} + ] + } +] + +# Process input +inputs = processor.apply_chat_template( + messages, + tokenize=True, + return_dict=True, + return_tensors="pt", + add_generation_prompt=True, +).to(model.device) +input_len = inputs["input_ids"].shape[-1] + +# Generate output +outputs = model.generate(**inputs, max_new_tokens=512) +response = processor.decode(outputs[0][input_len:], skip_special_tokens=False) + +# Parse output +processor.parse_response(response) +``` + +
+ + +
+Code for processing Videos + +Instead of using `AutoModelForCausalLM`, you can use `AutoModelForMultimodalLM` to process videos. To use it, make sure to install the following packages: + +`pip install -U transformers torch torchvision librosa accelerate` + +You can then load the model with the code below: + +```python +from transformers import AutoProcessor, AutoModelForMultimodalLM + +MODEL_ID = "google/gemma-4-E4B-it" + +# Load model +processor = AutoProcessor.from_pretrained(MODEL_ID) +model = AutoModelForMultimodalLM.from_pretrained( + MODEL_ID, + dtype="auto", + device_map="auto" +) +``` + +Once the model is loaded, you can start generating output by directly referencing the video URL in the prompt: + + +```python +# Prompt - add video before text +messages = [ + { + 'role': 'user', + 'content': [ + {"type": "video", "video": "https://github.com/bebechien/gemma/raw/refs/heads/main/videos/ForBiggerBlazes.mp4"}, + {'type': 'text', 'text': 'Describe this video.'} + ] + } +] + +# Process input +inputs = processor.apply_chat_template( + messages, + tokenize=True, + return_dict=True, + return_tensors="pt", + add_generation_prompt=True, +).to(model.device) +input_len = inputs["input_ids"].shape[-1] + +# Generate output +outputs = model.generate(**inputs, max_new_tokens=512) +response = processor.decode(outputs[0][input_len:], skip_special_tokens=False) + +# Parse output +processor.parse_response(response) +``` + +
+ + + +## **Best Practices** + +For the best performance, use these configurations and best practices: + +### 1. Sampling Parameters + +Use the following standardized sampling configuration across all use cases: + +* `temperature=1.0` +* `top_p=0.95` +* `top_k=64` + +### 2. Thinking Mode Configuration + +Compared to Gemma 3, the models use standard `system`, `assistant`, and `user` roles. To properly manage the thinking process, use the following control tokens: + +* **Trigger Thinking:** Thinking is enabled by including the `<|think|>` token at the start of the system prompt. To disable thinking, remove the token. +* **Standard Generation:** When thinking is enabled, the model will output its internal reasoning followed by the final answer using this structure: + `<|channel>thought\n`**[Internal reasoning]**`` +* **Disabled Thinking Behavior:** For all models except for the E2B and E4B variants, if thinking is disabled, the model will still generate the tags but with an empty thought block: + `<|channel>thought\n`**[Final answer]** + +> [!Note] +> Note that many libraries like Transformers and llama.cpp handle the complexities of the chat template for you. + +### 3. Multi-Turn Conversations + +* **No Thinking Content in History**: In multi-turn conversations, the historical model output should only include the final response. Thoughts from previous model turns must *not be added* before the next user turn begins. + +### 4. Modality order + +* For optimal performance with multimodal inputs, place image and/or audio content **before** the text in your prompt. + +### 5. Variable Image Resolution + +Aside from variable aspect ratios, Gemma 4 supports variable image resolution through a configurable visual token budget, which controls how many tokens are used to represent an image. A higher token budget preserves more visual detail at the cost of additional compute, while a lower budget enables faster inference for tasks that don't require fine-grained understanding. + +* The supported token budgets are: **70**, **140**, **280**, **560**, and **1120**. + * Use *lower budgets* for classification, captioning, or video understanding, where faster inference and processing many frames outweigh fine-grained detail. + * Use *higher budgets* for tasks like OCR, document parsing, or reading small text. + +### 6. Audio + +Use the following prompt structures for audio processing: + +* **Audio Speech Recognition (ASR)** + +```text +Transcribe the following speech segment in {LANGUAGE} into {LANGUAGE} text. + +Follow these specific instructions for formatting the answer: +* Only output the transcription, with no newlines. +* When transcribing numbers, write the digits, i.e. write 1.7 and not one point seven, and write 3 instead of three. +``` + +* **Automatic Speech Translation (AST)** + +```text +Transcribe the following speech segment in {SOURCE_LANGUAGE}, then translate it into {TARGET_LANGUAGE}. +When formatting the answer, first output the transcription in {SOURCE_LANGUAGE}, then one newline, then output the string '{TARGET_LANGUAGE}: ', then the translation in {TARGET_LANGUAGE}. +``` + +### 7. Audio and Video Length + +All models support image inputs and can process videos as frames whereas the E2B and E4B models also support audio inputs. Audio supports a maximum length of 30 seconds. Video supports a maximum of 60 seconds assuming the images are processed at one frame per second. + +## **Model Data** + +Data used for model training and how the data was processed. + +### **Training Dataset** + +Our pre-training dataset is a large-scale, diverse collection of data encompassing a wide range of domains and modalities, which includes web documents, code, images, audio, with a cutoff date of January 2025. Here are the key components: + +* **Web Documents**: A diverse collection of web text ensures the model is exposed to a broad range of linguistic styles, topics, and vocabulary. The training dataset includes content in over 140 languages. +* **Code**: Exposing the model to code helps it to learn the syntax and patterns of programming languages, which improves its ability to generate code and understand code-related questions. +* **Mathematics**: Training on mathematical text helps the model learn logical reasoning, symbolic representation, and to address mathematical queries. +* **Images**: A wide range of images enables the model to perform image analysis and visual data extraction tasks. + +The combination of these diverse data sources is crucial for training a powerful multimodal model that can handle a wide variety of different tasks and data formats. + +### **Data Preprocessing** + +Here are the key data cleaning and filtering methods applied to the training data: + +* **CSAM Filtering**: Rigorous CSAM (Child Sexual Abuse Material) filtering was applied at multiple stages in the data preparation process to ensure the exclusion of harmful and illegal content. +* **Sensitive Data Filtering**: As part of making Gemma pre-trained models safe and reliable, automated techniques were used to filter out certain personal information and other sensitive data from training sets. +* **Additional methods**: Filtering based on content quality and safety in line with [our policies](https://ai.google/static/documents/ai-responsibility-update-published-february-2025.pdf). + +## **Ethics and Safety** + +As open models become central to enterprise infrastructure, provenance and security are paramount. Developed by Google DeepMind, Gemma 4 undergoes the same rigorous safety evaluations as our proprietary Gemini models. + +### **Evaluation Approach** + +Gemma 4 models were developed in partnership with internal safety and responsible AI teams. A range of automated as well as human evaluations were conducted to help improve model safety. These evaluations align with [Google’s AI principles](https://ai.google/principles/), as well as safety policies, which aim to prevent our generative AI models from generating harmful content, including: + +* Content related to child sexual abuse material and exploitation +* Dangerous content (e.g., promoting suicide, or instructing in activities that could cause real-world harm) +* Sexually explicit content +* Hate speech (e.g., dehumanizing members of protected groups) +* Harassment (e.g., encouraging violence against people) + +### **Evaluation Results** + +For all areas of safety testing, we saw major improvements in all categories of content safety relative to previous Gemma models. Overall, Gemma 4 models significantly outperform Gemma 3 and 3n models in improving safety, while keeping unjustified refusals low. All testing was conducted without safety filters to evaluate the model capabilities and behaviors. For both text-to-text and image-to-text, and across all model sizes, the model produced minimal policy violations, and showed significant improvements over previous Gemma models' performance. + +## **Usage and Limitations** + +These models have certain limitations that users should be aware of. + +### **Intended Usage** + +Multimodal models (capable of processing vision, language, and/or audio) have a wide range of applications across various industries and domains. The following list of potential uses is not comprehensive. The purpose of this list is to provide contextual information about the possible use-cases that the model creators considered as part of model training and development. + +* **Content Creation and Communication** + * **Text Generation**: These models can be used to generate creative text formats such as poems, scripts, code, marketing copy, and email drafts. + * **Chatbots and Conversational AI**: Power conversational interfaces for customer service, virtual assistants, or interactive applications. + * **Text Summarization**: Generate concise summaries of a text corpus, research papers, or reports. + * **Image Data Extraction**: These models can be used to extract, interpret, and summarize visual data for text communications. + * **Audio Processing and Interaction**: The smaller models (E2B and E4B) can analyze and interpret audio inputs, enabling voice-driven interactions and transcriptions. +* **Research and Education** + * **Natural Language Processing (NLP) and VLM Research**: These models can serve as a foundation for researchers to experiment with VLM and NLP techniques, develop algorithms, and contribute to the advancement of the field. + * **Language Learning Tools**: Support interactive language learning experiences, aiding in grammar correction or providing writing practice. + * **Knowledge Exploration**: Assist researchers in exploring large bodies of text by generating summaries or answering questions about specific topics. + +### **Limitations** + +* **Training Data** + * The quality and diversity of the training data significantly influence the model's capabilities. Biases or gaps in the training data can lead to limitations in the model's responses. + * The scope of the training dataset determines the subject areas the model can handle effectively. +* **Context and Task Complexity** + * Models perform well on tasks that can be framed with clear prompts and instructions. Open-ended or highly complex tasks might be challenging. + * A model's performance can be influenced by the amount of context provided (longer context generally leads to better outputs, up to a certain point). +* **Language Ambiguity and Nuance** + * Natural language is inherently complex. Models might struggle to grasp subtle nuances, sarcasm, or figurative language. +* **Factual Accuracy** + * Models generate responses based on information they learned from their training datasets, but they are not knowledge bases. They may generate incorrect or outdated factual statements. +* **Common Sense** + * Models rely on statistical patterns in language. They might lack the ability to apply common sense reasoning in certain situations. + +### **Ethical Considerations and Risks** + +The development of vision-language models (VLMs) raises several ethical concerns. In creating an open model, we have carefully considered the following: + +* **Bias and Fairness** + * VLMs trained on large-scale, real-world text and image data can reflect socio-cultural biases embedded in the training material. Gemma 4 models underwent careful scrutiny, input data pre-processing, and post-training evaluations as reported in this card to help mitigate the risk of these biases. +* **Misinformation and Misuse** + * VLMs can be misused to generate text that is false, misleading, or harmful. + * Guidelines are provided for responsible use with the model, see the [Responsible Generative AI Toolkit](https://ai.google.dev/responsible). +* **Transparency and Accountability** + * This model card summarizes details on the models' architecture, capabilities, limitations, and evaluation processes. + * A responsibly developed open model offers the opportunity to share innovation by making VLM technology accessible to developers and researchers across the AI ecosystem. + +**Risks identified and mitigations**: + +* **Generation of harmful content**: Mechanisms and guidelines for content safety are essential. Developers are encouraged to exercise caution and implement appropriate content safety safeguards based on their specific product policies and application use cases. +* **Misuse for malicious purposes**: Technical limitations and developer and end-user education can help mitigate against malicious applications of VLMs. Educational resources and reporting mechanisms for users to flag misuse are provided. +* **Privacy violations**: Models were trained on data filtered for removal of certain personal information and other sensitive data. Developers are encouraged to adhere to privacy regulations with privacy-preserving techniques. +* **Perpetuation of biases**: It's encouraged to perform continuous monitoring (using evaluation metrics, human review) and the exploration of de-biasing techniques during model training, fine-tuning, and other use cases. + +### **Benefits** + +At the time of release, this family of models provides high-performance open vision-language model implementations designed from the ground up for responsible AI development compared to similarly sized models. diff --git a/chat/gguf/unsloth/gemma-4-E4B-it-GGUF/config.json b/chat/gguf/unsloth/gemma-4-E4B-it-GGUF/config.json new file mode 100644 index 0000000..9cb811d --- /dev/null +++ b/chat/gguf/unsloth/gemma-4-E4B-it-GGUF/config.json @@ -0,0 +1,197 @@ +{ + "architectures": [ + "Gemma4ForConditionalGeneration" + ], + "audio_config": { + "_name_or_path": "", + "architectures": null, + "attention_chunk_size": 12, + "attention_context_left": 13, + "attention_context_right": 0, + "attention_invalid_logits_value": -1000000000.0, + "attention_logit_cap": 50.0, + "chunk_size_feed_forward": 0, + "conv_kernel_size": 5, + "torch_dtype": "bfloat16", + "gradient_clipping": 10000000000.0, + "hidden_act": "silu", + "hidden_size": 1024, + "id2label": { + "0": "LABEL_0", + "1": "LABEL_1" + }, + "initializer_range": 0.02, + "is_encoder_decoder": false, + "label2id": { + "LABEL_0": 0, + "LABEL_1": 1 + }, + "model_type": "gemma4_audio", + "num_attention_heads": 8, + "num_hidden_layers": 12, + "output_attentions": false, + "output_hidden_states": false, + "output_proj_dims": 1536, + "problem_type": null, + "residual_weight": 0.5, + "return_dict": true, + "rms_norm_eps": 1e-06, + "subsampling_conv_channels": [ + 128, + 32 + ], + "use_clipped_linears": true + }, + "audio_token_id": 258881, + "boa_token_id": 256000, + "boi_token_id": 255999, + "torch_dtype": "bfloat16", + "eoa_token_id": 258883, + "eoa_token_index": 258883, + "eoi_token_id": 258882, + "eos_token_id": 106, + "image_token_id": 258880, + "initializer_range": 0.02, + "model_type": "gemma4", + "pad_token_id": 0, + "text_config": { + "attention_bias": false, + "attention_dropout": 0.0, + "attention_k_eq_v": false, + "bos_token_id": 2, + "torch_dtype": "bfloat16", + "enable_moe_block": false, + "eos_token_id": 1, + "expert_intermediate_size": null, + "final_logit_softcapping": 30.0, + "global_head_dim": 512, + "head_dim": 256, + "hidden_activation": "gelu_pytorch_tanh", + "hidden_size": 2560, + "hidden_size_per_layer_input": 256, + "initializer_range": 0.02, + "intermediate_size": 10240, + "layer_types": [ + "sliding_attention", + "sliding_attention", + "sliding_attention", + "sliding_attention", + "sliding_attention", + "full_attention", + "sliding_attention", + "sliding_attention", + "sliding_attention", + "sliding_attention", + "sliding_attention", + "full_attention", + "sliding_attention", + "sliding_attention", + "sliding_attention", + "sliding_attention", + "sliding_attention", + "full_attention", + "sliding_attention", + "sliding_attention", + "sliding_attention", + "sliding_attention", + "sliding_attention", + "full_attention", + "sliding_attention", + "sliding_attention", + "sliding_attention", + "sliding_attention", + "sliding_attention", + "full_attention", + "sliding_attention", + "sliding_attention", + "sliding_attention", + "sliding_attention", + "sliding_attention", + "full_attention", + "sliding_attention", + "sliding_attention", + "sliding_attention", + "sliding_attention", + "sliding_attention", + "full_attention" + ], + "max_position_embeddings": 131072, + "model_type": "gemma4_text", + "moe_intermediate_size": null, + "num_attention_heads": 8, + "num_experts": null, + "num_global_key_value_heads": null, + "num_hidden_layers": 42, + "num_key_value_heads": 2, + "num_kv_shared_layers": 18, + "pad_token_id": 0, + "rms_norm_eps": 1e-06, + "rope_parameters": { + "full_attention": { + "partial_rotary_factor": 0.25, + "rope_theta": 1000000.0, + "rope_type": "proportional" + }, + "sliding_attention": { + "rope_theta": 10000.0, + "rope_type": "default" + } + }, + "sliding_window": 512, + "tie_word_embeddings": true, + "top_k_experts": null, + "use_bidirectional_attention": null, + "use_cache": true, + "use_double_wide_mlp": false, + "vocab_size": 262144, + "vocab_size_per_layer_input": 262144 + }, + "tie_word_embeddings": true, + "transformers_version": "5.5.0.dev0", + "unsloth_fixed": true, + "video_token_id": 258884, + "vision_config": { + "_name_or_path": "", + "architectures": null, + "attention_bias": false, + "attention_dropout": 0.0, + "chunk_size_feed_forward": 0, + "default_output_length": 280, + "torch_dtype": "bfloat16", + "global_head_dim": 64, + "head_dim": 64, + "hidden_activation": "gelu_pytorch_tanh", + "hidden_size": 768, + "id2label": { + "0": "LABEL_0", + "1": "LABEL_1" + }, + "initializer_range": 0.02, + "intermediate_size": 3072, + "is_encoder_decoder": false, + "label2id": { + "LABEL_0": 0, + "LABEL_1": 1 + }, + "max_position_embeddings": 131072, + "model_type": "gemma4_vision", + "num_attention_heads": 12, + "num_hidden_layers": 16, + "num_key_value_heads": 12, + "output_attentions": false, + "output_hidden_states": false, + "patch_size": 16, + "pooling_kernel_size": 3, + "position_embedding_size": 10240, + "problem_type": null, + "return_dict": true, + "rms_norm_eps": 1e-06, + "rope_parameters": { + "rope_theta": 100.0, + "rope_type": "default" + }, + "standardize": false, + "use_clipped_linears": true + }, + "vision_soft_tokens_per_image": 280 +} \ No newline at end of file diff --git a/chat/gguf/unsloth/gemma-4-E4B-it-GGUF/gemma-4-E4B-it-Q4_K_M.gguf b/chat/gguf/unsloth/gemma-4-E4B-it-GGUF/gemma-4-E4B-it-Q4_K_M.gguf new file mode 100644 index 0000000..a1f2f31 --- /dev/null +++ b/chat/gguf/unsloth/gemma-4-E4B-it-GGUF/gemma-4-E4B-it-Q4_K_M.gguf @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:519b9793ed6ce0ff530f1b7c96e848e08e49e7af4d57bb97f76215963a54146d +size 4977169568 diff --git a/chat/gguf/unsloth/gemma-4-E4B-it-GGUF/mmproj-F16.gguf b/chat/gguf/unsloth/gemma-4-E4B-it-GGUF/mmproj-F16.gguf new file mode 100644 index 0000000..a260ff2 --- /dev/null +++ b/chat/gguf/unsloth/gemma-4-E4B-it-GGUF/mmproj-F16.gguf @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:ddf46c21d7078e95338cfc22306b19b276a29a5ad089023449dd54d4b6170a51 +size 990372672 diff --git a/chat/gguf/unsloth/gemma-4-E4B-it-qat-mobile-GGUF/README.md b/chat/gguf/unsloth/gemma-4-E4B-it-qat-mobile-GGUF/README.md new file mode 100644 index 0000000..64526e1 --- /dev/null +++ b/chat/gguf/unsloth/gemma-4-E4B-it-qat-mobile-GGUF/README.md @@ -0,0 +1,578 @@ +--- +library_name: transformers +license: apache-2.0 +license_link: https://ai.google.dev/gemma/docs/gemma_4_license +pipeline_tag: any-to-any +base_model: google/gemma-4-E4B-it-qat-mobile-transformers +tags: +- gemma4 +- unsloth +- gemma +- google +--- +# Read our How to [Run Gemma 4 QAT Guide!](https://unsloth.ai/docs/models/gemma-4/qat) +
+

+ See Unsloth Dynamic 2.0 GGUFs for our quantization benchmarks. +

+ + +
    +
  • Jun 9 Update: Added MTP support. See our MTP Guide.
  • +
  • Gemma 4 can now be run and fine-tuned in Unsloth Studio. Read our guide.
  • +
  • See all versions of Gemma 4 QAT (GGUF, 16-bit etc.) in our collection.
  • +
  • Example of Gemma 4 E4B (4-bit GGUF) running in Unsloth Studio with tool-calling:
  • +
+
+gemma 4 in unsloth studio + + +![image](https://cdn-uploads.huggingface.co/production/uploads/62ecdc18b72a69615d6bd857/XQqmw-hY_Ap2O_YVRBJAq.png) + +## Run with MTP (speculative decoding) + +This model ships a Multi-Token Prediction drafter at the repo root (`mtp-gemma-4-E4B-it.gguf`, a near-lossless smart Q4_0). A recent llama.cpp auto-discovers it from `-hf`, so you do not pass `--model-draft`: + +```bash +./build/bin/llama-server \ + -hf unsloth/gemma-4-E4B-it-qat-mobile-GGUF:UD-Q2_K_XL \ + --spec-type draft-mtp --spec-draft-n-max 4 \ + -ngl 999 -fa off +``` + +The drafter shares the target's KV cache and does not change the output (the target verifies every drafted token). See the `MTP/` folder for the other precisions and explicit usage. + + +
+ +
+ + +

+ Hugging Face | + GitHub | + Launch Blog | + Documentation +
+ License: Apache 2.0 | Authors: Google DeepMind +

+ +> [!Note] +> This model card is for the new versions of the Gemma 4 family optimized with Quantization-Aware Training (QAT), which allows preserving similar quality to bfloat16 while dramatically reducing the memory requirements to load the model. +> Four versions of the QAT checkpoints are available: +> * **Unquantized QAT checkpoints** (Q4_0): Half-precision weights extracted from the QAT pipeline, ideal for custom downstream compilation and research. Available for Gemma 4 E2B, E4B, 12B, 26B A4B, and 31B, and their drafter models. +> * **GGUF** (Q4_0): Ready-to-deploy formats for broad ecosystem compatibility. Available for Gemma 4 E2B, E4B, 12B, 26B A4B, and 31B. +> * **Mobile-optimized** (wNa8o8): A custom schema engineered explicitly for mobile hardware efficiency. It features targeted 2-bit decoding layers, optimized KV caches, and static activations to maximize VRAM savings. Available for Gemma 4 E2B and E4B. +> * **Compressed Tensors** (w4a16): QAT checkpoints serialized in the compressed-tensors format for native, optimized inference with vLLM. Available for Gemma 4 E2B, E4B, 12B, and 31B. + +Gemma is a family of open models built by Google DeepMind. Gemma 4 models are multimodal, handling text and image input (with audio supported on E2B, E4B, and 12B) and generating text output. This release includes open-weights models in both pre-trained and instruction-tuned variants. Gemma 4 features a context window of up to 256K tokens and maintains multilingual support in over 140 languages. + +Featuring both Dense and Mixture-of-Experts (MoE) architectures, Gemma 4 is well-suited for tasks like text generation, coding, and reasoning. The models are available in five distinct sizes: **E2B**, **E4B**, **12B**, **26B A4B**, and **31B**. Their diverse sizes make them deployable in environments ranging from high-end phones to laptops and servers, democratizing access to state-of-the-art AI. + +Gemma 4 introduces key **capability and architectural advancements**: + +* **Reasoning** – All models in the family are designed as highly capable reasoners, with configurable thinking modes. + +* **Extended Multimodalities** – Processes Text, Image with variable aspect ratio and resolution support (all models), Video, and Audio (featured natively on the E2B, E4B, and 12B models). + +* **Diverse & Efficient Architectures** – Offers Dense and Mixture-of-Experts (MoE) variants of different sizes for scalable deployment. + +* **Optimized for On-Device** – Smaller models are specifically designed for efficient local execution on laptops and mobile devices. + +* **Increased Context Window** – The small models feature a 128K context window, while the medium models support 256K. + +* **Enhanced Coding & Agentic Capabilities** – Achieves notable improvements in coding benchmarks alongside native function-calling support, powering highly capable autonomous agents. + +* **Native System Prompt Support** – Gemma 4 introduces native support for the `system` role, enabling more structured and controllable conversations. + +## **Models Overview** + +Gemma 4 models are designed to deliver frontier-level performance at each size, targeting deployment scenarios from mobile and edge devices (E2B, E4B) to consumer GPUs and workstations (12B, 26B A4B, 31B). They are well-suited for reasoning, agentic workflows, coding, and multimodal understanding. + +The models employ a hybrid attention mechanism that interleaves local sliding window attention with full global attention, ensuring the final layer is always global. This hybrid design delivers the processing speed and low memory footprint of a lightweight model without sacrificing the deep awareness required for complex, long-context tasks. To optimize memory for long contexts, global layers feature unified Keys and Values, and apply Proportional RoPE (p-RoPE). + +### Dense Models + +| Property | E2B | E4B | 12B Unified | 31B Dense | +| :---- | :---- | :---- | :---- | :---- | +| **Total Parameters** | 2.3B effective
(5.1B with embeddings) | 4.5B effective
(8B with embeddings) | 11.95B | 30.7B | +| **Layers** | 35 | 42 | 48 | 60 | +| **Sliding Window** | 512 tokens | 512 tokens | 1024 tokens | 1024 tokens | +| **Context Length** | 128K tokens | 128K tokens | 256K tokens | 256K tokens | +| **Vocabulary Size** | 262K | 262K | 262K | 262K | +| **Supported Modalities** | Text, Image, Audio | Text, Image, Audio | Text, Image, Audio | Text, Image | +| **Vision Encoder Parameters** | *~150M* | *~150M* | - | *~550M* | +| **Audio Encoder Parameters** | *~300M* | *~300M* | - | No Audio | + +The "E" in E2B and E4B stands for "effective" parameters. The smaller models incorporate Per-Layer Embeddings (PLE) to maximize parameter efficiency in on-device deployments. Rather than adding more layers or parameters to the model, PLE gives each decoder layer its own small embedding for every token. These embedding tables are large but are only used for quick lookups, which is why the effective parameter count is much smaller than the total. + +The "Unified" in Gemma 4 12B Unified refers to its encoder-free architecture. Other Gemma 4 models use dedicated encoders to process multimodal data before passing it to the LLM. Gemma 4 12B eliminates these encoders entirely, projecting raw image patches and audio waveforms directly into the LLM's embedding space through lightweight linear layers. This unified approach means all modalities flow straight into a single decoder-only transformer, reducing multimodal latency and allowing the entire model to be fine-tuned in one pass. + +### Mixture-of-Experts (MoE) Model + +| Property | 26B A4B MoE | +| :---- | :---- | +| **Total Parameters** | 25.2B | +| **Active Parameters** | 3.8B | +| **Layers** | 30 | +| **Sliding Window** | 1024 tokens | +| **Context Length** | 256K tokens | +| **Vocabulary Size** | 262K | +| **Expert Count** | 8 active / 128 total and 1 shared | +| **Supported Modalities** | Text, Image | +| **Vision Encoder Parameters** | *~550M* | + +The "A" in 26B A4B stands for "active parameters" in contrast to the total number of parameters the model contains. By only activating a 4B subset of parameters during inference, the Mixture-of-Experts model runs much faster than its 26B total might suggest. This makes it an excellent choice for fast inference compared to the dense 31B model since it runs almost as fast as a 4B-parameter model. + +## **Benchmark Results** + +These models were evaluated against a large collection of different datasets and metrics to cover different aspects of text generation. Evaluation results marked in the table are for instruction-tuned models. + +| | Gemma 4 31B | Gemma 4 26B A4B | Gemma 4 12B Unified | Gemma 4 E4B | Gemma 4 E2B | Gemma 3 27B (no think) | +| :---- | :---- | :---- | :---- | :---- | :---- | :---- | +| MMLU Pro | 85.2% | 82.6% | 77.2% | 69.4% | 60.0% | 67.6% | +| AIME 2026 no tools | 89.2% | 88.3% | 77.5% | 42.5% | 37.5% | 20.8% | +| LiveCodeBench v6 | 80.0% | 77.1% | 72.0% | 52.0% | 44.0% | 29.1% | +| Codeforces ELO | 2150 | 1718 | 1659 | 940 | 633 | 110 | +| GPQA Diamond | 84.3% | 82.3% | 78.8% | 58.6% | 43.4% | 42.4% | +| Tau2 (average over 3) | 76.9% | 68.2% | 69.0% | 42.2% | 24.5% | 16.2% | +| HLE no tools | 19.5% | 8.7% | 5.2% | - | - | - | +| HLE with search | 26.5% | 17.2% | - | - | - | - | +| BigBench Extra Hard | 74.4% | 64.8% | 53.0% | 33.1% | 21.9% | 19.3% | +| MMMLU | 88.4% | 86.3% | 83.4% | 76.6% | 67.4% | 70.7% | +| **Vision** | | | | | | | +| MMMU Pro | 76.9% | 73.8% | 69.1% | 52.6% | 44.2% | 49.7% | +| OmniDocBench 1.5 (average edit distance, lower is better) | 0.131 | 0.149 | 0.164 | 0.181 | 0.290 | 0.365 | +| MATH-Vision | 85.6% | 82.4% | 79.7% | 59.5% | 52.4% | 46.0% | +| MedXPertQA MM | 61.3% | 58.1% | 48.7% | 28.7% | 23.5% | - | +| **Audio** | | | | | | | +| CoVoST | - | - | 38.5* | 35.54 | 33.47 | - | +| FLEURS (lower is better) | - | - | 0.069* | 0.08 | 0.09 | - | +| **Long Context** | | | | | | | +| MRCR v2 8 needle 128k (average) | 66.4% | 44.1% | 43.4% | 25.4% | 19.1% | 13.5% | + +*Excluding Chinese language. + +## **Core Capabilities** + +Gemma 4 models handle a broad range of tasks across text, vision, and audio. Key capabilities include: + +* **Thinking** – Built-in reasoning mode that lets the model think step-by-step before answering. +* **Long Context** – Context windows of up to 128K tokens (E2B/E4B) and 256K tokens (12B, 26B A4B/31B). +* **Image Understanding** – Object detection, Document/PDF parsing, screen and UI understanding, chart comprehension, OCR (including multilingual), handwriting recognition, and pointing. Images can be processed at variable aspect ratios and resolutions. +* **Video Understanding** – Analyze video by processing sequences of frames. +* **Interleaved Multimodal Input** – Freely mix text and images in any order within a single prompt. +* **Function Calling** – Native support for structured tool use, enabling agentic workflows. +* **Coding** – Code generation, completion, and correction. +* **Multilingual** – Out-of-the-box support for 35+ languages, pre-trained on 140+ languages. +* **Audio** (E2B, E4B, and 12B only) – Automatic speech recognition (ASR) and speech-to-translated-text translation across multiple languages. + + +## Getting Started + +You can use all Gemma 4 models with the latest version of Transformers. To get started, install the necessary dependencies in your environment: + +`pip install -U transformers torch accelerate` + +Once you have everything installed, you can proceed to load the model with the code below: + +```python +from transformers import AutoProcessor, AutoModelForMultimodalLM + +MODEL_ID = "google/gemma-4-12B-it" + +# Load model +processor = AutoProcessor.from_pretrained(MODEL_ID) +model = AutoModelForMultimodalLM.from_pretrained( + MODEL_ID, + dtype="auto", + device_map="auto" +) +``` + +Once the model is loaded, you can start generating output: + +```python +# Prompt +messages = [ + {"role": "system", "content": "You are a helpful assistant."}, + {"role": "user", "content": "Write a short joke about saving RAM."}, +] + +# Process input +inputs = processor.apply_chat_template( + messages, + tokenize=True, + return_dict=True, + return_tensors="pt", + add_generation_prompt=True, + enable_thinking=False +).to(model.device) +input_len = inputs["input_ids"].shape[-1] + +# Generate output +outputs = model.generate(**inputs, max_new_tokens=1024) +response = processor.decode(outputs[0][input_len:], skip_special_tokens=False) + +# Parse output +processor.parse_response(response) +``` + +To enable reasoning, set `enable_thinking=True` and the `parse_response` function will take care of parsing the thinking output. + +Below, you will also find snippets for processing audio (E2B, E4B, 12B only), images, and video alongside text: + +
+Code for processing Audio + +Make sure to install the following packages: + +`pip install -U transformers torch torchvision librosa accelerate` + +You can then load the model with the code below: + +```python +from transformers import AutoProcessor, AutoModelForMultimodalLM + +MODEL_ID = "google/gemma-4-12B-it" + +# Load model +processor = AutoProcessor.from_pretrained(MODEL_ID) +model = AutoModelForMultimodalLM.from_pretrained( + MODEL_ID, + dtype="auto", + device_map="auto" +) +``` + +Once the model is loaded, you can start generating output by directly referencing the audio URL in the prompt: + + +```python +# Prompt - add audio after text +messages = [ + { + "role": "user", + "content": [ + {"type": "text", "text": "Transcribe the following speech segment in its original language. Follow these specific instructions for formatting the answer:\n* Only output the transcription, with no newlines.\n* When transcribing numbers, write the digits, i.e. write 1.7 and not one point seven, and write 3 instead of three."}, + {"type": "audio", "audio": "https://raw.githubusercontent.com/google-gemma/cookbook/refs/heads/main/apps/sample-data/journal1.wav"}, + ] + } +] + +# Process input +inputs = processor.apply_chat_template( + messages, + tokenize=True, + return_dict=True, + return_tensors="pt", + add_generation_prompt=True, +).to(model.device) +input_len = inputs["input_ids"].shape[-1] + +# Generate output +outputs = model.generate(**inputs, max_new_tokens=512) +response = processor.decode(outputs[0][input_len:], skip_special_tokens=False) + +# Parse output +processor.parse_response(response) +``` + +
+ +
+Code for processing Images + +Make sure to install the following packages: + + +`pip install -U transformers torch torchvision accelerate` + +You can then load the model with the code below: + +```python +from transformers import AutoProcessor, AutoModelForMultimodalLM + +MODEL_ID = "google/gemma-4-12B-it" + +# Load model +processor = AutoProcessor.from_pretrained(MODEL_ID) +model = AutoModelForMultimodalLM.from_pretrained( + MODEL_ID, + dtype="auto", + device_map="auto" +) +``` + +Once the model is loaded, you can start generating output by directly referencing the image URL in the prompt: + + +```python +# Prompt - add image before text +messages = [ + { + "role": "user", "content": [ + {"type": "image", "url": "https://raw.githubusercontent.com/google-gemma/cookbook/refs/heads/main/apps/sample-data/GoldenGate.png"}, + {"type": "text", "text": "What is shown in this image?"} + ] + } +] + +# Process input +inputs = processor.apply_chat_template( + messages, + tokenize=True, + return_dict=True, + return_tensors="pt", + add_generation_prompt=True, +).to(model.device) +input_len = inputs["input_ids"].shape[-1] + +# Generate output +outputs = model.generate(**inputs, max_new_tokens=512) +response = processor.decode(outputs[0][input_len:], skip_special_tokens=False) + +# Parse output +processor.parse_response(response) +``` + +
+ + +
+Code for processing Videos + +Make sure to install the following packages: + +`pip install -U transformers torch torchvision librosa accelerate` + +You can then load the model with the code below: + +```python +from transformers import AutoProcessor, AutoModelForMultimodalLM + +MODEL_ID = "google/gemma-4-12B-it" + +# Load model +processor = AutoProcessor.from_pretrained(MODEL_ID) +model = AutoModelForMultimodalLM.from_pretrained( + MODEL_ID, + dtype="auto", + device_map="auto" +) +``` + +Once the model is loaded, you can start generating output by directly referencing the video URL in the prompt: + + +```python +# Prompt - add video before text +messages = [ + { + 'role': 'user', + 'content': [ + {"type": "video", "video": "https://github.com/bebechien/gemma/raw/refs/heads/main/videos/ForBiggerBlazes.mp4"}, + {'type': 'text', 'text': 'Describe this video.'} + ] + } +] + +# Process input +inputs = processor.apply_chat_template( + messages, + tokenize=True, + return_dict=True, + return_tensors="pt", + add_generation_prompt=True, +).to(model.device) +input_len = inputs["input_ids"].shape[-1] + +# Generate output +outputs = model.generate(**inputs, max_new_tokens=512) +response = processor.decode(outputs[0][input_len:], skip_special_tokens=False) + +# Parse output +processor.parse_response(response) +``` + +
+ + + +## **Best Practices** + +For the best performance, use these configurations and best practices: + +### 1. Sampling Parameters + +Use the following standardized sampling configuration across all use cases: + +* `temperature=1.0` +* `top_p=0.95` +* `top_k=64` + +### 2. Thinking Mode Configuration + +Compared to Gemma 3, the models use standard `system`, `assistant`, and `user` roles. To properly manage the thinking process, use the following control tokens: + +* **Trigger Thinking:** Thinking is enabled by including the `<|think|>` token at the start of the system prompt. To disable thinking, remove the token. +* **Standard Generation:** When thinking is enabled, the model will output its internal reasoning followed by the final answer using this structure: + `<|channel>thought\n`**[Internal reasoning]**`` +* **Disabled Thinking Behavior:** For all models except for the E2B and E4B variants, if thinking is disabled, the model will still generate the tags but with an empty thought block: + `<|channel>thought\n`**[Final answer]** + +> [!Note] +> Note that many libraries like Transformers and llama.cpp handle the complexities of the chat template for you. + +### 3. Multi-Turn Conversations + +* **No Thinking Content in History**: In multi-turn conversations, the historical model output should only include the final response. Thoughts from previous model turns must *not be added* before the next user turn begins. + +### 4. Modality order + +For optimal performance with multimodal inputs, place: + +* Image content **before** the text in your prompt. +* Audio content **after** the text in your prompt. + +### 5. Variable Image Resolution + +Aside from variable aspect ratios, Gemma 4 supports variable image resolution through a configurable visual token budget, which controls how many tokens are used to represent an image. A higher token budget preserves more visual detail at the cost of additional compute, while a lower budget enables faster inference for tasks that don't require fine-grained understanding. + +* The supported token budgets are: **70**, **140**, **280**, **560**, and **1120**. + * Use *lower budgets* for classification, captioning, or video understanding, where faster inference and processing many frames outweigh fine-grained detail. + * Use *higher budgets* for tasks like OCR, document parsing, or reading small text. + +### 6. Audio + +Use the following prompt structures for audio processing: + +* **Audio Speech Recognition (ASR)** + +```text +Transcribe the following speech segment in {LANGUAGE} into {LANGUAGE} text. + +Follow these specific instructions for formatting the answer: +* Only output the transcription, with no newlines. +* When transcribing numbers, write the digits, i.e. write 1.7 and not one point seven, and write 3 instead of three. +``` + +* **Automatic Speech Translation (AST)** + +```text +Transcribe the following speech segment in {SOURCE_LANGUAGE}, then translate it into {TARGET_LANGUAGE}. +When formatting the answer, first output the transcription in {SOURCE_LANGUAGE}, then one newline, then output the string '{TARGET_LANGUAGE}: ', then the translation in {TARGET_LANGUAGE}. +``` + +### 7. Audio and Video Length + +All models support image inputs and can process videos as frames whereas the E2B, E4B, and 12B models also support audio inputs. Audio supports a maximum length of 30 seconds. Video supports a maximum of 60 seconds assuming the images are processed at one frame per second. + +## **Model Data** + +Data used for model training and how the data was processed. + +### **Training Dataset** + +Our pre-training dataset is a large-scale, diverse collection of data encompassing a wide range of domains and modalities, which includes web documents, code, images, audio, with a cutoff date of January 2025. Here are the key components: + +* **Web Documents**: A diverse collection of web text ensures the model is exposed to a broad range of linguistic styles, topics, and vocabulary. The training dataset includes content in over 140 languages. +* **Code**: Exposing the model to code helps it to learn the syntax and patterns of programming languages, which improves its ability to generate code and understand code-related questions. +* **Mathematics**: Training on mathematical text helps the model learn logical reasoning, symbolic representation, and to address mathematical queries. +* **Images**: A wide range of images enables the model to perform image analysis and visual data extraction tasks. + +The combination of these diverse data sources is crucial for training a powerful multimodal model that can handle a wide variety of different tasks and data formats. + +### **Data Preprocessing** + +Here are the key data cleaning and filtering methods applied to the training data: + +* **CSAM Filtering**: Rigorous CSAM (Child Sexual Abuse Material) filtering was applied at multiple stages in the data preparation process to ensure the exclusion of harmful and illegal content. +* **Sensitive Data Filtering**: As part of making Gemma pre-trained models safe and reliable, automated techniques were used to filter out certain personal information and other sensitive data from training sets. +* **Additional methods**: Filtering based on content quality and safety in line with [our policies](https://ai.google/static/documents/ai-responsibility-update-published-february-2025.pdf). + +## **Ethics and Safety** + +As open models become central to enterprise infrastructure, provenance and security are paramount. Developed by Google DeepMind, Gemma 4 undergoes the same rigorous safety evaluations as our proprietary Gemini models. + +### **Evaluation Approach** + +Gemma 4 models were developed in partnership with internal safety and responsible AI teams. A range of automated as well as human evaluations were conducted to help improve model safety. These evaluations align with [Google’s AI principles](https://ai.google/principles/), as well as safety policies, which aim to prevent our generative AI models from generating harmful content, including: + +* Content related to child sexual abuse material and exploitation +* Dangerous content (e.g., promoting suicide, or instructing in activities that could cause real-world harm) +* Sexually explicit content +* Hate speech (e.g., dehumanizing members of protected groups) +* Harassment (e.g., encouraging violence against people) + +### **Evaluation Results** + +For all areas of safety testing, we saw major improvements in all categories of content safety relative to previous Gemma models. Overall, Gemma 4 models significantly outperform Gemma 3 and 3n models in improving safety, while keeping unjustified refusals low. All testing was conducted without safety filters to evaluate the model capabilities and behaviors. For both text-to-text and image-to-text, and across all model sizes, the model produced minimal policy violations, and showed significant improvements over previous Gemma models' performance. + +## **Usage and Limitations** + +These models have certain limitations that users should be aware of. + +### **Intended Usage** + +Multimodal models (capable of processing vision, language, and/or audio) have a wide range of applications across various industries and domains. The following list of potential uses is not comprehensive. The purpose of this list is to provide contextual information about the possible use-cases that the model creators considered as part of model training and development. + +* **Content Creation and Communication** + * **Text Generation**: These models can be used to generate creative text formats such as poems, scripts, code, marketing copy, and email drafts. + * **Chatbots and Conversational AI**: Power conversational interfaces for customer service, virtual assistants, or interactive applications. + * **Text Summarization**: Generate concise summaries of a text corpus, research papers, or reports. + * **Image Data Extraction**: These models can be used to extract, interpret, and summarize visual data for text communications. + * **Audio Processing and Interaction**: The E2B, E4B, and 12B models can analyze and interpret audio inputs, enabling voice-driven interactions and transcriptions. +* **Research and Education** + * **Natural Language Processing (NLP) and VLM Research**: These models can serve as a foundation for researchers to experiment with VLM and NLP techniques, develop algorithms, and contribute to the advancement of the field. + * **Language Learning Tools**: Support interactive language learning experiences, aiding in grammar correction or providing writing practice. + * **Knowledge Exploration**: Assist researchers in exploring large bodies of text by generating summaries or answering questions about specific topics. + +### **Limitations** + +* **Training Data** + * The quality and diversity of the training data significantly influence the model's capabilities. Biases or gaps in the training data can lead to limitations in the model's responses. + * The scope of the training dataset determines the subject areas the model can handle effectively. +* **Context and Task Complexity** + * Models perform well on tasks that can be framed with clear prompts and instructions. Open-ended or highly complex tasks might be challenging. + * A model's performance can be influenced by the amount of context provided (longer context generally leads to better outputs, up to a certain point). +* **Language Ambiguity and Nuance** + * Natural language is inherently complex. Models might struggle to grasp subtle nuances, sarcasm, or figurative language. +* **Factual Accuracy** + * Models generate responses based on information they learned from their training datasets, but they are not knowledge bases. They may generate incorrect or outdated factual statements. +* **Common Sense** + * Models rely on statistical patterns in language. They might lack the ability to apply common sense reasoning in certain situations. + +### **Ethical Considerations and Risks** + +The development of vision-language models (VLMs) raises several ethical concerns. In creating an open model, we have carefully considered the following: + +* **Bias and Fairness** + * VLMs trained on large-scale, real-world text and image data can reflect socio-cultural biases embedded in the training material. Gemma 4 models underwent careful scrutiny, input data pre-processing, and post-training evaluations as reported in this card to help mitigate the risk of these biases. +* **Misinformation and Misuse** + * VLMs can be misused to generate text that is false, misleading, or harmful. + * Guidelines are provided for responsible use with the model, see the [Responsible Generative AI Toolkit](https://ai.google.dev/responsible). +* **Transparency and Accountability** + * This model card summarizes details on the models' architecture, capabilities, limitations, and evaluation processes. + * A responsibly developed open model offers the opportunity to share innovation by making VLM technology accessible to developers and researchers across the AI ecosystem. + +**Risks identified and mitigations**: + +* **Generation of harmful content**: Mechanisms and guidelines for content safety are essential. Developers are encouraged to exercise caution and implement appropriate content safety safeguards based on their specific product policies and application use cases. +* **Misuse for malicious purposes**: Technical limitations and developer and end-user education can help mitigate against malicious applications of VLMs. Educational resources and reporting mechanisms for users to flag misuse are provided. +* **Privacy violations**: Models were trained on data filtered for removal of certain personal information and other sensitive data. Developers are encouraged to adhere to privacy regulations with privacy-preserving techniques. +* **Perpetuation of biases**: It's encouraged to perform continuous monitoring (using evaluation metrics, human review) and the exploration of de-biasing techniques during model training, fine-tuning, and other use cases. + +### **Benefits** + +At the time of release, this family of models provides high-performance open vision-language model implementations designed from the ground up for responsible AI development compared to similarly sized models. \ No newline at end of file diff --git a/chat/gguf/unsloth/gemma-4-E4B-it-qat-mobile-GGUF/config.json b/chat/gguf/unsloth/gemma-4-E4B-it-qat-mobile-GGUF/config.json new file mode 100644 index 0000000..9cb811d --- /dev/null +++ b/chat/gguf/unsloth/gemma-4-E4B-it-qat-mobile-GGUF/config.json @@ -0,0 +1,197 @@ +{ + "architectures": [ + "Gemma4ForConditionalGeneration" + ], + "audio_config": { + "_name_or_path": "", + "architectures": null, + "attention_chunk_size": 12, + "attention_context_left": 13, + "attention_context_right": 0, + "attention_invalid_logits_value": -1000000000.0, + "attention_logit_cap": 50.0, + "chunk_size_feed_forward": 0, + "conv_kernel_size": 5, + "torch_dtype": "bfloat16", + "gradient_clipping": 10000000000.0, + "hidden_act": "silu", + "hidden_size": 1024, + "id2label": { + "0": "LABEL_0", + "1": "LABEL_1" + }, + "initializer_range": 0.02, + "is_encoder_decoder": false, + "label2id": { + "LABEL_0": 0, + "LABEL_1": 1 + }, + "model_type": "gemma4_audio", + "num_attention_heads": 8, + "num_hidden_layers": 12, + "output_attentions": false, + "output_hidden_states": false, + "output_proj_dims": 1536, + "problem_type": null, + "residual_weight": 0.5, + "return_dict": true, + "rms_norm_eps": 1e-06, + "subsampling_conv_channels": [ + 128, + 32 + ], + "use_clipped_linears": true + }, + "audio_token_id": 258881, + "boa_token_id": 256000, + "boi_token_id": 255999, + "torch_dtype": "bfloat16", + "eoa_token_id": 258883, + "eoa_token_index": 258883, + "eoi_token_id": 258882, + "eos_token_id": 106, + "image_token_id": 258880, + "initializer_range": 0.02, + "model_type": "gemma4", + "pad_token_id": 0, + "text_config": { + "attention_bias": false, + "attention_dropout": 0.0, + "attention_k_eq_v": false, + "bos_token_id": 2, + "torch_dtype": "bfloat16", + "enable_moe_block": false, + "eos_token_id": 1, + "expert_intermediate_size": null, + "final_logit_softcapping": 30.0, + "global_head_dim": 512, + "head_dim": 256, + "hidden_activation": "gelu_pytorch_tanh", + "hidden_size": 2560, + "hidden_size_per_layer_input": 256, + "initializer_range": 0.02, + "intermediate_size": 10240, + "layer_types": [ + "sliding_attention", + "sliding_attention", + "sliding_attention", + "sliding_attention", + "sliding_attention", + "full_attention", + "sliding_attention", + "sliding_attention", + "sliding_attention", + "sliding_attention", + "sliding_attention", + "full_attention", + "sliding_attention", + "sliding_attention", + "sliding_attention", + "sliding_attention", + "sliding_attention", + "full_attention", + "sliding_attention", + "sliding_attention", + "sliding_attention", + "sliding_attention", + "sliding_attention", + "full_attention", + "sliding_attention", + "sliding_attention", + "sliding_attention", + "sliding_attention", + "sliding_attention", + "full_attention", + "sliding_attention", + "sliding_attention", + "sliding_attention", + "sliding_attention", + "sliding_attention", + "full_attention", + "sliding_attention", + "sliding_attention", + "sliding_attention", + "sliding_attention", + "sliding_attention", + "full_attention" + ], + "max_position_embeddings": 131072, + "model_type": "gemma4_text", + "moe_intermediate_size": null, + "num_attention_heads": 8, + "num_experts": null, + "num_global_key_value_heads": null, + "num_hidden_layers": 42, + "num_key_value_heads": 2, + "num_kv_shared_layers": 18, + "pad_token_id": 0, + "rms_norm_eps": 1e-06, + "rope_parameters": { + "full_attention": { + "partial_rotary_factor": 0.25, + "rope_theta": 1000000.0, + "rope_type": "proportional" + }, + "sliding_attention": { + "rope_theta": 10000.0, + "rope_type": "default" + } + }, + "sliding_window": 512, + "tie_word_embeddings": true, + "top_k_experts": null, + "use_bidirectional_attention": null, + "use_cache": true, + "use_double_wide_mlp": false, + "vocab_size": 262144, + "vocab_size_per_layer_input": 262144 + }, + "tie_word_embeddings": true, + "transformers_version": "5.5.0.dev0", + "unsloth_fixed": true, + "video_token_id": 258884, + "vision_config": { + "_name_or_path": "", + "architectures": null, + "attention_bias": false, + "attention_dropout": 0.0, + "chunk_size_feed_forward": 0, + "default_output_length": 280, + "torch_dtype": "bfloat16", + "global_head_dim": 64, + "head_dim": 64, + "hidden_activation": "gelu_pytorch_tanh", + "hidden_size": 768, + "id2label": { + "0": "LABEL_0", + "1": "LABEL_1" + }, + "initializer_range": 0.02, + "intermediate_size": 3072, + "is_encoder_decoder": false, + "label2id": { + "LABEL_0": 0, + "LABEL_1": 1 + }, + "max_position_embeddings": 131072, + "model_type": "gemma4_vision", + "num_attention_heads": 12, + "num_hidden_layers": 16, + "num_key_value_heads": 12, + "output_attentions": false, + "output_hidden_states": false, + "patch_size": 16, + "pooling_kernel_size": 3, + "position_embedding_size": 10240, + "problem_type": null, + "return_dict": true, + "rms_norm_eps": 1e-06, + "rope_parameters": { + "rope_theta": 100.0, + "rope_type": "default" + }, + "standardize": false, + "use_clipped_linears": true + }, + "vision_soft_tokens_per_image": 280 +} \ No newline at end of file diff --git a/chat/gguf/unsloth/gemma-4-E4B-it-qat-mobile-GGUF/gemma-4-E4B-it-qat-UD-Q2_K_XL.gguf b/chat/gguf/unsloth/gemma-4-E4B-it-qat-mobile-GGUF/gemma-4-E4B-it-qat-UD-Q2_K_XL.gguf new file mode 100644 index 0000000..1072af5 --- /dev/null +++ b/chat/gguf/unsloth/gemma-4-E4B-it-qat-mobile-GGUF/gemma-4-E4B-it-qat-UD-Q2_K_XL.gguf @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:fa5add96dfe96039c24087e90a9239e9e15618df42df306d9043c7ae2f58184d +size 3219530176 diff --git a/chat/gguf/unsloth/gemma-4-E4B-it-qat-mobile-GGUF/mmproj-F16.gguf b/chat/gguf/unsloth/gemma-4-E4B-it-qat-mobile-GGUF/mmproj-F16.gguf new file mode 100644 index 0000000..a9ef767 --- /dev/null +++ b/chat/gguf/unsloth/gemma-4-E4B-it-qat-mobile-GGUF/mmproj-F16.gguf @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:6a255159ee4b01b304f633a57f017dd7d5a69d30fff52abb2614bf0813cef034 +size 990372672 diff --git a/chat/mlx/mlx-community/Qwen3.5-0.8B-MLX-4bit/.gitattributes b/chat/mlx/mlx-community/Qwen3.5-0.8B-MLX-4bit/.gitattributes new file mode 100644 index 0000000..52373fe --- /dev/null +++ b/chat/mlx/mlx-community/Qwen3.5-0.8B-MLX-4bit/.gitattributes @@ -0,0 +1,36 @@ +*.7z filter=lfs diff=lfs merge=lfs -text +*.arrow filter=lfs diff=lfs merge=lfs -text +*.bin filter=lfs diff=lfs merge=lfs -text +*.bz2 filter=lfs diff=lfs merge=lfs -text +*.ckpt filter=lfs diff=lfs merge=lfs -text +*.ftz filter=lfs diff=lfs merge=lfs -text +*.gz filter=lfs diff=lfs merge=lfs -text +*.h5 filter=lfs diff=lfs merge=lfs -text +*.joblib filter=lfs diff=lfs merge=lfs -text +*.lfs.* filter=lfs diff=lfs merge=lfs -text +*.mlmodel filter=lfs diff=lfs merge=lfs -text +*.model filter=lfs diff=lfs merge=lfs -text +*.msgpack filter=lfs diff=lfs merge=lfs -text +*.npy filter=lfs diff=lfs merge=lfs -text +*.npz filter=lfs diff=lfs merge=lfs -text +*.onnx filter=lfs diff=lfs merge=lfs -text +*.ot filter=lfs diff=lfs merge=lfs -text +*.parquet filter=lfs diff=lfs merge=lfs -text +*.pb filter=lfs diff=lfs merge=lfs -text +*.pickle filter=lfs diff=lfs merge=lfs -text +*.pkl filter=lfs diff=lfs merge=lfs -text +*.pt filter=lfs diff=lfs merge=lfs -text +*.pth filter=lfs diff=lfs merge=lfs -text +*.rar filter=lfs diff=lfs merge=lfs -text +*.safetensors filter=lfs diff=lfs merge=lfs -text +saved_model/**/* filter=lfs diff=lfs merge=lfs -text +*.tar.* filter=lfs diff=lfs merge=lfs -text +*.tar filter=lfs diff=lfs merge=lfs -text +*.tflite filter=lfs diff=lfs merge=lfs -text +*.tgz filter=lfs diff=lfs merge=lfs -text +*.wasm filter=lfs diff=lfs merge=lfs -text +*.xz filter=lfs diff=lfs merge=lfs -text +*.zip filter=lfs diff=lfs merge=lfs -text +*.zst filter=lfs diff=lfs merge=lfs -text +*tfevents* filter=lfs diff=lfs merge=lfs -text +tokenizer.json filter=lfs diff=lfs merge=lfs -text diff --git a/chat/mlx/mlx-community/Qwen3.5-0.8B-MLX-4bit/README.md b/chat/mlx/mlx-community/Qwen3.5-0.8B-MLX-4bit/README.md new file mode 100644 index 0000000..3b04882 --- /dev/null +++ b/chat/mlx/mlx-community/Qwen3.5-0.8B-MLX-4bit/README.md @@ -0,0 +1,75 @@ +--- +base_model: Qwen/Qwen3.5-0.8B +library_name: mlx +tags: + - mlx + - qwen3.5 + - vision-language-model + - quantized + - 4bit +license: apache-2.0 +--- + +# Qwen3.5-0.8B-MLX-4bit + +This is a 4-bit quantized MLX version of [Qwen/Qwen3.5-0.8B](https://huggingface.co/Qwen/Qwen3.5-0.8B) for Apple Silicon. + +## Model Details + +- **Original Model:** [Qwen/Qwen3.5-0.8B](https://huggingface.co/Qwen/Qwen3.5-0.8B) +- **Quantization:** 4-bit (5.863 bits per weight) +- **Group Size:** 64 +- **Format:** MLX SafeTensors +- **Framework:** [mlx-vlm](https://github.com/Blaizzy/mlx-vlm) +- **Disk Size:** ~622M + +## Conversion Details + +This model was converted using `mlx-vlm` from the [`pc/fix-qwen35-predicate`](https://github.com/Blaizzy/mlx-vlm/tree/pc/fix-qwen35-predicate) branch, which includes fixes for Qwen3.5 model support (proper handling of MoE gate layers, `shared_expert_gate`, and `A_log` casting). + +**Conversion command:** +```bash +python3 -m mlx_vlm convert \ + --hf-path "Qwen/Qwen3.5-0.8B" \ + --mlx-path "./Qwen3.5-0.8B-MLX-4bit" \ + -q --q-bits 4 --q-group-size 64 +``` + +## Important Note + +A better, more optimized conversion may be available from **@Prince** ([@Blaizzy](https://huggingface.co/Blaizzy)) in the MLX VLM community. Check the [mlx-community](https://huggingface.co/mlx-community) organization for updated versions as official Qwen3.5 support is merged into the main `mlx-vlm` branch. + +## Related Models + +- **bf16 (full precision):** [mlx-community/Qwen3.5-0.8B-MLX-bf16](https://huggingface.co/mlx-community/Qwen3.5-0.8B-MLX-bf16) +- **8-bit quantized:** [mlx-community/Qwen3.5-0.8B-MLX-8bit](https://huggingface.co/mlx-community/Qwen3.5-0.8B-MLX-8bit) +- **Original:** [Qwen/Qwen3.5-0.8B](https://huggingface.co/Qwen/Qwen3.5-0.8B) + +## Usage + +```python +from mlx_vlm import load, generate + +model, processor = load("mlx-community/Qwen3.5-0.8B-MLX-4bit") + +output = generate( + model, + processor, + prompt="Describe this image.", + image="path/to/image.jpg", + max_tokens=512 +) +print(output) +``` + +**CLI:** +```bash +python3 -m mlx_vlm.generate \ + --model mlx-community/Qwen3.5-0.8B-MLX-4bit \ + --image path/to/image.jpg \ + --prompt "Describe this image." +``` + +## License + +This model inherits the [Apache 2.0 license](https://huggingface.co/Qwen/Qwen3.5-0.8B) from the original Qwen model. diff --git a/chat/mlx/mlx-community/Qwen3.5-0.8B-MLX-4bit/chat_template.jinja b/chat/mlx/mlx-community/Qwen3.5-0.8B-MLX-4bit/chat_template.jinja new file mode 100644 index 0000000..0ef09f2 --- /dev/null +++ b/chat/mlx/mlx-community/Qwen3.5-0.8B-MLX-4bit/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is true %} + {{- '\n' }} + {%- else %} + {{- '\n\n\n\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/chat/mlx/mlx-community/Qwen3.5-0.8B-MLX-4bit/config.json b/chat/mlx/mlx-community/Qwen3.5-0.8B-MLX-4bit/config.json new file mode 100644 index 0000000..f2a232f --- /dev/null +++ b/chat/mlx/mlx-community/Qwen3.5-0.8B-MLX-4bit/config.json @@ -0,0 +1,106 @@ +{ + "architectures": [ + "Qwen3_5ForConditionalGeneration" + ], + "image_token_id": 248056, + "model_type": "qwen3_5", + "quantization": { + "group_size": 64, + "bits": 4, + "mode": "affine" + }, + "quantization_config": { + "group_size": 64, + "bits": 4, + "mode": "affine" + }, + "text_config": { + "attention_bias": false, + "attention_dropout": 0.0, + "attn_output_gate": true, + "dtype": "bfloat16", + "eos_token_id": 248044, + "full_attention_interval": 4, + "head_dim": 256, + "hidden_act": "silu", + "hidden_size": 1024, + "initializer_range": 0.02, + "intermediate_size": 3584, + "layer_types": [ + "linear_attention", + "linear_attention", + "linear_attention", + "full_attention", + "linear_attention", + "linear_attention", + "linear_attention", + "full_attention", + "linear_attention", + "linear_attention", + "linear_attention", + "full_attention", + "linear_attention", + "linear_attention", + "linear_attention", + "full_attention", + "linear_attention", + "linear_attention", + "linear_attention", + "full_attention", + "linear_attention", + "linear_attention", + "linear_attention", + "full_attention" + ], + "linear_conv_kernel_dim": 4, + "linear_key_head_dim": 128, + "linear_num_key_heads": 16, + "linear_num_value_heads": 16, + "linear_value_head_dim": 128, + "max_position_embeddings": 262144, + "mlp_only_layers": [], + "model_type": "qwen3_5_text", + "mtp_num_hidden_layers": 1, + "mtp_use_dedicated_embeddings": false, + "num_attention_heads": 8, + "num_hidden_layers": 24, + "num_key_value_heads": 2, + "rms_norm_eps": 1e-06, + "tie_word_embeddings": true, + "use_cache": true, + "vocab_size": 248320, + "mamba_ssm_dtype": "float32", + "rope_parameters": { + "mrope_interleaved": true, + "mrope_section": [ + 11, + 11, + 10 + ], + "rope_type": "default", + "rope_theta": 10000000, + "partial_rotary_factor": 0.25 + } + }, + "tie_word_embeddings": true, + "transformers_version": "4.57.0.dev0", + "video_token_id": 248057, + "vision_config": { + "deepstack_visual_indexes": [], + "depth": 12, + "hidden_act": "gelu_pytorch_tanh", + "hidden_size": 768, + "in_channels": 3, + "initializer_range": 0.02, + "intermediate_size": 3072, + "model_type": "qwen3_5", + "num_heads": 12, + "num_position_embeddings": 2304, + "out_hidden_size": 1024, + "patch_size": 16, + "spatial_merge_size": 2, + "temporal_patch_size": 2 + }, + "vision_end_token_id": 248054, + "vision_start_token_id": 248053 +} \ No newline at end of file diff --git a/chat/mlx/mlx-community/Qwen3.5-0.8B-MLX-4bit/model.safetensors b/chat/mlx/mlx-community/Qwen3.5-0.8B-MLX-4bit/model.safetensors new file mode 100644 index 0000000..60d8da0 --- /dev/null +++ b/chat/mlx/mlx-community/Qwen3.5-0.8B-MLX-4bit/model.safetensors @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:f5a0d9dd3efa73510542a8023d610ff26be2b4b020d181cfc4bedaa1fcc5dd9e +size 625229487 diff --git a/chat/mlx/mlx-community/Qwen3.5-0.8B-MLX-4bit/model.safetensors.index.json b/chat/mlx/mlx-community/Qwen3.5-0.8B-MLX-4bit/model.safetensors.index.json new file mode 100644 index 0000000..e9a7b62 --- /dev/null +++ b/chat/mlx/mlx-community/Qwen3.5-0.8B-MLX-4bit/model.safetensors.index.json @@ -0,0 +1,854 @@ +{ + "metadata": { + "total_size": 625124032 + }, + "weight_map": { + "language_model.model.embed_tokens.biases": "model.safetensors", + "language_model.model.embed_tokens.scales": "model.safetensors", + "language_model.model.embed_tokens.weight": "model.safetensors", + "language_model.model.layers.0.input_layernorm.weight": "model.safetensors", + "language_model.model.layers.0.linear_attn.A_log": "model.safetensors", + "language_model.model.layers.0.linear_attn.conv1d.weight": "model.safetensors", + "language_model.model.layers.0.linear_attn.dt_bias": "model.safetensors", + "language_model.model.layers.0.linear_attn.in_proj_a.biases": "model.safetensors", + "language_model.model.layers.0.linear_attn.in_proj_a.scales": "model.safetensors", + "language_model.model.layers.0.linear_attn.in_proj_a.weight": "model.safetensors", + "language_model.model.layers.0.linear_attn.in_proj_b.biases": "model.safetensors", + "language_model.model.layers.0.linear_attn.in_proj_b.scales": "model.safetensors", + "language_model.model.layers.0.linear_attn.in_proj_b.weight": "model.safetensors", + "language_model.model.layers.0.linear_attn.in_proj_qkv.biases": "model.safetensors", + "language_model.model.layers.0.linear_attn.in_proj_qkv.scales": "model.safetensors", + "language_model.model.layers.0.linear_attn.in_proj_qkv.weight": "model.safetensors", + "language_model.model.layers.0.linear_attn.in_proj_z.biases": "model.safetensors", + "language_model.model.layers.0.linear_attn.in_proj_z.scales": "model.safetensors", + "language_model.model.layers.0.linear_attn.in_proj_z.weight": "model.safetensors", + "language_model.model.layers.0.linear_attn.norm.weight": "model.safetensors", + "language_model.model.layers.0.linear_attn.out_proj.biases": "model.safetensors", + "language_model.model.layers.0.linear_attn.out_proj.scales": "model.safetensors", + "language_model.model.layers.0.linear_attn.out_proj.weight": "model.safetensors", + "language_model.model.layers.0.mlp.down_proj.biases": "model.safetensors", + "language_model.model.layers.0.mlp.down_proj.scales": "model.safetensors", + "language_model.model.layers.0.mlp.down_proj.weight": "model.safetensors", + "language_model.model.layers.0.mlp.gate_proj.biases": "model.safetensors", + "language_model.model.layers.0.mlp.gate_proj.scales": "model.safetensors", + "language_model.model.layers.0.mlp.gate_proj.weight": "model.safetensors", + "language_model.model.layers.0.mlp.up_proj.biases": "model.safetensors", + "language_model.model.layers.0.mlp.up_proj.scales": "model.safetensors", + "language_model.model.layers.0.mlp.up_proj.weight": "model.safetensors", + "language_model.model.layers.0.post_attention_layernorm.weight": "model.safetensors", + "language_model.model.layers.1.input_layernorm.weight": "model.safetensors", + "language_model.model.layers.1.linear_attn.A_log": "model.safetensors", + "language_model.model.layers.1.linear_attn.conv1d.weight": "model.safetensors", + "language_model.model.layers.1.linear_attn.dt_bias": "model.safetensors", + "language_model.model.layers.1.linear_attn.in_proj_a.biases": "model.safetensors", + "language_model.model.layers.1.linear_attn.in_proj_a.scales": "model.safetensors", + "language_model.model.layers.1.linear_attn.in_proj_a.weight": "model.safetensors", + "language_model.model.layers.1.linear_attn.in_proj_b.biases": "model.safetensors", + "language_model.model.layers.1.linear_attn.in_proj_b.scales": "model.safetensors", + "language_model.model.layers.1.linear_attn.in_proj_b.weight": "model.safetensors", + "language_model.model.layers.1.linear_attn.in_proj_qkv.biases": "model.safetensors", + "language_model.model.layers.1.linear_attn.in_proj_qkv.scales": "model.safetensors", + "language_model.model.layers.1.linear_attn.in_proj_qkv.weight": "model.safetensors", + "language_model.model.layers.1.linear_attn.in_proj_z.biases": "model.safetensors", + "language_model.model.layers.1.linear_attn.in_proj_z.scales": "model.safetensors", + "language_model.model.layers.1.linear_attn.in_proj_z.weight": "model.safetensors", + "language_model.model.layers.1.linear_attn.norm.weight": "model.safetensors", + "language_model.model.layers.1.linear_attn.out_proj.biases": "model.safetensors", + "language_model.model.layers.1.linear_attn.out_proj.scales": "model.safetensors", + "language_model.model.layers.1.linear_attn.out_proj.weight": "model.safetensors", + "language_model.model.layers.1.mlp.down_proj.biases": "model.safetensors", + "language_model.model.layers.1.mlp.down_proj.scales": "model.safetensors", + "language_model.model.layers.1.mlp.down_proj.weight": "model.safetensors", + "language_model.model.layers.1.mlp.gate_proj.biases": "model.safetensors", + "language_model.model.layers.1.mlp.gate_proj.scales": "model.safetensors", + "language_model.model.layers.1.mlp.gate_proj.weight": "model.safetensors", + "language_model.model.layers.1.mlp.up_proj.biases": "model.safetensors", + "language_model.model.layers.1.mlp.up_proj.scales": "model.safetensors", + "language_model.model.layers.1.mlp.up_proj.weight": "model.safetensors", + "language_model.model.layers.1.post_attention_layernorm.weight": "model.safetensors", + "language_model.model.layers.10.input_layernorm.weight": "model.safetensors", + "language_model.model.layers.10.linear_attn.A_log": "model.safetensors", + "language_model.model.layers.10.linear_attn.conv1d.weight": "model.safetensors", + "language_model.model.layers.10.linear_attn.dt_bias": "model.safetensors", + "language_model.model.layers.10.linear_attn.in_proj_a.biases": "model.safetensors", + "language_model.model.layers.10.linear_attn.in_proj_a.scales": "model.safetensors", + "language_model.model.layers.10.linear_attn.in_proj_a.weight": "model.safetensors", + "language_model.model.layers.10.linear_attn.in_proj_b.biases": "model.safetensors", + "language_model.model.layers.10.linear_attn.in_proj_b.scales": "model.safetensors", + "language_model.model.layers.10.linear_attn.in_proj_b.weight": "model.safetensors", + "language_model.model.layers.10.linear_attn.in_proj_qkv.biases": "model.safetensors", + "language_model.model.layers.10.linear_attn.in_proj_qkv.scales": "model.safetensors", + "language_model.model.layers.10.linear_attn.in_proj_qkv.weight": "model.safetensors", + "language_model.model.layers.10.linear_attn.in_proj_z.biases": "model.safetensors", + "language_model.model.layers.10.linear_attn.in_proj_z.scales": "model.safetensors", + "language_model.model.layers.10.linear_attn.in_proj_z.weight": "model.safetensors", + "language_model.model.layers.10.linear_attn.norm.weight": "model.safetensors", + "language_model.model.layers.10.linear_attn.out_proj.biases": "model.safetensors", + "language_model.model.layers.10.linear_attn.out_proj.scales": "model.safetensors", + "language_model.model.layers.10.linear_attn.out_proj.weight": "model.safetensors", + "language_model.model.layers.10.mlp.down_proj.biases": "model.safetensors", + "language_model.model.layers.10.mlp.down_proj.scales": "model.safetensors", + "language_model.model.layers.10.mlp.down_proj.weight": "model.safetensors", + "language_model.model.layers.10.mlp.gate_proj.biases": "model.safetensors", + "language_model.model.layers.10.mlp.gate_proj.scales": "model.safetensors", + "language_model.model.layers.10.mlp.gate_proj.weight": "model.safetensors", + "language_model.model.layers.10.mlp.up_proj.biases": "model.safetensors", + "language_model.model.layers.10.mlp.up_proj.scales": "model.safetensors", + "language_model.model.layers.10.mlp.up_proj.weight": "model.safetensors", + "language_model.model.layers.10.post_attention_layernorm.weight": "model.safetensors", + "language_model.model.layers.11.input_layernorm.weight": "model.safetensors", + "language_model.model.layers.11.mlp.down_proj.biases": "model.safetensors", + "language_model.model.layers.11.mlp.down_proj.scales": "model.safetensors", + "language_model.model.layers.11.mlp.down_proj.weight": "model.safetensors", + "language_model.model.layers.11.mlp.gate_proj.biases": "model.safetensors", + "language_model.model.layers.11.mlp.gate_proj.scales": "model.safetensors", + "language_model.model.layers.11.mlp.gate_proj.weight": "model.safetensors", + "language_model.model.layers.11.mlp.up_proj.biases": "model.safetensors", + "language_model.model.layers.11.mlp.up_proj.scales": "model.safetensors", + "language_model.model.layers.11.mlp.up_proj.weight": "model.safetensors", + "language_model.model.layers.11.post_attention_layernorm.weight": "model.safetensors", + "language_model.model.layers.11.self_attn.k_norm.weight": "model.safetensors", + "language_model.model.layers.11.self_attn.k_proj.biases": "model.safetensors", + "language_model.model.layers.11.self_attn.k_proj.scales": "model.safetensors", + "language_model.model.layers.11.self_attn.k_proj.weight": "model.safetensors", + "language_model.model.layers.11.self_attn.o_proj.biases": "model.safetensors", + "language_model.model.layers.11.self_attn.o_proj.scales": "model.safetensors", + "language_model.model.layers.11.self_attn.o_proj.weight": "model.safetensors", + "language_model.model.layers.11.self_attn.q_norm.weight": "model.safetensors", + "language_model.model.layers.11.self_attn.q_proj.biases": "model.safetensors", + "language_model.model.layers.11.self_attn.q_proj.scales": "model.safetensors", + "language_model.model.layers.11.self_attn.q_proj.weight": "model.safetensors", + "language_model.model.layers.11.self_attn.v_proj.biases": "model.safetensors", + "language_model.model.layers.11.self_attn.v_proj.scales": "model.safetensors", + "language_model.model.layers.11.self_attn.v_proj.weight": "model.safetensors", + "language_model.model.layers.12.input_layernorm.weight": "model.safetensors", + "language_model.model.layers.12.linear_attn.A_log": "model.safetensors", + "language_model.model.layers.12.linear_attn.conv1d.weight": "model.safetensors", + "language_model.model.layers.12.linear_attn.dt_bias": "model.safetensors", + "language_model.model.layers.12.linear_attn.in_proj_a.biases": "model.safetensors", + "language_model.model.layers.12.linear_attn.in_proj_a.scales": "model.safetensors", + "language_model.model.layers.12.linear_attn.in_proj_a.weight": "model.safetensors", + "language_model.model.layers.12.linear_attn.in_proj_b.biases": "model.safetensors", + "language_model.model.layers.12.linear_attn.in_proj_b.scales": "model.safetensors", + "language_model.model.layers.12.linear_attn.in_proj_b.weight": "model.safetensors", + "language_model.model.layers.12.linear_attn.in_proj_qkv.biases": "model.safetensors", + "language_model.model.layers.12.linear_attn.in_proj_qkv.scales": "model.safetensors", + "language_model.model.layers.12.linear_attn.in_proj_qkv.weight": "model.safetensors", + "language_model.model.layers.12.linear_attn.in_proj_z.biases": "model.safetensors", + "language_model.model.layers.12.linear_attn.in_proj_z.scales": "model.safetensors", + "language_model.model.layers.12.linear_attn.in_proj_z.weight": "model.safetensors", + "language_model.model.layers.12.linear_attn.norm.weight": "model.safetensors", + "language_model.model.layers.12.linear_attn.out_proj.biases": "model.safetensors", + "language_model.model.layers.12.linear_attn.out_proj.scales": "model.safetensors", + "language_model.model.layers.12.linear_attn.out_proj.weight": "model.safetensors", + "language_model.model.layers.12.mlp.down_proj.biases": "model.safetensors", + "language_model.model.layers.12.mlp.down_proj.scales": "model.safetensors", + "language_model.model.layers.12.mlp.down_proj.weight": "model.safetensors", + "language_model.model.layers.12.mlp.gate_proj.biases": "model.safetensors", + "language_model.model.layers.12.mlp.gate_proj.scales": "model.safetensors", + "language_model.model.layers.12.mlp.gate_proj.weight": "model.safetensors", + "language_model.model.layers.12.mlp.up_proj.biases": "model.safetensors", + "language_model.model.layers.12.mlp.up_proj.scales": "model.safetensors", + "language_model.model.layers.12.mlp.up_proj.weight": "model.safetensors", + "language_model.model.layers.12.post_attention_layernorm.weight": "model.safetensors", + "language_model.model.layers.13.input_layernorm.weight": "model.safetensors", + "language_model.model.layers.13.linear_attn.A_log": "model.safetensors", + "language_model.model.layers.13.linear_attn.conv1d.weight": "model.safetensors", + "language_model.model.layers.13.linear_attn.dt_bias": "model.safetensors", + "language_model.model.layers.13.linear_attn.in_proj_a.biases": "model.safetensors", + "language_model.model.layers.13.linear_attn.in_proj_a.scales": "model.safetensors", + "language_model.model.layers.13.linear_attn.in_proj_a.weight": "model.safetensors", + "language_model.model.layers.13.linear_attn.in_proj_b.biases": "model.safetensors", + "language_model.model.layers.13.linear_attn.in_proj_b.scales": "model.safetensors", + "language_model.model.layers.13.linear_attn.in_proj_b.weight": "model.safetensors", + "language_model.model.layers.13.linear_attn.in_proj_qkv.biases": "model.safetensors", + "language_model.model.layers.13.linear_attn.in_proj_qkv.scales": "model.safetensors", + "language_model.model.layers.13.linear_attn.in_proj_qkv.weight": "model.safetensors", + "language_model.model.layers.13.linear_attn.in_proj_z.biases": "model.safetensors", + "language_model.model.layers.13.linear_attn.in_proj_z.scales": "model.safetensors", + "language_model.model.layers.13.linear_attn.in_proj_z.weight": "model.safetensors", + "language_model.model.layers.13.linear_attn.norm.weight": "model.safetensors", + "language_model.model.layers.13.linear_attn.out_proj.biases": "model.safetensors", + "language_model.model.layers.13.linear_attn.out_proj.scales": "model.safetensors", + "language_model.model.layers.13.linear_attn.out_proj.weight": "model.safetensors", + "language_model.model.layers.13.mlp.down_proj.biases": "model.safetensors", + "language_model.model.layers.13.mlp.down_proj.scales": "model.safetensors", + "language_model.model.layers.13.mlp.down_proj.weight": "model.safetensors", + "language_model.model.layers.13.mlp.gate_proj.biases": "model.safetensors", + "language_model.model.layers.13.mlp.gate_proj.scales": "model.safetensors", + "language_model.model.layers.13.mlp.gate_proj.weight": "model.safetensors", + "language_model.model.layers.13.mlp.up_proj.biases": "model.safetensors", + "language_model.model.layers.13.mlp.up_proj.scales": "model.safetensors", + "language_model.model.layers.13.mlp.up_proj.weight": "model.safetensors", + "language_model.model.layers.13.post_attention_layernorm.weight": "model.safetensors", + "language_model.model.layers.14.input_layernorm.weight": "model.safetensors", + "language_model.model.layers.14.linear_attn.A_log": "model.safetensors", + "language_model.model.layers.14.linear_attn.conv1d.weight": "model.safetensors", + "language_model.model.layers.14.linear_attn.dt_bias": "model.safetensors", + "language_model.model.layers.14.linear_attn.in_proj_a.biases": "model.safetensors", + "language_model.model.layers.14.linear_attn.in_proj_a.scales": "model.safetensors", + "language_model.model.layers.14.linear_attn.in_proj_a.weight": "model.safetensors", + "language_model.model.layers.14.linear_attn.in_proj_b.biases": "model.safetensors", + "language_model.model.layers.14.linear_attn.in_proj_b.scales": "model.safetensors", + "language_model.model.layers.14.linear_attn.in_proj_b.weight": "model.safetensors", + "language_model.model.layers.14.linear_attn.in_proj_qkv.biases": "model.safetensors", + "language_model.model.layers.14.linear_attn.in_proj_qkv.scales": "model.safetensors", + "language_model.model.layers.14.linear_attn.in_proj_qkv.weight": "model.safetensors", + "language_model.model.layers.14.linear_attn.in_proj_z.biases": "model.safetensors", + "language_model.model.layers.14.linear_attn.in_proj_z.scales": "model.safetensors", + "language_model.model.layers.14.linear_attn.in_proj_z.weight": "model.safetensors", + "language_model.model.layers.14.linear_attn.norm.weight": "model.safetensors", + "language_model.model.layers.14.linear_attn.out_proj.biases": "model.safetensors", + "language_model.model.layers.14.linear_attn.out_proj.scales": "model.safetensors", + "language_model.model.layers.14.linear_attn.out_proj.weight": "model.safetensors", + "language_model.model.layers.14.mlp.down_proj.biases": "model.safetensors", + "language_model.model.layers.14.mlp.down_proj.scales": "model.safetensors", + "language_model.model.layers.14.mlp.down_proj.weight": "model.safetensors", + "language_model.model.layers.14.mlp.gate_proj.biases": "model.safetensors", + "language_model.model.layers.14.mlp.gate_proj.scales": "model.safetensors", + "language_model.model.layers.14.mlp.gate_proj.weight": "model.safetensors", + "language_model.model.layers.14.mlp.up_proj.biases": "model.safetensors", + "language_model.model.layers.14.mlp.up_proj.scales": "model.safetensors", + "language_model.model.layers.14.mlp.up_proj.weight": "model.safetensors", + "language_model.model.layers.14.post_attention_layernorm.weight": "model.safetensors", + "language_model.model.layers.15.input_layernorm.weight": "model.safetensors", + "language_model.model.layers.15.mlp.down_proj.biases": "model.safetensors", + "language_model.model.layers.15.mlp.down_proj.scales": "model.safetensors", + "language_model.model.layers.15.mlp.down_proj.weight": "model.safetensors", + "language_model.model.layers.15.mlp.gate_proj.biases": "model.safetensors", + "language_model.model.layers.15.mlp.gate_proj.scales": "model.safetensors", + "language_model.model.layers.15.mlp.gate_proj.weight": "model.safetensors", + "language_model.model.layers.15.mlp.up_proj.biases": "model.safetensors", + "language_model.model.layers.15.mlp.up_proj.scales": "model.safetensors", + "language_model.model.layers.15.mlp.up_proj.weight": "model.safetensors", + "language_model.model.layers.15.post_attention_layernorm.weight": "model.safetensors", + "language_model.model.layers.15.self_attn.k_norm.weight": "model.safetensors", + "language_model.model.layers.15.self_attn.k_proj.biases": "model.safetensors", + "language_model.model.layers.15.self_attn.k_proj.scales": "model.safetensors", + "language_model.model.layers.15.self_attn.k_proj.weight": "model.safetensors", + "language_model.model.layers.15.self_attn.o_proj.biases": "model.safetensors", + "language_model.model.layers.15.self_attn.o_proj.scales": "model.safetensors", + "language_model.model.layers.15.self_attn.o_proj.weight": "model.safetensors", + "language_model.model.layers.15.self_attn.q_norm.weight": "model.safetensors", + "language_model.model.layers.15.self_attn.q_proj.biases": "model.safetensors", + "language_model.model.layers.15.self_attn.q_proj.scales": "model.safetensors", + "language_model.model.layers.15.self_attn.q_proj.weight": "model.safetensors", + "language_model.model.layers.15.self_attn.v_proj.biases": "model.safetensors", + "language_model.model.layers.15.self_attn.v_proj.scales": "model.safetensors", + "language_model.model.layers.15.self_attn.v_proj.weight": "model.safetensors", + "language_model.model.layers.16.input_layernorm.weight": "model.safetensors", + "language_model.model.layers.16.linear_attn.A_log": "model.safetensors", + "language_model.model.layers.16.linear_attn.conv1d.weight": "model.safetensors", + "language_model.model.layers.16.linear_attn.dt_bias": "model.safetensors", + "language_model.model.layers.16.linear_attn.in_proj_a.biases": "model.safetensors", + "language_model.model.layers.16.linear_attn.in_proj_a.scales": "model.safetensors", + "language_model.model.layers.16.linear_attn.in_proj_a.weight": "model.safetensors", + "language_model.model.layers.16.linear_attn.in_proj_b.biases": "model.safetensors", + "language_model.model.layers.16.linear_attn.in_proj_b.scales": "model.safetensors", + "language_model.model.layers.16.linear_attn.in_proj_b.weight": "model.safetensors", + "language_model.model.layers.16.linear_attn.in_proj_qkv.biases": "model.safetensors", + "language_model.model.layers.16.linear_attn.in_proj_qkv.scales": "model.safetensors", + "language_model.model.layers.16.linear_attn.in_proj_qkv.weight": "model.safetensors", + "language_model.model.layers.16.linear_attn.in_proj_z.biases": "model.safetensors", + "language_model.model.layers.16.linear_attn.in_proj_z.scales": "model.safetensors", + "language_model.model.layers.16.linear_attn.in_proj_z.weight": "model.safetensors", + "language_model.model.layers.16.linear_attn.norm.weight": "model.safetensors", + "language_model.model.layers.16.linear_attn.out_proj.biases": "model.safetensors", + "language_model.model.layers.16.linear_attn.out_proj.scales": "model.safetensors", + "language_model.model.layers.16.linear_attn.out_proj.weight": "model.safetensors", + "language_model.model.layers.16.mlp.down_proj.biases": "model.safetensors", + "language_model.model.layers.16.mlp.down_proj.scales": "model.safetensors", + "language_model.model.layers.16.mlp.down_proj.weight": "model.safetensors", + "language_model.model.layers.16.mlp.gate_proj.biases": "model.safetensors", + "language_model.model.layers.16.mlp.gate_proj.scales": "model.safetensors", + "language_model.model.layers.16.mlp.gate_proj.weight": "model.safetensors", + "language_model.model.layers.16.mlp.up_proj.biases": "model.safetensors", + "language_model.model.layers.16.mlp.up_proj.scales": "model.safetensors", + "language_model.model.layers.16.mlp.up_proj.weight": "model.safetensors", + "language_model.model.layers.16.post_attention_layernorm.weight": "model.safetensors", + "language_model.model.layers.17.input_layernorm.weight": "model.safetensors", + "language_model.model.layers.17.linear_attn.A_log": "model.safetensors", + "language_model.model.layers.17.linear_attn.conv1d.weight": "model.safetensors", + "language_model.model.layers.17.linear_attn.dt_bias": "model.safetensors", + "language_model.model.layers.17.linear_attn.in_proj_a.biases": "model.safetensors", + "language_model.model.layers.17.linear_attn.in_proj_a.scales": "model.safetensors", + "language_model.model.layers.17.linear_attn.in_proj_a.weight": "model.safetensors", + "language_model.model.layers.17.linear_attn.in_proj_b.biases": "model.safetensors", + "language_model.model.layers.17.linear_attn.in_proj_b.scales": "model.safetensors", + "language_model.model.layers.17.linear_attn.in_proj_b.weight": "model.safetensors", + "language_model.model.layers.17.linear_attn.in_proj_qkv.biases": "model.safetensors", + "language_model.model.layers.17.linear_attn.in_proj_qkv.scales": "model.safetensors", + "language_model.model.layers.17.linear_attn.in_proj_qkv.weight": "model.safetensors", + "language_model.model.layers.17.linear_attn.in_proj_z.biases": "model.safetensors", + "language_model.model.layers.17.linear_attn.in_proj_z.scales": "model.safetensors", + "language_model.model.layers.17.linear_attn.in_proj_z.weight": "model.safetensors", + "language_model.model.layers.17.linear_attn.norm.weight": "model.safetensors", + "language_model.model.layers.17.linear_attn.out_proj.biases": "model.safetensors", + "language_model.model.layers.17.linear_attn.out_proj.scales": "model.safetensors", + "language_model.model.layers.17.linear_attn.out_proj.weight": "model.safetensors", + "language_model.model.layers.17.mlp.down_proj.biases": "model.safetensors", + "language_model.model.layers.17.mlp.down_proj.scales": "model.safetensors", + "language_model.model.layers.17.mlp.down_proj.weight": "model.safetensors", + "language_model.model.layers.17.mlp.gate_proj.biases": "model.safetensors", + "language_model.model.layers.17.mlp.gate_proj.scales": "model.safetensors", + "language_model.model.layers.17.mlp.gate_proj.weight": "model.safetensors", + "language_model.model.layers.17.mlp.up_proj.biases": "model.safetensors", + "language_model.model.layers.17.mlp.up_proj.scales": "model.safetensors", + "language_model.model.layers.17.mlp.up_proj.weight": "model.safetensors", + "language_model.model.layers.17.post_attention_layernorm.weight": "model.safetensors", + "language_model.model.layers.18.input_layernorm.weight": "model.safetensors", + "language_model.model.layers.18.linear_attn.A_log": "model.safetensors", + "language_model.model.layers.18.linear_attn.conv1d.weight": "model.safetensors", + "language_model.model.layers.18.linear_attn.dt_bias": "model.safetensors", + "language_model.model.layers.18.linear_attn.in_proj_a.biases": "model.safetensors", + "language_model.model.layers.18.linear_attn.in_proj_a.scales": "model.safetensors", + "language_model.model.layers.18.linear_attn.in_proj_a.weight": "model.safetensors", + "language_model.model.layers.18.linear_attn.in_proj_b.biases": "model.safetensors", + "language_model.model.layers.18.linear_attn.in_proj_b.scales": "model.safetensors", + "language_model.model.layers.18.linear_attn.in_proj_b.weight": "model.safetensors", + "language_model.model.layers.18.linear_attn.in_proj_qkv.biases": "model.safetensors", + "language_model.model.layers.18.linear_attn.in_proj_qkv.scales": "model.safetensors", + "language_model.model.layers.18.linear_attn.in_proj_qkv.weight": "model.safetensors", + "language_model.model.layers.18.linear_attn.in_proj_z.biases": "model.safetensors", + "language_model.model.layers.18.linear_attn.in_proj_z.scales": "model.safetensors", + "language_model.model.layers.18.linear_attn.in_proj_z.weight": "model.safetensors", + "language_model.model.layers.18.linear_attn.norm.weight": "model.safetensors", + "language_model.model.layers.18.linear_attn.out_proj.biases": "model.safetensors", + "language_model.model.layers.18.linear_attn.out_proj.scales": "model.safetensors", + "language_model.model.layers.18.linear_attn.out_proj.weight": "model.safetensors", + "language_model.model.layers.18.mlp.down_proj.biases": "model.safetensors", + "language_model.model.layers.18.mlp.down_proj.scales": "model.safetensors", + "language_model.model.layers.18.mlp.down_proj.weight": "model.safetensors", + "language_model.model.layers.18.mlp.gate_proj.biases": "model.safetensors", + "language_model.model.layers.18.mlp.gate_proj.scales": "model.safetensors", + "language_model.model.layers.18.mlp.gate_proj.weight": "model.safetensors", + "language_model.model.layers.18.mlp.up_proj.biases": "model.safetensors", + "language_model.model.layers.18.mlp.up_proj.scales": "model.safetensors", + "language_model.model.layers.18.mlp.up_proj.weight": "model.safetensors", + "language_model.model.layers.18.post_attention_layernorm.weight": "model.safetensors", + "language_model.model.layers.19.input_layernorm.weight": "model.safetensors", + "language_model.model.layers.19.mlp.down_proj.biases": "model.safetensors", + "language_model.model.layers.19.mlp.down_proj.scales": "model.safetensors", + "language_model.model.layers.19.mlp.down_proj.weight": "model.safetensors", + "language_model.model.layers.19.mlp.gate_proj.biases": "model.safetensors", + "language_model.model.layers.19.mlp.gate_proj.scales": "model.safetensors", + "language_model.model.layers.19.mlp.gate_proj.weight": "model.safetensors", + "language_model.model.layers.19.mlp.up_proj.biases": "model.safetensors", + "language_model.model.layers.19.mlp.up_proj.scales": "model.safetensors", + "language_model.model.layers.19.mlp.up_proj.weight": "model.safetensors", + "language_model.model.layers.19.post_attention_layernorm.weight": "model.safetensors", + "language_model.model.layers.19.self_attn.k_norm.weight": "model.safetensors", + "language_model.model.layers.19.self_attn.k_proj.biases": "model.safetensors", + "language_model.model.layers.19.self_attn.k_proj.scales": "model.safetensors", + "language_model.model.layers.19.self_attn.k_proj.weight": "model.safetensors", + "language_model.model.layers.19.self_attn.o_proj.biases": "model.safetensors", + "language_model.model.layers.19.self_attn.o_proj.scales": "model.safetensors", + "language_model.model.layers.19.self_attn.o_proj.weight": "model.safetensors", + "language_model.model.layers.19.self_attn.q_norm.weight": "model.safetensors", + "language_model.model.layers.19.self_attn.q_proj.biases": "model.safetensors", + "language_model.model.layers.19.self_attn.q_proj.scales": "model.safetensors", + "language_model.model.layers.19.self_attn.q_proj.weight": "model.safetensors", + "language_model.model.layers.19.self_attn.v_proj.biases": "model.safetensors", + "language_model.model.layers.19.self_attn.v_proj.scales": "model.safetensors", + "language_model.model.layers.19.self_attn.v_proj.weight": "model.safetensors", + "language_model.model.layers.2.input_layernorm.weight": "model.safetensors", + "language_model.model.layers.2.linear_attn.A_log": "model.safetensors", + "language_model.model.layers.2.linear_attn.conv1d.weight": "model.safetensors", + "language_model.model.layers.2.linear_attn.dt_bias": "model.safetensors", + "language_model.model.layers.2.linear_attn.in_proj_a.biases": "model.safetensors", + "language_model.model.layers.2.linear_attn.in_proj_a.scales": "model.safetensors", + "language_model.model.layers.2.linear_attn.in_proj_a.weight": "model.safetensors", + "language_model.model.layers.2.linear_attn.in_proj_b.biases": "model.safetensors", + "language_model.model.layers.2.linear_attn.in_proj_b.scales": "model.safetensors", + "language_model.model.layers.2.linear_attn.in_proj_b.weight": "model.safetensors", + "language_model.model.layers.2.linear_attn.in_proj_qkv.biases": "model.safetensors", + "language_model.model.layers.2.linear_attn.in_proj_qkv.scales": "model.safetensors", + "language_model.model.layers.2.linear_attn.in_proj_qkv.weight": "model.safetensors", + "language_model.model.layers.2.linear_attn.in_proj_z.biases": "model.safetensors", + "language_model.model.layers.2.linear_attn.in_proj_z.scales": "model.safetensors", + "language_model.model.layers.2.linear_attn.in_proj_z.weight": "model.safetensors", + "language_model.model.layers.2.linear_attn.norm.weight": "model.safetensors", + "language_model.model.layers.2.linear_attn.out_proj.biases": "model.safetensors", + "language_model.model.layers.2.linear_attn.out_proj.scales": "model.safetensors", + "language_model.model.layers.2.linear_attn.out_proj.weight": "model.safetensors", + "language_model.model.layers.2.mlp.down_proj.biases": "model.safetensors", + "language_model.model.layers.2.mlp.down_proj.scales": "model.safetensors", + "language_model.model.layers.2.mlp.down_proj.weight": "model.safetensors", + "language_model.model.layers.2.mlp.gate_proj.biases": "model.safetensors", + "language_model.model.layers.2.mlp.gate_proj.scales": "model.safetensors", + "language_model.model.layers.2.mlp.gate_proj.weight": "model.safetensors", + "language_model.model.layers.2.mlp.up_proj.biases": "model.safetensors", + "language_model.model.layers.2.mlp.up_proj.scales": "model.safetensors", + "language_model.model.layers.2.mlp.up_proj.weight": "model.safetensors", + "language_model.model.layers.2.post_attention_layernorm.weight": "model.safetensors", + "language_model.model.layers.20.input_layernorm.weight": "model.safetensors", + "language_model.model.layers.20.linear_attn.A_log": "model.safetensors", + "language_model.model.layers.20.linear_attn.conv1d.weight": "model.safetensors", + "language_model.model.layers.20.linear_attn.dt_bias": "model.safetensors", + "language_model.model.layers.20.linear_attn.in_proj_a.biases": "model.safetensors", + "language_model.model.layers.20.linear_attn.in_proj_a.scales": "model.safetensors", + "language_model.model.layers.20.linear_attn.in_proj_a.weight": "model.safetensors", + "language_model.model.layers.20.linear_attn.in_proj_b.biases": "model.safetensors", + "language_model.model.layers.20.linear_attn.in_proj_b.scales": "model.safetensors", + "language_model.model.layers.20.linear_attn.in_proj_b.weight": "model.safetensors", + "language_model.model.layers.20.linear_attn.in_proj_qkv.biases": "model.safetensors", + "language_model.model.layers.20.linear_attn.in_proj_qkv.scales": "model.safetensors", + "language_model.model.layers.20.linear_attn.in_proj_qkv.weight": "model.safetensors", + "language_model.model.layers.20.linear_attn.in_proj_z.biases": "model.safetensors", + "language_model.model.layers.20.linear_attn.in_proj_z.scales": "model.safetensors", + "language_model.model.layers.20.linear_attn.in_proj_z.weight": "model.safetensors", + "language_model.model.layers.20.linear_attn.norm.weight": "model.safetensors", + "language_model.model.layers.20.linear_attn.out_proj.biases": "model.safetensors", + "language_model.model.layers.20.linear_attn.out_proj.scales": "model.safetensors", + "language_model.model.layers.20.linear_attn.out_proj.weight": "model.safetensors", + "language_model.model.layers.20.mlp.down_proj.biases": "model.safetensors", + "language_model.model.layers.20.mlp.down_proj.scales": "model.safetensors", + "language_model.model.layers.20.mlp.down_proj.weight": "model.safetensors", + "language_model.model.layers.20.mlp.gate_proj.biases": "model.safetensors", + "language_model.model.layers.20.mlp.gate_proj.scales": "model.safetensors", + "language_model.model.layers.20.mlp.gate_proj.weight": "model.safetensors", + "language_model.model.layers.20.mlp.up_proj.biases": "model.safetensors", + "language_model.model.layers.20.mlp.up_proj.scales": "model.safetensors", + "language_model.model.layers.20.mlp.up_proj.weight": "model.safetensors", + "language_model.model.layers.20.post_attention_layernorm.weight": "model.safetensors", + "language_model.model.layers.21.input_layernorm.weight": "model.safetensors", + "language_model.model.layers.21.linear_attn.A_log": "model.safetensors", + "language_model.model.layers.21.linear_attn.conv1d.weight": "model.safetensors", + "language_model.model.layers.21.linear_attn.dt_bias": "model.safetensors", + "language_model.model.layers.21.linear_attn.in_proj_a.biases": "model.safetensors", + "language_model.model.layers.21.linear_attn.in_proj_a.scales": "model.safetensors", + "language_model.model.layers.21.linear_attn.in_proj_a.weight": "model.safetensors", + "language_model.model.layers.21.linear_attn.in_proj_b.biases": "model.safetensors", + "language_model.model.layers.21.linear_attn.in_proj_b.scales": "model.safetensors", + "language_model.model.layers.21.linear_attn.in_proj_b.weight": "model.safetensors", + "language_model.model.layers.21.linear_attn.in_proj_qkv.biases": "model.safetensors", + "language_model.model.layers.21.linear_attn.in_proj_qkv.scales": "model.safetensors", + "language_model.model.layers.21.linear_attn.in_proj_qkv.weight": "model.safetensors", + "language_model.model.layers.21.linear_attn.in_proj_z.biases": "model.safetensors", + "language_model.model.layers.21.linear_attn.in_proj_z.scales": "model.safetensors", + "language_model.model.layers.21.linear_attn.in_proj_z.weight": "model.safetensors", + "language_model.model.layers.21.linear_attn.norm.weight": "model.safetensors", + "language_model.model.layers.21.linear_attn.out_proj.biases": "model.safetensors", + "language_model.model.layers.21.linear_attn.out_proj.scales": "model.safetensors", + "language_model.model.layers.21.linear_attn.out_proj.weight": "model.safetensors", + "language_model.model.layers.21.mlp.down_proj.biases": "model.safetensors", + "language_model.model.layers.21.mlp.down_proj.scales": "model.safetensors", + "language_model.model.layers.21.mlp.down_proj.weight": "model.safetensors", + "language_model.model.layers.21.mlp.gate_proj.biases": "model.safetensors", + "language_model.model.layers.21.mlp.gate_proj.scales": "model.safetensors", + "language_model.model.layers.21.mlp.gate_proj.weight": "model.safetensors", + "language_model.model.layers.21.mlp.up_proj.biases": "model.safetensors", + "language_model.model.layers.21.mlp.up_proj.scales": "model.safetensors", + "language_model.model.layers.21.mlp.up_proj.weight": "model.safetensors", + "language_model.model.layers.21.post_attention_layernorm.weight": "model.safetensors", + "language_model.model.layers.22.input_layernorm.weight": "model.safetensors", + "language_model.model.layers.22.linear_attn.A_log": "model.safetensors", + "language_model.model.layers.22.linear_attn.conv1d.weight": "model.safetensors", + "language_model.model.layers.22.linear_attn.dt_bias": "model.safetensors", + "language_model.model.layers.22.linear_attn.in_proj_a.biases": "model.safetensors", + "language_model.model.layers.22.linear_attn.in_proj_a.scales": "model.safetensors", + "language_model.model.layers.22.linear_attn.in_proj_a.weight": "model.safetensors", + "language_model.model.layers.22.linear_attn.in_proj_b.biases": "model.safetensors", + "language_model.model.layers.22.linear_attn.in_proj_b.scales": "model.safetensors", + "language_model.model.layers.22.linear_attn.in_proj_b.weight": "model.safetensors", + "language_model.model.layers.22.linear_attn.in_proj_qkv.biases": "model.safetensors", + "language_model.model.layers.22.linear_attn.in_proj_qkv.scales": "model.safetensors", + "language_model.model.layers.22.linear_attn.in_proj_qkv.weight": "model.safetensors", + "language_model.model.layers.22.linear_attn.in_proj_z.biases": "model.safetensors", + "language_model.model.layers.22.linear_attn.in_proj_z.scales": "model.safetensors", + "language_model.model.layers.22.linear_attn.in_proj_z.weight": "model.safetensors", + "language_model.model.layers.22.linear_attn.norm.weight": "model.safetensors", + "language_model.model.layers.22.linear_attn.out_proj.biases": "model.safetensors", + "language_model.model.layers.22.linear_attn.out_proj.scales": "model.safetensors", + "language_model.model.layers.22.linear_attn.out_proj.weight": "model.safetensors", + "language_model.model.layers.22.mlp.down_proj.biases": "model.safetensors", + "language_model.model.layers.22.mlp.down_proj.scales": "model.safetensors", + "language_model.model.layers.22.mlp.down_proj.weight": "model.safetensors", + "language_model.model.layers.22.mlp.gate_proj.biases": "model.safetensors", + "language_model.model.layers.22.mlp.gate_proj.scales": "model.safetensors", + "language_model.model.layers.22.mlp.gate_proj.weight": "model.safetensors", + "language_model.model.layers.22.mlp.up_proj.biases": "model.safetensors", + "language_model.model.layers.22.mlp.up_proj.scales": "model.safetensors", + "language_model.model.layers.22.mlp.up_proj.weight": "model.safetensors", + "language_model.model.layers.22.post_attention_layernorm.weight": "model.safetensors", + "language_model.model.layers.23.input_layernorm.weight": "model.safetensors", + "language_model.model.layers.23.mlp.down_proj.biases": "model.safetensors", + "language_model.model.layers.23.mlp.down_proj.scales": "model.safetensors", + "language_model.model.layers.23.mlp.down_proj.weight": "model.safetensors", + "language_model.model.layers.23.mlp.gate_proj.biases": "model.safetensors", + "language_model.model.layers.23.mlp.gate_proj.scales": "model.safetensors", + "language_model.model.layers.23.mlp.gate_proj.weight": "model.safetensors", + "language_model.model.layers.23.mlp.up_proj.biases": "model.safetensors", + "language_model.model.layers.23.mlp.up_proj.scales": "model.safetensors", + "language_model.model.layers.23.mlp.up_proj.weight": "model.safetensors", + "language_model.model.layers.23.post_attention_layernorm.weight": "model.safetensors", + "language_model.model.layers.23.self_attn.k_norm.weight": "model.safetensors", + "language_model.model.layers.23.self_attn.k_proj.biases": "model.safetensors", + "language_model.model.layers.23.self_attn.k_proj.scales": "model.safetensors", + "language_model.model.layers.23.self_attn.k_proj.weight": "model.safetensors", + "language_model.model.layers.23.self_attn.o_proj.biases": "model.safetensors", + "language_model.model.layers.23.self_attn.o_proj.scales": "model.safetensors", + "language_model.model.layers.23.self_attn.o_proj.weight": "model.safetensors", + "language_model.model.layers.23.self_attn.q_norm.weight": "model.safetensors", + "language_model.model.layers.23.self_attn.q_proj.biases": "model.safetensors", + "language_model.model.layers.23.self_attn.q_proj.scales": "model.safetensors", + "language_model.model.layers.23.self_attn.q_proj.weight": "model.safetensors", + "language_model.model.layers.23.self_attn.v_proj.biases": "model.safetensors", + "language_model.model.layers.23.self_attn.v_proj.scales": "model.safetensors", + "language_model.model.layers.23.self_attn.v_proj.weight": "model.safetensors", + "language_model.model.layers.3.input_layernorm.weight": "model.safetensors", + "language_model.model.layers.3.mlp.down_proj.biases": "model.safetensors", + "language_model.model.layers.3.mlp.down_proj.scales": "model.safetensors", + "language_model.model.layers.3.mlp.down_proj.weight": "model.safetensors", + "language_model.model.layers.3.mlp.gate_proj.biases": "model.safetensors", + "language_model.model.layers.3.mlp.gate_proj.scales": "model.safetensors", + "language_model.model.layers.3.mlp.gate_proj.weight": "model.safetensors", + "language_model.model.layers.3.mlp.up_proj.biases": "model.safetensors", + "language_model.model.layers.3.mlp.up_proj.scales": "model.safetensors", + "language_model.model.layers.3.mlp.up_proj.weight": "model.safetensors", + "language_model.model.layers.3.post_attention_layernorm.weight": "model.safetensors", + "language_model.model.layers.3.self_attn.k_norm.weight": "model.safetensors", + "language_model.model.layers.3.self_attn.k_proj.biases": "model.safetensors", + "language_model.model.layers.3.self_attn.k_proj.scales": "model.safetensors", + "language_model.model.layers.3.self_attn.k_proj.weight": "model.safetensors", + "language_model.model.layers.3.self_attn.o_proj.biases": "model.safetensors", + "language_model.model.layers.3.self_attn.o_proj.scales": "model.safetensors", + "language_model.model.layers.3.self_attn.o_proj.weight": "model.safetensors", + "language_model.model.layers.3.self_attn.q_norm.weight": "model.safetensors", + "language_model.model.layers.3.self_attn.q_proj.biases": "model.safetensors", + "language_model.model.layers.3.self_attn.q_proj.scales": "model.safetensors", + "language_model.model.layers.3.self_attn.q_proj.weight": "model.safetensors", + "language_model.model.layers.3.self_attn.v_proj.biases": "model.safetensors", + "language_model.model.layers.3.self_attn.v_proj.scales": "model.safetensors", + "language_model.model.layers.3.self_attn.v_proj.weight": "model.safetensors", + "language_model.model.layers.4.input_layernorm.weight": "model.safetensors", + "language_model.model.layers.4.linear_attn.A_log": "model.safetensors", + "language_model.model.layers.4.linear_attn.conv1d.weight": "model.safetensors", + "language_model.model.layers.4.linear_attn.dt_bias": "model.safetensors", + "language_model.model.layers.4.linear_attn.in_proj_a.biases": "model.safetensors", + "language_model.model.layers.4.linear_attn.in_proj_a.scales": "model.safetensors", + "language_model.model.layers.4.linear_attn.in_proj_a.weight": "model.safetensors", + "language_model.model.layers.4.linear_attn.in_proj_b.biases": "model.safetensors", + "language_model.model.layers.4.linear_attn.in_proj_b.scales": "model.safetensors", + "language_model.model.layers.4.linear_attn.in_proj_b.weight": "model.safetensors", + "language_model.model.layers.4.linear_attn.in_proj_qkv.biases": "model.safetensors", + "language_model.model.layers.4.linear_attn.in_proj_qkv.scales": "model.safetensors", + "language_model.model.layers.4.linear_attn.in_proj_qkv.weight": "model.safetensors", + "language_model.model.layers.4.linear_attn.in_proj_z.biases": "model.safetensors", + "language_model.model.layers.4.linear_attn.in_proj_z.scales": "model.safetensors", + "language_model.model.layers.4.linear_attn.in_proj_z.weight": "model.safetensors", + "language_model.model.layers.4.linear_attn.norm.weight": "model.safetensors", + "language_model.model.layers.4.linear_attn.out_proj.biases": "model.safetensors", + "language_model.model.layers.4.linear_attn.out_proj.scales": "model.safetensors", + "language_model.model.layers.4.linear_attn.out_proj.weight": "model.safetensors", + "language_model.model.layers.4.mlp.down_proj.biases": "model.safetensors", + "language_model.model.layers.4.mlp.down_proj.scales": "model.safetensors", + "language_model.model.layers.4.mlp.down_proj.weight": "model.safetensors", + "language_model.model.layers.4.mlp.gate_proj.biases": "model.safetensors", + "language_model.model.layers.4.mlp.gate_proj.scales": "model.safetensors", + "language_model.model.layers.4.mlp.gate_proj.weight": "model.safetensors", + "language_model.model.layers.4.mlp.up_proj.biases": "model.safetensors", + "language_model.model.layers.4.mlp.up_proj.scales": "model.safetensors", + "language_model.model.layers.4.mlp.up_proj.weight": "model.safetensors", + "language_model.model.layers.4.post_attention_layernorm.weight": "model.safetensors", + "language_model.model.layers.5.input_layernorm.weight": "model.safetensors", + "language_model.model.layers.5.linear_attn.A_log": "model.safetensors", + "language_model.model.layers.5.linear_attn.conv1d.weight": "model.safetensors", + "language_model.model.layers.5.linear_attn.dt_bias": "model.safetensors", + "language_model.model.layers.5.linear_attn.in_proj_a.biases": "model.safetensors", + "language_model.model.layers.5.linear_attn.in_proj_a.scales": "model.safetensors", + "language_model.model.layers.5.linear_attn.in_proj_a.weight": "model.safetensors", + "language_model.model.layers.5.linear_attn.in_proj_b.biases": "model.safetensors", + "language_model.model.layers.5.linear_attn.in_proj_b.scales": "model.safetensors", + "language_model.model.layers.5.linear_attn.in_proj_b.weight": "model.safetensors", + "language_model.model.layers.5.linear_attn.in_proj_qkv.biases": "model.safetensors", + "language_model.model.layers.5.linear_attn.in_proj_qkv.scales": "model.safetensors", + "language_model.model.layers.5.linear_attn.in_proj_qkv.weight": "model.safetensors", + "language_model.model.layers.5.linear_attn.in_proj_z.biases": "model.safetensors", + "language_model.model.layers.5.linear_attn.in_proj_z.scales": "model.safetensors", + "language_model.model.layers.5.linear_attn.in_proj_z.weight": "model.safetensors", + "language_model.model.layers.5.linear_attn.norm.weight": "model.safetensors", + "language_model.model.layers.5.linear_attn.out_proj.biases": "model.safetensors", + "language_model.model.layers.5.linear_attn.out_proj.scales": "model.safetensors", + "language_model.model.layers.5.linear_attn.out_proj.weight": "model.safetensors", + "language_model.model.layers.5.mlp.down_proj.biases": "model.safetensors", + "language_model.model.layers.5.mlp.down_proj.scales": "model.safetensors", + "language_model.model.layers.5.mlp.down_proj.weight": "model.safetensors", + "language_model.model.layers.5.mlp.gate_proj.biases": "model.safetensors", + "language_model.model.layers.5.mlp.gate_proj.scales": "model.safetensors", + "language_model.model.layers.5.mlp.gate_proj.weight": "model.safetensors", + "language_model.model.layers.5.mlp.up_proj.biases": "model.safetensors", + "language_model.model.layers.5.mlp.up_proj.scales": "model.safetensors", + "language_model.model.layers.5.mlp.up_proj.weight": "model.safetensors", + "language_model.model.layers.5.post_attention_layernorm.weight": "model.safetensors", + "language_model.model.layers.6.input_layernorm.weight": "model.safetensors", + "language_model.model.layers.6.linear_attn.A_log": "model.safetensors", + "language_model.model.layers.6.linear_attn.conv1d.weight": "model.safetensors", + "language_model.model.layers.6.linear_attn.dt_bias": "model.safetensors", + "language_model.model.layers.6.linear_attn.in_proj_a.biases": "model.safetensors", + "language_model.model.layers.6.linear_attn.in_proj_a.scales": "model.safetensors", + "language_model.model.layers.6.linear_attn.in_proj_a.weight": "model.safetensors", + "language_model.model.layers.6.linear_attn.in_proj_b.biases": "model.safetensors", + "language_model.model.layers.6.linear_attn.in_proj_b.scales": "model.safetensors", + "language_model.model.layers.6.linear_attn.in_proj_b.weight": "model.safetensors", + "language_model.model.layers.6.linear_attn.in_proj_qkv.biases": "model.safetensors", + "language_model.model.layers.6.linear_attn.in_proj_qkv.scales": "model.safetensors", + "language_model.model.layers.6.linear_attn.in_proj_qkv.weight": "model.safetensors", + "language_model.model.layers.6.linear_attn.in_proj_z.biases": "model.safetensors", + "language_model.model.layers.6.linear_attn.in_proj_z.scales": "model.safetensors", + "language_model.model.layers.6.linear_attn.in_proj_z.weight": "model.safetensors", + "language_model.model.layers.6.linear_attn.norm.weight": "model.safetensors", + "language_model.model.layers.6.linear_attn.out_proj.biases": "model.safetensors", + "language_model.model.layers.6.linear_attn.out_proj.scales": "model.safetensors", + "language_model.model.layers.6.linear_attn.out_proj.weight": "model.safetensors", + "language_model.model.layers.6.mlp.down_proj.biases": "model.safetensors", + "language_model.model.layers.6.mlp.down_proj.scales": "model.safetensors", + "language_model.model.layers.6.mlp.down_proj.weight": "model.safetensors", + "language_model.model.layers.6.mlp.gate_proj.biases": "model.safetensors", + "language_model.model.layers.6.mlp.gate_proj.scales": "model.safetensors", + "language_model.model.layers.6.mlp.gate_proj.weight": "model.safetensors", + "language_model.model.layers.6.mlp.up_proj.biases": "model.safetensors", + "language_model.model.layers.6.mlp.up_proj.scales": "model.safetensors", + "language_model.model.layers.6.mlp.up_proj.weight": "model.safetensors", + "language_model.model.layers.6.post_attention_layernorm.weight": "model.safetensors", + "language_model.model.layers.7.input_layernorm.weight": "model.safetensors", + "language_model.model.layers.7.mlp.down_proj.biases": "model.safetensors", + "language_model.model.layers.7.mlp.down_proj.scales": "model.safetensors", + "language_model.model.layers.7.mlp.down_proj.weight": "model.safetensors", + "language_model.model.layers.7.mlp.gate_proj.biases": "model.safetensors", + "language_model.model.layers.7.mlp.gate_proj.scales": "model.safetensors", + "language_model.model.layers.7.mlp.gate_proj.weight": "model.safetensors", + "language_model.model.layers.7.mlp.up_proj.biases": "model.safetensors", + "language_model.model.layers.7.mlp.up_proj.scales": "model.safetensors", + "language_model.model.layers.7.mlp.up_proj.weight": "model.safetensors", + "language_model.model.layers.7.post_attention_layernorm.weight": "model.safetensors", + "language_model.model.layers.7.self_attn.k_norm.weight": "model.safetensors", + "language_model.model.layers.7.self_attn.k_proj.biases": "model.safetensors", + "language_model.model.layers.7.self_attn.k_proj.scales": "model.safetensors", + "language_model.model.layers.7.self_attn.k_proj.weight": "model.safetensors", + "language_model.model.layers.7.self_attn.o_proj.biases": "model.safetensors", + "language_model.model.layers.7.self_attn.o_proj.scales": "model.safetensors", + "language_model.model.layers.7.self_attn.o_proj.weight": "model.safetensors", + "language_model.model.layers.7.self_attn.q_norm.weight": "model.safetensors", + "language_model.model.layers.7.self_attn.q_proj.biases": "model.safetensors", + "language_model.model.layers.7.self_attn.q_proj.scales": "model.safetensors", + "language_model.model.layers.7.self_attn.q_proj.weight": "model.safetensors", + "language_model.model.layers.7.self_attn.v_proj.biases": "model.safetensors", + "language_model.model.layers.7.self_attn.v_proj.scales": "model.safetensors", + "language_model.model.layers.7.self_attn.v_proj.weight": "model.safetensors", + "language_model.model.layers.8.input_layernorm.weight": "model.safetensors", + "language_model.model.layers.8.linear_attn.A_log": "model.safetensors", + "language_model.model.layers.8.linear_attn.conv1d.weight": "model.safetensors", + "language_model.model.layers.8.linear_attn.dt_bias": "model.safetensors", + "language_model.model.layers.8.linear_attn.in_proj_a.biases": "model.safetensors", + "language_model.model.layers.8.linear_attn.in_proj_a.scales": "model.safetensors", + "language_model.model.layers.8.linear_attn.in_proj_a.weight": "model.safetensors", + "language_model.model.layers.8.linear_attn.in_proj_b.biases": "model.safetensors", + "language_model.model.layers.8.linear_attn.in_proj_b.scales": "model.safetensors", + "language_model.model.layers.8.linear_attn.in_proj_b.weight": "model.safetensors", + "language_model.model.layers.8.linear_attn.in_proj_qkv.biases": "model.safetensors", + "language_model.model.layers.8.linear_attn.in_proj_qkv.scales": "model.safetensors", + "language_model.model.layers.8.linear_attn.in_proj_qkv.weight": "model.safetensors", + "language_model.model.layers.8.linear_attn.in_proj_z.biases": "model.safetensors", + "language_model.model.layers.8.linear_attn.in_proj_z.scales": "model.safetensors", + "language_model.model.layers.8.linear_attn.in_proj_z.weight": "model.safetensors", + "language_model.model.layers.8.linear_attn.norm.weight": "model.safetensors", + "language_model.model.layers.8.linear_attn.out_proj.biases": "model.safetensors", + "language_model.model.layers.8.linear_attn.out_proj.scales": "model.safetensors", + "language_model.model.layers.8.linear_attn.out_proj.weight": "model.safetensors", + "language_model.model.layers.8.mlp.down_proj.biases": "model.safetensors", + "language_model.model.layers.8.mlp.down_proj.scales": "model.safetensors", + "language_model.model.layers.8.mlp.down_proj.weight": "model.safetensors", + "language_model.model.layers.8.mlp.gate_proj.biases": "model.safetensors", + "language_model.model.layers.8.mlp.gate_proj.scales": "model.safetensors", + "language_model.model.layers.8.mlp.gate_proj.weight": "model.safetensors", + "language_model.model.layers.8.mlp.up_proj.biases": "model.safetensors", + "language_model.model.layers.8.mlp.up_proj.scales": "model.safetensors", + "language_model.model.layers.8.mlp.up_proj.weight": "model.safetensors", + "language_model.model.layers.8.post_attention_layernorm.weight": "model.safetensors", + "language_model.model.layers.9.input_layernorm.weight": "model.safetensors", + "language_model.model.layers.9.linear_attn.A_log": "model.safetensors", + "language_model.model.layers.9.linear_attn.conv1d.weight": "model.safetensors", + "language_model.model.layers.9.linear_attn.dt_bias": "model.safetensors", + "language_model.model.layers.9.linear_attn.in_proj_a.biases": "model.safetensors", + "language_model.model.layers.9.linear_attn.in_proj_a.scales": "model.safetensors", + "language_model.model.layers.9.linear_attn.in_proj_a.weight": "model.safetensors", + "language_model.model.layers.9.linear_attn.in_proj_b.biases": "model.safetensors", + "language_model.model.layers.9.linear_attn.in_proj_b.scales": "model.safetensors", + "language_model.model.layers.9.linear_attn.in_proj_b.weight": "model.safetensors", + "language_model.model.layers.9.linear_attn.in_proj_qkv.biases": "model.safetensors", + "language_model.model.layers.9.linear_attn.in_proj_qkv.scales": "model.safetensors", + "language_model.model.layers.9.linear_attn.in_proj_qkv.weight": "model.safetensors", + "language_model.model.layers.9.linear_attn.in_proj_z.biases": "model.safetensors", + "language_model.model.layers.9.linear_attn.in_proj_z.scales": "model.safetensors", + "language_model.model.layers.9.linear_attn.in_proj_z.weight": "model.safetensors", + "language_model.model.layers.9.linear_attn.norm.weight": "model.safetensors", + "language_model.model.layers.9.linear_attn.out_proj.biases": "model.safetensors", + "language_model.model.layers.9.linear_attn.out_proj.scales": "model.safetensors", + "language_model.model.layers.9.linear_attn.out_proj.weight": "model.safetensors", + "language_model.model.layers.9.mlp.down_proj.biases": "model.safetensors", + "language_model.model.layers.9.mlp.down_proj.scales": "model.safetensors", + "language_model.model.layers.9.mlp.down_proj.weight": "model.safetensors", + "language_model.model.layers.9.mlp.gate_proj.biases": "model.safetensors", + "language_model.model.layers.9.mlp.gate_proj.scales": "model.safetensors", + "language_model.model.layers.9.mlp.gate_proj.weight": "model.safetensors", + "language_model.model.layers.9.mlp.up_proj.biases": "model.safetensors", + "language_model.model.layers.9.mlp.up_proj.scales": "model.safetensors", + "language_model.model.layers.9.mlp.up_proj.weight": "model.safetensors", + "language_model.model.layers.9.post_attention_layernorm.weight": "model.safetensors", + "language_model.model.norm.weight": "model.safetensors", + "vision_tower.blocks.0.attn.proj.bias": "model.safetensors", + "vision_tower.blocks.0.attn.proj.weight": "model.safetensors", + "vision_tower.blocks.0.attn.qkv.bias": "model.safetensors", + "vision_tower.blocks.0.attn.qkv.weight": "model.safetensors", + "vision_tower.blocks.0.mlp.linear_fc1.bias": "model.safetensors", + "vision_tower.blocks.0.mlp.linear_fc1.weight": "model.safetensors", + "vision_tower.blocks.0.mlp.linear_fc2.bias": "model.safetensors", + "vision_tower.blocks.0.mlp.linear_fc2.weight": "model.safetensors", + "vision_tower.blocks.0.norm1.bias": "model.safetensors", + "vision_tower.blocks.0.norm1.weight": "model.safetensors", + "vision_tower.blocks.0.norm2.bias": "model.safetensors", + "vision_tower.blocks.0.norm2.weight": "model.safetensors", + "vision_tower.blocks.1.attn.proj.bias": "model.safetensors", + "vision_tower.blocks.1.attn.proj.weight": "model.safetensors", + "vision_tower.blocks.1.attn.qkv.bias": "model.safetensors", + "vision_tower.blocks.1.attn.qkv.weight": "model.safetensors", + "vision_tower.blocks.1.mlp.linear_fc1.bias": "model.safetensors", + "vision_tower.blocks.1.mlp.linear_fc1.weight": "model.safetensors", + "vision_tower.blocks.1.mlp.linear_fc2.bias": "model.safetensors", + "vision_tower.blocks.1.mlp.linear_fc2.weight": "model.safetensors", + "vision_tower.blocks.1.norm1.bias": "model.safetensors", + "vision_tower.blocks.1.norm1.weight": "model.safetensors", + "vision_tower.blocks.1.norm2.bias": "model.safetensors", + "vision_tower.blocks.1.norm2.weight": "model.safetensors", + "vision_tower.blocks.10.attn.proj.bias": "model.safetensors", + "vision_tower.blocks.10.attn.proj.weight": "model.safetensors", + "vision_tower.blocks.10.attn.qkv.bias": "model.safetensors", + "vision_tower.blocks.10.attn.qkv.weight": "model.safetensors", + "vision_tower.blocks.10.mlp.linear_fc1.bias": "model.safetensors", + "vision_tower.blocks.10.mlp.linear_fc1.weight": "model.safetensors", + "vision_tower.blocks.10.mlp.linear_fc2.bias": "model.safetensors", + "vision_tower.blocks.10.mlp.linear_fc2.weight": "model.safetensors", + "vision_tower.blocks.10.norm1.bias": "model.safetensors", + "vision_tower.blocks.10.norm1.weight": "model.safetensors", + "vision_tower.blocks.10.norm2.bias": "model.safetensors", + "vision_tower.blocks.10.norm2.weight": "model.safetensors", + "vision_tower.blocks.11.attn.proj.bias": "model.safetensors", + "vision_tower.blocks.11.attn.proj.weight": "model.safetensors", + "vision_tower.blocks.11.attn.qkv.bias": "model.safetensors", + "vision_tower.blocks.11.attn.qkv.weight": "model.safetensors", + "vision_tower.blocks.11.mlp.linear_fc1.bias": "model.safetensors", + "vision_tower.blocks.11.mlp.linear_fc1.weight": "model.safetensors", + "vision_tower.blocks.11.mlp.linear_fc2.bias": "model.safetensors", + "vision_tower.blocks.11.mlp.linear_fc2.weight": "model.safetensors", + "vision_tower.blocks.11.norm1.bias": "model.safetensors", + "vision_tower.blocks.11.norm1.weight": "model.safetensors", + "vision_tower.blocks.11.norm2.bias": "model.safetensors", + "vision_tower.blocks.11.norm2.weight": "model.safetensors", + "vision_tower.blocks.2.attn.proj.bias": "model.safetensors", + "vision_tower.blocks.2.attn.proj.weight": "model.safetensors", + "vision_tower.blocks.2.attn.qkv.bias": "model.safetensors", + "vision_tower.blocks.2.attn.qkv.weight": "model.safetensors", + "vision_tower.blocks.2.mlp.linear_fc1.bias": "model.safetensors", + "vision_tower.blocks.2.mlp.linear_fc1.weight": "model.safetensors", + "vision_tower.blocks.2.mlp.linear_fc2.bias": "model.safetensors", + "vision_tower.blocks.2.mlp.linear_fc2.weight": "model.safetensors", + "vision_tower.blocks.2.norm1.bias": "model.safetensors", + "vision_tower.blocks.2.norm1.weight": "model.safetensors", + "vision_tower.blocks.2.norm2.bias": "model.safetensors", + "vision_tower.blocks.2.norm2.weight": "model.safetensors", + "vision_tower.blocks.3.attn.proj.bias": "model.safetensors", + "vision_tower.blocks.3.attn.proj.weight": "model.safetensors", + "vision_tower.blocks.3.attn.qkv.bias": "model.safetensors", + "vision_tower.blocks.3.attn.qkv.weight": "model.safetensors", + "vision_tower.blocks.3.mlp.linear_fc1.bias": "model.safetensors", + "vision_tower.blocks.3.mlp.linear_fc1.weight": "model.safetensors", + "vision_tower.blocks.3.mlp.linear_fc2.bias": "model.safetensors", + "vision_tower.blocks.3.mlp.linear_fc2.weight": "model.safetensors", + "vision_tower.blocks.3.norm1.bias": "model.safetensors", + "vision_tower.blocks.3.norm1.weight": "model.safetensors", + "vision_tower.blocks.3.norm2.bias": "model.safetensors", + "vision_tower.blocks.3.norm2.weight": "model.safetensors", + "vision_tower.blocks.4.attn.proj.bias": "model.safetensors", + "vision_tower.blocks.4.attn.proj.weight": "model.safetensors", + "vision_tower.blocks.4.attn.qkv.bias": "model.safetensors", + "vision_tower.blocks.4.attn.qkv.weight": "model.safetensors", + "vision_tower.blocks.4.mlp.linear_fc1.bias": "model.safetensors", + "vision_tower.blocks.4.mlp.linear_fc1.weight": "model.safetensors", + "vision_tower.blocks.4.mlp.linear_fc2.bias": "model.safetensors", + "vision_tower.blocks.4.mlp.linear_fc2.weight": "model.safetensors", + "vision_tower.blocks.4.norm1.bias": "model.safetensors", + "vision_tower.blocks.4.norm1.weight": "model.safetensors", + "vision_tower.blocks.4.norm2.bias": "model.safetensors", + "vision_tower.blocks.4.norm2.weight": "model.safetensors", + "vision_tower.blocks.5.attn.proj.bias": "model.safetensors", + "vision_tower.blocks.5.attn.proj.weight": "model.safetensors", + "vision_tower.blocks.5.attn.qkv.bias": "model.safetensors", + "vision_tower.blocks.5.attn.qkv.weight": "model.safetensors", + "vision_tower.blocks.5.mlp.linear_fc1.bias": "model.safetensors", + "vision_tower.blocks.5.mlp.linear_fc1.weight": "model.safetensors", + "vision_tower.blocks.5.mlp.linear_fc2.bias": "model.safetensors", + "vision_tower.blocks.5.mlp.linear_fc2.weight": "model.safetensors", + "vision_tower.blocks.5.norm1.bias": "model.safetensors", + "vision_tower.blocks.5.norm1.weight": "model.safetensors", + "vision_tower.blocks.5.norm2.bias": "model.safetensors", + "vision_tower.blocks.5.norm2.weight": "model.safetensors", + "vision_tower.blocks.6.attn.proj.bias": "model.safetensors", + "vision_tower.blocks.6.attn.proj.weight": "model.safetensors", + "vision_tower.blocks.6.attn.qkv.bias": "model.safetensors", + "vision_tower.blocks.6.attn.qkv.weight": "model.safetensors", + "vision_tower.blocks.6.mlp.linear_fc1.bias": "model.safetensors", + "vision_tower.blocks.6.mlp.linear_fc1.weight": "model.safetensors", + "vision_tower.blocks.6.mlp.linear_fc2.bias": "model.safetensors", + "vision_tower.blocks.6.mlp.linear_fc2.weight": "model.safetensors", + "vision_tower.blocks.6.norm1.bias": "model.safetensors", + "vision_tower.blocks.6.norm1.weight": "model.safetensors", + "vision_tower.blocks.6.norm2.bias": "model.safetensors", + "vision_tower.blocks.6.norm2.weight": "model.safetensors", + "vision_tower.blocks.7.attn.proj.bias": "model.safetensors", + "vision_tower.blocks.7.attn.proj.weight": "model.safetensors", + "vision_tower.blocks.7.attn.qkv.bias": "model.safetensors", + "vision_tower.blocks.7.attn.qkv.weight": "model.safetensors", + "vision_tower.blocks.7.mlp.linear_fc1.bias": "model.safetensors", + "vision_tower.blocks.7.mlp.linear_fc1.weight": "model.safetensors", + "vision_tower.blocks.7.mlp.linear_fc2.bias": "model.safetensors", + "vision_tower.blocks.7.mlp.linear_fc2.weight": "model.safetensors", + "vision_tower.blocks.7.norm1.bias": "model.safetensors", + "vision_tower.blocks.7.norm1.weight": "model.safetensors", + "vision_tower.blocks.7.norm2.bias": "model.safetensors", + "vision_tower.blocks.7.norm2.weight": "model.safetensors", + "vision_tower.blocks.8.attn.proj.bias": "model.safetensors", + "vision_tower.blocks.8.attn.proj.weight": "model.safetensors", + "vision_tower.blocks.8.attn.qkv.bias": "model.safetensors", + "vision_tower.blocks.8.attn.qkv.weight": "model.safetensors", + "vision_tower.blocks.8.mlp.linear_fc1.bias": "model.safetensors", + "vision_tower.blocks.8.mlp.linear_fc1.weight": "model.safetensors", + "vision_tower.blocks.8.mlp.linear_fc2.bias": "model.safetensors", + "vision_tower.blocks.8.mlp.linear_fc2.weight": "model.safetensors", + "vision_tower.blocks.8.norm1.bias": "model.safetensors", + "vision_tower.blocks.8.norm1.weight": "model.safetensors", + "vision_tower.blocks.8.norm2.bias": "model.safetensors", + "vision_tower.blocks.8.norm2.weight": "model.safetensors", + "vision_tower.blocks.9.attn.proj.bias": "model.safetensors", + "vision_tower.blocks.9.attn.proj.weight": "model.safetensors", + "vision_tower.blocks.9.attn.qkv.bias": "model.safetensors", + "vision_tower.blocks.9.attn.qkv.weight": "model.safetensors", + "vision_tower.blocks.9.mlp.linear_fc1.bias": "model.safetensors", + "vision_tower.blocks.9.mlp.linear_fc1.weight": "model.safetensors", + "vision_tower.blocks.9.mlp.linear_fc2.bias": "model.safetensors", + "vision_tower.blocks.9.mlp.linear_fc2.weight": "model.safetensors", + "vision_tower.blocks.9.norm1.bias": "model.safetensors", + "vision_tower.blocks.9.norm1.weight": "model.safetensors", + "vision_tower.blocks.9.norm2.bias": "model.safetensors", + "vision_tower.blocks.9.norm2.weight": "model.safetensors", + "vision_tower.merger.linear_fc1.bias": "model.safetensors", + "vision_tower.merger.linear_fc1.weight": "model.safetensors", + "vision_tower.merger.linear_fc2.bias": "model.safetensors", + "vision_tower.merger.linear_fc2.weight": "model.safetensors", + "vision_tower.merger.norm.bias": "model.safetensors", + "vision_tower.merger.norm.weight": "model.safetensors", + "vision_tower.patch_embed.proj.bias": "model.safetensors", + "vision_tower.patch_embed.proj.weight": "model.safetensors", + "vision_tower.pos_embed.weight": "model.safetensors" + } +} \ No newline at end of file diff --git a/chat/mlx/mlx-community/Qwen3.5-0.8B-MLX-4bit/preprocessor_config.json b/chat/mlx/mlx-community/Qwen3.5-0.8B-MLX-4bit/preprocessor_config.json new file mode 100644 index 0000000..2ea84a4 --- /dev/null +++ b/chat/mlx/mlx-community/Qwen3.5-0.8B-MLX-4bit/preprocessor_config.json @@ -0,0 +1,21 @@ +{ + "size": { + "longest_edge": 16777216, + "shortest_edge": 65536 + }, + "patch_size": 16, + "temporal_patch_size": 2, + "merge_size": 2, + "image_mean": [ + 0.5, + 0.5, + 0.5 + ], + "image_std": [ + 0.5, + 0.5, + 0.5 + ], + "processor_class": "Qwen3VLProcessor", + "image_processor_type": "Qwen2VLImageProcessorFast" +} \ No newline at end of file diff --git a/chat/mlx/mlx-community/Qwen3.5-0.8B-MLX-4bit/processor_config.json b/chat/mlx/mlx-community/Qwen3.5-0.8B-MLX-4bit/processor_config.json new file mode 100644 index 0000000..7ad6acd --- /dev/null +++ b/chat/mlx/mlx-community/Qwen3.5-0.8B-MLX-4bit/processor_config.json @@ -0,0 +1,63 @@ +{ + "image_processor": { + "data_format": "channels_first", + "do_convert_rgb": true, + "do_normalize": true, + "do_rescale": true, + "do_resize": true, + "image_mean": [ + 0.5, + 0.5, + 0.5 + ], + "image_processor_type": "Qwen2VLImageProcessorFast", + "image_std": [ + 0.5, + 0.5, + 0.5 + ], + "merge_size": 2, + "patch_size": 16, + "resample": 3, + "rescale_factor": 0.00392156862745098, + "size": { + "longest_edge": 16777216, + "shortest_edge": 65536 + }, + "temporal_patch_size": 2 + }, + "processor_class": "Qwen3VLProcessor", + "video_processor": { + "data_format": "channels_first", + "default_to_square": true, + "do_convert_rgb": true, + "do_normalize": true, + "do_rescale": true, + "do_resize": true, + "do_sample_frames": true, + "fps": 2, + "image_mean": [ + 0.5, + 0.5, + 0.5 + ], + "image_std": [ + 0.5, + 0.5, + 0.5 + ], + "max_frames": 768, + "merge_size": 2, + "min_frames": 4, + "patch_size": 16, + "resample": 3, + "rescale_factor": 0.00392156862745098, + "return_metadata": false, + "size": { + "longest_edge": 25165824, + "shortest_edge": 4096 + }, + "temporal_patch_size": 2, + "video_processor_type": "Qwen3VLVideoProcessor" + } +} diff --git a/chat/mlx/mlx-community/Qwen3.5-0.8B-MLX-4bit/tokenizer.json b/chat/mlx/mlx-community/Qwen3.5-0.8B-MLX-4bit/tokenizer.json new file mode 100644 index 0000000..67741b0 --- /dev/null +++ b/chat/mlx/mlx-community/Qwen3.5-0.8B-MLX-4bit/tokenizer.json @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:87a7830d63fcf43bf241c3c5242e96e62dd3fdc29224ca26fed8ea333db72de4 +size 19989343 diff --git a/chat/mlx/mlx-community/Qwen3.5-0.8B-MLX-4bit/tokenizer_config.json b/chat/mlx/mlx-community/Qwen3.5-0.8B-MLX-4bit/tokenizer_config.json new file mode 100644 index 0000000..a068e24 --- /dev/null +++ b/chat/mlx/mlx-community/Qwen3.5-0.8B-MLX-4bit/tokenizer_config.json @@ -0,0 +1,32 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|im_end|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": true, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "processor_class": "Qwen3VLProcessor", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/chat/mlx/mlx-community/Qwen3.5-0.8B-MLX-4bit/video_preprocessor_config.json b/chat/mlx/mlx-community/Qwen3.5-0.8B-MLX-4bit/video_preprocessor_config.json new file mode 100644 index 0000000..3ba673a --- /dev/null +++ b/chat/mlx/mlx-community/Qwen3.5-0.8B-MLX-4bit/video_preprocessor_config.json @@ -0,0 +1,21 @@ +{ + "size": { + "longest_edge": 25165824, + "shortest_edge": 4096 + }, + "patch_size": 16, + "temporal_patch_size": 2, + "merge_size": 2, + "image_mean": [ + 0.5, + 0.5, + 0.5 + ], + "image_std": [ + 0.5, + 0.5, + 0.5 + ], + "processor_class": "Qwen3VLProcessor", + "video_processor_type": "Qwen3VLVideoProcessor" +} \ No newline at end of file diff --git a/chat/mlx/mlx-community/Qwen3.5-0.8B-MLX-4bit/vocab.json b/chat/mlx/mlx-community/Qwen3.5-0.8B-MLX-4bit/vocab.json new file mode 100644 index 0000000..d32f7ed --- /dev/null +++ b/chat/mlx/mlx-community/Qwen3.5-0.8B-MLX-4bit/vocab.json @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:ce99b4cb2983d118806ce0a8b777a35b093e2000a503ebde25853284c9dfa003 +size 6722759 diff --git a/chat/mlx/mlx-community/Qwen3.5-2B-MLX-4bit/.gitattributes b/chat/mlx/mlx-community/Qwen3.5-2B-MLX-4bit/.gitattributes new file mode 100644 index 0000000..52373fe --- /dev/null +++ b/chat/mlx/mlx-community/Qwen3.5-2B-MLX-4bit/.gitattributes @@ -0,0 +1,36 @@ +*.7z filter=lfs diff=lfs merge=lfs -text +*.arrow filter=lfs diff=lfs merge=lfs -text +*.bin filter=lfs diff=lfs merge=lfs -text +*.bz2 filter=lfs diff=lfs merge=lfs -text +*.ckpt filter=lfs diff=lfs merge=lfs -text +*.ftz filter=lfs diff=lfs merge=lfs -text +*.gz filter=lfs diff=lfs merge=lfs -text +*.h5 filter=lfs diff=lfs merge=lfs -text +*.joblib filter=lfs diff=lfs merge=lfs -text +*.lfs.* filter=lfs diff=lfs merge=lfs -text +*.mlmodel filter=lfs diff=lfs merge=lfs -text +*.model filter=lfs diff=lfs merge=lfs -text +*.msgpack filter=lfs diff=lfs merge=lfs -text +*.npy filter=lfs diff=lfs merge=lfs -text +*.npz filter=lfs diff=lfs merge=lfs -text +*.onnx filter=lfs diff=lfs merge=lfs -text +*.ot filter=lfs diff=lfs merge=lfs -text +*.parquet filter=lfs diff=lfs merge=lfs -text +*.pb filter=lfs diff=lfs merge=lfs -text +*.pickle filter=lfs diff=lfs merge=lfs -text +*.pkl filter=lfs diff=lfs merge=lfs -text +*.pt filter=lfs diff=lfs merge=lfs -text +*.pth filter=lfs diff=lfs merge=lfs -text +*.rar filter=lfs diff=lfs merge=lfs -text +*.safetensors filter=lfs diff=lfs merge=lfs -text +saved_model/**/* filter=lfs diff=lfs merge=lfs -text +*.tar.* filter=lfs diff=lfs merge=lfs -text +*.tar filter=lfs diff=lfs merge=lfs -text +*.tflite filter=lfs diff=lfs merge=lfs -text +*.tgz filter=lfs diff=lfs merge=lfs -text +*.wasm filter=lfs diff=lfs merge=lfs -text +*.xz filter=lfs diff=lfs merge=lfs -text +*.zip filter=lfs diff=lfs merge=lfs -text +*.zst filter=lfs diff=lfs merge=lfs -text +*tfevents* filter=lfs diff=lfs merge=lfs -text +tokenizer.json filter=lfs diff=lfs merge=lfs -text diff --git a/chat/mlx/mlx-community/Qwen3.5-2B-MLX-4bit/README.md b/chat/mlx/mlx-community/Qwen3.5-2B-MLX-4bit/README.md new file mode 100644 index 0000000..27d920b --- /dev/null +++ b/chat/mlx/mlx-community/Qwen3.5-2B-MLX-4bit/README.md @@ -0,0 +1,75 @@ +--- +base_model: Qwen/Qwen3.5-2B +library_name: mlx +tags: + - mlx + - qwen3.5 + - vision-language-model + - quantized + - 4bit +license: apache-2.0 +--- + +# Qwen3.5-2B-MLX-4bit + +This is a 4-bit quantized MLX version of [Qwen/Qwen3.5-2B](https://huggingface.co/Qwen/Qwen3.5-2B) for Apple Silicon. + +## Model Details + +- **Original Model:** [Qwen/Qwen3.5-2B](https://huggingface.co/Qwen/Qwen3.5-2B) +- **Quantization:** 4-bit (6.225 bits per weight) +- **Group Size:** 64 +- **Format:** MLX SafeTensors +- **Framework:** [mlx-vlm](https://github.com/Blaizzy/mlx-vlm) +- **Disk Size:** ~1.6G + +## Conversion Details + +This model was converted using `mlx-vlm` from the [`pc/fix-qwen35-predicate`](https://github.com/Blaizzy/mlx-vlm/tree/pc/fix-qwen35-predicate) branch, which includes fixes for Qwen3.5 model support (proper handling of MoE gate layers, `shared_expert_gate`, and `A_log` casting). + +**Conversion command:** +```bash +python3 -m mlx_vlm convert \ + --hf-path "Qwen/Qwen3.5-2B" \ + --mlx-path "./Qwen3.5-2B-MLX-4bit" \ + -q --q-bits 4 --q-group-size 64 +``` + +## Important Note + +A better, more optimized conversion may be available from **@Prince** ([@Blaizzy](https://huggingface.co/Blaizzy)) in the MLX VLM community. Check the [mlx-community](https://huggingface.co/mlx-community) organization for updated versions as official Qwen3.5 support is merged into the main `mlx-vlm` branch. + +## Related Models + +- **bf16 (full precision):** [mlx-community/Qwen3.5-2B-MLX-bf16](https://huggingface.co/mlx-community/Qwen3.5-2B-MLX-bf16) +- **8-bit quantized:** [mlx-community/Qwen3.5-2B-MLX-8bit](https://huggingface.co/mlx-community/Qwen3.5-2B-MLX-8bit) +- **Original:** [Qwen/Qwen3.5-2B](https://huggingface.co/Qwen/Qwen3.5-2B) + +## Usage + +```python +from mlx_vlm import load, generate + +model, processor = load("mlx-community/Qwen3.5-2B-MLX-4bit") + +output = generate( + model, + processor, + prompt="Describe this image.", + image="path/to/image.jpg", + max_tokens=512 +) +print(output) +``` + +**CLI:** +```bash +python3 -m mlx_vlm.generate \ + --model mlx-community/Qwen3.5-2B-MLX-4bit \ + --image path/to/image.jpg \ + --prompt "Describe this image." +``` + +## License + +This model inherits the [Apache 2.0 license](https://huggingface.co/Qwen/Qwen3.5-2B) from the original Qwen model. diff --git a/chat/mlx/mlx-community/Qwen3.5-2B-MLX-4bit/chat_template.jinja b/chat/mlx/mlx-community/Qwen3.5-2B-MLX-4bit/chat_template.jinja new file mode 100644 index 0000000..0ef09f2 --- /dev/null +++ b/chat/mlx/mlx-community/Qwen3.5-2B-MLX-4bit/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is true %} + {{- '\n' }} + {%- else %} + {{- '\n\n\n\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/chat/mlx/mlx-community/Qwen3.5-2B-MLX-4bit/config.json b/chat/mlx/mlx-community/Qwen3.5-2B-MLX-4bit/config.json new file mode 100644 index 0000000..6d90190 --- /dev/null +++ b/chat/mlx/mlx-community/Qwen3.5-2B-MLX-4bit/config.json @@ -0,0 +1,106 @@ +{ + "architectures": [ + "Qwen3_5ForConditionalGeneration" + ], + "image_token_id": 248056, + "model_type": "qwen3_5", + "quantization": { + "group_size": 64, + "bits": 4, + "mode": "affine" + }, + "quantization_config": { + "group_size": 64, + "bits": 4, + "mode": "affine" + }, + "text_config": { + "attention_bias": false, + "attention_dropout": 0.0, + "attn_output_gate": true, + "dtype": "bfloat16", + "eos_token_id": 248044, + "full_attention_interval": 4, + "head_dim": 256, + "hidden_act": "silu", + "hidden_size": 2048, + "initializer_range": 0.02, + "intermediate_size": 6144, + "layer_types": [ + "linear_attention", + "linear_attention", + "linear_attention", + "full_attention", + "linear_attention", + "linear_attention", + "linear_attention", + "full_attention", + "linear_attention", + "linear_attention", + "linear_attention", + "full_attention", + "linear_attention", + "linear_attention", + "linear_attention", + "full_attention", + "linear_attention", + "linear_attention", + "linear_attention", + "full_attention", + "linear_attention", + "linear_attention", + "linear_attention", + "full_attention" + ], + "linear_conv_kernel_dim": 4, + "linear_key_head_dim": 128, + "linear_num_key_heads": 16, + "linear_num_value_heads": 16, + "linear_value_head_dim": 128, + "max_position_embeddings": 262144, + "mlp_only_layers": [], + "model_type": "qwen3_5_text", + "mtp_num_hidden_layers": 1, + "mtp_use_dedicated_embeddings": false, + "num_attention_heads": 8, + "num_hidden_layers": 24, + "num_key_value_heads": 2, + "rms_norm_eps": 1e-06, + "tie_word_embeddings": true, + "use_cache": true, + "vocab_size": 248320, + "mamba_ssm_dtype": "float32", + "rope_parameters": { + "mrope_interleaved": true, + "mrope_section": [ + 11, + 11, + 10 + ], + "rope_type": "default", + "rope_theta": 10000000, + "partial_rotary_factor": 0.25 + } + }, + "tie_word_embeddings": true, + "transformers_version": "4.57.0.dev0", + "video_token_id": 248057, + "vision_config": { + "deepstack_visual_indexes": [], + "depth": 24, + "hidden_act": "gelu_pytorch_tanh", + "hidden_size": 1024, + "in_channels": 3, + "initializer_range": 0.02, + "intermediate_size": 4096, + "model_type": "qwen3_5", + "num_heads": 16, + "num_position_embeddings": 2304, + "out_hidden_size": 2048, + "patch_size": 16, + "spatial_merge_size": 2, + "temporal_patch_size": 2 + }, + "vision_end_token_id": 248054, + "vision_start_token_id": 248053 +} \ No newline at end of file diff --git a/chat/mlx/mlx-community/Qwen3.5-2B-MLX-4bit/model.safetensors b/chat/mlx/mlx-community/Qwen3.5-2B-MLX-4bit/model.safetensors new file mode 100644 index 0000000..13e3e26 --- /dev/null +++ b/chat/mlx/mlx-community/Qwen3.5-2B-MLX-4bit/model.safetensors @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:713fe7e5d3c3965f7106b0d0ee17615f7869c23c8d327996df8c1196fbcf07d5 +size 1722271785 diff --git a/chat/mlx/mlx-community/Qwen3.5-2B-MLX-4bit/model.safetensors.index.json b/chat/mlx/mlx-community/Qwen3.5-2B-MLX-4bit/model.safetensors.index.json new file mode 100644 index 0000000..2d9ef9d --- /dev/null +++ b/chat/mlx/mlx-community/Qwen3.5-2B-MLX-4bit/model.safetensors.index.json @@ -0,0 +1,998 @@ +{ + "metadata": { + "total_size": 1722149056 + }, + "weight_map": { + "language_model.model.embed_tokens.biases": "model.safetensors", + "language_model.model.embed_tokens.scales": "model.safetensors", + "language_model.model.embed_tokens.weight": "model.safetensors", + "language_model.model.layers.0.input_layernorm.weight": "model.safetensors", + "language_model.model.layers.0.linear_attn.A_log": "model.safetensors", + "language_model.model.layers.0.linear_attn.conv1d.weight": "model.safetensors", + "language_model.model.layers.0.linear_attn.dt_bias": "model.safetensors", + "language_model.model.layers.0.linear_attn.in_proj_a.biases": "model.safetensors", + "language_model.model.layers.0.linear_attn.in_proj_a.scales": "model.safetensors", + "language_model.model.layers.0.linear_attn.in_proj_a.weight": "model.safetensors", + "language_model.model.layers.0.linear_attn.in_proj_b.biases": "model.safetensors", + "language_model.model.layers.0.linear_attn.in_proj_b.scales": "model.safetensors", + "language_model.model.layers.0.linear_attn.in_proj_b.weight": "model.safetensors", + "language_model.model.layers.0.linear_attn.in_proj_qkv.biases": "model.safetensors", + "language_model.model.layers.0.linear_attn.in_proj_qkv.scales": "model.safetensors", + "language_model.model.layers.0.linear_attn.in_proj_qkv.weight": "model.safetensors", + "language_model.model.layers.0.linear_attn.in_proj_z.biases": "model.safetensors", + "language_model.model.layers.0.linear_attn.in_proj_z.scales": "model.safetensors", + "language_model.model.layers.0.linear_attn.in_proj_z.weight": "model.safetensors", + "language_model.model.layers.0.linear_attn.norm.weight": "model.safetensors", + "language_model.model.layers.0.linear_attn.out_proj.biases": "model.safetensors", + "language_model.model.layers.0.linear_attn.out_proj.scales": "model.safetensors", + "language_model.model.layers.0.linear_attn.out_proj.weight": "model.safetensors", + "language_model.model.layers.0.mlp.down_proj.biases": "model.safetensors", + "language_model.model.layers.0.mlp.down_proj.scales": "model.safetensors", + "language_model.model.layers.0.mlp.down_proj.weight": "model.safetensors", + "language_model.model.layers.0.mlp.gate_proj.biases": "model.safetensors", + "language_model.model.layers.0.mlp.gate_proj.scales": "model.safetensors", + "language_model.model.layers.0.mlp.gate_proj.weight": "model.safetensors", + "language_model.model.layers.0.mlp.up_proj.biases": "model.safetensors", + "language_model.model.layers.0.mlp.up_proj.scales": "model.safetensors", + "language_model.model.layers.0.mlp.up_proj.weight": "model.safetensors", + "language_model.model.layers.0.post_attention_layernorm.weight": "model.safetensors", + "language_model.model.layers.1.input_layernorm.weight": "model.safetensors", + "language_model.model.layers.1.linear_attn.A_log": "model.safetensors", + "language_model.model.layers.1.linear_attn.conv1d.weight": "model.safetensors", + "language_model.model.layers.1.linear_attn.dt_bias": "model.safetensors", + "language_model.model.layers.1.linear_attn.in_proj_a.biases": "model.safetensors", + "language_model.model.layers.1.linear_attn.in_proj_a.scales": "model.safetensors", + "language_model.model.layers.1.linear_attn.in_proj_a.weight": "model.safetensors", + "language_model.model.layers.1.linear_attn.in_proj_b.biases": "model.safetensors", + "language_model.model.layers.1.linear_attn.in_proj_b.scales": "model.safetensors", + "language_model.model.layers.1.linear_attn.in_proj_b.weight": "model.safetensors", + "language_model.model.layers.1.linear_attn.in_proj_qkv.biases": "model.safetensors", + "language_model.model.layers.1.linear_attn.in_proj_qkv.scales": "model.safetensors", + "language_model.model.layers.1.linear_attn.in_proj_qkv.weight": "model.safetensors", + "language_model.model.layers.1.linear_attn.in_proj_z.biases": "model.safetensors", + "language_model.model.layers.1.linear_attn.in_proj_z.scales": "model.safetensors", + "language_model.model.layers.1.linear_attn.in_proj_z.weight": "model.safetensors", + "language_model.model.layers.1.linear_attn.norm.weight": "model.safetensors", + "language_model.model.layers.1.linear_attn.out_proj.biases": "model.safetensors", + "language_model.model.layers.1.linear_attn.out_proj.scales": "model.safetensors", + "language_model.model.layers.1.linear_attn.out_proj.weight": "model.safetensors", + "language_model.model.layers.1.mlp.down_proj.biases": "model.safetensors", + "language_model.model.layers.1.mlp.down_proj.scales": "model.safetensors", + "language_model.model.layers.1.mlp.down_proj.weight": "model.safetensors", + "language_model.model.layers.1.mlp.gate_proj.biases": "model.safetensors", + "language_model.model.layers.1.mlp.gate_proj.scales": "model.safetensors", + "language_model.model.layers.1.mlp.gate_proj.weight": "model.safetensors", + "language_model.model.layers.1.mlp.up_proj.biases": "model.safetensors", + "language_model.model.layers.1.mlp.up_proj.scales": "model.safetensors", + "language_model.model.layers.1.mlp.up_proj.weight": "model.safetensors", + "language_model.model.layers.1.post_attention_layernorm.weight": "model.safetensors", + "language_model.model.layers.10.input_layernorm.weight": "model.safetensors", + "language_model.model.layers.10.linear_attn.A_log": "model.safetensors", + "language_model.model.layers.10.linear_attn.conv1d.weight": "model.safetensors", + "language_model.model.layers.10.linear_attn.dt_bias": "model.safetensors", + "language_model.model.layers.10.linear_attn.in_proj_a.biases": "model.safetensors", + "language_model.model.layers.10.linear_attn.in_proj_a.scales": "model.safetensors", + "language_model.model.layers.10.linear_attn.in_proj_a.weight": "model.safetensors", + "language_model.model.layers.10.linear_attn.in_proj_b.biases": "model.safetensors", + "language_model.model.layers.10.linear_attn.in_proj_b.scales": "model.safetensors", + "language_model.model.layers.10.linear_attn.in_proj_b.weight": "model.safetensors", + "language_model.model.layers.10.linear_attn.in_proj_qkv.biases": "model.safetensors", + "language_model.model.layers.10.linear_attn.in_proj_qkv.scales": "model.safetensors", + "language_model.model.layers.10.linear_attn.in_proj_qkv.weight": "model.safetensors", + "language_model.model.layers.10.linear_attn.in_proj_z.biases": "model.safetensors", + "language_model.model.layers.10.linear_attn.in_proj_z.scales": "model.safetensors", + "language_model.model.layers.10.linear_attn.in_proj_z.weight": "model.safetensors", + "language_model.model.layers.10.linear_attn.norm.weight": "model.safetensors", + "language_model.model.layers.10.linear_attn.out_proj.biases": "model.safetensors", + "language_model.model.layers.10.linear_attn.out_proj.scales": "model.safetensors", + "language_model.model.layers.10.linear_attn.out_proj.weight": "model.safetensors", + "language_model.model.layers.10.mlp.down_proj.biases": "model.safetensors", + "language_model.model.layers.10.mlp.down_proj.scales": "model.safetensors", + "language_model.model.layers.10.mlp.down_proj.weight": "model.safetensors", + "language_model.model.layers.10.mlp.gate_proj.biases": "model.safetensors", + "language_model.model.layers.10.mlp.gate_proj.scales": "model.safetensors", + "language_model.model.layers.10.mlp.gate_proj.weight": "model.safetensors", + "language_model.model.layers.10.mlp.up_proj.biases": "model.safetensors", + "language_model.model.layers.10.mlp.up_proj.scales": "model.safetensors", + "language_model.model.layers.10.mlp.up_proj.weight": "model.safetensors", + "language_model.model.layers.10.post_attention_layernorm.weight": "model.safetensors", + "language_model.model.layers.11.input_layernorm.weight": "model.safetensors", + "language_model.model.layers.11.mlp.down_proj.biases": "model.safetensors", + "language_model.model.layers.11.mlp.down_proj.scales": "model.safetensors", + "language_model.model.layers.11.mlp.down_proj.weight": "model.safetensors", + "language_model.model.layers.11.mlp.gate_proj.biases": "model.safetensors", + "language_model.model.layers.11.mlp.gate_proj.scales": "model.safetensors", + "language_model.model.layers.11.mlp.gate_proj.weight": "model.safetensors", + "language_model.model.layers.11.mlp.up_proj.biases": "model.safetensors", + "language_model.model.layers.11.mlp.up_proj.scales": "model.safetensors", + "language_model.model.layers.11.mlp.up_proj.weight": "model.safetensors", + "language_model.model.layers.11.post_attention_layernorm.weight": "model.safetensors", + "language_model.model.layers.11.self_attn.k_norm.weight": "model.safetensors", + "language_model.model.layers.11.self_attn.k_proj.biases": "model.safetensors", + "language_model.model.layers.11.self_attn.k_proj.scales": "model.safetensors", + "language_model.model.layers.11.self_attn.k_proj.weight": "model.safetensors", + "language_model.model.layers.11.self_attn.o_proj.biases": "model.safetensors", + "language_model.model.layers.11.self_attn.o_proj.scales": "model.safetensors", + "language_model.model.layers.11.self_attn.o_proj.weight": "model.safetensors", + "language_model.model.layers.11.self_attn.q_norm.weight": "model.safetensors", + "language_model.model.layers.11.self_attn.q_proj.biases": "model.safetensors", + "language_model.model.layers.11.self_attn.q_proj.scales": "model.safetensors", + "language_model.model.layers.11.self_attn.q_proj.weight": "model.safetensors", + "language_model.model.layers.11.self_attn.v_proj.biases": "model.safetensors", + "language_model.model.layers.11.self_attn.v_proj.scales": "model.safetensors", + "language_model.model.layers.11.self_attn.v_proj.weight": "model.safetensors", + "language_model.model.layers.12.input_layernorm.weight": "model.safetensors", + "language_model.model.layers.12.linear_attn.A_log": "model.safetensors", + "language_model.model.layers.12.linear_attn.conv1d.weight": "model.safetensors", + "language_model.model.layers.12.linear_attn.dt_bias": "model.safetensors", + "language_model.model.layers.12.linear_attn.in_proj_a.biases": "model.safetensors", + "language_model.model.layers.12.linear_attn.in_proj_a.scales": "model.safetensors", + "language_model.model.layers.12.linear_attn.in_proj_a.weight": "model.safetensors", + "language_model.model.layers.12.linear_attn.in_proj_b.biases": "model.safetensors", + "language_model.model.layers.12.linear_attn.in_proj_b.scales": "model.safetensors", + "language_model.model.layers.12.linear_attn.in_proj_b.weight": "model.safetensors", + "language_model.model.layers.12.linear_attn.in_proj_qkv.biases": "model.safetensors", + "language_model.model.layers.12.linear_attn.in_proj_qkv.scales": "model.safetensors", + "language_model.model.layers.12.linear_attn.in_proj_qkv.weight": "model.safetensors", + "language_model.model.layers.12.linear_attn.in_proj_z.biases": "model.safetensors", + "language_model.model.layers.12.linear_attn.in_proj_z.scales": "model.safetensors", + "language_model.model.layers.12.linear_attn.in_proj_z.weight": "model.safetensors", + "language_model.model.layers.12.linear_attn.norm.weight": "model.safetensors", + "language_model.model.layers.12.linear_attn.out_proj.biases": "model.safetensors", + "language_model.model.layers.12.linear_attn.out_proj.scales": "model.safetensors", + "language_model.model.layers.12.linear_attn.out_proj.weight": "model.safetensors", + "language_model.model.layers.12.mlp.down_proj.biases": "model.safetensors", + "language_model.model.layers.12.mlp.down_proj.scales": "model.safetensors", + "language_model.model.layers.12.mlp.down_proj.weight": "model.safetensors", + "language_model.model.layers.12.mlp.gate_proj.biases": "model.safetensors", + "language_model.model.layers.12.mlp.gate_proj.scales": "model.safetensors", + "language_model.model.layers.12.mlp.gate_proj.weight": "model.safetensors", + "language_model.model.layers.12.mlp.up_proj.biases": "model.safetensors", + "language_model.model.layers.12.mlp.up_proj.scales": "model.safetensors", + "language_model.model.layers.12.mlp.up_proj.weight": "model.safetensors", + "language_model.model.layers.12.post_attention_layernorm.weight": "model.safetensors", + "language_model.model.layers.13.input_layernorm.weight": "model.safetensors", + "language_model.model.layers.13.linear_attn.A_log": "model.safetensors", + "language_model.model.layers.13.linear_attn.conv1d.weight": "model.safetensors", + "language_model.model.layers.13.linear_attn.dt_bias": "model.safetensors", + "language_model.model.layers.13.linear_attn.in_proj_a.biases": "model.safetensors", + "language_model.model.layers.13.linear_attn.in_proj_a.scales": "model.safetensors", + "language_model.model.layers.13.linear_attn.in_proj_a.weight": "model.safetensors", + "language_model.model.layers.13.linear_attn.in_proj_b.biases": "model.safetensors", + "language_model.model.layers.13.linear_attn.in_proj_b.scales": "model.safetensors", + "language_model.model.layers.13.linear_attn.in_proj_b.weight": "model.safetensors", + "language_model.model.layers.13.linear_attn.in_proj_qkv.biases": "model.safetensors", + "language_model.model.layers.13.linear_attn.in_proj_qkv.scales": "model.safetensors", + "language_model.model.layers.13.linear_attn.in_proj_qkv.weight": "model.safetensors", + "language_model.model.layers.13.linear_attn.in_proj_z.biases": "model.safetensors", + "language_model.model.layers.13.linear_attn.in_proj_z.scales": "model.safetensors", + "language_model.model.layers.13.linear_attn.in_proj_z.weight": "model.safetensors", + "language_model.model.layers.13.linear_attn.norm.weight": "model.safetensors", + "language_model.model.layers.13.linear_attn.out_proj.biases": "model.safetensors", + "language_model.model.layers.13.linear_attn.out_proj.scales": "model.safetensors", + "language_model.model.layers.13.linear_attn.out_proj.weight": "model.safetensors", + "language_model.model.layers.13.mlp.down_proj.biases": "model.safetensors", + "language_model.model.layers.13.mlp.down_proj.scales": "model.safetensors", + "language_model.model.layers.13.mlp.down_proj.weight": "model.safetensors", + "language_model.model.layers.13.mlp.gate_proj.biases": "model.safetensors", + "language_model.model.layers.13.mlp.gate_proj.scales": "model.safetensors", + "language_model.model.layers.13.mlp.gate_proj.weight": "model.safetensors", + "language_model.model.layers.13.mlp.up_proj.biases": "model.safetensors", + "language_model.model.layers.13.mlp.up_proj.scales": "model.safetensors", + "language_model.model.layers.13.mlp.up_proj.weight": "model.safetensors", + "language_model.model.layers.13.post_attention_layernorm.weight": "model.safetensors", + "language_model.model.layers.14.input_layernorm.weight": "model.safetensors", + "language_model.model.layers.14.linear_attn.A_log": "model.safetensors", + "language_model.model.layers.14.linear_attn.conv1d.weight": "model.safetensors", + "language_model.model.layers.14.linear_attn.dt_bias": "model.safetensors", + "language_model.model.layers.14.linear_attn.in_proj_a.biases": "model.safetensors", + "language_model.model.layers.14.linear_attn.in_proj_a.scales": "model.safetensors", + "language_model.model.layers.14.linear_attn.in_proj_a.weight": "model.safetensors", + "language_model.model.layers.14.linear_attn.in_proj_b.biases": "model.safetensors", + "language_model.model.layers.14.linear_attn.in_proj_b.scales": "model.safetensors", + "language_model.model.layers.14.linear_attn.in_proj_b.weight": "model.safetensors", + "language_model.model.layers.14.linear_attn.in_proj_qkv.biases": "model.safetensors", + "language_model.model.layers.14.linear_attn.in_proj_qkv.scales": "model.safetensors", + "language_model.model.layers.14.linear_attn.in_proj_qkv.weight": "model.safetensors", + "language_model.model.layers.14.linear_attn.in_proj_z.biases": "model.safetensors", + "language_model.model.layers.14.linear_attn.in_proj_z.scales": "model.safetensors", + "language_model.model.layers.14.linear_attn.in_proj_z.weight": "model.safetensors", + "language_model.model.layers.14.linear_attn.norm.weight": "model.safetensors", + "language_model.model.layers.14.linear_attn.out_proj.biases": "model.safetensors", + "language_model.model.layers.14.linear_attn.out_proj.scales": "model.safetensors", + "language_model.model.layers.14.linear_attn.out_proj.weight": "model.safetensors", + "language_model.model.layers.14.mlp.down_proj.biases": "model.safetensors", + "language_model.model.layers.14.mlp.down_proj.scales": "model.safetensors", + "language_model.model.layers.14.mlp.down_proj.weight": "model.safetensors", + "language_model.model.layers.14.mlp.gate_proj.biases": "model.safetensors", + "language_model.model.layers.14.mlp.gate_proj.scales": "model.safetensors", + "language_model.model.layers.14.mlp.gate_proj.weight": "model.safetensors", + "language_model.model.layers.14.mlp.up_proj.biases": "model.safetensors", + "language_model.model.layers.14.mlp.up_proj.scales": "model.safetensors", + "language_model.model.layers.14.mlp.up_proj.weight": "model.safetensors", + "language_model.model.layers.14.post_attention_layernorm.weight": "model.safetensors", + "language_model.model.layers.15.input_layernorm.weight": "model.safetensors", + "language_model.model.layers.15.mlp.down_proj.biases": "model.safetensors", + "language_model.model.layers.15.mlp.down_proj.scales": "model.safetensors", + "language_model.model.layers.15.mlp.down_proj.weight": "model.safetensors", + "language_model.model.layers.15.mlp.gate_proj.biases": "model.safetensors", + "language_model.model.layers.15.mlp.gate_proj.scales": "model.safetensors", + "language_model.model.layers.15.mlp.gate_proj.weight": "model.safetensors", + "language_model.model.layers.15.mlp.up_proj.biases": "model.safetensors", + "language_model.model.layers.15.mlp.up_proj.scales": "model.safetensors", + "language_model.model.layers.15.mlp.up_proj.weight": "model.safetensors", + "language_model.model.layers.15.post_attention_layernorm.weight": "model.safetensors", + "language_model.model.layers.15.self_attn.k_norm.weight": "model.safetensors", + "language_model.model.layers.15.self_attn.k_proj.biases": "model.safetensors", + "language_model.model.layers.15.self_attn.k_proj.scales": "model.safetensors", + "language_model.model.layers.15.self_attn.k_proj.weight": "model.safetensors", + "language_model.model.layers.15.self_attn.o_proj.biases": "model.safetensors", + "language_model.model.layers.15.self_attn.o_proj.scales": "model.safetensors", + "language_model.model.layers.15.self_attn.o_proj.weight": "model.safetensors", + "language_model.model.layers.15.self_attn.q_norm.weight": "model.safetensors", + "language_model.model.layers.15.self_attn.q_proj.biases": "model.safetensors", + "language_model.model.layers.15.self_attn.q_proj.scales": "model.safetensors", + "language_model.model.layers.15.self_attn.q_proj.weight": "model.safetensors", + "language_model.model.layers.15.self_attn.v_proj.biases": "model.safetensors", + "language_model.model.layers.15.self_attn.v_proj.scales": "model.safetensors", + "language_model.model.layers.15.self_attn.v_proj.weight": "model.safetensors", + "language_model.model.layers.16.input_layernorm.weight": "model.safetensors", + "language_model.model.layers.16.linear_attn.A_log": "model.safetensors", + "language_model.model.layers.16.linear_attn.conv1d.weight": "model.safetensors", + "language_model.model.layers.16.linear_attn.dt_bias": "model.safetensors", + "language_model.model.layers.16.linear_attn.in_proj_a.biases": "model.safetensors", + "language_model.model.layers.16.linear_attn.in_proj_a.scales": "model.safetensors", + "language_model.model.layers.16.linear_attn.in_proj_a.weight": "model.safetensors", + "language_model.model.layers.16.linear_attn.in_proj_b.biases": "model.safetensors", + "language_model.model.layers.16.linear_attn.in_proj_b.scales": "model.safetensors", + "language_model.model.layers.16.linear_attn.in_proj_b.weight": "model.safetensors", + "language_model.model.layers.16.linear_attn.in_proj_qkv.biases": "model.safetensors", + "language_model.model.layers.16.linear_attn.in_proj_qkv.scales": "model.safetensors", + "language_model.model.layers.16.linear_attn.in_proj_qkv.weight": "model.safetensors", + "language_model.model.layers.16.linear_attn.in_proj_z.biases": "model.safetensors", + "language_model.model.layers.16.linear_attn.in_proj_z.scales": "model.safetensors", + "language_model.model.layers.16.linear_attn.in_proj_z.weight": "model.safetensors", + "language_model.model.layers.16.linear_attn.norm.weight": "model.safetensors", + "language_model.model.layers.16.linear_attn.out_proj.biases": "model.safetensors", + "language_model.model.layers.16.linear_attn.out_proj.scales": "model.safetensors", + "language_model.model.layers.16.linear_attn.out_proj.weight": "model.safetensors", + "language_model.model.layers.16.mlp.down_proj.biases": "model.safetensors", + "language_model.model.layers.16.mlp.down_proj.scales": "model.safetensors", + "language_model.model.layers.16.mlp.down_proj.weight": "model.safetensors", + "language_model.model.layers.16.mlp.gate_proj.biases": "model.safetensors", + "language_model.model.layers.16.mlp.gate_proj.scales": "model.safetensors", + "language_model.model.layers.16.mlp.gate_proj.weight": "model.safetensors", + "language_model.model.layers.16.mlp.up_proj.biases": "model.safetensors", + "language_model.model.layers.16.mlp.up_proj.scales": "model.safetensors", + "language_model.model.layers.16.mlp.up_proj.weight": "model.safetensors", + "language_model.model.layers.16.post_attention_layernorm.weight": "model.safetensors", + "language_model.model.layers.17.input_layernorm.weight": "model.safetensors", + "language_model.model.layers.17.linear_attn.A_log": "model.safetensors", + "language_model.model.layers.17.linear_attn.conv1d.weight": "model.safetensors", + "language_model.model.layers.17.linear_attn.dt_bias": "model.safetensors", + "language_model.model.layers.17.linear_attn.in_proj_a.biases": "model.safetensors", + "language_model.model.layers.17.linear_attn.in_proj_a.scales": "model.safetensors", + "language_model.model.layers.17.linear_attn.in_proj_a.weight": "model.safetensors", + "language_model.model.layers.17.linear_attn.in_proj_b.biases": "model.safetensors", + "language_model.model.layers.17.linear_attn.in_proj_b.scales": "model.safetensors", + "language_model.model.layers.17.linear_attn.in_proj_b.weight": "model.safetensors", + "language_model.model.layers.17.linear_attn.in_proj_qkv.biases": "model.safetensors", + "language_model.model.layers.17.linear_attn.in_proj_qkv.scales": "model.safetensors", + "language_model.model.layers.17.linear_attn.in_proj_qkv.weight": "model.safetensors", + "language_model.model.layers.17.linear_attn.in_proj_z.biases": "model.safetensors", + "language_model.model.layers.17.linear_attn.in_proj_z.scales": "model.safetensors", + "language_model.model.layers.17.linear_attn.in_proj_z.weight": "model.safetensors", + "language_model.model.layers.17.linear_attn.norm.weight": "model.safetensors", + "language_model.model.layers.17.linear_attn.out_proj.biases": "model.safetensors", + "language_model.model.layers.17.linear_attn.out_proj.scales": "model.safetensors", + "language_model.model.layers.17.linear_attn.out_proj.weight": "model.safetensors", + "language_model.model.layers.17.mlp.down_proj.biases": "model.safetensors", + "language_model.model.layers.17.mlp.down_proj.scales": "model.safetensors", + "language_model.model.layers.17.mlp.down_proj.weight": "model.safetensors", + "language_model.model.layers.17.mlp.gate_proj.biases": "model.safetensors", + "language_model.model.layers.17.mlp.gate_proj.scales": "model.safetensors", + "language_model.model.layers.17.mlp.gate_proj.weight": "model.safetensors", + "language_model.model.layers.17.mlp.up_proj.biases": "model.safetensors", + "language_model.model.layers.17.mlp.up_proj.scales": "model.safetensors", + "language_model.model.layers.17.mlp.up_proj.weight": "model.safetensors", + "language_model.model.layers.17.post_attention_layernorm.weight": "model.safetensors", + "language_model.model.layers.18.input_layernorm.weight": "model.safetensors", + "language_model.model.layers.18.linear_attn.A_log": "model.safetensors", + "language_model.model.layers.18.linear_attn.conv1d.weight": "model.safetensors", + "language_model.model.layers.18.linear_attn.dt_bias": "model.safetensors", + "language_model.model.layers.18.linear_attn.in_proj_a.biases": "model.safetensors", + "language_model.model.layers.18.linear_attn.in_proj_a.scales": "model.safetensors", + "language_model.model.layers.18.linear_attn.in_proj_a.weight": "model.safetensors", + "language_model.model.layers.18.linear_attn.in_proj_b.biases": "model.safetensors", + "language_model.model.layers.18.linear_attn.in_proj_b.scales": "model.safetensors", + "language_model.model.layers.18.linear_attn.in_proj_b.weight": "model.safetensors", + "language_model.model.layers.18.linear_attn.in_proj_qkv.biases": "model.safetensors", + "language_model.model.layers.18.linear_attn.in_proj_qkv.scales": "model.safetensors", + "language_model.model.layers.18.linear_attn.in_proj_qkv.weight": "model.safetensors", + "language_model.model.layers.18.linear_attn.in_proj_z.biases": "model.safetensors", + "language_model.model.layers.18.linear_attn.in_proj_z.scales": "model.safetensors", + "language_model.model.layers.18.linear_attn.in_proj_z.weight": "model.safetensors", + "language_model.model.layers.18.linear_attn.norm.weight": "model.safetensors", + "language_model.model.layers.18.linear_attn.out_proj.biases": "model.safetensors", + "language_model.model.layers.18.linear_attn.out_proj.scales": "model.safetensors", + "language_model.model.layers.18.linear_attn.out_proj.weight": "model.safetensors", + "language_model.model.layers.18.mlp.down_proj.biases": "model.safetensors", + "language_model.model.layers.18.mlp.down_proj.scales": "model.safetensors", + "language_model.model.layers.18.mlp.down_proj.weight": "model.safetensors", + "language_model.model.layers.18.mlp.gate_proj.biases": "model.safetensors", + "language_model.model.layers.18.mlp.gate_proj.scales": "model.safetensors", + "language_model.model.layers.18.mlp.gate_proj.weight": "model.safetensors", + "language_model.model.layers.18.mlp.up_proj.biases": "model.safetensors", + "language_model.model.layers.18.mlp.up_proj.scales": "model.safetensors", + "language_model.model.layers.18.mlp.up_proj.weight": "model.safetensors", + "language_model.model.layers.18.post_attention_layernorm.weight": "model.safetensors", + "language_model.model.layers.19.input_layernorm.weight": "model.safetensors", + "language_model.model.layers.19.mlp.down_proj.biases": "model.safetensors", + "language_model.model.layers.19.mlp.down_proj.scales": "model.safetensors", + "language_model.model.layers.19.mlp.down_proj.weight": "model.safetensors", + "language_model.model.layers.19.mlp.gate_proj.biases": "model.safetensors", + "language_model.model.layers.19.mlp.gate_proj.scales": "model.safetensors", + "language_model.model.layers.19.mlp.gate_proj.weight": "model.safetensors", + "language_model.model.layers.19.mlp.up_proj.biases": "model.safetensors", + "language_model.model.layers.19.mlp.up_proj.scales": "model.safetensors", + "language_model.model.layers.19.mlp.up_proj.weight": "model.safetensors", + "language_model.model.layers.19.post_attention_layernorm.weight": "model.safetensors", + "language_model.model.layers.19.self_attn.k_norm.weight": "model.safetensors", + "language_model.model.layers.19.self_attn.k_proj.biases": "model.safetensors", + "language_model.model.layers.19.self_attn.k_proj.scales": "model.safetensors", + "language_model.model.layers.19.self_attn.k_proj.weight": "model.safetensors", + "language_model.model.layers.19.self_attn.o_proj.biases": "model.safetensors", + "language_model.model.layers.19.self_attn.o_proj.scales": "model.safetensors", + "language_model.model.layers.19.self_attn.o_proj.weight": "model.safetensors", + "language_model.model.layers.19.self_attn.q_norm.weight": "model.safetensors", + "language_model.model.layers.19.self_attn.q_proj.biases": "model.safetensors", + "language_model.model.layers.19.self_attn.q_proj.scales": "model.safetensors", + "language_model.model.layers.19.self_attn.q_proj.weight": "model.safetensors", + "language_model.model.layers.19.self_attn.v_proj.biases": "model.safetensors", + "language_model.model.layers.19.self_attn.v_proj.scales": "model.safetensors", + "language_model.model.layers.19.self_attn.v_proj.weight": "model.safetensors", + "language_model.model.layers.2.input_layernorm.weight": "model.safetensors", + "language_model.model.layers.2.linear_attn.A_log": "model.safetensors", + "language_model.model.layers.2.linear_attn.conv1d.weight": "model.safetensors", + "language_model.model.layers.2.linear_attn.dt_bias": "model.safetensors", + "language_model.model.layers.2.linear_attn.in_proj_a.biases": "model.safetensors", + "language_model.model.layers.2.linear_attn.in_proj_a.scales": "model.safetensors", + "language_model.model.layers.2.linear_attn.in_proj_a.weight": "model.safetensors", + "language_model.model.layers.2.linear_attn.in_proj_b.biases": "model.safetensors", + "language_model.model.layers.2.linear_attn.in_proj_b.scales": "model.safetensors", + "language_model.model.layers.2.linear_attn.in_proj_b.weight": "model.safetensors", + "language_model.model.layers.2.linear_attn.in_proj_qkv.biases": "model.safetensors", + "language_model.model.layers.2.linear_attn.in_proj_qkv.scales": "model.safetensors", + "language_model.model.layers.2.linear_attn.in_proj_qkv.weight": "model.safetensors", + "language_model.model.layers.2.linear_attn.in_proj_z.biases": "model.safetensors", + "language_model.model.layers.2.linear_attn.in_proj_z.scales": "model.safetensors", + "language_model.model.layers.2.linear_attn.in_proj_z.weight": "model.safetensors", + "language_model.model.layers.2.linear_attn.norm.weight": "model.safetensors", + "language_model.model.layers.2.linear_attn.out_proj.biases": "model.safetensors", + "language_model.model.layers.2.linear_attn.out_proj.scales": "model.safetensors", + "language_model.model.layers.2.linear_attn.out_proj.weight": "model.safetensors", + "language_model.model.layers.2.mlp.down_proj.biases": "model.safetensors", + "language_model.model.layers.2.mlp.down_proj.scales": "model.safetensors", + "language_model.model.layers.2.mlp.down_proj.weight": "model.safetensors", + "language_model.model.layers.2.mlp.gate_proj.biases": "model.safetensors", + "language_model.model.layers.2.mlp.gate_proj.scales": "model.safetensors", + "language_model.model.layers.2.mlp.gate_proj.weight": "model.safetensors", + "language_model.model.layers.2.mlp.up_proj.biases": "model.safetensors", + "language_model.model.layers.2.mlp.up_proj.scales": "model.safetensors", + "language_model.model.layers.2.mlp.up_proj.weight": "model.safetensors", + "language_model.model.layers.2.post_attention_layernorm.weight": "model.safetensors", + "language_model.model.layers.20.input_layernorm.weight": "model.safetensors", + "language_model.model.layers.20.linear_attn.A_log": "model.safetensors", + "language_model.model.layers.20.linear_attn.conv1d.weight": "model.safetensors", + "language_model.model.layers.20.linear_attn.dt_bias": "model.safetensors", + "language_model.model.layers.20.linear_attn.in_proj_a.biases": "model.safetensors", + "language_model.model.layers.20.linear_attn.in_proj_a.scales": "model.safetensors", + "language_model.model.layers.20.linear_attn.in_proj_a.weight": "model.safetensors", + "language_model.model.layers.20.linear_attn.in_proj_b.biases": "model.safetensors", + "language_model.model.layers.20.linear_attn.in_proj_b.scales": "model.safetensors", + "language_model.model.layers.20.linear_attn.in_proj_b.weight": "model.safetensors", + "language_model.model.layers.20.linear_attn.in_proj_qkv.biases": "model.safetensors", + "language_model.model.layers.20.linear_attn.in_proj_qkv.scales": "model.safetensors", + "language_model.model.layers.20.linear_attn.in_proj_qkv.weight": "model.safetensors", + "language_model.model.layers.20.linear_attn.in_proj_z.biases": "model.safetensors", + "language_model.model.layers.20.linear_attn.in_proj_z.scales": "model.safetensors", + "language_model.model.layers.20.linear_attn.in_proj_z.weight": "model.safetensors", + "language_model.model.layers.20.linear_attn.norm.weight": "model.safetensors", + "language_model.model.layers.20.linear_attn.out_proj.biases": "model.safetensors", + "language_model.model.layers.20.linear_attn.out_proj.scales": "model.safetensors", + "language_model.model.layers.20.linear_attn.out_proj.weight": "model.safetensors", + "language_model.model.layers.20.mlp.down_proj.biases": "model.safetensors", + "language_model.model.layers.20.mlp.down_proj.scales": "model.safetensors", + "language_model.model.layers.20.mlp.down_proj.weight": "model.safetensors", + "language_model.model.layers.20.mlp.gate_proj.biases": "model.safetensors", + "language_model.model.layers.20.mlp.gate_proj.scales": "model.safetensors", + "language_model.model.layers.20.mlp.gate_proj.weight": "model.safetensors", + "language_model.model.layers.20.mlp.up_proj.biases": "model.safetensors", + "language_model.model.layers.20.mlp.up_proj.scales": "model.safetensors", + "language_model.model.layers.20.mlp.up_proj.weight": "model.safetensors", + "language_model.model.layers.20.post_attention_layernorm.weight": "model.safetensors", + "language_model.model.layers.21.input_layernorm.weight": "model.safetensors", + "language_model.model.layers.21.linear_attn.A_log": "model.safetensors", + "language_model.model.layers.21.linear_attn.conv1d.weight": "model.safetensors", + "language_model.model.layers.21.linear_attn.dt_bias": "model.safetensors", + "language_model.model.layers.21.linear_attn.in_proj_a.biases": "model.safetensors", + "language_model.model.layers.21.linear_attn.in_proj_a.scales": "model.safetensors", + "language_model.model.layers.21.linear_attn.in_proj_a.weight": "model.safetensors", + "language_model.model.layers.21.linear_attn.in_proj_b.biases": "model.safetensors", + "language_model.model.layers.21.linear_attn.in_proj_b.scales": "model.safetensors", + "language_model.model.layers.21.linear_attn.in_proj_b.weight": "model.safetensors", + "language_model.model.layers.21.linear_attn.in_proj_qkv.biases": "model.safetensors", + "language_model.model.layers.21.linear_attn.in_proj_qkv.scales": "model.safetensors", + "language_model.model.layers.21.linear_attn.in_proj_qkv.weight": "model.safetensors", + "language_model.model.layers.21.linear_attn.in_proj_z.biases": "model.safetensors", + "language_model.model.layers.21.linear_attn.in_proj_z.scales": "model.safetensors", + "language_model.model.layers.21.linear_attn.in_proj_z.weight": "model.safetensors", + "language_model.model.layers.21.linear_attn.norm.weight": "model.safetensors", + "language_model.model.layers.21.linear_attn.out_proj.biases": "model.safetensors", + "language_model.model.layers.21.linear_attn.out_proj.scales": "model.safetensors", + "language_model.model.layers.21.linear_attn.out_proj.weight": "model.safetensors", + "language_model.model.layers.21.mlp.down_proj.biases": "model.safetensors", + "language_model.model.layers.21.mlp.down_proj.scales": "model.safetensors", + "language_model.model.layers.21.mlp.down_proj.weight": "model.safetensors", + "language_model.model.layers.21.mlp.gate_proj.biases": "model.safetensors", + "language_model.model.layers.21.mlp.gate_proj.scales": "model.safetensors", + "language_model.model.layers.21.mlp.gate_proj.weight": "model.safetensors", + "language_model.model.layers.21.mlp.up_proj.biases": "model.safetensors", + "language_model.model.layers.21.mlp.up_proj.scales": "model.safetensors", + "language_model.model.layers.21.mlp.up_proj.weight": "model.safetensors", + "language_model.model.layers.21.post_attention_layernorm.weight": "model.safetensors", + "language_model.model.layers.22.input_layernorm.weight": "model.safetensors", + "language_model.model.layers.22.linear_attn.A_log": "model.safetensors", + "language_model.model.layers.22.linear_attn.conv1d.weight": "model.safetensors", + "language_model.model.layers.22.linear_attn.dt_bias": "model.safetensors", + "language_model.model.layers.22.linear_attn.in_proj_a.biases": "model.safetensors", + "language_model.model.layers.22.linear_attn.in_proj_a.scales": "model.safetensors", + "language_model.model.layers.22.linear_attn.in_proj_a.weight": "model.safetensors", + "language_model.model.layers.22.linear_attn.in_proj_b.biases": "model.safetensors", + "language_model.model.layers.22.linear_attn.in_proj_b.scales": "model.safetensors", + "language_model.model.layers.22.linear_attn.in_proj_b.weight": "model.safetensors", + "language_model.model.layers.22.linear_attn.in_proj_qkv.biases": "model.safetensors", + "language_model.model.layers.22.linear_attn.in_proj_qkv.scales": "model.safetensors", + "language_model.model.layers.22.linear_attn.in_proj_qkv.weight": "model.safetensors", + "language_model.model.layers.22.linear_attn.in_proj_z.biases": "model.safetensors", + "language_model.model.layers.22.linear_attn.in_proj_z.scales": "model.safetensors", + "language_model.model.layers.22.linear_attn.in_proj_z.weight": "model.safetensors", + "language_model.model.layers.22.linear_attn.norm.weight": "model.safetensors", + "language_model.model.layers.22.linear_attn.out_proj.biases": "model.safetensors", + "language_model.model.layers.22.linear_attn.out_proj.scales": "model.safetensors", + "language_model.model.layers.22.linear_attn.out_proj.weight": "model.safetensors", + "language_model.model.layers.22.mlp.down_proj.biases": "model.safetensors", + "language_model.model.layers.22.mlp.down_proj.scales": "model.safetensors", + "language_model.model.layers.22.mlp.down_proj.weight": "model.safetensors", + "language_model.model.layers.22.mlp.gate_proj.biases": "model.safetensors", + "language_model.model.layers.22.mlp.gate_proj.scales": "model.safetensors", + "language_model.model.layers.22.mlp.gate_proj.weight": "model.safetensors", + "language_model.model.layers.22.mlp.up_proj.biases": "model.safetensors", + "language_model.model.layers.22.mlp.up_proj.scales": "model.safetensors", + "language_model.model.layers.22.mlp.up_proj.weight": "model.safetensors", + "language_model.model.layers.22.post_attention_layernorm.weight": "model.safetensors", + "language_model.model.layers.23.input_layernorm.weight": "model.safetensors", + "language_model.model.layers.23.mlp.down_proj.biases": "model.safetensors", + "language_model.model.layers.23.mlp.down_proj.scales": "model.safetensors", + "language_model.model.layers.23.mlp.down_proj.weight": "model.safetensors", + "language_model.model.layers.23.mlp.gate_proj.biases": "model.safetensors", + "language_model.model.layers.23.mlp.gate_proj.scales": "model.safetensors", + "language_model.model.layers.23.mlp.gate_proj.weight": "model.safetensors", + "language_model.model.layers.23.mlp.up_proj.biases": "model.safetensors", + "language_model.model.layers.23.mlp.up_proj.scales": "model.safetensors", + "language_model.model.layers.23.mlp.up_proj.weight": "model.safetensors", + "language_model.model.layers.23.post_attention_layernorm.weight": "model.safetensors", + "language_model.model.layers.23.self_attn.k_norm.weight": "model.safetensors", + "language_model.model.layers.23.self_attn.k_proj.biases": "model.safetensors", + "language_model.model.layers.23.self_attn.k_proj.scales": "model.safetensors", + "language_model.model.layers.23.self_attn.k_proj.weight": "model.safetensors", + "language_model.model.layers.23.self_attn.o_proj.biases": "model.safetensors", + "language_model.model.layers.23.self_attn.o_proj.scales": "model.safetensors", + "language_model.model.layers.23.self_attn.o_proj.weight": "model.safetensors", + "language_model.model.layers.23.self_attn.q_norm.weight": "model.safetensors", + "language_model.model.layers.23.self_attn.q_proj.biases": "model.safetensors", + "language_model.model.layers.23.self_attn.q_proj.scales": "model.safetensors", + "language_model.model.layers.23.self_attn.q_proj.weight": "model.safetensors", + "language_model.model.layers.23.self_attn.v_proj.biases": "model.safetensors", + "language_model.model.layers.23.self_attn.v_proj.scales": "model.safetensors", + "language_model.model.layers.23.self_attn.v_proj.weight": "model.safetensors", + "language_model.model.layers.3.input_layernorm.weight": "model.safetensors", + "language_model.model.layers.3.mlp.down_proj.biases": "model.safetensors", + "language_model.model.layers.3.mlp.down_proj.scales": "model.safetensors", + "language_model.model.layers.3.mlp.down_proj.weight": "model.safetensors", + "language_model.model.layers.3.mlp.gate_proj.biases": "model.safetensors", + "language_model.model.layers.3.mlp.gate_proj.scales": "model.safetensors", + "language_model.model.layers.3.mlp.gate_proj.weight": "model.safetensors", + "language_model.model.layers.3.mlp.up_proj.biases": "model.safetensors", + "language_model.model.layers.3.mlp.up_proj.scales": "model.safetensors", + "language_model.model.layers.3.mlp.up_proj.weight": "model.safetensors", + "language_model.model.layers.3.post_attention_layernorm.weight": "model.safetensors", + "language_model.model.layers.3.self_attn.k_norm.weight": "model.safetensors", + "language_model.model.layers.3.self_attn.k_proj.biases": "model.safetensors", + "language_model.model.layers.3.self_attn.k_proj.scales": "model.safetensors", + "language_model.model.layers.3.self_attn.k_proj.weight": "model.safetensors", + "language_model.model.layers.3.self_attn.o_proj.biases": "model.safetensors", + "language_model.model.layers.3.self_attn.o_proj.scales": "model.safetensors", + "language_model.model.layers.3.self_attn.o_proj.weight": "model.safetensors", + "language_model.model.layers.3.self_attn.q_norm.weight": "model.safetensors", + "language_model.model.layers.3.self_attn.q_proj.biases": "model.safetensors", + "language_model.model.layers.3.self_attn.q_proj.scales": "model.safetensors", + "language_model.model.layers.3.self_attn.q_proj.weight": "model.safetensors", + "language_model.model.layers.3.self_attn.v_proj.biases": "model.safetensors", + "language_model.model.layers.3.self_attn.v_proj.scales": "model.safetensors", + "language_model.model.layers.3.self_attn.v_proj.weight": "model.safetensors", + "language_model.model.layers.4.input_layernorm.weight": "model.safetensors", + "language_model.model.layers.4.linear_attn.A_log": "model.safetensors", + "language_model.model.layers.4.linear_attn.conv1d.weight": "model.safetensors", + "language_model.model.layers.4.linear_attn.dt_bias": "model.safetensors", + "language_model.model.layers.4.linear_attn.in_proj_a.biases": "model.safetensors", + "language_model.model.layers.4.linear_attn.in_proj_a.scales": "model.safetensors", + "language_model.model.layers.4.linear_attn.in_proj_a.weight": "model.safetensors", + "language_model.model.layers.4.linear_attn.in_proj_b.biases": "model.safetensors", + "language_model.model.layers.4.linear_attn.in_proj_b.scales": "model.safetensors", + "language_model.model.layers.4.linear_attn.in_proj_b.weight": "model.safetensors", + "language_model.model.layers.4.linear_attn.in_proj_qkv.biases": "model.safetensors", + "language_model.model.layers.4.linear_attn.in_proj_qkv.scales": "model.safetensors", + "language_model.model.layers.4.linear_attn.in_proj_qkv.weight": "model.safetensors", + "language_model.model.layers.4.linear_attn.in_proj_z.biases": "model.safetensors", + "language_model.model.layers.4.linear_attn.in_proj_z.scales": "model.safetensors", + "language_model.model.layers.4.linear_attn.in_proj_z.weight": "model.safetensors", + "language_model.model.layers.4.linear_attn.norm.weight": "model.safetensors", + "language_model.model.layers.4.linear_attn.out_proj.biases": "model.safetensors", + "language_model.model.layers.4.linear_attn.out_proj.scales": "model.safetensors", + "language_model.model.layers.4.linear_attn.out_proj.weight": "model.safetensors", + "language_model.model.layers.4.mlp.down_proj.biases": "model.safetensors", + "language_model.model.layers.4.mlp.down_proj.scales": "model.safetensors", + "language_model.model.layers.4.mlp.down_proj.weight": "model.safetensors", + "language_model.model.layers.4.mlp.gate_proj.biases": "model.safetensors", + "language_model.model.layers.4.mlp.gate_proj.scales": "model.safetensors", + "language_model.model.layers.4.mlp.gate_proj.weight": "model.safetensors", + "language_model.model.layers.4.mlp.up_proj.biases": "model.safetensors", + "language_model.model.layers.4.mlp.up_proj.scales": "model.safetensors", + "language_model.model.layers.4.mlp.up_proj.weight": "model.safetensors", + "language_model.model.layers.4.post_attention_layernorm.weight": "model.safetensors", + "language_model.model.layers.5.input_layernorm.weight": "model.safetensors", + "language_model.model.layers.5.linear_attn.A_log": "model.safetensors", + "language_model.model.layers.5.linear_attn.conv1d.weight": "model.safetensors", + "language_model.model.layers.5.linear_attn.dt_bias": "model.safetensors", + "language_model.model.layers.5.linear_attn.in_proj_a.biases": "model.safetensors", + "language_model.model.layers.5.linear_attn.in_proj_a.scales": "model.safetensors", + "language_model.model.layers.5.linear_attn.in_proj_a.weight": "model.safetensors", + "language_model.model.layers.5.linear_attn.in_proj_b.biases": "model.safetensors", + "language_model.model.layers.5.linear_attn.in_proj_b.scales": "model.safetensors", + "language_model.model.layers.5.linear_attn.in_proj_b.weight": "model.safetensors", + "language_model.model.layers.5.linear_attn.in_proj_qkv.biases": "model.safetensors", + "language_model.model.layers.5.linear_attn.in_proj_qkv.scales": "model.safetensors", + "language_model.model.layers.5.linear_attn.in_proj_qkv.weight": "model.safetensors", + "language_model.model.layers.5.linear_attn.in_proj_z.biases": "model.safetensors", + "language_model.model.layers.5.linear_attn.in_proj_z.scales": "model.safetensors", + "language_model.model.layers.5.linear_attn.in_proj_z.weight": "model.safetensors", + "language_model.model.layers.5.linear_attn.norm.weight": "model.safetensors", + "language_model.model.layers.5.linear_attn.out_proj.biases": "model.safetensors", + "language_model.model.layers.5.linear_attn.out_proj.scales": "model.safetensors", + "language_model.model.layers.5.linear_attn.out_proj.weight": "model.safetensors", + "language_model.model.layers.5.mlp.down_proj.biases": "model.safetensors", + "language_model.model.layers.5.mlp.down_proj.scales": "model.safetensors", + "language_model.model.layers.5.mlp.down_proj.weight": "model.safetensors", + "language_model.model.layers.5.mlp.gate_proj.biases": "model.safetensors", + "language_model.model.layers.5.mlp.gate_proj.scales": "model.safetensors", + "language_model.model.layers.5.mlp.gate_proj.weight": "model.safetensors", + "language_model.model.layers.5.mlp.up_proj.biases": "model.safetensors", + "language_model.model.layers.5.mlp.up_proj.scales": "model.safetensors", + "language_model.model.layers.5.mlp.up_proj.weight": "model.safetensors", + "language_model.model.layers.5.post_attention_layernorm.weight": "model.safetensors", + "language_model.model.layers.6.input_layernorm.weight": "model.safetensors", + "language_model.model.layers.6.linear_attn.A_log": "model.safetensors", + "language_model.model.layers.6.linear_attn.conv1d.weight": "model.safetensors", + "language_model.model.layers.6.linear_attn.dt_bias": "model.safetensors", + "language_model.model.layers.6.linear_attn.in_proj_a.biases": "model.safetensors", + "language_model.model.layers.6.linear_attn.in_proj_a.scales": "model.safetensors", + "language_model.model.layers.6.linear_attn.in_proj_a.weight": "model.safetensors", + "language_model.model.layers.6.linear_attn.in_proj_b.biases": "model.safetensors", + "language_model.model.layers.6.linear_attn.in_proj_b.scales": "model.safetensors", + "language_model.model.layers.6.linear_attn.in_proj_b.weight": "model.safetensors", + "language_model.model.layers.6.linear_attn.in_proj_qkv.biases": "model.safetensors", + "language_model.model.layers.6.linear_attn.in_proj_qkv.scales": "model.safetensors", + "language_model.model.layers.6.linear_attn.in_proj_qkv.weight": "model.safetensors", + "language_model.model.layers.6.linear_attn.in_proj_z.biases": "model.safetensors", + "language_model.model.layers.6.linear_attn.in_proj_z.scales": "model.safetensors", + "language_model.model.layers.6.linear_attn.in_proj_z.weight": "model.safetensors", + "language_model.model.layers.6.linear_attn.norm.weight": "model.safetensors", + "language_model.model.layers.6.linear_attn.out_proj.biases": "model.safetensors", + "language_model.model.layers.6.linear_attn.out_proj.scales": "model.safetensors", + "language_model.model.layers.6.linear_attn.out_proj.weight": "model.safetensors", + "language_model.model.layers.6.mlp.down_proj.biases": "model.safetensors", + "language_model.model.layers.6.mlp.down_proj.scales": "model.safetensors", + "language_model.model.layers.6.mlp.down_proj.weight": "model.safetensors", + "language_model.model.layers.6.mlp.gate_proj.biases": "model.safetensors", + "language_model.model.layers.6.mlp.gate_proj.scales": "model.safetensors", + "language_model.model.layers.6.mlp.gate_proj.weight": "model.safetensors", + "language_model.model.layers.6.mlp.up_proj.biases": "model.safetensors", + "language_model.model.layers.6.mlp.up_proj.scales": "model.safetensors", + "language_model.model.layers.6.mlp.up_proj.weight": "model.safetensors", + "language_model.model.layers.6.post_attention_layernorm.weight": "model.safetensors", + "language_model.model.layers.7.input_layernorm.weight": "model.safetensors", + "language_model.model.layers.7.mlp.down_proj.biases": "model.safetensors", + "language_model.model.layers.7.mlp.down_proj.scales": "model.safetensors", + "language_model.model.layers.7.mlp.down_proj.weight": "model.safetensors", + "language_model.model.layers.7.mlp.gate_proj.biases": "model.safetensors", + "language_model.model.layers.7.mlp.gate_proj.scales": "model.safetensors", + "language_model.model.layers.7.mlp.gate_proj.weight": "model.safetensors", + "language_model.model.layers.7.mlp.up_proj.biases": "model.safetensors", + "language_model.model.layers.7.mlp.up_proj.scales": "model.safetensors", + "language_model.model.layers.7.mlp.up_proj.weight": "model.safetensors", + "language_model.model.layers.7.post_attention_layernorm.weight": "model.safetensors", + "language_model.model.layers.7.self_attn.k_norm.weight": "model.safetensors", + "language_model.model.layers.7.self_attn.k_proj.biases": "model.safetensors", + "language_model.model.layers.7.self_attn.k_proj.scales": "model.safetensors", + "language_model.model.layers.7.self_attn.k_proj.weight": "model.safetensors", + "language_model.model.layers.7.self_attn.o_proj.biases": "model.safetensors", + "language_model.model.layers.7.self_attn.o_proj.scales": "model.safetensors", + "language_model.model.layers.7.self_attn.o_proj.weight": "model.safetensors", + "language_model.model.layers.7.self_attn.q_norm.weight": "model.safetensors", + "language_model.model.layers.7.self_attn.q_proj.biases": "model.safetensors", + "language_model.model.layers.7.self_attn.q_proj.scales": "model.safetensors", + "language_model.model.layers.7.self_attn.q_proj.weight": "model.safetensors", + "language_model.model.layers.7.self_attn.v_proj.biases": "model.safetensors", + "language_model.model.layers.7.self_attn.v_proj.scales": "model.safetensors", + "language_model.model.layers.7.self_attn.v_proj.weight": "model.safetensors", + "language_model.model.layers.8.input_layernorm.weight": "model.safetensors", + "language_model.model.layers.8.linear_attn.A_log": "model.safetensors", + "language_model.model.layers.8.linear_attn.conv1d.weight": "model.safetensors", + "language_model.model.layers.8.linear_attn.dt_bias": "model.safetensors", + "language_model.model.layers.8.linear_attn.in_proj_a.biases": "model.safetensors", + "language_model.model.layers.8.linear_attn.in_proj_a.scales": "model.safetensors", + "language_model.model.layers.8.linear_attn.in_proj_a.weight": "model.safetensors", + "language_model.model.layers.8.linear_attn.in_proj_b.biases": "model.safetensors", + "language_model.model.layers.8.linear_attn.in_proj_b.scales": "model.safetensors", + "language_model.model.layers.8.linear_attn.in_proj_b.weight": "model.safetensors", + "language_model.model.layers.8.linear_attn.in_proj_qkv.biases": "model.safetensors", + "language_model.model.layers.8.linear_attn.in_proj_qkv.scales": "model.safetensors", + "language_model.model.layers.8.linear_attn.in_proj_qkv.weight": "model.safetensors", + "language_model.model.layers.8.linear_attn.in_proj_z.biases": "model.safetensors", + "language_model.model.layers.8.linear_attn.in_proj_z.scales": "model.safetensors", + "language_model.model.layers.8.linear_attn.in_proj_z.weight": "model.safetensors", + "language_model.model.layers.8.linear_attn.norm.weight": "model.safetensors", + "language_model.model.layers.8.linear_attn.out_proj.biases": "model.safetensors", + "language_model.model.layers.8.linear_attn.out_proj.scales": "model.safetensors", + "language_model.model.layers.8.linear_attn.out_proj.weight": "model.safetensors", + "language_model.model.layers.8.mlp.down_proj.biases": "model.safetensors", + "language_model.model.layers.8.mlp.down_proj.scales": "model.safetensors", + "language_model.model.layers.8.mlp.down_proj.weight": "model.safetensors", + "language_model.model.layers.8.mlp.gate_proj.biases": "model.safetensors", + "language_model.model.layers.8.mlp.gate_proj.scales": "model.safetensors", + "language_model.model.layers.8.mlp.gate_proj.weight": "model.safetensors", + "language_model.model.layers.8.mlp.up_proj.biases": "model.safetensors", + "language_model.model.layers.8.mlp.up_proj.scales": "model.safetensors", + "language_model.model.layers.8.mlp.up_proj.weight": "model.safetensors", + "language_model.model.layers.8.post_attention_layernorm.weight": "model.safetensors", + "language_model.model.layers.9.input_layernorm.weight": "model.safetensors", + "language_model.model.layers.9.linear_attn.A_log": "model.safetensors", + "language_model.model.layers.9.linear_attn.conv1d.weight": "model.safetensors", + "language_model.model.layers.9.linear_attn.dt_bias": "model.safetensors", + "language_model.model.layers.9.linear_attn.in_proj_a.biases": "model.safetensors", + "language_model.model.layers.9.linear_attn.in_proj_a.scales": "model.safetensors", + "language_model.model.layers.9.linear_attn.in_proj_a.weight": "model.safetensors", + "language_model.model.layers.9.linear_attn.in_proj_b.biases": "model.safetensors", + "language_model.model.layers.9.linear_attn.in_proj_b.scales": "model.safetensors", + "language_model.model.layers.9.linear_attn.in_proj_b.weight": "model.safetensors", + "language_model.model.layers.9.linear_attn.in_proj_qkv.biases": "model.safetensors", + "language_model.model.layers.9.linear_attn.in_proj_qkv.scales": "model.safetensors", + "language_model.model.layers.9.linear_attn.in_proj_qkv.weight": "model.safetensors", + "language_model.model.layers.9.linear_attn.in_proj_z.biases": "model.safetensors", + "language_model.model.layers.9.linear_attn.in_proj_z.scales": "model.safetensors", + "language_model.model.layers.9.linear_attn.in_proj_z.weight": "model.safetensors", + "language_model.model.layers.9.linear_attn.norm.weight": "model.safetensors", + "language_model.model.layers.9.linear_attn.out_proj.biases": "model.safetensors", + "language_model.model.layers.9.linear_attn.out_proj.scales": "model.safetensors", + "language_model.model.layers.9.linear_attn.out_proj.weight": "model.safetensors", + "language_model.model.layers.9.mlp.down_proj.biases": "model.safetensors", + "language_model.model.layers.9.mlp.down_proj.scales": "model.safetensors", + "language_model.model.layers.9.mlp.down_proj.weight": "model.safetensors", + "language_model.model.layers.9.mlp.gate_proj.biases": "model.safetensors", + "language_model.model.layers.9.mlp.gate_proj.scales": "model.safetensors", + "language_model.model.layers.9.mlp.gate_proj.weight": "model.safetensors", + "language_model.model.layers.9.mlp.up_proj.biases": "model.safetensors", + "language_model.model.layers.9.mlp.up_proj.scales": "model.safetensors", + "language_model.model.layers.9.mlp.up_proj.weight": "model.safetensors", + "language_model.model.layers.9.post_attention_layernorm.weight": "model.safetensors", + "language_model.model.norm.weight": "model.safetensors", + "vision_tower.blocks.0.attn.proj.bias": "model.safetensors", + "vision_tower.blocks.0.attn.proj.weight": "model.safetensors", + "vision_tower.blocks.0.attn.qkv.bias": "model.safetensors", + "vision_tower.blocks.0.attn.qkv.weight": "model.safetensors", + "vision_tower.blocks.0.mlp.linear_fc1.bias": "model.safetensors", + "vision_tower.blocks.0.mlp.linear_fc1.weight": "model.safetensors", + "vision_tower.blocks.0.mlp.linear_fc2.bias": "model.safetensors", + "vision_tower.blocks.0.mlp.linear_fc2.weight": "model.safetensors", + "vision_tower.blocks.0.norm1.bias": "model.safetensors", + "vision_tower.blocks.0.norm1.weight": "model.safetensors", + "vision_tower.blocks.0.norm2.bias": "model.safetensors", + "vision_tower.blocks.0.norm2.weight": "model.safetensors", + "vision_tower.blocks.1.attn.proj.bias": "model.safetensors", + "vision_tower.blocks.1.attn.proj.weight": "model.safetensors", + "vision_tower.blocks.1.attn.qkv.bias": "model.safetensors", + "vision_tower.blocks.1.attn.qkv.weight": "model.safetensors", + "vision_tower.blocks.1.mlp.linear_fc1.bias": "model.safetensors", + "vision_tower.blocks.1.mlp.linear_fc1.weight": "model.safetensors", + "vision_tower.blocks.1.mlp.linear_fc2.bias": "model.safetensors", + "vision_tower.blocks.1.mlp.linear_fc2.weight": "model.safetensors", + "vision_tower.blocks.1.norm1.bias": "model.safetensors", + "vision_tower.blocks.1.norm1.weight": "model.safetensors", + "vision_tower.blocks.1.norm2.bias": "model.safetensors", + "vision_tower.blocks.1.norm2.weight": "model.safetensors", + "vision_tower.blocks.10.attn.proj.bias": "model.safetensors", + "vision_tower.blocks.10.attn.proj.weight": "model.safetensors", + "vision_tower.blocks.10.attn.qkv.bias": "model.safetensors", + "vision_tower.blocks.10.attn.qkv.weight": "model.safetensors", + "vision_tower.blocks.10.mlp.linear_fc1.bias": "model.safetensors", + "vision_tower.blocks.10.mlp.linear_fc1.weight": "model.safetensors", + "vision_tower.blocks.10.mlp.linear_fc2.bias": "model.safetensors", + "vision_tower.blocks.10.mlp.linear_fc2.weight": "model.safetensors", + "vision_tower.blocks.10.norm1.bias": "model.safetensors", + "vision_tower.blocks.10.norm1.weight": "model.safetensors", + "vision_tower.blocks.10.norm2.bias": "model.safetensors", + "vision_tower.blocks.10.norm2.weight": "model.safetensors", + "vision_tower.blocks.11.attn.proj.bias": "model.safetensors", + "vision_tower.blocks.11.attn.proj.weight": "model.safetensors", + "vision_tower.blocks.11.attn.qkv.bias": "model.safetensors", + "vision_tower.blocks.11.attn.qkv.weight": "model.safetensors", + "vision_tower.blocks.11.mlp.linear_fc1.bias": "model.safetensors", + "vision_tower.blocks.11.mlp.linear_fc1.weight": "model.safetensors", + "vision_tower.blocks.11.mlp.linear_fc2.bias": "model.safetensors", + "vision_tower.blocks.11.mlp.linear_fc2.weight": "model.safetensors", + "vision_tower.blocks.11.norm1.bias": "model.safetensors", + "vision_tower.blocks.11.norm1.weight": "model.safetensors", + "vision_tower.blocks.11.norm2.bias": "model.safetensors", + "vision_tower.blocks.11.norm2.weight": "model.safetensors", + "vision_tower.blocks.12.attn.proj.bias": "model.safetensors", + "vision_tower.blocks.12.attn.proj.weight": "model.safetensors", + "vision_tower.blocks.12.attn.qkv.bias": "model.safetensors", + "vision_tower.blocks.12.attn.qkv.weight": "model.safetensors", + "vision_tower.blocks.12.mlp.linear_fc1.bias": "model.safetensors", + "vision_tower.blocks.12.mlp.linear_fc1.weight": "model.safetensors", + "vision_tower.blocks.12.mlp.linear_fc2.bias": "model.safetensors", + "vision_tower.blocks.12.mlp.linear_fc2.weight": "model.safetensors", + "vision_tower.blocks.12.norm1.bias": "model.safetensors", + "vision_tower.blocks.12.norm1.weight": "model.safetensors", + "vision_tower.blocks.12.norm2.bias": "model.safetensors", + "vision_tower.blocks.12.norm2.weight": "model.safetensors", + "vision_tower.blocks.13.attn.proj.bias": "model.safetensors", + "vision_tower.blocks.13.attn.proj.weight": "model.safetensors", + "vision_tower.blocks.13.attn.qkv.bias": "model.safetensors", + "vision_tower.blocks.13.attn.qkv.weight": "model.safetensors", + "vision_tower.blocks.13.mlp.linear_fc1.bias": "model.safetensors", + "vision_tower.blocks.13.mlp.linear_fc1.weight": "model.safetensors", + "vision_tower.blocks.13.mlp.linear_fc2.bias": "model.safetensors", + "vision_tower.blocks.13.mlp.linear_fc2.weight": "model.safetensors", + "vision_tower.blocks.13.norm1.bias": "model.safetensors", + "vision_tower.blocks.13.norm1.weight": "model.safetensors", + "vision_tower.blocks.13.norm2.bias": "model.safetensors", + "vision_tower.blocks.13.norm2.weight": "model.safetensors", + "vision_tower.blocks.14.attn.proj.bias": "model.safetensors", + "vision_tower.blocks.14.attn.proj.weight": "model.safetensors", + "vision_tower.blocks.14.attn.qkv.bias": "model.safetensors", + "vision_tower.blocks.14.attn.qkv.weight": "model.safetensors", + "vision_tower.blocks.14.mlp.linear_fc1.bias": "model.safetensors", + "vision_tower.blocks.14.mlp.linear_fc1.weight": "model.safetensors", + "vision_tower.blocks.14.mlp.linear_fc2.bias": "model.safetensors", + "vision_tower.blocks.14.mlp.linear_fc2.weight": "model.safetensors", + "vision_tower.blocks.14.norm1.bias": "model.safetensors", + "vision_tower.blocks.14.norm1.weight": "model.safetensors", + "vision_tower.blocks.14.norm2.bias": "model.safetensors", + "vision_tower.blocks.14.norm2.weight": "model.safetensors", + "vision_tower.blocks.15.attn.proj.bias": "model.safetensors", + "vision_tower.blocks.15.attn.proj.weight": "model.safetensors", + "vision_tower.blocks.15.attn.qkv.bias": "model.safetensors", + "vision_tower.blocks.15.attn.qkv.weight": "model.safetensors", + "vision_tower.blocks.15.mlp.linear_fc1.bias": "model.safetensors", + "vision_tower.blocks.15.mlp.linear_fc1.weight": "model.safetensors", + "vision_tower.blocks.15.mlp.linear_fc2.bias": "model.safetensors", + "vision_tower.blocks.15.mlp.linear_fc2.weight": "model.safetensors", + "vision_tower.blocks.15.norm1.bias": "model.safetensors", + "vision_tower.blocks.15.norm1.weight": "model.safetensors", + "vision_tower.blocks.15.norm2.bias": "model.safetensors", + "vision_tower.blocks.15.norm2.weight": "model.safetensors", + "vision_tower.blocks.16.attn.proj.bias": "model.safetensors", + "vision_tower.blocks.16.attn.proj.weight": "model.safetensors", + "vision_tower.blocks.16.attn.qkv.bias": "model.safetensors", + "vision_tower.blocks.16.attn.qkv.weight": "model.safetensors", + "vision_tower.blocks.16.mlp.linear_fc1.bias": "model.safetensors", + "vision_tower.blocks.16.mlp.linear_fc1.weight": "model.safetensors", + "vision_tower.blocks.16.mlp.linear_fc2.bias": "model.safetensors", + "vision_tower.blocks.16.mlp.linear_fc2.weight": "model.safetensors", + "vision_tower.blocks.16.norm1.bias": "model.safetensors", + "vision_tower.blocks.16.norm1.weight": "model.safetensors", + "vision_tower.blocks.16.norm2.bias": "model.safetensors", + "vision_tower.blocks.16.norm2.weight": "model.safetensors", + "vision_tower.blocks.17.attn.proj.bias": "model.safetensors", + "vision_tower.blocks.17.attn.proj.weight": "model.safetensors", + "vision_tower.blocks.17.attn.qkv.bias": "model.safetensors", + "vision_tower.blocks.17.attn.qkv.weight": "model.safetensors", + "vision_tower.blocks.17.mlp.linear_fc1.bias": "model.safetensors", + "vision_tower.blocks.17.mlp.linear_fc1.weight": "model.safetensors", + "vision_tower.blocks.17.mlp.linear_fc2.bias": "model.safetensors", + "vision_tower.blocks.17.mlp.linear_fc2.weight": "model.safetensors", + "vision_tower.blocks.17.norm1.bias": "model.safetensors", + "vision_tower.blocks.17.norm1.weight": "model.safetensors", + "vision_tower.blocks.17.norm2.bias": "model.safetensors", + "vision_tower.blocks.17.norm2.weight": "model.safetensors", + "vision_tower.blocks.18.attn.proj.bias": "model.safetensors", + "vision_tower.blocks.18.attn.proj.weight": "model.safetensors", + "vision_tower.blocks.18.attn.qkv.bias": "model.safetensors", + "vision_tower.blocks.18.attn.qkv.weight": "model.safetensors", + "vision_tower.blocks.18.mlp.linear_fc1.bias": "model.safetensors", + "vision_tower.blocks.18.mlp.linear_fc1.weight": "model.safetensors", + "vision_tower.blocks.18.mlp.linear_fc2.bias": "model.safetensors", + "vision_tower.blocks.18.mlp.linear_fc2.weight": "model.safetensors", + "vision_tower.blocks.18.norm1.bias": "model.safetensors", + "vision_tower.blocks.18.norm1.weight": "model.safetensors", + "vision_tower.blocks.18.norm2.bias": "model.safetensors", + "vision_tower.blocks.18.norm2.weight": "model.safetensors", + "vision_tower.blocks.19.attn.proj.bias": "model.safetensors", + "vision_tower.blocks.19.attn.proj.weight": "model.safetensors", + "vision_tower.blocks.19.attn.qkv.bias": "model.safetensors", + "vision_tower.blocks.19.attn.qkv.weight": "model.safetensors", + "vision_tower.blocks.19.mlp.linear_fc1.bias": "model.safetensors", + "vision_tower.blocks.19.mlp.linear_fc1.weight": "model.safetensors", + "vision_tower.blocks.19.mlp.linear_fc2.bias": "model.safetensors", + "vision_tower.blocks.19.mlp.linear_fc2.weight": "model.safetensors", + "vision_tower.blocks.19.norm1.bias": "model.safetensors", + "vision_tower.blocks.19.norm1.weight": "model.safetensors", + "vision_tower.blocks.19.norm2.bias": "model.safetensors", + "vision_tower.blocks.19.norm2.weight": "model.safetensors", + "vision_tower.blocks.2.attn.proj.bias": "model.safetensors", + "vision_tower.blocks.2.attn.proj.weight": "model.safetensors", + "vision_tower.blocks.2.attn.qkv.bias": "model.safetensors", + "vision_tower.blocks.2.attn.qkv.weight": "model.safetensors", + "vision_tower.blocks.2.mlp.linear_fc1.bias": "model.safetensors", + "vision_tower.blocks.2.mlp.linear_fc1.weight": "model.safetensors", + "vision_tower.blocks.2.mlp.linear_fc2.bias": "model.safetensors", + "vision_tower.blocks.2.mlp.linear_fc2.weight": "model.safetensors", + "vision_tower.blocks.2.norm1.bias": "model.safetensors", + "vision_tower.blocks.2.norm1.weight": "model.safetensors", + "vision_tower.blocks.2.norm2.bias": "model.safetensors", + "vision_tower.blocks.2.norm2.weight": "model.safetensors", + "vision_tower.blocks.20.attn.proj.bias": "model.safetensors", + "vision_tower.blocks.20.attn.proj.weight": "model.safetensors", + "vision_tower.blocks.20.attn.qkv.bias": "model.safetensors", + "vision_tower.blocks.20.attn.qkv.weight": "model.safetensors", + "vision_tower.blocks.20.mlp.linear_fc1.bias": "model.safetensors", + "vision_tower.blocks.20.mlp.linear_fc1.weight": "model.safetensors", + "vision_tower.blocks.20.mlp.linear_fc2.bias": "model.safetensors", + "vision_tower.blocks.20.mlp.linear_fc2.weight": "model.safetensors", + "vision_tower.blocks.20.norm1.bias": "model.safetensors", + "vision_tower.blocks.20.norm1.weight": "model.safetensors", + "vision_tower.blocks.20.norm2.bias": "model.safetensors", + "vision_tower.blocks.20.norm2.weight": "model.safetensors", + "vision_tower.blocks.21.attn.proj.bias": "model.safetensors", + "vision_tower.blocks.21.attn.proj.weight": "model.safetensors", + "vision_tower.blocks.21.attn.qkv.bias": "model.safetensors", + "vision_tower.blocks.21.attn.qkv.weight": "model.safetensors", + "vision_tower.blocks.21.mlp.linear_fc1.bias": "model.safetensors", + "vision_tower.blocks.21.mlp.linear_fc1.weight": "model.safetensors", + "vision_tower.blocks.21.mlp.linear_fc2.bias": "model.safetensors", + "vision_tower.blocks.21.mlp.linear_fc2.weight": "model.safetensors", + "vision_tower.blocks.21.norm1.bias": "model.safetensors", + "vision_tower.blocks.21.norm1.weight": "model.safetensors", + "vision_tower.blocks.21.norm2.bias": "model.safetensors", + "vision_tower.blocks.21.norm2.weight": "model.safetensors", + "vision_tower.blocks.22.attn.proj.bias": "model.safetensors", + "vision_tower.blocks.22.attn.proj.weight": "model.safetensors", + "vision_tower.blocks.22.attn.qkv.bias": "model.safetensors", + "vision_tower.blocks.22.attn.qkv.weight": "model.safetensors", + "vision_tower.blocks.22.mlp.linear_fc1.bias": "model.safetensors", + "vision_tower.blocks.22.mlp.linear_fc1.weight": "model.safetensors", + "vision_tower.blocks.22.mlp.linear_fc2.bias": "model.safetensors", + "vision_tower.blocks.22.mlp.linear_fc2.weight": "model.safetensors", + "vision_tower.blocks.22.norm1.bias": "model.safetensors", + "vision_tower.blocks.22.norm1.weight": "model.safetensors", + "vision_tower.blocks.22.norm2.bias": "model.safetensors", + "vision_tower.blocks.22.norm2.weight": "model.safetensors", + "vision_tower.blocks.23.attn.proj.bias": "model.safetensors", + "vision_tower.blocks.23.attn.proj.weight": "model.safetensors", + "vision_tower.blocks.23.attn.qkv.bias": "model.safetensors", + "vision_tower.blocks.23.attn.qkv.weight": "model.safetensors", + "vision_tower.blocks.23.mlp.linear_fc1.bias": "model.safetensors", + "vision_tower.blocks.23.mlp.linear_fc1.weight": "model.safetensors", + "vision_tower.blocks.23.mlp.linear_fc2.bias": "model.safetensors", + "vision_tower.blocks.23.mlp.linear_fc2.weight": "model.safetensors", + "vision_tower.blocks.23.norm1.bias": "model.safetensors", + "vision_tower.blocks.23.norm1.weight": "model.safetensors", + "vision_tower.blocks.23.norm2.bias": "model.safetensors", + "vision_tower.blocks.23.norm2.weight": "model.safetensors", + "vision_tower.blocks.3.attn.proj.bias": "model.safetensors", + "vision_tower.blocks.3.attn.proj.weight": "model.safetensors", + "vision_tower.blocks.3.attn.qkv.bias": "model.safetensors", + "vision_tower.blocks.3.attn.qkv.weight": "model.safetensors", + "vision_tower.blocks.3.mlp.linear_fc1.bias": "model.safetensors", + "vision_tower.blocks.3.mlp.linear_fc1.weight": "model.safetensors", + "vision_tower.blocks.3.mlp.linear_fc2.bias": "model.safetensors", + "vision_tower.blocks.3.mlp.linear_fc2.weight": "model.safetensors", + "vision_tower.blocks.3.norm1.bias": "model.safetensors", + "vision_tower.blocks.3.norm1.weight": "model.safetensors", + "vision_tower.blocks.3.norm2.bias": "model.safetensors", + "vision_tower.blocks.3.norm2.weight": "model.safetensors", + "vision_tower.blocks.4.attn.proj.bias": "model.safetensors", + "vision_tower.blocks.4.attn.proj.weight": "model.safetensors", + "vision_tower.blocks.4.attn.qkv.bias": "model.safetensors", + "vision_tower.blocks.4.attn.qkv.weight": "model.safetensors", + "vision_tower.blocks.4.mlp.linear_fc1.bias": "model.safetensors", + "vision_tower.blocks.4.mlp.linear_fc1.weight": "model.safetensors", + "vision_tower.blocks.4.mlp.linear_fc2.bias": "model.safetensors", + "vision_tower.blocks.4.mlp.linear_fc2.weight": "model.safetensors", + "vision_tower.blocks.4.norm1.bias": "model.safetensors", + "vision_tower.blocks.4.norm1.weight": "model.safetensors", + "vision_tower.blocks.4.norm2.bias": "model.safetensors", + "vision_tower.blocks.4.norm2.weight": "model.safetensors", + "vision_tower.blocks.5.attn.proj.bias": "model.safetensors", + "vision_tower.blocks.5.attn.proj.weight": "model.safetensors", + "vision_tower.blocks.5.attn.qkv.bias": "model.safetensors", + "vision_tower.blocks.5.attn.qkv.weight": "model.safetensors", + "vision_tower.blocks.5.mlp.linear_fc1.bias": "model.safetensors", + "vision_tower.blocks.5.mlp.linear_fc1.weight": "model.safetensors", + "vision_tower.blocks.5.mlp.linear_fc2.bias": "model.safetensors", + "vision_tower.blocks.5.mlp.linear_fc2.weight": "model.safetensors", + "vision_tower.blocks.5.norm1.bias": "model.safetensors", + "vision_tower.blocks.5.norm1.weight": "model.safetensors", + "vision_tower.blocks.5.norm2.bias": "model.safetensors", + "vision_tower.blocks.5.norm2.weight": "model.safetensors", + "vision_tower.blocks.6.attn.proj.bias": "model.safetensors", + "vision_tower.blocks.6.attn.proj.weight": "model.safetensors", + "vision_tower.blocks.6.attn.qkv.bias": "model.safetensors", + "vision_tower.blocks.6.attn.qkv.weight": "model.safetensors", + "vision_tower.blocks.6.mlp.linear_fc1.bias": "model.safetensors", + "vision_tower.blocks.6.mlp.linear_fc1.weight": "model.safetensors", + "vision_tower.blocks.6.mlp.linear_fc2.bias": "model.safetensors", + "vision_tower.blocks.6.mlp.linear_fc2.weight": "model.safetensors", + "vision_tower.blocks.6.norm1.bias": "model.safetensors", + "vision_tower.blocks.6.norm1.weight": "model.safetensors", + "vision_tower.blocks.6.norm2.bias": "model.safetensors", + "vision_tower.blocks.6.norm2.weight": "model.safetensors", + "vision_tower.blocks.7.attn.proj.bias": "model.safetensors", + "vision_tower.blocks.7.attn.proj.weight": "model.safetensors", + "vision_tower.blocks.7.attn.qkv.bias": "model.safetensors", + "vision_tower.blocks.7.attn.qkv.weight": "model.safetensors", + "vision_tower.blocks.7.mlp.linear_fc1.bias": "model.safetensors", + "vision_tower.blocks.7.mlp.linear_fc1.weight": "model.safetensors", + "vision_tower.blocks.7.mlp.linear_fc2.bias": "model.safetensors", + "vision_tower.blocks.7.mlp.linear_fc2.weight": "model.safetensors", + "vision_tower.blocks.7.norm1.bias": "model.safetensors", + "vision_tower.blocks.7.norm1.weight": "model.safetensors", + "vision_tower.blocks.7.norm2.bias": "model.safetensors", + "vision_tower.blocks.7.norm2.weight": "model.safetensors", + "vision_tower.blocks.8.attn.proj.bias": "model.safetensors", + "vision_tower.blocks.8.attn.proj.weight": "model.safetensors", + "vision_tower.blocks.8.attn.qkv.bias": "model.safetensors", + "vision_tower.blocks.8.attn.qkv.weight": "model.safetensors", + "vision_tower.blocks.8.mlp.linear_fc1.bias": "model.safetensors", + "vision_tower.blocks.8.mlp.linear_fc1.weight": "model.safetensors", + "vision_tower.blocks.8.mlp.linear_fc2.bias": "model.safetensors", + "vision_tower.blocks.8.mlp.linear_fc2.weight": "model.safetensors", + "vision_tower.blocks.8.norm1.bias": "model.safetensors", + "vision_tower.blocks.8.norm1.weight": "model.safetensors", + "vision_tower.blocks.8.norm2.bias": "model.safetensors", + "vision_tower.blocks.8.norm2.weight": "model.safetensors", + "vision_tower.blocks.9.attn.proj.bias": "model.safetensors", + "vision_tower.blocks.9.attn.proj.weight": "model.safetensors", + "vision_tower.blocks.9.attn.qkv.bias": "model.safetensors", + "vision_tower.blocks.9.attn.qkv.weight": "model.safetensors", + "vision_tower.blocks.9.mlp.linear_fc1.bias": "model.safetensors", + "vision_tower.blocks.9.mlp.linear_fc1.weight": "model.safetensors", + "vision_tower.blocks.9.mlp.linear_fc2.bias": "model.safetensors", + "vision_tower.blocks.9.mlp.linear_fc2.weight": "model.safetensors", + "vision_tower.blocks.9.norm1.bias": "model.safetensors", + "vision_tower.blocks.9.norm1.weight": "model.safetensors", + "vision_tower.blocks.9.norm2.bias": "model.safetensors", + "vision_tower.blocks.9.norm2.weight": "model.safetensors", + "vision_tower.merger.linear_fc1.bias": "model.safetensors", + "vision_tower.merger.linear_fc1.weight": "model.safetensors", + "vision_tower.merger.linear_fc2.bias": "model.safetensors", + "vision_tower.merger.linear_fc2.weight": "model.safetensors", + "vision_tower.merger.norm.bias": "model.safetensors", + "vision_tower.merger.norm.weight": "model.safetensors", + "vision_tower.patch_embed.proj.bias": "model.safetensors", + "vision_tower.patch_embed.proj.weight": "model.safetensors", + "vision_tower.pos_embed.weight": "model.safetensors" + } +} \ No newline at end of file diff --git a/chat/mlx/mlx-community/Qwen3.5-2B-MLX-4bit/preprocessor_config.json b/chat/mlx/mlx-community/Qwen3.5-2B-MLX-4bit/preprocessor_config.json new file mode 100644 index 0000000..2ea84a4 --- /dev/null +++ b/chat/mlx/mlx-community/Qwen3.5-2B-MLX-4bit/preprocessor_config.json @@ -0,0 +1,21 @@ +{ + "size": { + "longest_edge": 16777216, + "shortest_edge": 65536 + }, + "patch_size": 16, + "temporal_patch_size": 2, + "merge_size": 2, + "image_mean": [ + 0.5, + 0.5, + 0.5 + ], + "image_std": [ + 0.5, + 0.5, + 0.5 + ], + "processor_class": "Qwen3VLProcessor", + "image_processor_type": "Qwen2VLImageProcessorFast" +} \ No newline at end of file diff --git a/chat/mlx/mlx-community/Qwen3.5-2B-MLX-4bit/processor_config.json b/chat/mlx/mlx-community/Qwen3.5-2B-MLX-4bit/processor_config.json new file mode 100644 index 0000000..7ad6acd --- /dev/null +++ b/chat/mlx/mlx-community/Qwen3.5-2B-MLX-4bit/processor_config.json @@ -0,0 +1,63 @@ +{ + "image_processor": { + "data_format": "channels_first", + "do_convert_rgb": true, + "do_normalize": true, + "do_rescale": true, + "do_resize": true, + "image_mean": [ + 0.5, + 0.5, + 0.5 + ], + "image_processor_type": "Qwen2VLImageProcessorFast", + "image_std": [ + 0.5, + 0.5, + 0.5 + ], + "merge_size": 2, + "patch_size": 16, + "resample": 3, + "rescale_factor": 0.00392156862745098, + "size": { + "longest_edge": 16777216, + "shortest_edge": 65536 + }, + "temporal_patch_size": 2 + }, + "processor_class": "Qwen3VLProcessor", + "video_processor": { + "data_format": "channels_first", + "default_to_square": true, + "do_convert_rgb": true, + "do_normalize": true, + "do_rescale": true, + "do_resize": true, + "do_sample_frames": true, + "fps": 2, + "image_mean": [ + 0.5, + 0.5, + 0.5 + ], + "image_std": [ + 0.5, + 0.5, + 0.5 + ], + "max_frames": 768, + "merge_size": 2, + "min_frames": 4, + "patch_size": 16, + "resample": 3, + "rescale_factor": 0.00392156862745098, + "return_metadata": false, + "size": { + "longest_edge": 25165824, + "shortest_edge": 4096 + }, + "temporal_patch_size": 2, + "video_processor_type": "Qwen3VLVideoProcessor" + } +} diff --git a/chat/mlx/mlx-community/Qwen3.5-2B-MLX-4bit/tokenizer.json b/chat/mlx/mlx-community/Qwen3.5-2B-MLX-4bit/tokenizer.json new file mode 100644 index 0000000..67741b0 --- /dev/null +++ b/chat/mlx/mlx-community/Qwen3.5-2B-MLX-4bit/tokenizer.json @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:87a7830d63fcf43bf241c3c5242e96e62dd3fdc29224ca26fed8ea333db72de4 +size 19989343 diff --git a/chat/mlx/mlx-community/Qwen3.5-2B-MLX-4bit/tokenizer_config.json b/chat/mlx/mlx-community/Qwen3.5-2B-MLX-4bit/tokenizer_config.json new file mode 100644 index 0000000..a068e24 --- /dev/null +++ b/chat/mlx/mlx-community/Qwen3.5-2B-MLX-4bit/tokenizer_config.json @@ -0,0 +1,32 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|im_end|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": true, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "processor_class": "Qwen3VLProcessor", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/chat/mlx/mlx-community/Qwen3.5-2B-MLX-4bit/video_preprocessor_config.json b/chat/mlx/mlx-community/Qwen3.5-2B-MLX-4bit/video_preprocessor_config.json new file mode 100644 index 0000000..3ba673a --- /dev/null +++ b/chat/mlx/mlx-community/Qwen3.5-2B-MLX-4bit/video_preprocessor_config.json @@ -0,0 +1,21 @@ +{ + "size": { + "longest_edge": 25165824, + "shortest_edge": 4096 + }, + "patch_size": 16, + "temporal_patch_size": 2, + "merge_size": 2, + "image_mean": [ + 0.5, + 0.5, + 0.5 + ], + "image_std": [ + 0.5, + 0.5, + 0.5 + ], + "processor_class": "Qwen3VLProcessor", + "video_processor_type": "Qwen3VLVideoProcessor" +} \ No newline at end of file diff --git a/chat/mlx/mlx-community/Qwen3.5-2B-MLX-4bit/vocab.json b/chat/mlx/mlx-community/Qwen3.5-2B-MLX-4bit/vocab.json new file mode 100644 index 0000000..d32f7ed --- /dev/null +++ b/chat/mlx/mlx-community/Qwen3.5-2B-MLX-4bit/vocab.json @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:ce99b4cb2983d118806ce0a8b777a35b093e2000a503ebde25853284c9dfa003 +size 6722759 diff --git a/chat/mlx/mlx-community/Qwen3.5-4B-MLX-4bit/.gitattributes b/chat/mlx/mlx-community/Qwen3.5-4B-MLX-4bit/.gitattributes new file mode 100644 index 0000000..52373fe --- /dev/null +++ b/chat/mlx/mlx-community/Qwen3.5-4B-MLX-4bit/.gitattributes @@ -0,0 +1,36 @@ +*.7z filter=lfs diff=lfs merge=lfs -text +*.arrow filter=lfs diff=lfs merge=lfs -text +*.bin filter=lfs diff=lfs merge=lfs -text +*.bz2 filter=lfs diff=lfs merge=lfs -text +*.ckpt filter=lfs diff=lfs merge=lfs -text +*.ftz filter=lfs diff=lfs merge=lfs -text +*.gz filter=lfs diff=lfs merge=lfs -text +*.h5 filter=lfs diff=lfs merge=lfs -text +*.joblib filter=lfs diff=lfs merge=lfs -text +*.lfs.* filter=lfs diff=lfs merge=lfs -text +*.mlmodel filter=lfs diff=lfs merge=lfs -text +*.model filter=lfs diff=lfs merge=lfs -text +*.msgpack filter=lfs diff=lfs merge=lfs -text +*.npy filter=lfs diff=lfs merge=lfs -text +*.npz filter=lfs diff=lfs merge=lfs -text +*.onnx filter=lfs diff=lfs merge=lfs -text +*.ot filter=lfs diff=lfs merge=lfs -text +*.parquet filter=lfs diff=lfs merge=lfs -text +*.pb filter=lfs diff=lfs merge=lfs -text +*.pickle filter=lfs diff=lfs merge=lfs -text +*.pkl filter=lfs diff=lfs merge=lfs -text +*.pt filter=lfs diff=lfs merge=lfs -text +*.pth filter=lfs diff=lfs merge=lfs -text +*.rar filter=lfs diff=lfs merge=lfs -text +*.safetensors filter=lfs diff=lfs merge=lfs -text +saved_model/**/* filter=lfs diff=lfs merge=lfs -text +*.tar.* filter=lfs diff=lfs merge=lfs -text +*.tar filter=lfs diff=lfs merge=lfs -text +*.tflite filter=lfs diff=lfs merge=lfs -text +*.tgz filter=lfs diff=lfs merge=lfs -text +*.wasm filter=lfs diff=lfs merge=lfs -text +*.xz filter=lfs diff=lfs merge=lfs -text +*.zip filter=lfs diff=lfs merge=lfs -text +*.zst filter=lfs diff=lfs merge=lfs -text +*tfevents* filter=lfs diff=lfs merge=lfs -text +tokenizer.json filter=lfs diff=lfs merge=lfs -text diff --git a/chat/mlx/mlx-community/Qwen3.5-4B-MLX-4bit/README.md b/chat/mlx/mlx-community/Qwen3.5-4B-MLX-4bit/README.md new file mode 100644 index 0000000..5d96bdf --- /dev/null +++ b/chat/mlx/mlx-community/Qwen3.5-4B-MLX-4bit/README.md @@ -0,0 +1,75 @@ +--- +base_model: Qwen/Qwen3.5-4B +library_name: mlx +tags: + - mlx + - qwen3.5 + - vision-language-model + - quantized + - 4bit +license: apache-2.0 +--- + +# Qwen3.5-4B-MLX-4bit + +This is a 4-bit quantized MLX version of [Qwen/Qwen3.5-4B](https://huggingface.co/Qwen/Qwen3.5-4B) for Apple Silicon. + +## Model Details + +- **Original Model:** [Qwen/Qwen3.5-4B](https://huggingface.co/Qwen/Qwen3.5-4B) +- **Quantization:** 4-bit (5.347 bits per weight) +- **Group Size:** 64 +- **Format:** MLX SafeTensors +- **Framework:** [mlx-vlm](https://github.com/Blaizzy/mlx-vlm) +- **Disk Size:** ~2.9G + +## Conversion Details + +This model was converted using `mlx-vlm` from the [`pc/fix-qwen35-predicate`](https://github.com/Blaizzy/mlx-vlm/tree/pc/fix-qwen35-predicate) branch, which includes fixes for Qwen3.5 model support (proper handling of MoE gate layers, `shared_expert_gate`, and `A_log` casting). + +**Conversion command:** +```bash +python3 -m mlx_vlm convert \ + --hf-path "Qwen/Qwen3.5-4B" \ + --mlx-path "./Qwen3.5-4B-MLX-4bit" \ + -q --q-bits 4 --q-group-size 64 +``` + +## Important Note + +A better, more optimized conversion may be available from **@Prince** ([@Blaizzy](https://huggingface.co/Blaizzy)) in the MLX VLM community. Check the [mlx-community](https://huggingface.co/mlx-community) organization for updated versions as official Qwen3.5 support is merged into the main `mlx-vlm` branch. + +## Related Models + +- **bf16 (full precision):** [mlx-community/Qwen3.5-4B-MLX-bf16](https://huggingface.co/mlx-community/Qwen3.5-4B-MLX-bf16) +- **8-bit quantized:** [mlx-community/Qwen3.5-4B-MLX-8bit](https://huggingface.co/mlx-community/Qwen3.5-4B-MLX-8bit) +- **Original:** [Qwen/Qwen3.5-4B](https://huggingface.co/Qwen/Qwen3.5-4B) + +## Usage + +```python +from mlx_vlm import load, generate + +model, processor = load("mlx-community/Qwen3.5-4B-MLX-4bit") + +output = generate( + model, + processor, + prompt="Describe this image.", + image="path/to/image.jpg", + max_tokens=512 +) +print(output) +``` + +**CLI:** +```bash +python3 -m mlx_vlm.generate \ + --model mlx-community/Qwen3.5-4B-MLX-4bit \ + --image path/to/image.jpg \ + --prompt "Describe this image." +``` + +## License + +This model inherits the [Apache 2.0 license](https://huggingface.co/Qwen/Qwen3.5-4B) from the original Qwen model. diff --git a/chat/mlx/mlx-community/Qwen3.5-4B-MLX-4bit/chat_template.jinja b/chat/mlx/mlx-community/Qwen3.5-4B-MLX-4bit/chat_template.jinja new file mode 100644 index 0000000..a585dec --- /dev/null +++ b/chat/mlx/mlx-community/Qwen3.5-4B-MLX-4bit/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/chat/mlx/mlx-community/Qwen3.5-4B-MLX-4bit/config.json b/chat/mlx/mlx-community/Qwen3.5-4B-MLX-4bit/config.json new file mode 100644 index 0000000..cb3e1a8 --- /dev/null +++ b/chat/mlx/mlx-community/Qwen3.5-4B-MLX-4bit/config.json @@ -0,0 +1,114 @@ +{ + "architectures": [ + "Qwen3_5ForConditionalGeneration" + ], + "image_token_id": 248056, + "model_type": "qwen3_5", + "quantization": { + "group_size": 64, + "bits": 4, + "mode": "affine" + }, + "quantization_config": { + "group_size": 64, + "bits": 4, + "mode": "affine" + }, + "text_config": { + "attention_bias": false, + "attention_dropout": 0.0, + "attn_output_gate": true, + "dtype": "bfloat16", + "eos_token_id": 248044, + "full_attention_interval": 4, + "head_dim": 256, + "hidden_act": "silu", + "hidden_size": 2560, + "initializer_range": 0.02, + "intermediate_size": 9216, + "layer_types": [ + "linear_attention", + "linear_attention", + "linear_attention", + "full_attention", + "linear_attention", + "linear_attention", + "linear_attention", + "full_attention", + "linear_attention", + "linear_attention", + "linear_attention", + "full_attention", + "linear_attention", + "linear_attention", + "linear_attention", + "full_attention", + "linear_attention", + "linear_attention", + "linear_attention", + "full_attention", + "linear_attention", + "linear_attention", + "linear_attention", + "full_attention", + "linear_attention", + "linear_attention", + "linear_attention", + "full_attention", + "linear_attention", + "linear_attention", + "linear_attention", + "full_attention" + ], + "linear_conv_kernel_dim": 4, + "linear_key_head_dim": 128, + "linear_num_key_heads": 16, + "linear_num_value_heads": 32, + "linear_value_head_dim": 128, + "max_position_embeddings": 262144, + "mlp_only_layers": [], + "model_type": "qwen3_5_text", + "mtp_num_hidden_layers": 1, + "mtp_use_dedicated_embeddings": false, + "num_attention_heads": 16, + "num_hidden_layers": 32, + "num_key_value_heads": 4, + "rms_norm_eps": 1e-06, + "tie_word_embeddings": true, + "use_cache": true, + "vocab_size": 248320, + "mamba_ssm_dtype": "float32", + "rope_parameters": { + "mrope_interleaved": true, + "mrope_section": [ + 11, + 11, + 10 + ], + "rope_type": "default", + "rope_theta": 10000000, + "partial_rotary_factor": 0.25 + } + }, + "tie_word_embeddings": true, + "transformers_version": "4.57.0.dev0", + "video_token_id": 248057, + "vision_config": { + "deepstack_visual_indexes": [], + "depth": 24, + "hidden_act": "gelu_pytorch_tanh", + "hidden_size": 1024, + "in_channels": 3, + "initializer_range": 0.02, + "intermediate_size": 4096, + "model_type": "qwen3_5", + "num_heads": 16, + "num_position_embeddings": 2304, + "out_hidden_size": 2560, + "patch_size": 16, + "spatial_merge_size": 2, + "temporal_patch_size": 2 + }, + "vision_end_token_id": 248054, + "vision_start_token_id": 248053 +} \ No newline at end of file diff --git a/chat/mlx/mlx-community/Qwen3.5-4B-MLX-4bit/model.safetensors b/chat/mlx/mlx-community/Qwen3.5-4B-MLX-4bit/model.safetensors new file mode 100644 index 0000000..7af3bae --- /dev/null +++ b/chat/mlx/mlx-community/Qwen3.5-4B-MLX-4bit/model.safetensors @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:5fb9acd0246866381cf8c5c354c6db1019f6498eec4ccb4f5edcc71ffeacb2db +size 3034300695 diff --git a/chat/mlx/mlx-community/Qwen3.5-4B-MLX-4bit/model.safetensors.index.json b/chat/mlx/mlx-community/Qwen3.5-4B-MLX-4bit/model.safetensors.index.json new file mode 100644 index 0000000..40196ba --- /dev/null +++ b/chat/mlx/mlx-community/Qwen3.5-4B-MLX-4bit/model.safetensors.index.json @@ -0,0 +1,1228 @@ +{ + "metadata": { + "total_size": 3034147328 + }, + "weight_map": { + "language_model.model.embed_tokens.biases": "model.safetensors", + "language_model.model.embed_tokens.scales": "model.safetensors", + "language_model.model.embed_tokens.weight": "model.safetensors", + "language_model.model.layers.0.input_layernorm.weight": "model.safetensors", + "language_model.model.layers.0.linear_attn.A_log": "model.safetensors", + "language_model.model.layers.0.linear_attn.conv1d.weight": "model.safetensors", + "language_model.model.layers.0.linear_attn.dt_bias": "model.safetensors", + "language_model.model.layers.0.linear_attn.in_proj_a.biases": "model.safetensors", + "language_model.model.layers.0.linear_attn.in_proj_a.scales": "model.safetensors", + "language_model.model.layers.0.linear_attn.in_proj_a.weight": "model.safetensors", + "language_model.model.layers.0.linear_attn.in_proj_b.biases": "model.safetensors", + "language_model.model.layers.0.linear_attn.in_proj_b.scales": "model.safetensors", + "language_model.model.layers.0.linear_attn.in_proj_b.weight": "model.safetensors", + "language_model.model.layers.0.linear_attn.in_proj_qkv.biases": "model.safetensors", + "language_model.model.layers.0.linear_attn.in_proj_qkv.scales": "model.safetensors", + "language_model.model.layers.0.linear_attn.in_proj_qkv.weight": "model.safetensors", + "language_model.model.layers.0.linear_attn.in_proj_z.biases": "model.safetensors", + "language_model.model.layers.0.linear_attn.in_proj_z.scales": "model.safetensors", + "language_model.model.layers.0.linear_attn.in_proj_z.weight": "model.safetensors", + "language_model.model.layers.0.linear_attn.norm.weight": "model.safetensors", + "language_model.model.layers.0.linear_attn.out_proj.biases": "model.safetensors", + "language_model.model.layers.0.linear_attn.out_proj.scales": "model.safetensors", + "language_model.model.layers.0.linear_attn.out_proj.weight": "model.safetensors", + "language_model.model.layers.0.mlp.down_proj.biases": "model.safetensors", + "language_model.model.layers.0.mlp.down_proj.scales": "model.safetensors", + "language_model.model.layers.0.mlp.down_proj.weight": "model.safetensors", + "language_model.model.layers.0.mlp.gate_proj.biases": "model.safetensors", + "language_model.model.layers.0.mlp.gate_proj.scales": "model.safetensors", + "language_model.model.layers.0.mlp.gate_proj.weight": "model.safetensors", + "language_model.model.layers.0.mlp.up_proj.biases": "model.safetensors", + "language_model.model.layers.0.mlp.up_proj.scales": "model.safetensors", + "language_model.model.layers.0.mlp.up_proj.weight": "model.safetensors", + "language_model.model.layers.0.post_attention_layernorm.weight": "model.safetensors", + "language_model.model.layers.1.input_layernorm.weight": "model.safetensors", + "language_model.model.layers.1.linear_attn.A_log": "model.safetensors", + "language_model.model.layers.1.linear_attn.conv1d.weight": "model.safetensors", + "language_model.model.layers.1.linear_attn.dt_bias": "model.safetensors", + "language_model.model.layers.1.linear_attn.in_proj_a.biases": "model.safetensors", + "language_model.model.layers.1.linear_attn.in_proj_a.scales": "model.safetensors", + "language_model.model.layers.1.linear_attn.in_proj_a.weight": "model.safetensors", + "language_model.model.layers.1.linear_attn.in_proj_b.biases": "model.safetensors", + "language_model.model.layers.1.linear_attn.in_proj_b.scales": "model.safetensors", + "language_model.model.layers.1.linear_attn.in_proj_b.weight": "model.safetensors", + "language_model.model.layers.1.linear_attn.in_proj_qkv.biases": "model.safetensors", + "language_model.model.layers.1.linear_attn.in_proj_qkv.scales": "model.safetensors", + "language_model.model.layers.1.linear_attn.in_proj_qkv.weight": "model.safetensors", + "language_model.model.layers.1.linear_attn.in_proj_z.biases": "model.safetensors", + "language_model.model.layers.1.linear_attn.in_proj_z.scales": "model.safetensors", + "language_model.model.layers.1.linear_attn.in_proj_z.weight": "model.safetensors", + "language_model.model.layers.1.linear_attn.norm.weight": "model.safetensors", + "language_model.model.layers.1.linear_attn.out_proj.biases": "model.safetensors", + "language_model.model.layers.1.linear_attn.out_proj.scales": "model.safetensors", + "language_model.model.layers.1.linear_attn.out_proj.weight": "model.safetensors", + "language_model.model.layers.1.mlp.down_proj.biases": "model.safetensors", + "language_model.model.layers.1.mlp.down_proj.scales": "model.safetensors", + "language_model.model.layers.1.mlp.down_proj.weight": "model.safetensors", + "language_model.model.layers.1.mlp.gate_proj.biases": "model.safetensors", + "language_model.model.layers.1.mlp.gate_proj.scales": "model.safetensors", + "language_model.model.layers.1.mlp.gate_proj.weight": "model.safetensors", + "language_model.model.layers.1.mlp.up_proj.biases": "model.safetensors", + "language_model.model.layers.1.mlp.up_proj.scales": "model.safetensors", + "language_model.model.layers.1.mlp.up_proj.weight": "model.safetensors", + "language_model.model.layers.1.post_attention_layernorm.weight": "model.safetensors", + "language_model.model.layers.10.input_layernorm.weight": "model.safetensors", + "language_model.model.layers.10.linear_attn.A_log": "model.safetensors", + "language_model.model.layers.10.linear_attn.conv1d.weight": "model.safetensors", + "language_model.model.layers.10.linear_attn.dt_bias": "model.safetensors", + "language_model.model.layers.10.linear_attn.in_proj_a.biases": "model.safetensors", + "language_model.model.layers.10.linear_attn.in_proj_a.scales": "model.safetensors", + "language_model.model.layers.10.linear_attn.in_proj_a.weight": "model.safetensors", + "language_model.model.layers.10.linear_attn.in_proj_b.biases": "model.safetensors", + "language_model.model.layers.10.linear_attn.in_proj_b.scales": "model.safetensors", + "language_model.model.layers.10.linear_attn.in_proj_b.weight": "model.safetensors", + "language_model.model.layers.10.linear_attn.in_proj_qkv.biases": "model.safetensors", + "language_model.model.layers.10.linear_attn.in_proj_qkv.scales": "model.safetensors", + "language_model.model.layers.10.linear_attn.in_proj_qkv.weight": "model.safetensors", + "language_model.model.layers.10.linear_attn.in_proj_z.biases": "model.safetensors", + "language_model.model.layers.10.linear_attn.in_proj_z.scales": "model.safetensors", + "language_model.model.layers.10.linear_attn.in_proj_z.weight": "model.safetensors", + "language_model.model.layers.10.linear_attn.norm.weight": "model.safetensors", + "language_model.model.layers.10.linear_attn.out_proj.biases": "model.safetensors", + "language_model.model.layers.10.linear_attn.out_proj.scales": "model.safetensors", + "language_model.model.layers.10.linear_attn.out_proj.weight": "model.safetensors", + "language_model.model.layers.10.mlp.down_proj.biases": "model.safetensors", + "language_model.model.layers.10.mlp.down_proj.scales": "model.safetensors", + "language_model.model.layers.10.mlp.down_proj.weight": "model.safetensors", + "language_model.model.layers.10.mlp.gate_proj.biases": "model.safetensors", + "language_model.model.layers.10.mlp.gate_proj.scales": "model.safetensors", + "language_model.model.layers.10.mlp.gate_proj.weight": "model.safetensors", + "language_model.model.layers.10.mlp.up_proj.biases": "model.safetensors", + "language_model.model.layers.10.mlp.up_proj.scales": "model.safetensors", + "language_model.model.layers.10.mlp.up_proj.weight": "model.safetensors", + "language_model.model.layers.10.post_attention_layernorm.weight": "model.safetensors", + "language_model.model.layers.11.input_layernorm.weight": "model.safetensors", + "language_model.model.layers.11.mlp.down_proj.biases": "model.safetensors", + "language_model.model.layers.11.mlp.down_proj.scales": "model.safetensors", + "language_model.model.layers.11.mlp.down_proj.weight": "model.safetensors", + "language_model.model.layers.11.mlp.gate_proj.biases": "model.safetensors", + "language_model.model.layers.11.mlp.gate_proj.scales": "model.safetensors", + "language_model.model.layers.11.mlp.gate_proj.weight": "model.safetensors", + "language_model.model.layers.11.mlp.up_proj.biases": "model.safetensors", + "language_model.model.layers.11.mlp.up_proj.scales": "model.safetensors", + "language_model.model.layers.11.mlp.up_proj.weight": "model.safetensors", + "language_model.model.layers.11.post_attention_layernorm.weight": "model.safetensors", + "language_model.model.layers.11.self_attn.k_norm.weight": "model.safetensors", + "language_model.model.layers.11.self_attn.k_proj.biases": "model.safetensors", + "language_model.model.layers.11.self_attn.k_proj.scales": "model.safetensors", + "language_model.model.layers.11.self_attn.k_proj.weight": "model.safetensors", + "language_model.model.layers.11.self_attn.o_proj.biases": "model.safetensors", + "language_model.model.layers.11.self_attn.o_proj.scales": "model.safetensors", + "language_model.model.layers.11.self_attn.o_proj.weight": "model.safetensors", + "language_model.model.layers.11.self_attn.q_norm.weight": "model.safetensors", + "language_model.model.layers.11.self_attn.q_proj.biases": "model.safetensors", + "language_model.model.layers.11.self_attn.q_proj.scales": "model.safetensors", + "language_model.model.layers.11.self_attn.q_proj.weight": "model.safetensors", + "language_model.model.layers.11.self_attn.v_proj.biases": "model.safetensors", + "language_model.model.layers.11.self_attn.v_proj.scales": "model.safetensors", + "language_model.model.layers.11.self_attn.v_proj.weight": "model.safetensors", + "language_model.model.layers.12.input_layernorm.weight": "model.safetensors", + "language_model.model.layers.12.linear_attn.A_log": "model.safetensors", + "language_model.model.layers.12.linear_attn.conv1d.weight": "model.safetensors", + "language_model.model.layers.12.linear_attn.dt_bias": "model.safetensors", + "language_model.model.layers.12.linear_attn.in_proj_a.biases": "model.safetensors", + "language_model.model.layers.12.linear_attn.in_proj_a.scales": "model.safetensors", + "language_model.model.layers.12.linear_attn.in_proj_a.weight": "model.safetensors", + "language_model.model.layers.12.linear_attn.in_proj_b.biases": "model.safetensors", + "language_model.model.layers.12.linear_attn.in_proj_b.scales": "model.safetensors", + "language_model.model.layers.12.linear_attn.in_proj_b.weight": "model.safetensors", + "language_model.model.layers.12.linear_attn.in_proj_qkv.biases": "model.safetensors", + "language_model.model.layers.12.linear_attn.in_proj_qkv.scales": "model.safetensors", + "language_model.model.layers.12.linear_attn.in_proj_qkv.weight": "model.safetensors", + "language_model.model.layers.12.linear_attn.in_proj_z.biases": "model.safetensors", + "language_model.model.layers.12.linear_attn.in_proj_z.scales": "model.safetensors", + "language_model.model.layers.12.linear_attn.in_proj_z.weight": "model.safetensors", + "language_model.model.layers.12.linear_attn.norm.weight": "model.safetensors", + "language_model.model.layers.12.linear_attn.out_proj.biases": "model.safetensors", + "language_model.model.layers.12.linear_attn.out_proj.scales": "model.safetensors", + "language_model.model.layers.12.linear_attn.out_proj.weight": "model.safetensors", + "language_model.model.layers.12.mlp.down_proj.biases": "model.safetensors", + "language_model.model.layers.12.mlp.down_proj.scales": "model.safetensors", + "language_model.model.layers.12.mlp.down_proj.weight": "model.safetensors", + "language_model.model.layers.12.mlp.gate_proj.biases": "model.safetensors", + "language_model.model.layers.12.mlp.gate_proj.scales": "model.safetensors", + "language_model.model.layers.12.mlp.gate_proj.weight": "model.safetensors", + "language_model.model.layers.12.mlp.up_proj.biases": "model.safetensors", + "language_model.model.layers.12.mlp.up_proj.scales": "model.safetensors", + "language_model.model.layers.12.mlp.up_proj.weight": "model.safetensors", + "language_model.model.layers.12.post_attention_layernorm.weight": "model.safetensors", + "language_model.model.layers.13.input_layernorm.weight": "model.safetensors", + "language_model.model.layers.13.linear_attn.A_log": "model.safetensors", + "language_model.model.layers.13.linear_attn.conv1d.weight": "model.safetensors", + "language_model.model.layers.13.linear_attn.dt_bias": "model.safetensors", + "language_model.model.layers.13.linear_attn.in_proj_a.biases": "model.safetensors", + "language_model.model.layers.13.linear_attn.in_proj_a.scales": "model.safetensors", + "language_model.model.layers.13.linear_attn.in_proj_a.weight": "model.safetensors", + "language_model.model.layers.13.linear_attn.in_proj_b.biases": "model.safetensors", + "language_model.model.layers.13.linear_attn.in_proj_b.scales": "model.safetensors", + "language_model.model.layers.13.linear_attn.in_proj_b.weight": "model.safetensors", + "language_model.model.layers.13.linear_attn.in_proj_qkv.biases": "model.safetensors", + "language_model.model.layers.13.linear_attn.in_proj_qkv.scales": "model.safetensors", + "language_model.model.layers.13.linear_attn.in_proj_qkv.weight": "model.safetensors", + "language_model.model.layers.13.linear_attn.in_proj_z.biases": "model.safetensors", + "language_model.model.layers.13.linear_attn.in_proj_z.scales": "model.safetensors", + "language_model.model.layers.13.linear_attn.in_proj_z.weight": "model.safetensors", + "language_model.model.layers.13.linear_attn.norm.weight": "model.safetensors", + "language_model.model.layers.13.linear_attn.out_proj.biases": "model.safetensors", + "language_model.model.layers.13.linear_attn.out_proj.scales": "model.safetensors", + "language_model.model.layers.13.linear_attn.out_proj.weight": "model.safetensors", + "language_model.model.layers.13.mlp.down_proj.biases": "model.safetensors", + "language_model.model.layers.13.mlp.down_proj.scales": "model.safetensors", + "language_model.model.layers.13.mlp.down_proj.weight": "model.safetensors", + "language_model.model.layers.13.mlp.gate_proj.biases": "model.safetensors", + "language_model.model.layers.13.mlp.gate_proj.scales": "model.safetensors", + "language_model.model.layers.13.mlp.gate_proj.weight": "model.safetensors", + "language_model.model.layers.13.mlp.up_proj.biases": "model.safetensors", + "language_model.model.layers.13.mlp.up_proj.scales": "model.safetensors", + "language_model.model.layers.13.mlp.up_proj.weight": "model.safetensors", + "language_model.model.layers.13.post_attention_layernorm.weight": "model.safetensors", + "language_model.model.layers.14.input_layernorm.weight": "model.safetensors", + "language_model.model.layers.14.linear_attn.A_log": "model.safetensors", + "language_model.model.layers.14.linear_attn.conv1d.weight": "model.safetensors", + "language_model.model.layers.14.linear_attn.dt_bias": "model.safetensors", + "language_model.model.layers.14.linear_attn.in_proj_a.biases": "model.safetensors", + "language_model.model.layers.14.linear_attn.in_proj_a.scales": "model.safetensors", + "language_model.model.layers.14.linear_attn.in_proj_a.weight": "model.safetensors", + "language_model.model.layers.14.linear_attn.in_proj_b.biases": "model.safetensors", + "language_model.model.layers.14.linear_attn.in_proj_b.scales": "model.safetensors", + "language_model.model.layers.14.linear_attn.in_proj_b.weight": "model.safetensors", + "language_model.model.layers.14.linear_attn.in_proj_qkv.biases": "model.safetensors", + "language_model.model.layers.14.linear_attn.in_proj_qkv.scales": "model.safetensors", + "language_model.model.layers.14.linear_attn.in_proj_qkv.weight": "model.safetensors", + "language_model.model.layers.14.linear_attn.in_proj_z.biases": "model.safetensors", + "language_model.model.layers.14.linear_attn.in_proj_z.scales": "model.safetensors", + "language_model.model.layers.14.linear_attn.in_proj_z.weight": "model.safetensors", + "language_model.model.layers.14.linear_attn.norm.weight": "model.safetensors", + "language_model.model.layers.14.linear_attn.out_proj.biases": "model.safetensors", + "language_model.model.layers.14.linear_attn.out_proj.scales": "model.safetensors", + "language_model.model.layers.14.linear_attn.out_proj.weight": "model.safetensors", + "language_model.model.layers.14.mlp.down_proj.biases": "model.safetensors", + "language_model.model.layers.14.mlp.down_proj.scales": "model.safetensors", + "language_model.model.layers.14.mlp.down_proj.weight": "model.safetensors", + "language_model.model.layers.14.mlp.gate_proj.biases": "model.safetensors", + "language_model.model.layers.14.mlp.gate_proj.scales": "model.safetensors", + "language_model.model.layers.14.mlp.gate_proj.weight": "model.safetensors", + "language_model.model.layers.14.mlp.up_proj.biases": "model.safetensors", + "language_model.model.layers.14.mlp.up_proj.scales": "model.safetensors", + "language_model.model.layers.14.mlp.up_proj.weight": "model.safetensors", + "language_model.model.layers.14.post_attention_layernorm.weight": "model.safetensors", + "language_model.model.layers.15.input_layernorm.weight": "model.safetensors", + "language_model.model.layers.15.mlp.down_proj.biases": "model.safetensors", + "language_model.model.layers.15.mlp.down_proj.scales": "model.safetensors", + "language_model.model.layers.15.mlp.down_proj.weight": "model.safetensors", + "language_model.model.layers.15.mlp.gate_proj.biases": "model.safetensors", + "language_model.model.layers.15.mlp.gate_proj.scales": "model.safetensors", + "language_model.model.layers.15.mlp.gate_proj.weight": "model.safetensors", + "language_model.model.layers.15.mlp.up_proj.biases": "model.safetensors", + "language_model.model.layers.15.mlp.up_proj.scales": "model.safetensors", + "language_model.model.layers.15.mlp.up_proj.weight": "model.safetensors", + "language_model.model.layers.15.post_attention_layernorm.weight": "model.safetensors", + "language_model.model.layers.15.self_attn.k_norm.weight": "model.safetensors", + "language_model.model.layers.15.self_attn.k_proj.biases": "model.safetensors", + "language_model.model.layers.15.self_attn.k_proj.scales": "model.safetensors", + "language_model.model.layers.15.self_attn.k_proj.weight": "model.safetensors", + "language_model.model.layers.15.self_attn.o_proj.biases": "model.safetensors", + "language_model.model.layers.15.self_attn.o_proj.scales": "model.safetensors", + "language_model.model.layers.15.self_attn.o_proj.weight": "model.safetensors", + "language_model.model.layers.15.self_attn.q_norm.weight": "model.safetensors", + "language_model.model.layers.15.self_attn.q_proj.biases": "model.safetensors", + "language_model.model.layers.15.self_attn.q_proj.scales": "model.safetensors", + "language_model.model.layers.15.self_attn.q_proj.weight": "model.safetensors", + "language_model.model.layers.15.self_attn.v_proj.biases": "model.safetensors", + "language_model.model.layers.15.self_attn.v_proj.scales": "model.safetensors", + "language_model.model.layers.15.self_attn.v_proj.weight": "model.safetensors", + "language_model.model.layers.16.input_layernorm.weight": "model.safetensors", + "language_model.model.layers.16.linear_attn.A_log": "model.safetensors", + "language_model.model.layers.16.linear_attn.conv1d.weight": "model.safetensors", + "language_model.model.layers.16.linear_attn.dt_bias": "model.safetensors", + "language_model.model.layers.16.linear_attn.in_proj_a.biases": "model.safetensors", + "language_model.model.layers.16.linear_attn.in_proj_a.scales": "model.safetensors", + "language_model.model.layers.16.linear_attn.in_proj_a.weight": "model.safetensors", + "language_model.model.layers.16.linear_attn.in_proj_b.biases": "model.safetensors", + "language_model.model.layers.16.linear_attn.in_proj_b.scales": "model.safetensors", + "language_model.model.layers.16.linear_attn.in_proj_b.weight": "model.safetensors", + "language_model.model.layers.16.linear_attn.in_proj_qkv.biases": "model.safetensors", + "language_model.model.layers.16.linear_attn.in_proj_qkv.scales": "model.safetensors", + "language_model.model.layers.16.linear_attn.in_proj_qkv.weight": "model.safetensors", + "language_model.model.layers.16.linear_attn.in_proj_z.biases": "model.safetensors", + "language_model.model.layers.16.linear_attn.in_proj_z.scales": "model.safetensors", + "language_model.model.layers.16.linear_attn.in_proj_z.weight": "model.safetensors", + "language_model.model.layers.16.linear_attn.norm.weight": "model.safetensors", + "language_model.model.layers.16.linear_attn.out_proj.biases": "model.safetensors", + "language_model.model.layers.16.linear_attn.out_proj.scales": "model.safetensors", + "language_model.model.layers.16.linear_attn.out_proj.weight": "model.safetensors", + "language_model.model.layers.16.mlp.down_proj.biases": "model.safetensors", + "language_model.model.layers.16.mlp.down_proj.scales": "model.safetensors", + "language_model.model.layers.16.mlp.down_proj.weight": "model.safetensors", + "language_model.model.layers.16.mlp.gate_proj.biases": "model.safetensors", + "language_model.model.layers.16.mlp.gate_proj.scales": "model.safetensors", + "language_model.model.layers.16.mlp.gate_proj.weight": "model.safetensors", + "language_model.model.layers.16.mlp.up_proj.biases": "model.safetensors", + "language_model.model.layers.16.mlp.up_proj.scales": "model.safetensors", + "language_model.model.layers.16.mlp.up_proj.weight": "model.safetensors", + "language_model.model.layers.16.post_attention_layernorm.weight": "model.safetensors", + "language_model.model.layers.17.input_layernorm.weight": "model.safetensors", + "language_model.model.layers.17.linear_attn.A_log": "model.safetensors", + "language_model.model.layers.17.linear_attn.conv1d.weight": "model.safetensors", + "language_model.model.layers.17.linear_attn.dt_bias": "model.safetensors", + "language_model.model.layers.17.linear_attn.in_proj_a.biases": "model.safetensors", + "language_model.model.layers.17.linear_attn.in_proj_a.scales": "model.safetensors", + "language_model.model.layers.17.linear_attn.in_proj_a.weight": "model.safetensors", + "language_model.model.layers.17.linear_attn.in_proj_b.biases": "model.safetensors", + "language_model.model.layers.17.linear_attn.in_proj_b.scales": "model.safetensors", + "language_model.model.layers.17.linear_attn.in_proj_b.weight": "model.safetensors", + "language_model.model.layers.17.linear_attn.in_proj_qkv.biases": "model.safetensors", + "language_model.model.layers.17.linear_attn.in_proj_qkv.scales": "model.safetensors", + "language_model.model.layers.17.linear_attn.in_proj_qkv.weight": "model.safetensors", + "language_model.model.layers.17.linear_attn.in_proj_z.biases": "model.safetensors", + "language_model.model.layers.17.linear_attn.in_proj_z.scales": "model.safetensors", + "language_model.model.layers.17.linear_attn.in_proj_z.weight": "model.safetensors", + "language_model.model.layers.17.linear_attn.norm.weight": "model.safetensors", + "language_model.model.layers.17.linear_attn.out_proj.biases": "model.safetensors", + "language_model.model.layers.17.linear_attn.out_proj.scales": "model.safetensors", + "language_model.model.layers.17.linear_attn.out_proj.weight": "model.safetensors", + "language_model.model.layers.17.mlp.down_proj.biases": "model.safetensors", + "language_model.model.layers.17.mlp.down_proj.scales": "model.safetensors", + "language_model.model.layers.17.mlp.down_proj.weight": "model.safetensors", + "language_model.model.layers.17.mlp.gate_proj.biases": "model.safetensors", + "language_model.model.layers.17.mlp.gate_proj.scales": "model.safetensors", + "language_model.model.layers.17.mlp.gate_proj.weight": "model.safetensors", + "language_model.model.layers.17.mlp.up_proj.biases": "model.safetensors", + "language_model.model.layers.17.mlp.up_proj.scales": "model.safetensors", + "language_model.model.layers.17.mlp.up_proj.weight": "model.safetensors", + "language_model.model.layers.17.post_attention_layernorm.weight": "model.safetensors", + "language_model.model.layers.18.input_layernorm.weight": "model.safetensors", + "language_model.model.layers.18.linear_attn.A_log": "model.safetensors", + "language_model.model.layers.18.linear_attn.conv1d.weight": "model.safetensors", + "language_model.model.layers.18.linear_attn.dt_bias": "model.safetensors", + "language_model.model.layers.18.linear_attn.in_proj_a.biases": "model.safetensors", + "language_model.model.layers.18.linear_attn.in_proj_a.scales": "model.safetensors", + "language_model.model.layers.18.linear_attn.in_proj_a.weight": "model.safetensors", + "language_model.model.layers.18.linear_attn.in_proj_b.biases": "model.safetensors", + "language_model.model.layers.18.linear_attn.in_proj_b.scales": "model.safetensors", + "language_model.model.layers.18.linear_attn.in_proj_b.weight": "model.safetensors", + "language_model.model.layers.18.linear_attn.in_proj_qkv.biases": "model.safetensors", + "language_model.model.layers.18.linear_attn.in_proj_qkv.scales": "model.safetensors", + "language_model.model.layers.18.linear_attn.in_proj_qkv.weight": "model.safetensors", + "language_model.model.layers.18.linear_attn.in_proj_z.biases": "model.safetensors", + "language_model.model.layers.18.linear_attn.in_proj_z.scales": "model.safetensors", + "language_model.model.layers.18.linear_attn.in_proj_z.weight": "model.safetensors", + "language_model.model.layers.18.linear_attn.norm.weight": "model.safetensors", + "language_model.model.layers.18.linear_attn.out_proj.biases": "model.safetensors", + "language_model.model.layers.18.linear_attn.out_proj.scales": "model.safetensors", + "language_model.model.layers.18.linear_attn.out_proj.weight": "model.safetensors", + "language_model.model.layers.18.mlp.down_proj.biases": "model.safetensors", + "language_model.model.layers.18.mlp.down_proj.scales": "model.safetensors", + "language_model.model.layers.18.mlp.down_proj.weight": "model.safetensors", + "language_model.model.layers.18.mlp.gate_proj.biases": "model.safetensors", + "language_model.model.layers.18.mlp.gate_proj.scales": "model.safetensors", + "language_model.model.layers.18.mlp.gate_proj.weight": "model.safetensors", + "language_model.model.layers.18.mlp.up_proj.biases": "model.safetensors", + "language_model.model.layers.18.mlp.up_proj.scales": "model.safetensors", + "language_model.model.layers.18.mlp.up_proj.weight": "model.safetensors", + "language_model.model.layers.18.post_attention_layernorm.weight": "model.safetensors", + "language_model.model.layers.19.input_layernorm.weight": "model.safetensors", + "language_model.model.layers.19.mlp.down_proj.biases": "model.safetensors", + "language_model.model.layers.19.mlp.down_proj.scales": "model.safetensors", + "language_model.model.layers.19.mlp.down_proj.weight": "model.safetensors", + "language_model.model.layers.19.mlp.gate_proj.biases": "model.safetensors", + "language_model.model.layers.19.mlp.gate_proj.scales": "model.safetensors", + "language_model.model.layers.19.mlp.gate_proj.weight": "model.safetensors", + "language_model.model.layers.19.mlp.up_proj.biases": "model.safetensors", + "language_model.model.layers.19.mlp.up_proj.scales": "model.safetensors", + "language_model.model.layers.19.mlp.up_proj.weight": "model.safetensors", + "language_model.model.layers.19.post_attention_layernorm.weight": "model.safetensors", + "language_model.model.layers.19.self_attn.k_norm.weight": "model.safetensors", + "language_model.model.layers.19.self_attn.k_proj.biases": "model.safetensors", + "language_model.model.layers.19.self_attn.k_proj.scales": "model.safetensors", + "language_model.model.layers.19.self_attn.k_proj.weight": "model.safetensors", + "language_model.model.layers.19.self_attn.o_proj.biases": "model.safetensors", + "language_model.model.layers.19.self_attn.o_proj.scales": "model.safetensors", + "language_model.model.layers.19.self_attn.o_proj.weight": "model.safetensors", + "language_model.model.layers.19.self_attn.q_norm.weight": "model.safetensors", + "language_model.model.layers.19.self_attn.q_proj.biases": "model.safetensors", + "language_model.model.layers.19.self_attn.q_proj.scales": "model.safetensors", + "language_model.model.layers.19.self_attn.q_proj.weight": "model.safetensors", + "language_model.model.layers.19.self_attn.v_proj.biases": "model.safetensors", + "language_model.model.layers.19.self_attn.v_proj.scales": "model.safetensors", + "language_model.model.layers.19.self_attn.v_proj.weight": "model.safetensors", + "language_model.model.layers.2.input_layernorm.weight": "model.safetensors", + "language_model.model.layers.2.linear_attn.A_log": "model.safetensors", + "language_model.model.layers.2.linear_attn.conv1d.weight": "model.safetensors", + "language_model.model.layers.2.linear_attn.dt_bias": "model.safetensors", + "language_model.model.layers.2.linear_attn.in_proj_a.biases": "model.safetensors", + "language_model.model.layers.2.linear_attn.in_proj_a.scales": "model.safetensors", + "language_model.model.layers.2.linear_attn.in_proj_a.weight": "model.safetensors", + "language_model.model.layers.2.linear_attn.in_proj_b.biases": "model.safetensors", + "language_model.model.layers.2.linear_attn.in_proj_b.scales": "model.safetensors", + "language_model.model.layers.2.linear_attn.in_proj_b.weight": "model.safetensors", + "language_model.model.layers.2.linear_attn.in_proj_qkv.biases": "model.safetensors", + "language_model.model.layers.2.linear_attn.in_proj_qkv.scales": "model.safetensors", + "language_model.model.layers.2.linear_attn.in_proj_qkv.weight": "model.safetensors", + "language_model.model.layers.2.linear_attn.in_proj_z.biases": "model.safetensors", + "language_model.model.layers.2.linear_attn.in_proj_z.scales": "model.safetensors", + "language_model.model.layers.2.linear_attn.in_proj_z.weight": "model.safetensors", + "language_model.model.layers.2.linear_attn.norm.weight": "model.safetensors", + "language_model.model.layers.2.linear_attn.out_proj.biases": "model.safetensors", + "language_model.model.layers.2.linear_attn.out_proj.scales": "model.safetensors", + "language_model.model.layers.2.linear_attn.out_proj.weight": "model.safetensors", + "language_model.model.layers.2.mlp.down_proj.biases": "model.safetensors", + "language_model.model.layers.2.mlp.down_proj.scales": "model.safetensors", + "language_model.model.layers.2.mlp.down_proj.weight": "model.safetensors", + "language_model.model.layers.2.mlp.gate_proj.biases": "model.safetensors", + "language_model.model.layers.2.mlp.gate_proj.scales": "model.safetensors", + "language_model.model.layers.2.mlp.gate_proj.weight": "model.safetensors", + "language_model.model.layers.2.mlp.up_proj.biases": "model.safetensors", + "language_model.model.layers.2.mlp.up_proj.scales": "model.safetensors", + "language_model.model.layers.2.mlp.up_proj.weight": "model.safetensors", + "language_model.model.layers.2.post_attention_layernorm.weight": "model.safetensors", + "language_model.model.layers.20.input_layernorm.weight": "model.safetensors", + "language_model.model.layers.20.linear_attn.A_log": "model.safetensors", + "language_model.model.layers.20.linear_attn.conv1d.weight": "model.safetensors", + "language_model.model.layers.20.linear_attn.dt_bias": "model.safetensors", + "language_model.model.layers.20.linear_attn.in_proj_a.biases": "model.safetensors", + "language_model.model.layers.20.linear_attn.in_proj_a.scales": "model.safetensors", + "language_model.model.layers.20.linear_attn.in_proj_a.weight": "model.safetensors", + "language_model.model.layers.20.linear_attn.in_proj_b.biases": "model.safetensors", + "language_model.model.layers.20.linear_attn.in_proj_b.scales": "model.safetensors", + "language_model.model.layers.20.linear_attn.in_proj_b.weight": "model.safetensors", + "language_model.model.layers.20.linear_attn.in_proj_qkv.biases": "model.safetensors", + "language_model.model.layers.20.linear_attn.in_proj_qkv.scales": "model.safetensors", + "language_model.model.layers.20.linear_attn.in_proj_qkv.weight": "model.safetensors", + "language_model.model.layers.20.linear_attn.in_proj_z.biases": "model.safetensors", + "language_model.model.layers.20.linear_attn.in_proj_z.scales": "model.safetensors", + "language_model.model.layers.20.linear_attn.in_proj_z.weight": "model.safetensors", + "language_model.model.layers.20.linear_attn.norm.weight": "model.safetensors", + "language_model.model.layers.20.linear_attn.out_proj.biases": "model.safetensors", + "language_model.model.layers.20.linear_attn.out_proj.scales": "model.safetensors", + "language_model.model.layers.20.linear_attn.out_proj.weight": "model.safetensors", + "language_model.model.layers.20.mlp.down_proj.biases": "model.safetensors", + "language_model.model.layers.20.mlp.down_proj.scales": "model.safetensors", + "language_model.model.layers.20.mlp.down_proj.weight": "model.safetensors", + "language_model.model.layers.20.mlp.gate_proj.biases": "model.safetensors", + "language_model.model.layers.20.mlp.gate_proj.scales": "model.safetensors", + "language_model.model.layers.20.mlp.gate_proj.weight": "model.safetensors", + "language_model.model.layers.20.mlp.up_proj.biases": "model.safetensors", + "language_model.model.layers.20.mlp.up_proj.scales": "model.safetensors", + "language_model.model.layers.20.mlp.up_proj.weight": "model.safetensors", + "language_model.model.layers.20.post_attention_layernorm.weight": "model.safetensors", + "language_model.model.layers.21.input_layernorm.weight": "model.safetensors", + "language_model.model.layers.21.linear_attn.A_log": "model.safetensors", + "language_model.model.layers.21.linear_attn.conv1d.weight": "model.safetensors", + "language_model.model.layers.21.linear_attn.dt_bias": "model.safetensors", + "language_model.model.layers.21.linear_attn.in_proj_a.biases": "model.safetensors", + "language_model.model.layers.21.linear_attn.in_proj_a.scales": "model.safetensors", + "language_model.model.layers.21.linear_attn.in_proj_a.weight": "model.safetensors", + "language_model.model.layers.21.linear_attn.in_proj_b.biases": "model.safetensors", + "language_model.model.layers.21.linear_attn.in_proj_b.scales": "model.safetensors", + "language_model.model.layers.21.linear_attn.in_proj_b.weight": "model.safetensors", + "language_model.model.layers.21.linear_attn.in_proj_qkv.biases": "model.safetensors", + "language_model.model.layers.21.linear_attn.in_proj_qkv.scales": "model.safetensors", + "language_model.model.layers.21.linear_attn.in_proj_qkv.weight": "model.safetensors", + "language_model.model.layers.21.linear_attn.in_proj_z.biases": "model.safetensors", + "language_model.model.layers.21.linear_attn.in_proj_z.scales": "model.safetensors", + "language_model.model.layers.21.linear_attn.in_proj_z.weight": "model.safetensors", + "language_model.model.layers.21.linear_attn.norm.weight": "model.safetensors", + "language_model.model.layers.21.linear_attn.out_proj.biases": "model.safetensors", + "language_model.model.layers.21.linear_attn.out_proj.scales": "model.safetensors", + "language_model.model.layers.21.linear_attn.out_proj.weight": "model.safetensors", + "language_model.model.layers.21.mlp.down_proj.biases": "model.safetensors", + "language_model.model.layers.21.mlp.down_proj.scales": "model.safetensors", + "language_model.model.layers.21.mlp.down_proj.weight": "model.safetensors", + "language_model.model.layers.21.mlp.gate_proj.biases": "model.safetensors", + "language_model.model.layers.21.mlp.gate_proj.scales": "model.safetensors", + "language_model.model.layers.21.mlp.gate_proj.weight": "model.safetensors", + "language_model.model.layers.21.mlp.up_proj.biases": "model.safetensors", + "language_model.model.layers.21.mlp.up_proj.scales": "model.safetensors", + "language_model.model.layers.21.mlp.up_proj.weight": "model.safetensors", + "language_model.model.layers.21.post_attention_layernorm.weight": "model.safetensors", + "language_model.model.layers.22.input_layernorm.weight": "model.safetensors", + "language_model.model.layers.22.linear_attn.A_log": "model.safetensors", + "language_model.model.layers.22.linear_attn.conv1d.weight": "model.safetensors", + "language_model.model.layers.22.linear_attn.dt_bias": "model.safetensors", + "language_model.model.layers.22.linear_attn.in_proj_a.biases": "model.safetensors", + "language_model.model.layers.22.linear_attn.in_proj_a.scales": "model.safetensors", + "language_model.model.layers.22.linear_attn.in_proj_a.weight": "model.safetensors", + "language_model.model.layers.22.linear_attn.in_proj_b.biases": "model.safetensors", + "language_model.model.layers.22.linear_attn.in_proj_b.scales": "model.safetensors", + "language_model.model.layers.22.linear_attn.in_proj_b.weight": "model.safetensors", + "language_model.model.layers.22.linear_attn.in_proj_qkv.biases": "model.safetensors", + "language_model.model.layers.22.linear_attn.in_proj_qkv.scales": "model.safetensors", + "language_model.model.layers.22.linear_attn.in_proj_qkv.weight": "model.safetensors", + "language_model.model.layers.22.linear_attn.in_proj_z.biases": "model.safetensors", + "language_model.model.layers.22.linear_attn.in_proj_z.scales": "model.safetensors", + "language_model.model.layers.22.linear_attn.in_proj_z.weight": "model.safetensors", + "language_model.model.layers.22.linear_attn.norm.weight": "model.safetensors", + "language_model.model.layers.22.linear_attn.out_proj.biases": "model.safetensors", + "language_model.model.layers.22.linear_attn.out_proj.scales": "model.safetensors", + "language_model.model.layers.22.linear_attn.out_proj.weight": "model.safetensors", + "language_model.model.layers.22.mlp.down_proj.biases": "model.safetensors", + "language_model.model.layers.22.mlp.down_proj.scales": "model.safetensors", + "language_model.model.layers.22.mlp.down_proj.weight": "model.safetensors", + "language_model.model.layers.22.mlp.gate_proj.biases": "model.safetensors", + "language_model.model.layers.22.mlp.gate_proj.scales": "model.safetensors", + "language_model.model.layers.22.mlp.gate_proj.weight": "model.safetensors", + "language_model.model.layers.22.mlp.up_proj.biases": "model.safetensors", + "language_model.model.layers.22.mlp.up_proj.scales": "model.safetensors", + "language_model.model.layers.22.mlp.up_proj.weight": "model.safetensors", + "language_model.model.layers.22.post_attention_layernorm.weight": "model.safetensors", + "language_model.model.layers.23.input_layernorm.weight": "model.safetensors", + "language_model.model.layers.23.mlp.down_proj.biases": "model.safetensors", + "language_model.model.layers.23.mlp.down_proj.scales": "model.safetensors", + "language_model.model.layers.23.mlp.down_proj.weight": "model.safetensors", + "language_model.model.layers.23.mlp.gate_proj.biases": "model.safetensors", + "language_model.model.layers.23.mlp.gate_proj.scales": "model.safetensors", + "language_model.model.layers.23.mlp.gate_proj.weight": "model.safetensors", + "language_model.model.layers.23.mlp.up_proj.biases": "model.safetensors", + "language_model.model.layers.23.mlp.up_proj.scales": "model.safetensors", + "language_model.model.layers.23.mlp.up_proj.weight": "model.safetensors", + "language_model.model.layers.23.post_attention_layernorm.weight": "model.safetensors", + "language_model.model.layers.23.self_attn.k_norm.weight": "model.safetensors", + "language_model.model.layers.23.self_attn.k_proj.biases": "model.safetensors", + "language_model.model.layers.23.self_attn.k_proj.scales": "model.safetensors", + "language_model.model.layers.23.self_attn.k_proj.weight": "model.safetensors", + "language_model.model.layers.23.self_attn.o_proj.biases": "model.safetensors", + "language_model.model.layers.23.self_attn.o_proj.scales": "model.safetensors", + "language_model.model.layers.23.self_attn.o_proj.weight": "model.safetensors", + "language_model.model.layers.23.self_attn.q_norm.weight": "model.safetensors", + "language_model.model.layers.23.self_attn.q_proj.biases": "model.safetensors", + "language_model.model.layers.23.self_attn.q_proj.scales": "model.safetensors", + "language_model.model.layers.23.self_attn.q_proj.weight": "model.safetensors", + "language_model.model.layers.23.self_attn.v_proj.biases": "model.safetensors", + "language_model.model.layers.23.self_attn.v_proj.scales": "model.safetensors", + "language_model.model.layers.23.self_attn.v_proj.weight": "model.safetensors", + "language_model.model.layers.24.input_layernorm.weight": "model.safetensors", + "language_model.model.layers.24.linear_attn.A_log": "model.safetensors", + "language_model.model.layers.24.linear_attn.conv1d.weight": "model.safetensors", + "language_model.model.layers.24.linear_attn.dt_bias": "model.safetensors", + "language_model.model.layers.24.linear_attn.in_proj_a.biases": "model.safetensors", + "language_model.model.layers.24.linear_attn.in_proj_a.scales": "model.safetensors", + "language_model.model.layers.24.linear_attn.in_proj_a.weight": "model.safetensors", + "language_model.model.layers.24.linear_attn.in_proj_b.biases": "model.safetensors", + "language_model.model.layers.24.linear_attn.in_proj_b.scales": "model.safetensors", + "language_model.model.layers.24.linear_attn.in_proj_b.weight": "model.safetensors", + "language_model.model.layers.24.linear_attn.in_proj_qkv.biases": "model.safetensors", + "language_model.model.layers.24.linear_attn.in_proj_qkv.scales": "model.safetensors", + "language_model.model.layers.24.linear_attn.in_proj_qkv.weight": "model.safetensors", + "language_model.model.layers.24.linear_attn.in_proj_z.biases": "model.safetensors", + "language_model.model.layers.24.linear_attn.in_proj_z.scales": "model.safetensors", + "language_model.model.layers.24.linear_attn.in_proj_z.weight": "model.safetensors", + "language_model.model.layers.24.linear_attn.norm.weight": "model.safetensors", + "language_model.model.layers.24.linear_attn.out_proj.biases": "model.safetensors", + "language_model.model.layers.24.linear_attn.out_proj.scales": "model.safetensors", + "language_model.model.layers.24.linear_attn.out_proj.weight": "model.safetensors", + "language_model.model.layers.24.mlp.down_proj.biases": "model.safetensors", + "language_model.model.layers.24.mlp.down_proj.scales": "model.safetensors", + "language_model.model.layers.24.mlp.down_proj.weight": "model.safetensors", + "language_model.model.layers.24.mlp.gate_proj.biases": "model.safetensors", + "language_model.model.layers.24.mlp.gate_proj.scales": "model.safetensors", + "language_model.model.layers.24.mlp.gate_proj.weight": "model.safetensors", + "language_model.model.layers.24.mlp.up_proj.biases": "model.safetensors", + "language_model.model.layers.24.mlp.up_proj.scales": "model.safetensors", + "language_model.model.layers.24.mlp.up_proj.weight": "model.safetensors", + "language_model.model.layers.24.post_attention_layernorm.weight": "model.safetensors", + "language_model.model.layers.25.input_layernorm.weight": "model.safetensors", + "language_model.model.layers.25.linear_attn.A_log": "model.safetensors", + "language_model.model.layers.25.linear_attn.conv1d.weight": "model.safetensors", + "language_model.model.layers.25.linear_attn.dt_bias": "model.safetensors", + "language_model.model.layers.25.linear_attn.in_proj_a.biases": "model.safetensors", + "language_model.model.layers.25.linear_attn.in_proj_a.scales": "model.safetensors", + "language_model.model.layers.25.linear_attn.in_proj_a.weight": "model.safetensors", + "language_model.model.layers.25.linear_attn.in_proj_b.biases": "model.safetensors", + "language_model.model.layers.25.linear_attn.in_proj_b.scales": "model.safetensors", + "language_model.model.layers.25.linear_attn.in_proj_b.weight": "model.safetensors", + "language_model.model.layers.25.linear_attn.in_proj_qkv.biases": "model.safetensors", + "language_model.model.layers.25.linear_attn.in_proj_qkv.scales": "model.safetensors", + "language_model.model.layers.25.linear_attn.in_proj_qkv.weight": "model.safetensors", + "language_model.model.layers.25.linear_attn.in_proj_z.biases": "model.safetensors", + "language_model.model.layers.25.linear_attn.in_proj_z.scales": "model.safetensors", + "language_model.model.layers.25.linear_attn.in_proj_z.weight": "model.safetensors", + "language_model.model.layers.25.linear_attn.norm.weight": "model.safetensors", + "language_model.model.layers.25.linear_attn.out_proj.biases": "model.safetensors", + "language_model.model.layers.25.linear_attn.out_proj.scales": "model.safetensors", + "language_model.model.layers.25.linear_attn.out_proj.weight": "model.safetensors", + "language_model.model.layers.25.mlp.down_proj.biases": "model.safetensors", + "language_model.model.layers.25.mlp.down_proj.scales": "model.safetensors", + "language_model.model.layers.25.mlp.down_proj.weight": "model.safetensors", + "language_model.model.layers.25.mlp.gate_proj.biases": "model.safetensors", + "language_model.model.layers.25.mlp.gate_proj.scales": "model.safetensors", + "language_model.model.layers.25.mlp.gate_proj.weight": "model.safetensors", + "language_model.model.layers.25.mlp.up_proj.biases": "model.safetensors", + "language_model.model.layers.25.mlp.up_proj.scales": "model.safetensors", + "language_model.model.layers.25.mlp.up_proj.weight": "model.safetensors", + "language_model.model.layers.25.post_attention_layernorm.weight": "model.safetensors", + "language_model.model.layers.26.input_layernorm.weight": "model.safetensors", + "language_model.model.layers.26.linear_attn.A_log": "model.safetensors", + "language_model.model.layers.26.linear_attn.conv1d.weight": "model.safetensors", + "language_model.model.layers.26.linear_attn.dt_bias": "model.safetensors", + "language_model.model.layers.26.linear_attn.in_proj_a.biases": "model.safetensors", + "language_model.model.layers.26.linear_attn.in_proj_a.scales": "model.safetensors", + "language_model.model.layers.26.linear_attn.in_proj_a.weight": "model.safetensors", + "language_model.model.layers.26.linear_attn.in_proj_b.biases": "model.safetensors", + "language_model.model.layers.26.linear_attn.in_proj_b.scales": "model.safetensors", + "language_model.model.layers.26.linear_attn.in_proj_b.weight": "model.safetensors", + "language_model.model.layers.26.linear_attn.in_proj_qkv.biases": "model.safetensors", + "language_model.model.layers.26.linear_attn.in_proj_qkv.scales": "model.safetensors", + "language_model.model.layers.26.linear_attn.in_proj_qkv.weight": "model.safetensors", + "language_model.model.layers.26.linear_attn.in_proj_z.biases": "model.safetensors", + "language_model.model.layers.26.linear_attn.in_proj_z.scales": "model.safetensors", + "language_model.model.layers.26.linear_attn.in_proj_z.weight": "model.safetensors", + "language_model.model.layers.26.linear_attn.norm.weight": "model.safetensors", + "language_model.model.layers.26.linear_attn.out_proj.biases": "model.safetensors", + "language_model.model.layers.26.linear_attn.out_proj.scales": "model.safetensors", + "language_model.model.layers.26.linear_attn.out_proj.weight": "model.safetensors", + "language_model.model.layers.26.mlp.down_proj.biases": "model.safetensors", + "language_model.model.layers.26.mlp.down_proj.scales": "model.safetensors", + "language_model.model.layers.26.mlp.down_proj.weight": "model.safetensors", + "language_model.model.layers.26.mlp.gate_proj.biases": "model.safetensors", + "language_model.model.layers.26.mlp.gate_proj.scales": "model.safetensors", + "language_model.model.layers.26.mlp.gate_proj.weight": "model.safetensors", + "language_model.model.layers.26.mlp.up_proj.biases": "model.safetensors", + "language_model.model.layers.26.mlp.up_proj.scales": "model.safetensors", + "language_model.model.layers.26.mlp.up_proj.weight": "model.safetensors", + "language_model.model.layers.26.post_attention_layernorm.weight": "model.safetensors", + "language_model.model.layers.27.input_layernorm.weight": "model.safetensors", + "language_model.model.layers.27.mlp.down_proj.biases": "model.safetensors", + "language_model.model.layers.27.mlp.down_proj.scales": "model.safetensors", + "language_model.model.layers.27.mlp.down_proj.weight": "model.safetensors", + "language_model.model.layers.27.mlp.gate_proj.biases": "model.safetensors", + "language_model.model.layers.27.mlp.gate_proj.scales": "model.safetensors", + "language_model.model.layers.27.mlp.gate_proj.weight": "model.safetensors", + "language_model.model.layers.27.mlp.up_proj.biases": "model.safetensors", + "language_model.model.layers.27.mlp.up_proj.scales": "model.safetensors", + "language_model.model.layers.27.mlp.up_proj.weight": "model.safetensors", + "language_model.model.layers.27.post_attention_layernorm.weight": "model.safetensors", + "language_model.model.layers.27.self_attn.k_norm.weight": "model.safetensors", + "language_model.model.layers.27.self_attn.k_proj.biases": "model.safetensors", + "language_model.model.layers.27.self_attn.k_proj.scales": "model.safetensors", + "language_model.model.layers.27.self_attn.k_proj.weight": "model.safetensors", + "language_model.model.layers.27.self_attn.o_proj.biases": "model.safetensors", + "language_model.model.layers.27.self_attn.o_proj.scales": "model.safetensors", + "language_model.model.layers.27.self_attn.o_proj.weight": "model.safetensors", + "language_model.model.layers.27.self_attn.q_norm.weight": "model.safetensors", + "language_model.model.layers.27.self_attn.q_proj.biases": "model.safetensors", + "language_model.model.layers.27.self_attn.q_proj.scales": "model.safetensors", + "language_model.model.layers.27.self_attn.q_proj.weight": "model.safetensors", + "language_model.model.layers.27.self_attn.v_proj.biases": "model.safetensors", + "language_model.model.layers.27.self_attn.v_proj.scales": "model.safetensors", + "language_model.model.layers.27.self_attn.v_proj.weight": "model.safetensors", + "language_model.model.layers.28.input_layernorm.weight": "model.safetensors", + "language_model.model.layers.28.linear_attn.A_log": "model.safetensors", + "language_model.model.layers.28.linear_attn.conv1d.weight": "model.safetensors", + "language_model.model.layers.28.linear_attn.dt_bias": "model.safetensors", + "language_model.model.layers.28.linear_attn.in_proj_a.biases": "model.safetensors", + "language_model.model.layers.28.linear_attn.in_proj_a.scales": "model.safetensors", + "language_model.model.layers.28.linear_attn.in_proj_a.weight": "model.safetensors", + "language_model.model.layers.28.linear_attn.in_proj_b.biases": "model.safetensors", + "language_model.model.layers.28.linear_attn.in_proj_b.scales": "model.safetensors", + "language_model.model.layers.28.linear_attn.in_proj_b.weight": "model.safetensors", + "language_model.model.layers.28.linear_attn.in_proj_qkv.biases": "model.safetensors", + "language_model.model.layers.28.linear_attn.in_proj_qkv.scales": "model.safetensors", + "language_model.model.layers.28.linear_attn.in_proj_qkv.weight": "model.safetensors", + "language_model.model.layers.28.linear_attn.in_proj_z.biases": "model.safetensors", + "language_model.model.layers.28.linear_attn.in_proj_z.scales": "model.safetensors", + "language_model.model.layers.28.linear_attn.in_proj_z.weight": "model.safetensors", + "language_model.model.layers.28.linear_attn.norm.weight": "model.safetensors", + "language_model.model.layers.28.linear_attn.out_proj.biases": "model.safetensors", + "language_model.model.layers.28.linear_attn.out_proj.scales": "model.safetensors", + "language_model.model.layers.28.linear_attn.out_proj.weight": "model.safetensors", + "language_model.model.layers.28.mlp.down_proj.biases": "model.safetensors", + "language_model.model.layers.28.mlp.down_proj.scales": "model.safetensors", + "language_model.model.layers.28.mlp.down_proj.weight": "model.safetensors", + "language_model.model.layers.28.mlp.gate_proj.biases": "model.safetensors", + "language_model.model.layers.28.mlp.gate_proj.scales": "model.safetensors", + "language_model.model.layers.28.mlp.gate_proj.weight": "model.safetensors", + "language_model.model.layers.28.mlp.up_proj.biases": "model.safetensors", + "language_model.model.layers.28.mlp.up_proj.scales": "model.safetensors", + "language_model.model.layers.28.mlp.up_proj.weight": "model.safetensors", + "language_model.model.layers.28.post_attention_layernorm.weight": "model.safetensors", + "language_model.model.layers.29.input_layernorm.weight": "model.safetensors", + "language_model.model.layers.29.linear_attn.A_log": "model.safetensors", + "language_model.model.layers.29.linear_attn.conv1d.weight": "model.safetensors", + "language_model.model.layers.29.linear_attn.dt_bias": "model.safetensors", + "language_model.model.layers.29.linear_attn.in_proj_a.biases": "model.safetensors", + "language_model.model.layers.29.linear_attn.in_proj_a.scales": "model.safetensors", + "language_model.model.layers.29.linear_attn.in_proj_a.weight": "model.safetensors", + "language_model.model.layers.29.linear_attn.in_proj_b.biases": "model.safetensors", + "language_model.model.layers.29.linear_attn.in_proj_b.scales": "model.safetensors", + "language_model.model.layers.29.linear_attn.in_proj_b.weight": "model.safetensors", + "language_model.model.layers.29.linear_attn.in_proj_qkv.biases": "model.safetensors", + "language_model.model.layers.29.linear_attn.in_proj_qkv.scales": "model.safetensors", + "language_model.model.layers.29.linear_attn.in_proj_qkv.weight": "model.safetensors", + "language_model.model.layers.29.linear_attn.in_proj_z.biases": "model.safetensors", + "language_model.model.layers.29.linear_attn.in_proj_z.scales": "model.safetensors", + "language_model.model.layers.29.linear_attn.in_proj_z.weight": "model.safetensors", + "language_model.model.layers.29.linear_attn.norm.weight": "model.safetensors", + "language_model.model.layers.29.linear_attn.out_proj.biases": "model.safetensors", + "language_model.model.layers.29.linear_attn.out_proj.scales": "model.safetensors", + "language_model.model.layers.29.linear_attn.out_proj.weight": "model.safetensors", + "language_model.model.layers.29.mlp.down_proj.biases": "model.safetensors", + "language_model.model.layers.29.mlp.down_proj.scales": "model.safetensors", + "language_model.model.layers.29.mlp.down_proj.weight": "model.safetensors", + "language_model.model.layers.29.mlp.gate_proj.biases": "model.safetensors", + "language_model.model.layers.29.mlp.gate_proj.scales": "model.safetensors", + "language_model.model.layers.29.mlp.gate_proj.weight": "model.safetensors", + "language_model.model.layers.29.mlp.up_proj.biases": "model.safetensors", + "language_model.model.layers.29.mlp.up_proj.scales": "model.safetensors", + "language_model.model.layers.29.mlp.up_proj.weight": "model.safetensors", + "language_model.model.layers.29.post_attention_layernorm.weight": "model.safetensors", + "language_model.model.layers.3.input_layernorm.weight": "model.safetensors", + "language_model.model.layers.3.mlp.down_proj.biases": "model.safetensors", + "language_model.model.layers.3.mlp.down_proj.scales": "model.safetensors", + "language_model.model.layers.3.mlp.down_proj.weight": "model.safetensors", + "language_model.model.layers.3.mlp.gate_proj.biases": "model.safetensors", + "language_model.model.layers.3.mlp.gate_proj.scales": "model.safetensors", + "language_model.model.layers.3.mlp.gate_proj.weight": "model.safetensors", + "language_model.model.layers.3.mlp.up_proj.biases": "model.safetensors", + "language_model.model.layers.3.mlp.up_proj.scales": "model.safetensors", + "language_model.model.layers.3.mlp.up_proj.weight": "model.safetensors", + "language_model.model.layers.3.post_attention_layernorm.weight": "model.safetensors", + "language_model.model.layers.3.self_attn.k_norm.weight": "model.safetensors", + "language_model.model.layers.3.self_attn.k_proj.biases": "model.safetensors", + "language_model.model.layers.3.self_attn.k_proj.scales": "model.safetensors", + "language_model.model.layers.3.self_attn.k_proj.weight": "model.safetensors", + "language_model.model.layers.3.self_attn.o_proj.biases": "model.safetensors", + "language_model.model.layers.3.self_attn.o_proj.scales": "model.safetensors", + "language_model.model.layers.3.self_attn.o_proj.weight": "model.safetensors", + "language_model.model.layers.3.self_attn.q_norm.weight": "model.safetensors", + "language_model.model.layers.3.self_attn.q_proj.biases": "model.safetensors", + "language_model.model.layers.3.self_attn.q_proj.scales": "model.safetensors", + "language_model.model.layers.3.self_attn.q_proj.weight": "model.safetensors", + "language_model.model.layers.3.self_attn.v_proj.biases": "model.safetensors", + "language_model.model.layers.3.self_attn.v_proj.scales": "model.safetensors", + "language_model.model.layers.3.self_attn.v_proj.weight": "model.safetensors", + "language_model.model.layers.30.input_layernorm.weight": "model.safetensors", + "language_model.model.layers.30.linear_attn.A_log": "model.safetensors", + "language_model.model.layers.30.linear_attn.conv1d.weight": "model.safetensors", + "language_model.model.layers.30.linear_attn.dt_bias": "model.safetensors", + "language_model.model.layers.30.linear_attn.in_proj_a.biases": "model.safetensors", + "language_model.model.layers.30.linear_attn.in_proj_a.scales": "model.safetensors", + "language_model.model.layers.30.linear_attn.in_proj_a.weight": "model.safetensors", + "language_model.model.layers.30.linear_attn.in_proj_b.biases": "model.safetensors", + "language_model.model.layers.30.linear_attn.in_proj_b.scales": "model.safetensors", + "language_model.model.layers.30.linear_attn.in_proj_b.weight": "model.safetensors", + "language_model.model.layers.30.linear_attn.in_proj_qkv.biases": "model.safetensors", + "language_model.model.layers.30.linear_attn.in_proj_qkv.scales": "model.safetensors", + "language_model.model.layers.30.linear_attn.in_proj_qkv.weight": "model.safetensors", + "language_model.model.layers.30.linear_attn.in_proj_z.biases": "model.safetensors", + "language_model.model.layers.30.linear_attn.in_proj_z.scales": "model.safetensors", + "language_model.model.layers.30.linear_attn.in_proj_z.weight": "model.safetensors", + "language_model.model.layers.30.linear_attn.norm.weight": "model.safetensors", + "language_model.model.layers.30.linear_attn.out_proj.biases": "model.safetensors", + "language_model.model.layers.30.linear_attn.out_proj.scales": "model.safetensors", + "language_model.model.layers.30.linear_attn.out_proj.weight": "model.safetensors", + "language_model.model.layers.30.mlp.down_proj.biases": "model.safetensors", + "language_model.model.layers.30.mlp.down_proj.scales": "model.safetensors", + "language_model.model.layers.30.mlp.down_proj.weight": "model.safetensors", + "language_model.model.layers.30.mlp.gate_proj.biases": "model.safetensors", + "language_model.model.layers.30.mlp.gate_proj.scales": "model.safetensors", + "language_model.model.layers.30.mlp.gate_proj.weight": "model.safetensors", + "language_model.model.layers.30.mlp.up_proj.biases": "model.safetensors", + "language_model.model.layers.30.mlp.up_proj.scales": "model.safetensors", + "language_model.model.layers.30.mlp.up_proj.weight": "model.safetensors", + "language_model.model.layers.30.post_attention_layernorm.weight": "model.safetensors", + "language_model.model.layers.31.input_layernorm.weight": "model.safetensors", + "language_model.model.layers.31.mlp.down_proj.biases": "model.safetensors", + "language_model.model.layers.31.mlp.down_proj.scales": "model.safetensors", + "language_model.model.layers.31.mlp.down_proj.weight": "model.safetensors", + "language_model.model.layers.31.mlp.gate_proj.biases": "model.safetensors", + "language_model.model.layers.31.mlp.gate_proj.scales": "model.safetensors", + "language_model.model.layers.31.mlp.gate_proj.weight": "model.safetensors", + "language_model.model.layers.31.mlp.up_proj.biases": "model.safetensors", + "language_model.model.layers.31.mlp.up_proj.scales": "model.safetensors", + "language_model.model.layers.31.mlp.up_proj.weight": "model.safetensors", + "language_model.model.layers.31.post_attention_layernorm.weight": "model.safetensors", + "language_model.model.layers.31.self_attn.k_norm.weight": "model.safetensors", + "language_model.model.layers.31.self_attn.k_proj.biases": "model.safetensors", + "language_model.model.layers.31.self_attn.k_proj.scales": "model.safetensors", + "language_model.model.layers.31.self_attn.k_proj.weight": "model.safetensors", + "language_model.model.layers.31.self_attn.o_proj.biases": "model.safetensors", + "language_model.model.layers.31.self_attn.o_proj.scales": "model.safetensors", + "language_model.model.layers.31.self_attn.o_proj.weight": "model.safetensors", + "language_model.model.layers.31.self_attn.q_norm.weight": "model.safetensors", + "language_model.model.layers.31.self_attn.q_proj.biases": "model.safetensors", + "language_model.model.layers.31.self_attn.q_proj.scales": "model.safetensors", + "language_model.model.layers.31.self_attn.q_proj.weight": "model.safetensors", + "language_model.model.layers.31.self_attn.v_proj.biases": "model.safetensors", + "language_model.model.layers.31.self_attn.v_proj.scales": "model.safetensors", + "language_model.model.layers.31.self_attn.v_proj.weight": "model.safetensors", + "language_model.model.layers.4.input_layernorm.weight": "model.safetensors", + "language_model.model.layers.4.linear_attn.A_log": "model.safetensors", + "language_model.model.layers.4.linear_attn.conv1d.weight": "model.safetensors", + "language_model.model.layers.4.linear_attn.dt_bias": "model.safetensors", + "language_model.model.layers.4.linear_attn.in_proj_a.biases": "model.safetensors", + "language_model.model.layers.4.linear_attn.in_proj_a.scales": "model.safetensors", + "language_model.model.layers.4.linear_attn.in_proj_a.weight": "model.safetensors", + "language_model.model.layers.4.linear_attn.in_proj_b.biases": "model.safetensors", + "language_model.model.layers.4.linear_attn.in_proj_b.scales": "model.safetensors", + "language_model.model.layers.4.linear_attn.in_proj_b.weight": "model.safetensors", + "language_model.model.layers.4.linear_attn.in_proj_qkv.biases": "model.safetensors", + "language_model.model.layers.4.linear_attn.in_proj_qkv.scales": "model.safetensors", + "language_model.model.layers.4.linear_attn.in_proj_qkv.weight": "model.safetensors", + "language_model.model.layers.4.linear_attn.in_proj_z.biases": "model.safetensors", + "language_model.model.layers.4.linear_attn.in_proj_z.scales": "model.safetensors", + "language_model.model.layers.4.linear_attn.in_proj_z.weight": "model.safetensors", + "language_model.model.layers.4.linear_attn.norm.weight": "model.safetensors", + "language_model.model.layers.4.linear_attn.out_proj.biases": "model.safetensors", + "language_model.model.layers.4.linear_attn.out_proj.scales": "model.safetensors", + "language_model.model.layers.4.linear_attn.out_proj.weight": "model.safetensors", + "language_model.model.layers.4.mlp.down_proj.biases": "model.safetensors", + "language_model.model.layers.4.mlp.down_proj.scales": "model.safetensors", + "language_model.model.layers.4.mlp.down_proj.weight": "model.safetensors", + "language_model.model.layers.4.mlp.gate_proj.biases": "model.safetensors", + "language_model.model.layers.4.mlp.gate_proj.scales": "model.safetensors", + "language_model.model.layers.4.mlp.gate_proj.weight": "model.safetensors", + "language_model.model.layers.4.mlp.up_proj.biases": "model.safetensors", + "language_model.model.layers.4.mlp.up_proj.scales": "model.safetensors", + "language_model.model.layers.4.mlp.up_proj.weight": "model.safetensors", + "language_model.model.layers.4.post_attention_layernorm.weight": "model.safetensors", + "language_model.model.layers.5.input_layernorm.weight": "model.safetensors", + "language_model.model.layers.5.linear_attn.A_log": "model.safetensors", + "language_model.model.layers.5.linear_attn.conv1d.weight": "model.safetensors", + "language_model.model.layers.5.linear_attn.dt_bias": "model.safetensors", + "language_model.model.layers.5.linear_attn.in_proj_a.biases": "model.safetensors", + "language_model.model.layers.5.linear_attn.in_proj_a.scales": "model.safetensors", + "language_model.model.layers.5.linear_attn.in_proj_a.weight": "model.safetensors", + "language_model.model.layers.5.linear_attn.in_proj_b.biases": "model.safetensors", + "language_model.model.layers.5.linear_attn.in_proj_b.scales": "model.safetensors", + "language_model.model.layers.5.linear_attn.in_proj_b.weight": "model.safetensors", + "language_model.model.layers.5.linear_attn.in_proj_qkv.biases": "model.safetensors", + "language_model.model.layers.5.linear_attn.in_proj_qkv.scales": "model.safetensors", + "language_model.model.layers.5.linear_attn.in_proj_qkv.weight": "model.safetensors", + "language_model.model.layers.5.linear_attn.in_proj_z.biases": "model.safetensors", + "language_model.model.layers.5.linear_attn.in_proj_z.scales": "model.safetensors", + "language_model.model.layers.5.linear_attn.in_proj_z.weight": "model.safetensors", + "language_model.model.layers.5.linear_attn.norm.weight": "model.safetensors", + "language_model.model.layers.5.linear_attn.out_proj.biases": "model.safetensors", + "language_model.model.layers.5.linear_attn.out_proj.scales": "model.safetensors", + "language_model.model.layers.5.linear_attn.out_proj.weight": "model.safetensors", + "language_model.model.layers.5.mlp.down_proj.biases": "model.safetensors", + "language_model.model.layers.5.mlp.down_proj.scales": "model.safetensors", + "language_model.model.layers.5.mlp.down_proj.weight": "model.safetensors", + "language_model.model.layers.5.mlp.gate_proj.biases": "model.safetensors", + "language_model.model.layers.5.mlp.gate_proj.scales": "model.safetensors", + "language_model.model.layers.5.mlp.gate_proj.weight": "model.safetensors", + "language_model.model.layers.5.mlp.up_proj.biases": "model.safetensors", + "language_model.model.layers.5.mlp.up_proj.scales": "model.safetensors", + "language_model.model.layers.5.mlp.up_proj.weight": "model.safetensors", + "language_model.model.layers.5.post_attention_layernorm.weight": "model.safetensors", + "language_model.model.layers.6.input_layernorm.weight": "model.safetensors", + "language_model.model.layers.6.linear_attn.A_log": "model.safetensors", + "language_model.model.layers.6.linear_attn.conv1d.weight": "model.safetensors", + "language_model.model.layers.6.linear_attn.dt_bias": "model.safetensors", + "language_model.model.layers.6.linear_attn.in_proj_a.biases": "model.safetensors", + "language_model.model.layers.6.linear_attn.in_proj_a.scales": "model.safetensors", + "language_model.model.layers.6.linear_attn.in_proj_a.weight": "model.safetensors", + "language_model.model.layers.6.linear_attn.in_proj_b.biases": "model.safetensors", + "language_model.model.layers.6.linear_attn.in_proj_b.scales": "model.safetensors", + "language_model.model.layers.6.linear_attn.in_proj_b.weight": "model.safetensors", + "language_model.model.layers.6.linear_attn.in_proj_qkv.biases": "model.safetensors", + "language_model.model.layers.6.linear_attn.in_proj_qkv.scales": "model.safetensors", + "language_model.model.layers.6.linear_attn.in_proj_qkv.weight": "model.safetensors", + "language_model.model.layers.6.linear_attn.in_proj_z.biases": "model.safetensors", + "language_model.model.layers.6.linear_attn.in_proj_z.scales": "model.safetensors", + "language_model.model.layers.6.linear_attn.in_proj_z.weight": "model.safetensors", + "language_model.model.layers.6.linear_attn.norm.weight": "model.safetensors", + "language_model.model.layers.6.linear_attn.out_proj.biases": "model.safetensors", + "language_model.model.layers.6.linear_attn.out_proj.scales": "model.safetensors", + "language_model.model.layers.6.linear_attn.out_proj.weight": "model.safetensors", + "language_model.model.layers.6.mlp.down_proj.biases": "model.safetensors", + "language_model.model.layers.6.mlp.down_proj.scales": "model.safetensors", + "language_model.model.layers.6.mlp.down_proj.weight": "model.safetensors", + "language_model.model.layers.6.mlp.gate_proj.biases": "model.safetensors", + "language_model.model.layers.6.mlp.gate_proj.scales": "model.safetensors", + "language_model.model.layers.6.mlp.gate_proj.weight": "model.safetensors", + "language_model.model.layers.6.mlp.up_proj.biases": "model.safetensors", + "language_model.model.layers.6.mlp.up_proj.scales": "model.safetensors", + "language_model.model.layers.6.mlp.up_proj.weight": "model.safetensors", + "language_model.model.layers.6.post_attention_layernorm.weight": "model.safetensors", + "language_model.model.layers.7.input_layernorm.weight": "model.safetensors", + "language_model.model.layers.7.mlp.down_proj.biases": "model.safetensors", + "language_model.model.layers.7.mlp.down_proj.scales": "model.safetensors", + "language_model.model.layers.7.mlp.down_proj.weight": "model.safetensors", + "language_model.model.layers.7.mlp.gate_proj.biases": "model.safetensors", + "language_model.model.layers.7.mlp.gate_proj.scales": "model.safetensors", + "language_model.model.layers.7.mlp.gate_proj.weight": "model.safetensors", + "language_model.model.layers.7.mlp.up_proj.biases": "model.safetensors", + "language_model.model.layers.7.mlp.up_proj.scales": "model.safetensors", + "language_model.model.layers.7.mlp.up_proj.weight": "model.safetensors", + "language_model.model.layers.7.post_attention_layernorm.weight": "model.safetensors", + "language_model.model.layers.7.self_attn.k_norm.weight": "model.safetensors", + "language_model.model.layers.7.self_attn.k_proj.biases": "model.safetensors", + "language_model.model.layers.7.self_attn.k_proj.scales": "model.safetensors", + "language_model.model.layers.7.self_attn.k_proj.weight": "model.safetensors", + "language_model.model.layers.7.self_attn.o_proj.biases": "model.safetensors", + "language_model.model.layers.7.self_attn.o_proj.scales": "model.safetensors", + "language_model.model.layers.7.self_attn.o_proj.weight": "model.safetensors", + "language_model.model.layers.7.self_attn.q_norm.weight": "model.safetensors", + "language_model.model.layers.7.self_attn.q_proj.biases": "model.safetensors", + "language_model.model.layers.7.self_attn.q_proj.scales": "model.safetensors", + "language_model.model.layers.7.self_attn.q_proj.weight": "model.safetensors", + "language_model.model.layers.7.self_attn.v_proj.biases": "model.safetensors", + "language_model.model.layers.7.self_attn.v_proj.scales": "model.safetensors", + "language_model.model.layers.7.self_attn.v_proj.weight": "model.safetensors", + "language_model.model.layers.8.input_layernorm.weight": "model.safetensors", + "language_model.model.layers.8.linear_attn.A_log": "model.safetensors", + "language_model.model.layers.8.linear_attn.conv1d.weight": "model.safetensors", + "language_model.model.layers.8.linear_attn.dt_bias": "model.safetensors", + "language_model.model.layers.8.linear_attn.in_proj_a.biases": "model.safetensors", + "language_model.model.layers.8.linear_attn.in_proj_a.scales": "model.safetensors", + "language_model.model.layers.8.linear_attn.in_proj_a.weight": "model.safetensors", + "language_model.model.layers.8.linear_attn.in_proj_b.biases": "model.safetensors", + "language_model.model.layers.8.linear_attn.in_proj_b.scales": "model.safetensors", + "language_model.model.layers.8.linear_attn.in_proj_b.weight": "model.safetensors", + "language_model.model.layers.8.linear_attn.in_proj_qkv.biases": "model.safetensors", + "language_model.model.layers.8.linear_attn.in_proj_qkv.scales": "model.safetensors", + "language_model.model.layers.8.linear_attn.in_proj_qkv.weight": "model.safetensors", + "language_model.model.layers.8.linear_attn.in_proj_z.biases": "model.safetensors", + "language_model.model.layers.8.linear_attn.in_proj_z.scales": "model.safetensors", + "language_model.model.layers.8.linear_attn.in_proj_z.weight": "model.safetensors", + "language_model.model.layers.8.linear_attn.norm.weight": "model.safetensors", + "language_model.model.layers.8.linear_attn.out_proj.biases": "model.safetensors", + "language_model.model.layers.8.linear_attn.out_proj.scales": "model.safetensors", + "language_model.model.layers.8.linear_attn.out_proj.weight": "model.safetensors", + "language_model.model.layers.8.mlp.down_proj.biases": "model.safetensors", + "language_model.model.layers.8.mlp.down_proj.scales": "model.safetensors", + "language_model.model.layers.8.mlp.down_proj.weight": "model.safetensors", + "language_model.model.layers.8.mlp.gate_proj.biases": "model.safetensors", + "language_model.model.layers.8.mlp.gate_proj.scales": "model.safetensors", + "language_model.model.layers.8.mlp.gate_proj.weight": "model.safetensors", + "language_model.model.layers.8.mlp.up_proj.biases": "model.safetensors", + "language_model.model.layers.8.mlp.up_proj.scales": "model.safetensors", + "language_model.model.layers.8.mlp.up_proj.weight": "model.safetensors", + "language_model.model.layers.8.post_attention_layernorm.weight": "model.safetensors", + "language_model.model.layers.9.input_layernorm.weight": "model.safetensors", + "language_model.model.layers.9.linear_attn.A_log": "model.safetensors", + "language_model.model.layers.9.linear_attn.conv1d.weight": "model.safetensors", + "language_model.model.layers.9.linear_attn.dt_bias": "model.safetensors", + "language_model.model.layers.9.linear_attn.in_proj_a.biases": "model.safetensors", + "language_model.model.layers.9.linear_attn.in_proj_a.scales": "model.safetensors", + "language_model.model.layers.9.linear_attn.in_proj_a.weight": "model.safetensors", + "language_model.model.layers.9.linear_attn.in_proj_b.biases": "model.safetensors", + "language_model.model.layers.9.linear_attn.in_proj_b.scales": "model.safetensors", + "language_model.model.layers.9.linear_attn.in_proj_b.weight": "model.safetensors", + "language_model.model.layers.9.linear_attn.in_proj_qkv.biases": "model.safetensors", + "language_model.model.layers.9.linear_attn.in_proj_qkv.scales": "model.safetensors", + "language_model.model.layers.9.linear_attn.in_proj_qkv.weight": "model.safetensors", + "language_model.model.layers.9.linear_attn.in_proj_z.biases": "model.safetensors", + "language_model.model.layers.9.linear_attn.in_proj_z.scales": "model.safetensors", + "language_model.model.layers.9.linear_attn.in_proj_z.weight": "model.safetensors", + "language_model.model.layers.9.linear_attn.norm.weight": "model.safetensors", + "language_model.model.layers.9.linear_attn.out_proj.biases": "model.safetensors", + "language_model.model.layers.9.linear_attn.out_proj.scales": "model.safetensors", + "language_model.model.layers.9.linear_attn.out_proj.weight": "model.safetensors", + "language_model.model.layers.9.mlp.down_proj.biases": "model.safetensors", + "language_model.model.layers.9.mlp.down_proj.scales": "model.safetensors", + "language_model.model.layers.9.mlp.down_proj.weight": "model.safetensors", + "language_model.model.layers.9.mlp.gate_proj.biases": "model.safetensors", + "language_model.model.layers.9.mlp.gate_proj.scales": "model.safetensors", + "language_model.model.layers.9.mlp.gate_proj.weight": "model.safetensors", + "language_model.model.layers.9.mlp.up_proj.biases": "model.safetensors", + "language_model.model.layers.9.mlp.up_proj.scales": "model.safetensors", + "language_model.model.layers.9.mlp.up_proj.weight": "model.safetensors", + "language_model.model.layers.9.post_attention_layernorm.weight": "model.safetensors", + "language_model.model.norm.weight": "model.safetensors", + "vision_tower.blocks.0.attn.proj.bias": "model.safetensors", + "vision_tower.blocks.0.attn.proj.weight": "model.safetensors", + "vision_tower.blocks.0.attn.qkv.bias": "model.safetensors", + "vision_tower.blocks.0.attn.qkv.weight": "model.safetensors", + "vision_tower.blocks.0.mlp.linear_fc1.bias": "model.safetensors", + "vision_tower.blocks.0.mlp.linear_fc1.weight": "model.safetensors", + "vision_tower.blocks.0.mlp.linear_fc2.bias": "model.safetensors", + "vision_tower.blocks.0.mlp.linear_fc2.weight": "model.safetensors", + "vision_tower.blocks.0.norm1.bias": "model.safetensors", + "vision_tower.blocks.0.norm1.weight": "model.safetensors", + "vision_tower.blocks.0.norm2.bias": "model.safetensors", + "vision_tower.blocks.0.norm2.weight": "model.safetensors", + "vision_tower.blocks.1.attn.proj.bias": "model.safetensors", + "vision_tower.blocks.1.attn.proj.weight": "model.safetensors", + "vision_tower.blocks.1.attn.qkv.bias": "model.safetensors", + "vision_tower.blocks.1.attn.qkv.weight": "model.safetensors", + "vision_tower.blocks.1.mlp.linear_fc1.bias": "model.safetensors", + "vision_tower.blocks.1.mlp.linear_fc1.weight": "model.safetensors", + "vision_tower.blocks.1.mlp.linear_fc2.bias": "model.safetensors", + "vision_tower.blocks.1.mlp.linear_fc2.weight": "model.safetensors", + "vision_tower.blocks.1.norm1.bias": "model.safetensors", + "vision_tower.blocks.1.norm1.weight": "model.safetensors", + "vision_tower.blocks.1.norm2.bias": "model.safetensors", + "vision_tower.blocks.1.norm2.weight": "model.safetensors", + "vision_tower.blocks.10.attn.proj.bias": "model.safetensors", + "vision_tower.blocks.10.attn.proj.weight": "model.safetensors", + "vision_tower.blocks.10.attn.qkv.bias": "model.safetensors", + "vision_tower.blocks.10.attn.qkv.weight": "model.safetensors", + "vision_tower.blocks.10.mlp.linear_fc1.bias": "model.safetensors", + "vision_tower.blocks.10.mlp.linear_fc1.weight": "model.safetensors", + "vision_tower.blocks.10.mlp.linear_fc2.bias": "model.safetensors", + "vision_tower.blocks.10.mlp.linear_fc2.weight": "model.safetensors", + "vision_tower.blocks.10.norm1.bias": "model.safetensors", + "vision_tower.blocks.10.norm1.weight": "model.safetensors", + "vision_tower.blocks.10.norm2.bias": "model.safetensors", + "vision_tower.blocks.10.norm2.weight": "model.safetensors", + "vision_tower.blocks.11.attn.proj.bias": "model.safetensors", + "vision_tower.blocks.11.attn.proj.weight": "model.safetensors", + "vision_tower.blocks.11.attn.qkv.bias": "model.safetensors", + "vision_tower.blocks.11.attn.qkv.weight": "model.safetensors", + "vision_tower.blocks.11.mlp.linear_fc1.bias": "model.safetensors", + "vision_tower.blocks.11.mlp.linear_fc1.weight": "model.safetensors", + "vision_tower.blocks.11.mlp.linear_fc2.bias": "model.safetensors", + "vision_tower.blocks.11.mlp.linear_fc2.weight": "model.safetensors", + "vision_tower.blocks.11.norm1.bias": "model.safetensors", + "vision_tower.blocks.11.norm1.weight": "model.safetensors", + "vision_tower.blocks.11.norm2.bias": "model.safetensors", + "vision_tower.blocks.11.norm2.weight": "model.safetensors", + "vision_tower.blocks.12.attn.proj.bias": "model.safetensors", + "vision_tower.blocks.12.attn.proj.weight": "model.safetensors", + "vision_tower.blocks.12.attn.qkv.bias": "model.safetensors", + "vision_tower.blocks.12.attn.qkv.weight": "model.safetensors", + "vision_tower.blocks.12.mlp.linear_fc1.bias": "model.safetensors", + "vision_tower.blocks.12.mlp.linear_fc1.weight": "model.safetensors", + "vision_tower.blocks.12.mlp.linear_fc2.bias": "model.safetensors", + "vision_tower.blocks.12.mlp.linear_fc2.weight": "model.safetensors", + "vision_tower.blocks.12.norm1.bias": "model.safetensors", + "vision_tower.blocks.12.norm1.weight": "model.safetensors", + "vision_tower.blocks.12.norm2.bias": "model.safetensors", + "vision_tower.blocks.12.norm2.weight": "model.safetensors", + "vision_tower.blocks.13.attn.proj.bias": "model.safetensors", + "vision_tower.blocks.13.attn.proj.weight": "model.safetensors", + "vision_tower.blocks.13.attn.qkv.bias": "model.safetensors", + "vision_tower.blocks.13.attn.qkv.weight": "model.safetensors", + "vision_tower.blocks.13.mlp.linear_fc1.bias": "model.safetensors", + "vision_tower.blocks.13.mlp.linear_fc1.weight": "model.safetensors", + "vision_tower.blocks.13.mlp.linear_fc2.bias": "model.safetensors", + "vision_tower.blocks.13.mlp.linear_fc2.weight": "model.safetensors", + "vision_tower.blocks.13.norm1.bias": "model.safetensors", + "vision_tower.blocks.13.norm1.weight": "model.safetensors", + "vision_tower.blocks.13.norm2.bias": "model.safetensors", + "vision_tower.blocks.13.norm2.weight": "model.safetensors", + "vision_tower.blocks.14.attn.proj.bias": "model.safetensors", + "vision_tower.blocks.14.attn.proj.weight": "model.safetensors", + "vision_tower.blocks.14.attn.qkv.bias": "model.safetensors", + "vision_tower.blocks.14.attn.qkv.weight": "model.safetensors", + "vision_tower.blocks.14.mlp.linear_fc1.bias": "model.safetensors", + "vision_tower.blocks.14.mlp.linear_fc1.weight": "model.safetensors", + "vision_tower.blocks.14.mlp.linear_fc2.bias": "model.safetensors", + "vision_tower.blocks.14.mlp.linear_fc2.weight": "model.safetensors", + "vision_tower.blocks.14.norm1.bias": "model.safetensors", + "vision_tower.blocks.14.norm1.weight": "model.safetensors", + "vision_tower.blocks.14.norm2.bias": "model.safetensors", + "vision_tower.blocks.14.norm2.weight": "model.safetensors", + "vision_tower.blocks.15.attn.proj.bias": "model.safetensors", + "vision_tower.blocks.15.attn.proj.weight": "model.safetensors", + "vision_tower.blocks.15.attn.qkv.bias": "model.safetensors", + "vision_tower.blocks.15.attn.qkv.weight": "model.safetensors", + "vision_tower.blocks.15.mlp.linear_fc1.bias": "model.safetensors", + "vision_tower.blocks.15.mlp.linear_fc1.weight": "model.safetensors", + "vision_tower.blocks.15.mlp.linear_fc2.bias": "model.safetensors", + "vision_tower.blocks.15.mlp.linear_fc2.weight": "model.safetensors", + "vision_tower.blocks.15.norm1.bias": "model.safetensors", + "vision_tower.blocks.15.norm1.weight": "model.safetensors", + "vision_tower.blocks.15.norm2.bias": "model.safetensors", + "vision_tower.blocks.15.norm2.weight": "model.safetensors", + "vision_tower.blocks.16.attn.proj.bias": "model.safetensors", + "vision_tower.blocks.16.attn.proj.weight": "model.safetensors", + "vision_tower.blocks.16.attn.qkv.bias": "model.safetensors", + "vision_tower.blocks.16.attn.qkv.weight": "model.safetensors", + "vision_tower.blocks.16.mlp.linear_fc1.bias": "model.safetensors", + "vision_tower.blocks.16.mlp.linear_fc1.weight": "model.safetensors", + "vision_tower.blocks.16.mlp.linear_fc2.bias": "model.safetensors", + "vision_tower.blocks.16.mlp.linear_fc2.weight": "model.safetensors", + "vision_tower.blocks.16.norm1.bias": "model.safetensors", + "vision_tower.blocks.16.norm1.weight": "model.safetensors", + "vision_tower.blocks.16.norm2.bias": "model.safetensors", + "vision_tower.blocks.16.norm2.weight": "model.safetensors", + "vision_tower.blocks.17.attn.proj.bias": "model.safetensors", + "vision_tower.blocks.17.attn.proj.weight": "model.safetensors", + "vision_tower.blocks.17.attn.qkv.bias": "model.safetensors", + "vision_tower.blocks.17.attn.qkv.weight": "model.safetensors", + "vision_tower.blocks.17.mlp.linear_fc1.bias": "model.safetensors", + "vision_tower.blocks.17.mlp.linear_fc1.weight": "model.safetensors", + "vision_tower.blocks.17.mlp.linear_fc2.bias": "model.safetensors", + "vision_tower.blocks.17.mlp.linear_fc2.weight": "model.safetensors", + "vision_tower.blocks.17.norm1.bias": "model.safetensors", + "vision_tower.blocks.17.norm1.weight": "model.safetensors", + "vision_tower.blocks.17.norm2.bias": "model.safetensors", + "vision_tower.blocks.17.norm2.weight": "model.safetensors", + "vision_tower.blocks.18.attn.proj.bias": "model.safetensors", + "vision_tower.blocks.18.attn.proj.weight": "model.safetensors", + "vision_tower.blocks.18.attn.qkv.bias": "model.safetensors", + "vision_tower.blocks.18.attn.qkv.weight": "model.safetensors", + "vision_tower.blocks.18.mlp.linear_fc1.bias": "model.safetensors", + "vision_tower.blocks.18.mlp.linear_fc1.weight": "model.safetensors", + "vision_tower.blocks.18.mlp.linear_fc2.bias": "model.safetensors", + "vision_tower.blocks.18.mlp.linear_fc2.weight": "model.safetensors", + "vision_tower.blocks.18.norm1.bias": "model.safetensors", + "vision_tower.blocks.18.norm1.weight": "model.safetensors", + "vision_tower.blocks.18.norm2.bias": "model.safetensors", + "vision_tower.blocks.18.norm2.weight": "model.safetensors", + "vision_tower.blocks.19.attn.proj.bias": "model.safetensors", + "vision_tower.blocks.19.attn.proj.weight": "model.safetensors", + "vision_tower.blocks.19.attn.qkv.bias": "model.safetensors", + "vision_tower.blocks.19.attn.qkv.weight": "model.safetensors", + "vision_tower.blocks.19.mlp.linear_fc1.bias": "model.safetensors", + "vision_tower.blocks.19.mlp.linear_fc1.weight": "model.safetensors", + "vision_tower.blocks.19.mlp.linear_fc2.bias": "model.safetensors", + "vision_tower.blocks.19.mlp.linear_fc2.weight": "model.safetensors", + "vision_tower.blocks.19.norm1.bias": "model.safetensors", + "vision_tower.blocks.19.norm1.weight": "model.safetensors", + "vision_tower.blocks.19.norm2.bias": "model.safetensors", + "vision_tower.blocks.19.norm2.weight": "model.safetensors", + "vision_tower.blocks.2.attn.proj.bias": "model.safetensors", + "vision_tower.blocks.2.attn.proj.weight": "model.safetensors", + "vision_tower.blocks.2.attn.qkv.bias": "model.safetensors", + "vision_tower.blocks.2.attn.qkv.weight": "model.safetensors", + "vision_tower.blocks.2.mlp.linear_fc1.bias": "model.safetensors", + "vision_tower.blocks.2.mlp.linear_fc1.weight": "model.safetensors", + "vision_tower.blocks.2.mlp.linear_fc2.bias": "model.safetensors", + "vision_tower.blocks.2.mlp.linear_fc2.weight": "model.safetensors", + "vision_tower.blocks.2.norm1.bias": "model.safetensors", + "vision_tower.blocks.2.norm1.weight": "model.safetensors", + "vision_tower.blocks.2.norm2.bias": "model.safetensors", + "vision_tower.blocks.2.norm2.weight": "model.safetensors", + "vision_tower.blocks.20.attn.proj.bias": "model.safetensors", + "vision_tower.blocks.20.attn.proj.weight": "model.safetensors", + "vision_tower.blocks.20.attn.qkv.bias": "model.safetensors", + "vision_tower.blocks.20.attn.qkv.weight": "model.safetensors", + "vision_tower.blocks.20.mlp.linear_fc1.bias": "model.safetensors", + "vision_tower.blocks.20.mlp.linear_fc1.weight": "model.safetensors", + "vision_tower.blocks.20.mlp.linear_fc2.bias": "model.safetensors", + "vision_tower.blocks.20.mlp.linear_fc2.weight": "model.safetensors", + "vision_tower.blocks.20.norm1.bias": "model.safetensors", + "vision_tower.blocks.20.norm1.weight": "model.safetensors", + "vision_tower.blocks.20.norm2.bias": "model.safetensors", + "vision_tower.blocks.20.norm2.weight": "model.safetensors", + "vision_tower.blocks.21.attn.proj.bias": "model.safetensors", + "vision_tower.blocks.21.attn.proj.weight": "model.safetensors", + "vision_tower.blocks.21.attn.qkv.bias": "model.safetensors", + "vision_tower.blocks.21.attn.qkv.weight": "model.safetensors", + "vision_tower.blocks.21.mlp.linear_fc1.bias": "model.safetensors", + "vision_tower.blocks.21.mlp.linear_fc1.weight": "model.safetensors", + "vision_tower.blocks.21.mlp.linear_fc2.bias": "model.safetensors", + "vision_tower.blocks.21.mlp.linear_fc2.weight": "model.safetensors", + "vision_tower.blocks.21.norm1.bias": "model.safetensors", + "vision_tower.blocks.21.norm1.weight": "model.safetensors", + "vision_tower.blocks.21.norm2.bias": "model.safetensors", + "vision_tower.blocks.21.norm2.weight": "model.safetensors", + "vision_tower.blocks.22.attn.proj.bias": "model.safetensors", + "vision_tower.blocks.22.attn.proj.weight": "model.safetensors", + "vision_tower.blocks.22.attn.qkv.bias": "model.safetensors", + "vision_tower.blocks.22.attn.qkv.weight": "model.safetensors", + "vision_tower.blocks.22.mlp.linear_fc1.bias": "model.safetensors", + "vision_tower.blocks.22.mlp.linear_fc1.weight": "model.safetensors", + "vision_tower.blocks.22.mlp.linear_fc2.bias": "model.safetensors", + "vision_tower.blocks.22.mlp.linear_fc2.weight": "model.safetensors", + "vision_tower.blocks.22.norm1.bias": "model.safetensors", + "vision_tower.blocks.22.norm1.weight": "model.safetensors", + "vision_tower.blocks.22.norm2.bias": "model.safetensors", + "vision_tower.blocks.22.norm2.weight": "model.safetensors", + "vision_tower.blocks.23.attn.proj.bias": "model.safetensors", + "vision_tower.blocks.23.attn.proj.weight": "model.safetensors", + "vision_tower.blocks.23.attn.qkv.bias": "model.safetensors", + "vision_tower.blocks.23.attn.qkv.weight": "model.safetensors", + "vision_tower.blocks.23.mlp.linear_fc1.bias": "model.safetensors", + "vision_tower.blocks.23.mlp.linear_fc1.weight": "model.safetensors", + "vision_tower.blocks.23.mlp.linear_fc2.bias": "model.safetensors", + "vision_tower.blocks.23.mlp.linear_fc2.weight": "model.safetensors", + "vision_tower.blocks.23.norm1.bias": "model.safetensors", + "vision_tower.blocks.23.norm1.weight": "model.safetensors", + "vision_tower.blocks.23.norm2.bias": "model.safetensors", + "vision_tower.blocks.23.norm2.weight": "model.safetensors", + "vision_tower.blocks.3.attn.proj.bias": "model.safetensors", + "vision_tower.blocks.3.attn.proj.weight": "model.safetensors", + "vision_tower.blocks.3.attn.qkv.bias": "model.safetensors", + "vision_tower.blocks.3.attn.qkv.weight": "model.safetensors", + "vision_tower.blocks.3.mlp.linear_fc1.bias": "model.safetensors", + "vision_tower.blocks.3.mlp.linear_fc1.weight": "model.safetensors", + "vision_tower.blocks.3.mlp.linear_fc2.bias": "model.safetensors", + "vision_tower.blocks.3.mlp.linear_fc2.weight": "model.safetensors", + "vision_tower.blocks.3.norm1.bias": "model.safetensors", + "vision_tower.blocks.3.norm1.weight": "model.safetensors", + "vision_tower.blocks.3.norm2.bias": "model.safetensors", + "vision_tower.blocks.3.norm2.weight": "model.safetensors", + "vision_tower.blocks.4.attn.proj.bias": "model.safetensors", + "vision_tower.blocks.4.attn.proj.weight": "model.safetensors", + "vision_tower.blocks.4.attn.qkv.bias": "model.safetensors", + "vision_tower.blocks.4.attn.qkv.weight": "model.safetensors", + "vision_tower.blocks.4.mlp.linear_fc1.bias": "model.safetensors", + "vision_tower.blocks.4.mlp.linear_fc1.weight": "model.safetensors", + "vision_tower.blocks.4.mlp.linear_fc2.bias": "model.safetensors", + "vision_tower.blocks.4.mlp.linear_fc2.weight": "model.safetensors", + "vision_tower.blocks.4.norm1.bias": "model.safetensors", + "vision_tower.blocks.4.norm1.weight": "model.safetensors", + "vision_tower.blocks.4.norm2.bias": "model.safetensors", + "vision_tower.blocks.4.norm2.weight": "model.safetensors", + "vision_tower.blocks.5.attn.proj.bias": "model.safetensors", + "vision_tower.blocks.5.attn.proj.weight": "model.safetensors", + "vision_tower.blocks.5.attn.qkv.bias": "model.safetensors", + "vision_tower.blocks.5.attn.qkv.weight": "model.safetensors", + "vision_tower.blocks.5.mlp.linear_fc1.bias": "model.safetensors", + "vision_tower.blocks.5.mlp.linear_fc1.weight": "model.safetensors", + "vision_tower.blocks.5.mlp.linear_fc2.bias": "model.safetensors", + "vision_tower.blocks.5.mlp.linear_fc2.weight": "model.safetensors", + "vision_tower.blocks.5.norm1.bias": "model.safetensors", + "vision_tower.blocks.5.norm1.weight": "model.safetensors", + "vision_tower.blocks.5.norm2.bias": "model.safetensors", + "vision_tower.blocks.5.norm2.weight": "model.safetensors", + "vision_tower.blocks.6.attn.proj.bias": "model.safetensors", + "vision_tower.blocks.6.attn.proj.weight": "model.safetensors", + "vision_tower.blocks.6.attn.qkv.bias": "model.safetensors", + "vision_tower.blocks.6.attn.qkv.weight": "model.safetensors", + "vision_tower.blocks.6.mlp.linear_fc1.bias": "model.safetensors", + "vision_tower.blocks.6.mlp.linear_fc1.weight": "model.safetensors", + "vision_tower.blocks.6.mlp.linear_fc2.bias": "model.safetensors", + "vision_tower.blocks.6.mlp.linear_fc2.weight": "model.safetensors", + "vision_tower.blocks.6.norm1.bias": "model.safetensors", + "vision_tower.blocks.6.norm1.weight": "model.safetensors", + "vision_tower.blocks.6.norm2.bias": "model.safetensors", + "vision_tower.blocks.6.norm2.weight": "model.safetensors", + "vision_tower.blocks.7.attn.proj.bias": "model.safetensors", + "vision_tower.blocks.7.attn.proj.weight": "model.safetensors", + "vision_tower.blocks.7.attn.qkv.bias": "model.safetensors", + "vision_tower.blocks.7.attn.qkv.weight": "model.safetensors", + "vision_tower.blocks.7.mlp.linear_fc1.bias": "model.safetensors", + "vision_tower.blocks.7.mlp.linear_fc1.weight": "model.safetensors", + "vision_tower.blocks.7.mlp.linear_fc2.bias": "model.safetensors", + "vision_tower.blocks.7.mlp.linear_fc2.weight": "model.safetensors", + "vision_tower.blocks.7.norm1.bias": "model.safetensors", + "vision_tower.blocks.7.norm1.weight": "model.safetensors", + "vision_tower.blocks.7.norm2.bias": "model.safetensors", + "vision_tower.blocks.7.norm2.weight": "model.safetensors", + "vision_tower.blocks.8.attn.proj.bias": "model.safetensors", + "vision_tower.blocks.8.attn.proj.weight": "model.safetensors", + "vision_tower.blocks.8.attn.qkv.bias": "model.safetensors", + "vision_tower.blocks.8.attn.qkv.weight": "model.safetensors", + "vision_tower.blocks.8.mlp.linear_fc1.bias": "model.safetensors", + "vision_tower.blocks.8.mlp.linear_fc1.weight": "model.safetensors", + "vision_tower.blocks.8.mlp.linear_fc2.bias": "model.safetensors", + "vision_tower.blocks.8.mlp.linear_fc2.weight": "model.safetensors", + "vision_tower.blocks.8.norm1.bias": "model.safetensors", + "vision_tower.blocks.8.norm1.weight": "model.safetensors", + "vision_tower.blocks.8.norm2.bias": "model.safetensors", + "vision_tower.blocks.8.norm2.weight": "model.safetensors", + "vision_tower.blocks.9.attn.proj.bias": "model.safetensors", + "vision_tower.blocks.9.attn.proj.weight": "model.safetensors", + "vision_tower.blocks.9.attn.qkv.bias": "model.safetensors", + "vision_tower.blocks.9.attn.qkv.weight": "model.safetensors", + "vision_tower.blocks.9.mlp.linear_fc1.bias": "model.safetensors", + "vision_tower.blocks.9.mlp.linear_fc1.weight": "model.safetensors", + "vision_tower.blocks.9.mlp.linear_fc2.bias": "model.safetensors", + "vision_tower.blocks.9.mlp.linear_fc2.weight": "model.safetensors", + "vision_tower.blocks.9.norm1.bias": "model.safetensors", + "vision_tower.blocks.9.norm1.weight": "model.safetensors", + "vision_tower.blocks.9.norm2.bias": "model.safetensors", + "vision_tower.blocks.9.norm2.weight": "model.safetensors", + "vision_tower.merger.linear_fc1.bias": "model.safetensors", + "vision_tower.merger.linear_fc1.weight": "model.safetensors", + "vision_tower.merger.linear_fc2.bias": "model.safetensors", + "vision_tower.merger.linear_fc2.weight": "model.safetensors", + "vision_tower.merger.norm.bias": "model.safetensors", + "vision_tower.merger.norm.weight": "model.safetensors", + "vision_tower.patch_embed.proj.bias": "model.safetensors", + "vision_tower.patch_embed.proj.weight": "model.safetensors", + "vision_tower.pos_embed.weight": "model.safetensors" + } +} \ No newline at end of file diff --git a/chat/mlx/mlx-community/Qwen3.5-4B-MLX-4bit/preprocessor_config.json b/chat/mlx/mlx-community/Qwen3.5-4B-MLX-4bit/preprocessor_config.json new file mode 100644 index 0000000..2ea84a4 --- /dev/null +++ b/chat/mlx/mlx-community/Qwen3.5-4B-MLX-4bit/preprocessor_config.json @@ -0,0 +1,21 @@ +{ + "size": { + "longest_edge": 16777216, + "shortest_edge": 65536 + }, + "patch_size": 16, + "temporal_patch_size": 2, + "merge_size": 2, + "image_mean": [ + 0.5, + 0.5, + 0.5 + ], + "image_std": [ + 0.5, + 0.5, + 0.5 + ], + "processor_class": "Qwen3VLProcessor", + "image_processor_type": "Qwen2VLImageProcessorFast" +} \ No newline at end of file diff --git a/chat/mlx/mlx-community/Qwen3.5-4B-MLX-4bit/processor_config.json b/chat/mlx/mlx-community/Qwen3.5-4B-MLX-4bit/processor_config.json new file mode 100644 index 0000000..7ad6acd --- /dev/null +++ b/chat/mlx/mlx-community/Qwen3.5-4B-MLX-4bit/processor_config.json @@ -0,0 +1,63 @@ +{ + "image_processor": { + "data_format": "channels_first", + "do_convert_rgb": true, + "do_normalize": true, + "do_rescale": true, + "do_resize": true, + "image_mean": [ + 0.5, + 0.5, + 0.5 + ], + "image_processor_type": "Qwen2VLImageProcessorFast", + "image_std": [ + 0.5, + 0.5, + 0.5 + ], + "merge_size": 2, + "patch_size": 16, + "resample": 3, + "rescale_factor": 0.00392156862745098, + "size": { + "longest_edge": 16777216, + "shortest_edge": 65536 + }, + "temporal_patch_size": 2 + }, + "processor_class": "Qwen3VLProcessor", + "video_processor": { + "data_format": "channels_first", + "default_to_square": true, + "do_convert_rgb": true, + "do_normalize": true, + "do_rescale": true, + "do_resize": true, + "do_sample_frames": true, + "fps": 2, + "image_mean": [ + 0.5, + 0.5, + 0.5 + ], + "image_std": [ + 0.5, + 0.5, + 0.5 + ], + "max_frames": 768, + "merge_size": 2, + "min_frames": 4, + "patch_size": 16, + "resample": 3, + "rescale_factor": 0.00392156862745098, + "return_metadata": false, + "size": { + "longest_edge": 25165824, + "shortest_edge": 4096 + }, + "temporal_patch_size": 2, + "video_processor_type": "Qwen3VLVideoProcessor" + } +} diff --git a/chat/mlx/mlx-community/Qwen3.5-4B-MLX-4bit/tokenizer.json b/chat/mlx/mlx-community/Qwen3.5-4B-MLX-4bit/tokenizer.json new file mode 100644 index 0000000..67741b0 --- /dev/null +++ b/chat/mlx/mlx-community/Qwen3.5-4B-MLX-4bit/tokenizer.json @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:87a7830d63fcf43bf241c3c5242e96e62dd3fdc29224ca26fed8ea333db72de4 +size 19989343 diff --git a/chat/mlx/mlx-community/Qwen3.5-4B-MLX-4bit/tokenizer_config.json b/chat/mlx/mlx-community/Qwen3.5-4B-MLX-4bit/tokenizer_config.json new file mode 100644 index 0000000..a068e24 --- /dev/null +++ b/chat/mlx/mlx-community/Qwen3.5-4B-MLX-4bit/tokenizer_config.json @@ -0,0 +1,32 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|im_end|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": true, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "processor_class": "Qwen3VLProcessor", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/chat/mlx/mlx-community/Qwen3.5-4B-MLX-4bit/video_preprocessor_config.json b/chat/mlx/mlx-community/Qwen3.5-4B-MLX-4bit/video_preprocessor_config.json new file mode 100644 index 0000000..3ba673a --- /dev/null +++ b/chat/mlx/mlx-community/Qwen3.5-4B-MLX-4bit/video_preprocessor_config.json @@ -0,0 +1,21 @@ +{ + "size": { + "longest_edge": 25165824, + "shortest_edge": 4096 + }, + "patch_size": 16, + "temporal_patch_size": 2, + "merge_size": 2, + "image_mean": [ + 0.5, + 0.5, + 0.5 + ], + "image_std": [ + 0.5, + 0.5, + 0.5 + ], + "processor_class": "Qwen3VLProcessor", + "video_processor_type": "Qwen3VLVideoProcessor" +} \ No newline at end of file diff --git a/chat/mlx/mlx-community/Qwen3.5-4B-MLX-4bit/vocab.json b/chat/mlx/mlx-community/Qwen3.5-4B-MLX-4bit/vocab.json new file mode 100644 index 0000000..d32f7ed --- /dev/null +++ b/chat/mlx/mlx-community/Qwen3.5-4B-MLX-4bit/vocab.json @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:ce99b4cb2983d118806ce0a8b777a35b093e2000a503ebde25853284c9dfa003 +size 6722759 diff --git a/chat/mlx/mlx-community/Qwen3.5-9B-MLX-4bit/.gitattributes b/chat/mlx/mlx-community/Qwen3.5-9B-MLX-4bit/.gitattributes new file mode 100644 index 0000000..52373fe --- /dev/null +++ b/chat/mlx/mlx-community/Qwen3.5-9B-MLX-4bit/.gitattributes @@ -0,0 +1,36 @@ +*.7z filter=lfs diff=lfs merge=lfs -text +*.arrow filter=lfs diff=lfs merge=lfs -text +*.bin filter=lfs diff=lfs merge=lfs -text +*.bz2 filter=lfs diff=lfs merge=lfs -text +*.ckpt filter=lfs diff=lfs merge=lfs -text +*.ftz filter=lfs diff=lfs merge=lfs -text +*.gz filter=lfs diff=lfs merge=lfs -text +*.h5 filter=lfs diff=lfs merge=lfs -text +*.joblib filter=lfs diff=lfs merge=lfs -text +*.lfs.* filter=lfs diff=lfs merge=lfs -text +*.mlmodel filter=lfs diff=lfs merge=lfs -text +*.model filter=lfs diff=lfs merge=lfs -text +*.msgpack filter=lfs diff=lfs merge=lfs -text +*.npy filter=lfs diff=lfs merge=lfs -text +*.npz filter=lfs diff=lfs merge=lfs -text +*.onnx filter=lfs diff=lfs merge=lfs -text +*.ot filter=lfs diff=lfs merge=lfs -text +*.parquet filter=lfs diff=lfs merge=lfs -text +*.pb filter=lfs diff=lfs merge=lfs -text +*.pickle filter=lfs diff=lfs merge=lfs -text +*.pkl filter=lfs diff=lfs merge=lfs -text +*.pt filter=lfs diff=lfs merge=lfs -text +*.pth filter=lfs diff=lfs merge=lfs -text +*.rar filter=lfs diff=lfs merge=lfs -text +*.safetensors filter=lfs diff=lfs merge=lfs -text +saved_model/**/* filter=lfs diff=lfs merge=lfs -text +*.tar.* filter=lfs diff=lfs merge=lfs -text +*.tar filter=lfs diff=lfs merge=lfs -text +*.tflite filter=lfs diff=lfs merge=lfs -text +*.tgz filter=lfs diff=lfs merge=lfs -text +*.wasm filter=lfs diff=lfs merge=lfs -text +*.xz filter=lfs diff=lfs merge=lfs -text +*.zip filter=lfs diff=lfs merge=lfs -text +*.zst filter=lfs diff=lfs merge=lfs -text +*tfevents* filter=lfs diff=lfs merge=lfs -text +tokenizer.json filter=lfs diff=lfs merge=lfs -text diff --git a/chat/mlx/mlx-community/Qwen3.5-9B-MLX-4bit/README.md b/chat/mlx/mlx-community/Qwen3.5-9B-MLX-4bit/README.md new file mode 100644 index 0000000..5d6f034 --- /dev/null +++ b/chat/mlx/mlx-community/Qwen3.5-9B-MLX-4bit/README.md @@ -0,0 +1,76 @@ +--- +base_model: Qwen/Qwen3.5-9B +library_name: mlx +pipeline_tag: image-text-to-text +tags: + - mlx + - qwen3.5 + - vision-language-model + - quantized + - 4bit +license: apache-2.0 +--- + +# Qwen3.5-9B-MLX-4bit + +This is a quantized MLX version of [Qwen/Qwen3.5-9B](https://huggingface.co/Qwen/Qwen3.5-9B) for Apple Silicon. + +## Model Details + +- **Original Model:** [Qwen/Qwen3.5-9B](https://huggingface.co/Qwen/Qwen3.5-9B) +- **Quantization:** 4-bit (~5.059 bits per weight) +- **Group Size:** 64 +- **Format:** MLX SafeTensors +- **Framework:** [mlx-vlm](https://github.com/Blaizzy/mlx-vlm) + +## Conversion Details + +This model was converted using `mlx-vlm` with 4-bit quantization. + +**Conversion command:** +```bash +python3 -m mlx_vlm convert \ + --hf-path "Qwen/Qwen3.5-9B" \ + --mlx-path "./mlx_models/Qwen3.5-9B-MLX-4bit" \ + -q --q-bits 4 --q-group-size 64 +``` + +## Important Note + +A better, more optimized conversion may be available from **@Prince** ([@Blaizzy](https://huggingface.co/Blaizzy)) in the MLX VLM community. Check the [mlx-community](https://huggingface.co/mlx-community) organization for updated versions as official Qwen3.5 support is merged into the main `mlx-vlm` branch. + +## Usage + +```python +from mlx_vlm import load, generate + +model, processor = load("mlx-community/Qwen3.5-9B-MLX-4bit") + +output = generate( + model, + processor, + prompt="Describe this image in detail", + image="path/to/image.jpg", + max_tokens=200 +) +print(output) +``` + +Or from the command line: +```bash +mlx_vlm generate \ + --model mlx-community/Qwen3.5-9B-MLX-4bit \ + --prompt "Describe this image" \ + --image path/to/image.jpg \ + --max-tokens 200 +``` + +## Performance + +- **Disk Size:** ~5.6 GB +- Runs efficiently on Apple Silicon Macs (M1/M2/M3/M4) +- Lower memory footprint compared to 8-bit quantization + +## License + +This model inherits the [Apache 2.0 license](https://huggingface.co/Qwen/Qwen3.5-9B/blob/main/LICENSE) from the original Qwen3.5-9B model. diff --git a/chat/mlx/mlx-community/Qwen3.5-9B-MLX-4bit/chat_template.jinja b/chat/mlx/mlx-community/Qwen3.5-9B-MLX-4bit/chat_template.jinja new file mode 100644 index 0000000..a585dec --- /dev/null +++ b/chat/mlx/mlx-community/Qwen3.5-9B-MLX-4bit/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if loop.index0 > ns.last_query_index %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/chat/mlx/mlx-community/Qwen3.5-9B-MLX-4bit/config.json b/chat/mlx/mlx-community/Qwen3.5-9B-MLX-4bit/config.json new file mode 100644 index 0000000..0435ae3 --- /dev/null +++ b/chat/mlx/mlx-community/Qwen3.5-9B-MLX-4bit/config.json @@ -0,0 +1,113 @@ +{ + "architectures": [ + "Qwen3_5ForConditionalGeneration" + ], + "image_token_id": 248056, + "model_type": "qwen3_5", + "quantization": { + "group_size": 64, + "bits": 4, + "mode": "affine" + }, + "quantization_config": { + "group_size": 64, + "bits": 4, + "mode": "affine" + }, + "text_config": { + "attention_bias": false, + "attention_dropout": 0.0, + "attn_output_gate": true, + "dtype": "bfloat16", + "eos_token_id": 248044, + "full_attention_interval": 4, + "head_dim": 256, + "hidden_act": "silu", + "hidden_size": 4096, + "initializer_range": 0.02, + "intermediate_size": 12288, + "layer_types": [ + "linear_attention", + "linear_attention", + "linear_attention", + "full_attention", + "linear_attention", + "linear_attention", + "linear_attention", + "full_attention", + "linear_attention", + "linear_attention", + "linear_attention", + "full_attention", + "linear_attention", + "linear_attention", + "linear_attention", + "full_attention", + "linear_attention", + "linear_attention", + "linear_attention", + "full_attention", + "linear_attention", + "linear_attention", + "linear_attention", + "full_attention", + "linear_attention", + "linear_attention", + "linear_attention", + "full_attention", + "linear_attention", + "linear_attention", + "linear_attention", + "full_attention" + ], + "linear_conv_kernel_dim": 4, + "linear_key_head_dim": 128, + "linear_num_key_heads": 16, + "linear_num_value_heads": 32, + "linear_value_head_dim": 128, + "max_position_embeddings": 262144, + "mlp_only_layers": [], + "model_type": "qwen3_5_text", + "mtp_num_hidden_layers": 1, + "mtp_use_dedicated_embeddings": false, + "num_attention_heads": 16, + "num_hidden_layers": 32, + "num_key_value_heads": 4, + "rms_norm_eps": 1e-06, + "use_cache": true, + "vocab_size": 248320, + "mamba_ssm_dtype": "float32", + "rope_parameters": { + "mrope_interleaved": true, + "mrope_section": [ + 11, + 11, + 10 + ], + "rope_type": "default", + "rope_theta": 10000000, + "partial_rotary_factor": 0.25 + } + }, + "tie_word_embeddings": false, + "transformers_version": "4.57.0.dev0", + "video_token_id": 248057, + "vision_config": { + "deepstack_visual_indexes": [], + "depth": 27, + "hidden_act": "gelu_pytorch_tanh", + "hidden_size": 1152, + "in_channels": 3, + "initializer_range": 0.02, + "intermediate_size": 4304, + "model_type": "qwen3_5", + "num_heads": 16, + "num_position_embeddings": 2304, + "out_hidden_size": 4096, + "patch_size": 16, + "spatial_merge_size": 2, + "temporal_patch_size": 2 + }, + "vision_end_token_id": 248054, + "vision_start_token_id": 248053 +} \ No newline at end of file diff --git a/chat/mlx/mlx-community/Qwen3.5-9B-MLX-4bit/model-00001-of-00002.safetensors b/chat/mlx/mlx-community/Qwen3.5-9B-MLX-4bit/model-00001-of-00002.safetensors new file mode 100644 index 0000000..ddb369e --- /dev/null +++ b/chat/mlx/mlx-community/Qwen3.5-9B-MLX-4bit/model-00001-of-00002.safetensors @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:a68b87558c6ef43f74c2bd63ce7e9092ceddc3101f3def0030774bae5f42aadd +size 5349771222 diff --git a/chat/mlx/mlx-community/Qwen3.5-9B-MLX-4bit/model-00002-of-00002.safetensors b/chat/mlx/mlx-community/Qwen3.5-9B-MLX-4bit/model-00002-of-00002.safetensors new file mode 100644 index 0000000..806973d --- /dev/null +++ b/chat/mlx/mlx-community/Qwen3.5-9B-MLX-4bit/model-00002-of-00002.safetensors @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:b0a770bf8469c7f3f18756a0e0283f1c1174344a83e059a4e483f6af4907352d +size 600449850 diff --git a/chat/mlx/mlx-community/Qwen3.5-9B-MLX-4bit/model.safetensors.index.json b/chat/mlx/mlx-community/Qwen3.5-9B-MLX-4bit/model.safetensors.index.json new file mode 100644 index 0000000..d366fa5 --- /dev/null +++ b/chat/mlx/mlx-community/Qwen3.5-9B-MLX-4bit/model.safetensors.index.json @@ -0,0 +1,1267 @@ +{ + "metadata": { + "total_size": 5950062560 + }, + "weight_map": { + "language_model.lm_head.biases": "model-00002-of-00002.safetensors", + "language_model.lm_head.scales": "model-00002-of-00002.safetensors", + "language_model.lm_head.weight": "model-00002-of-00002.safetensors", + "language_model.model.embed_tokens.biases": "model-00001-of-00002.safetensors", + "language_model.model.embed_tokens.scales": "model-00001-of-00002.safetensors", + "language_model.model.embed_tokens.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.0.input_layernorm.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.0.linear_attn.A_log": "model-00001-of-00002.safetensors", + "language_model.model.layers.0.linear_attn.conv1d.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.0.linear_attn.dt_bias": "model-00001-of-00002.safetensors", + "language_model.model.layers.0.linear_attn.in_proj_a.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.0.linear_attn.in_proj_a.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.0.linear_attn.in_proj_a.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.0.linear_attn.in_proj_b.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.0.linear_attn.in_proj_b.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.0.linear_attn.in_proj_b.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.0.linear_attn.in_proj_qkv.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.0.linear_attn.in_proj_qkv.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.0.linear_attn.in_proj_qkv.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.0.linear_attn.in_proj_z.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.0.linear_attn.in_proj_z.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.0.linear_attn.in_proj_z.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.0.linear_attn.norm.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.0.linear_attn.out_proj.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.0.linear_attn.out_proj.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.0.linear_attn.out_proj.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.0.mlp.down_proj.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.0.mlp.down_proj.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.0.mlp.down_proj.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.0.mlp.gate_proj.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.0.mlp.gate_proj.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.0.mlp.gate_proj.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.0.mlp.up_proj.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.0.mlp.up_proj.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.0.mlp.up_proj.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.0.post_attention_layernorm.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.1.input_layernorm.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.1.linear_attn.A_log": "model-00001-of-00002.safetensors", + "language_model.model.layers.1.linear_attn.conv1d.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.1.linear_attn.dt_bias": "model-00001-of-00002.safetensors", + "language_model.model.layers.1.linear_attn.in_proj_a.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.1.linear_attn.in_proj_a.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.1.linear_attn.in_proj_a.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.1.linear_attn.in_proj_b.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.1.linear_attn.in_proj_b.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.1.linear_attn.in_proj_b.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.1.linear_attn.in_proj_qkv.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.1.linear_attn.in_proj_qkv.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.1.linear_attn.in_proj_qkv.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.1.linear_attn.in_proj_z.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.1.linear_attn.in_proj_z.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.1.linear_attn.in_proj_z.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.1.linear_attn.norm.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.1.linear_attn.out_proj.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.1.linear_attn.out_proj.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.1.linear_attn.out_proj.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.1.mlp.down_proj.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.1.mlp.down_proj.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.1.mlp.down_proj.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.1.mlp.gate_proj.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.1.mlp.gate_proj.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.1.mlp.gate_proj.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.1.mlp.up_proj.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.1.mlp.up_proj.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.1.mlp.up_proj.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.1.post_attention_layernorm.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.10.input_layernorm.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.10.linear_attn.A_log": "model-00001-of-00002.safetensors", + "language_model.model.layers.10.linear_attn.conv1d.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.10.linear_attn.dt_bias": "model-00001-of-00002.safetensors", + "language_model.model.layers.10.linear_attn.in_proj_a.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.10.linear_attn.in_proj_a.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.10.linear_attn.in_proj_a.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.10.linear_attn.in_proj_b.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.10.linear_attn.in_proj_b.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.10.linear_attn.in_proj_b.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.10.linear_attn.in_proj_qkv.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.10.linear_attn.in_proj_qkv.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.10.linear_attn.in_proj_qkv.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.10.linear_attn.in_proj_z.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.10.linear_attn.in_proj_z.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.10.linear_attn.in_proj_z.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.10.linear_attn.norm.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.10.linear_attn.out_proj.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.10.linear_attn.out_proj.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.10.linear_attn.out_proj.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.10.mlp.down_proj.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.10.mlp.down_proj.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.10.mlp.down_proj.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.10.mlp.gate_proj.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.10.mlp.gate_proj.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.10.mlp.gate_proj.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.10.mlp.up_proj.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.10.mlp.up_proj.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.10.mlp.up_proj.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.10.post_attention_layernorm.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.11.input_layernorm.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.11.mlp.down_proj.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.11.mlp.down_proj.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.11.mlp.down_proj.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.11.mlp.gate_proj.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.11.mlp.gate_proj.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.11.mlp.gate_proj.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.11.mlp.up_proj.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.11.mlp.up_proj.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.11.mlp.up_proj.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.11.post_attention_layernorm.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.11.self_attn.k_norm.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.11.self_attn.k_proj.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.11.self_attn.k_proj.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.11.self_attn.k_proj.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.11.self_attn.o_proj.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.11.self_attn.o_proj.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.11.self_attn.o_proj.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.11.self_attn.q_norm.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.11.self_attn.q_proj.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.11.self_attn.q_proj.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.11.self_attn.q_proj.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.11.self_attn.v_proj.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.11.self_attn.v_proj.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.11.self_attn.v_proj.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.12.input_layernorm.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.12.linear_attn.A_log": "model-00001-of-00002.safetensors", + "language_model.model.layers.12.linear_attn.conv1d.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.12.linear_attn.dt_bias": "model-00001-of-00002.safetensors", + "language_model.model.layers.12.linear_attn.in_proj_a.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.12.linear_attn.in_proj_a.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.12.linear_attn.in_proj_a.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.12.linear_attn.in_proj_b.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.12.linear_attn.in_proj_b.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.12.linear_attn.in_proj_b.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.12.linear_attn.in_proj_qkv.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.12.linear_attn.in_proj_qkv.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.12.linear_attn.in_proj_qkv.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.12.linear_attn.in_proj_z.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.12.linear_attn.in_proj_z.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.12.linear_attn.in_proj_z.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.12.linear_attn.norm.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.12.linear_attn.out_proj.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.12.linear_attn.out_proj.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.12.linear_attn.out_proj.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.12.mlp.down_proj.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.12.mlp.down_proj.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.12.mlp.down_proj.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.12.mlp.gate_proj.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.12.mlp.gate_proj.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.12.mlp.gate_proj.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.12.mlp.up_proj.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.12.mlp.up_proj.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.12.mlp.up_proj.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.12.post_attention_layernorm.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.13.input_layernorm.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.13.linear_attn.A_log": "model-00001-of-00002.safetensors", + "language_model.model.layers.13.linear_attn.conv1d.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.13.linear_attn.dt_bias": "model-00001-of-00002.safetensors", + "language_model.model.layers.13.linear_attn.in_proj_a.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.13.linear_attn.in_proj_a.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.13.linear_attn.in_proj_a.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.13.linear_attn.in_proj_b.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.13.linear_attn.in_proj_b.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.13.linear_attn.in_proj_b.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.13.linear_attn.in_proj_qkv.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.13.linear_attn.in_proj_qkv.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.13.linear_attn.in_proj_qkv.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.13.linear_attn.in_proj_z.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.13.linear_attn.in_proj_z.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.13.linear_attn.in_proj_z.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.13.linear_attn.norm.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.13.linear_attn.out_proj.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.13.linear_attn.out_proj.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.13.linear_attn.out_proj.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.13.mlp.down_proj.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.13.mlp.down_proj.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.13.mlp.down_proj.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.13.mlp.gate_proj.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.13.mlp.gate_proj.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.13.mlp.gate_proj.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.13.mlp.up_proj.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.13.mlp.up_proj.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.13.mlp.up_proj.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.13.post_attention_layernorm.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.14.input_layernorm.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.14.linear_attn.A_log": "model-00001-of-00002.safetensors", + "language_model.model.layers.14.linear_attn.conv1d.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.14.linear_attn.dt_bias": "model-00001-of-00002.safetensors", + "language_model.model.layers.14.linear_attn.in_proj_a.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.14.linear_attn.in_proj_a.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.14.linear_attn.in_proj_a.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.14.linear_attn.in_proj_b.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.14.linear_attn.in_proj_b.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.14.linear_attn.in_proj_b.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.14.linear_attn.in_proj_qkv.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.14.linear_attn.in_proj_qkv.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.14.linear_attn.in_proj_qkv.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.14.linear_attn.in_proj_z.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.14.linear_attn.in_proj_z.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.14.linear_attn.in_proj_z.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.14.linear_attn.norm.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.14.linear_attn.out_proj.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.14.linear_attn.out_proj.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.14.linear_attn.out_proj.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.14.mlp.down_proj.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.14.mlp.down_proj.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.14.mlp.down_proj.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.14.mlp.gate_proj.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.14.mlp.gate_proj.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.14.mlp.gate_proj.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.14.mlp.up_proj.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.14.mlp.up_proj.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.14.mlp.up_proj.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.14.post_attention_layernorm.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.15.input_layernorm.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.15.mlp.down_proj.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.15.mlp.down_proj.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.15.mlp.down_proj.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.15.mlp.gate_proj.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.15.mlp.gate_proj.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.15.mlp.gate_proj.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.15.mlp.up_proj.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.15.mlp.up_proj.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.15.mlp.up_proj.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.15.post_attention_layernorm.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.15.self_attn.k_norm.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.15.self_attn.k_proj.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.15.self_attn.k_proj.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.15.self_attn.k_proj.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.15.self_attn.o_proj.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.15.self_attn.o_proj.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.15.self_attn.o_proj.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.15.self_attn.q_norm.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.15.self_attn.q_proj.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.15.self_attn.q_proj.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.15.self_attn.q_proj.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.15.self_attn.v_proj.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.15.self_attn.v_proj.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.15.self_attn.v_proj.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.16.input_layernorm.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.16.linear_attn.A_log": "model-00001-of-00002.safetensors", + "language_model.model.layers.16.linear_attn.conv1d.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.16.linear_attn.dt_bias": "model-00001-of-00002.safetensors", + "language_model.model.layers.16.linear_attn.in_proj_a.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.16.linear_attn.in_proj_a.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.16.linear_attn.in_proj_a.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.16.linear_attn.in_proj_b.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.16.linear_attn.in_proj_b.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.16.linear_attn.in_proj_b.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.16.linear_attn.in_proj_qkv.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.16.linear_attn.in_proj_qkv.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.16.linear_attn.in_proj_qkv.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.16.linear_attn.in_proj_z.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.16.linear_attn.in_proj_z.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.16.linear_attn.in_proj_z.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.16.linear_attn.norm.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.16.linear_attn.out_proj.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.16.linear_attn.out_proj.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.16.linear_attn.out_proj.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.16.mlp.down_proj.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.16.mlp.down_proj.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.16.mlp.down_proj.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.16.mlp.gate_proj.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.16.mlp.gate_proj.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.16.mlp.gate_proj.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.16.mlp.up_proj.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.16.mlp.up_proj.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.16.mlp.up_proj.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.16.post_attention_layernorm.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.17.input_layernorm.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.17.linear_attn.A_log": "model-00001-of-00002.safetensors", + "language_model.model.layers.17.linear_attn.conv1d.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.17.linear_attn.dt_bias": "model-00001-of-00002.safetensors", + "language_model.model.layers.17.linear_attn.in_proj_a.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.17.linear_attn.in_proj_a.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.17.linear_attn.in_proj_a.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.17.linear_attn.in_proj_b.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.17.linear_attn.in_proj_b.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.17.linear_attn.in_proj_b.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.17.linear_attn.in_proj_qkv.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.17.linear_attn.in_proj_qkv.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.17.linear_attn.in_proj_qkv.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.17.linear_attn.in_proj_z.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.17.linear_attn.in_proj_z.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.17.linear_attn.in_proj_z.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.17.linear_attn.norm.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.17.linear_attn.out_proj.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.17.linear_attn.out_proj.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.17.linear_attn.out_proj.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.17.mlp.down_proj.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.17.mlp.down_proj.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.17.mlp.down_proj.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.17.mlp.gate_proj.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.17.mlp.gate_proj.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.17.mlp.gate_proj.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.17.mlp.up_proj.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.17.mlp.up_proj.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.17.mlp.up_proj.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.17.post_attention_layernorm.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.18.input_layernorm.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.18.linear_attn.A_log": "model-00001-of-00002.safetensors", + "language_model.model.layers.18.linear_attn.conv1d.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.18.linear_attn.dt_bias": "model-00001-of-00002.safetensors", + "language_model.model.layers.18.linear_attn.in_proj_a.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.18.linear_attn.in_proj_a.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.18.linear_attn.in_proj_a.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.18.linear_attn.in_proj_b.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.18.linear_attn.in_proj_b.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.18.linear_attn.in_proj_b.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.18.linear_attn.in_proj_qkv.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.18.linear_attn.in_proj_qkv.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.18.linear_attn.in_proj_qkv.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.18.linear_attn.in_proj_z.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.18.linear_attn.in_proj_z.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.18.linear_attn.in_proj_z.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.18.linear_attn.norm.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.18.linear_attn.out_proj.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.18.linear_attn.out_proj.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.18.linear_attn.out_proj.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.18.mlp.down_proj.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.18.mlp.down_proj.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.18.mlp.down_proj.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.18.mlp.gate_proj.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.18.mlp.gate_proj.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.18.mlp.gate_proj.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.18.mlp.up_proj.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.18.mlp.up_proj.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.18.mlp.up_proj.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.18.post_attention_layernorm.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.19.input_layernorm.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.19.mlp.down_proj.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.19.mlp.down_proj.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.19.mlp.down_proj.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.19.mlp.gate_proj.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.19.mlp.gate_proj.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.19.mlp.gate_proj.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.19.mlp.up_proj.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.19.mlp.up_proj.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.19.mlp.up_proj.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.19.post_attention_layernorm.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.19.self_attn.k_norm.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.19.self_attn.k_proj.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.19.self_attn.k_proj.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.19.self_attn.k_proj.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.19.self_attn.o_proj.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.19.self_attn.o_proj.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.19.self_attn.o_proj.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.19.self_attn.q_norm.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.19.self_attn.q_proj.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.19.self_attn.q_proj.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.19.self_attn.q_proj.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.19.self_attn.v_proj.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.19.self_attn.v_proj.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.19.self_attn.v_proj.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.2.input_layernorm.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.2.linear_attn.A_log": "model-00001-of-00002.safetensors", + "language_model.model.layers.2.linear_attn.conv1d.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.2.linear_attn.dt_bias": "model-00001-of-00002.safetensors", + "language_model.model.layers.2.linear_attn.in_proj_a.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.2.linear_attn.in_proj_a.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.2.linear_attn.in_proj_a.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.2.linear_attn.in_proj_b.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.2.linear_attn.in_proj_b.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.2.linear_attn.in_proj_b.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.2.linear_attn.in_proj_qkv.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.2.linear_attn.in_proj_qkv.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.2.linear_attn.in_proj_qkv.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.2.linear_attn.in_proj_z.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.2.linear_attn.in_proj_z.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.2.linear_attn.in_proj_z.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.2.linear_attn.norm.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.2.linear_attn.out_proj.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.2.linear_attn.out_proj.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.2.linear_attn.out_proj.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.2.mlp.down_proj.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.2.mlp.down_proj.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.2.mlp.down_proj.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.2.mlp.gate_proj.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.2.mlp.gate_proj.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.2.mlp.gate_proj.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.2.mlp.up_proj.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.2.mlp.up_proj.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.2.mlp.up_proj.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.2.post_attention_layernorm.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.20.input_layernorm.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.20.linear_attn.A_log": "model-00001-of-00002.safetensors", + "language_model.model.layers.20.linear_attn.conv1d.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.20.linear_attn.dt_bias": "model-00001-of-00002.safetensors", + "language_model.model.layers.20.linear_attn.in_proj_a.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.20.linear_attn.in_proj_a.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.20.linear_attn.in_proj_a.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.20.linear_attn.in_proj_b.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.20.linear_attn.in_proj_b.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.20.linear_attn.in_proj_b.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.20.linear_attn.in_proj_qkv.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.20.linear_attn.in_proj_qkv.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.20.linear_attn.in_proj_qkv.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.20.linear_attn.in_proj_z.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.20.linear_attn.in_proj_z.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.20.linear_attn.in_proj_z.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.20.linear_attn.norm.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.20.linear_attn.out_proj.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.20.linear_attn.out_proj.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.20.linear_attn.out_proj.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.20.mlp.down_proj.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.20.mlp.down_proj.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.20.mlp.down_proj.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.20.mlp.gate_proj.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.20.mlp.gate_proj.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.20.mlp.gate_proj.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.20.mlp.up_proj.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.20.mlp.up_proj.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.20.mlp.up_proj.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.20.post_attention_layernorm.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.21.input_layernorm.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.21.linear_attn.A_log": "model-00001-of-00002.safetensors", + "language_model.model.layers.21.linear_attn.conv1d.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.21.linear_attn.dt_bias": "model-00001-of-00002.safetensors", + "language_model.model.layers.21.linear_attn.in_proj_a.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.21.linear_attn.in_proj_a.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.21.linear_attn.in_proj_a.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.21.linear_attn.in_proj_b.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.21.linear_attn.in_proj_b.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.21.linear_attn.in_proj_b.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.21.linear_attn.in_proj_qkv.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.21.linear_attn.in_proj_qkv.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.21.linear_attn.in_proj_qkv.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.21.linear_attn.in_proj_z.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.21.linear_attn.in_proj_z.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.21.linear_attn.in_proj_z.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.21.linear_attn.norm.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.21.linear_attn.out_proj.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.21.linear_attn.out_proj.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.21.linear_attn.out_proj.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.21.mlp.down_proj.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.21.mlp.down_proj.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.21.mlp.down_proj.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.21.mlp.gate_proj.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.21.mlp.gate_proj.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.21.mlp.gate_proj.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.21.mlp.up_proj.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.21.mlp.up_proj.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.21.mlp.up_proj.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.21.post_attention_layernorm.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.22.input_layernorm.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.22.linear_attn.A_log": "model-00001-of-00002.safetensors", + "language_model.model.layers.22.linear_attn.conv1d.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.22.linear_attn.dt_bias": "model-00001-of-00002.safetensors", + "language_model.model.layers.22.linear_attn.in_proj_a.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.22.linear_attn.in_proj_a.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.22.linear_attn.in_proj_a.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.22.linear_attn.in_proj_b.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.22.linear_attn.in_proj_b.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.22.linear_attn.in_proj_b.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.22.linear_attn.in_proj_qkv.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.22.linear_attn.in_proj_qkv.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.22.linear_attn.in_proj_qkv.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.22.linear_attn.in_proj_z.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.22.linear_attn.in_proj_z.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.22.linear_attn.in_proj_z.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.22.linear_attn.norm.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.22.linear_attn.out_proj.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.22.linear_attn.out_proj.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.22.linear_attn.out_proj.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.22.mlp.down_proj.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.22.mlp.down_proj.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.22.mlp.down_proj.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.22.mlp.gate_proj.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.22.mlp.gate_proj.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.22.mlp.gate_proj.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.22.mlp.up_proj.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.22.mlp.up_proj.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.22.mlp.up_proj.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.22.post_attention_layernorm.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.23.input_layernorm.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.23.mlp.down_proj.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.23.mlp.down_proj.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.23.mlp.down_proj.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.23.mlp.gate_proj.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.23.mlp.gate_proj.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.23.mlp.gate_proj.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.23.mlp.up_proj.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.23.mlp.up_proj.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.23.mlp.up_proj.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.23.post_attention_layernorm.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.23.self_attn.k_norm.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.23.self_attn.k_proj.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.23.self_attn.k_proj.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.23.self_attn.k_proj.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.23.self_attn.o_proj.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.23.self_attn.o_proj.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.23.self_attn.o_proj.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.23.self_attn.q_norm.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.23.self_attn.q_proj.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.23.self_attn.q_proj.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.23.self_attn.q_proj.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.23.self_attn.v_proj.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.23.self_attn.v_proj.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.23.self_attn.v_proj.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.24.input_layernorm.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.24.linear_attn.A_log": "model-00001-of-00002.safetensors", + "language_model.model.layers.24.linear_attn.conv1d.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.24.linear_attn.dt_bias": "model-00001-of-00002.safetensors", + "language_model.model.layers.24.linear_attn.in_proj_a.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.24.linear_attn.in_proj_a.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.24.linear_attn.in_proj_a.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.24.linear_attn.in_proj_b.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.24.linear_attn.in_proj_b.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.24.linear_attn.in_proj_b.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.24.linear_attn.in_proj_qkv.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.24.linear_attn.in_proj_qkv.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.24.linear_attn.in_proj_qkv.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.24.linear_attn.in_proj_z.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.24.linear_attn.in_proj_z.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.24.linear_attn.in_proj_z.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.24.linear_attn.norm.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.24.linear_attn.out_proj.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.24.linear_attn.out_proj.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.24.linear_attn.out_proj.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.24.mlp.down_proj.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.24.mlp.down_proj.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.24.mlp.down_proj.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.24.mlp.gate_proj.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.24.mlp.gate_proj.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.24.mlp.gate_proj.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.24.mlp.up_proj.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.24.mlp.up_proj.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.24.mlp.up_proj.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.24.post_attention_layernorm.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.25.input_layernorm.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.25.linear_attn.A_log": "model-00001-of-00002.safetensors", + "language_model.model.layers.25.linear_attn.conv1d.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.25.linear_attn.dt_bias": "model-00001-of-00002.safetensors", + "language_model.model.layers.25.linear_attn.in_proj_a.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.25.linear_attn.in_proj_a.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.25.linear_attn.in_proj_a.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.25.linear_attn.in_proj_b.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.25.linear_attn.in_proj_b.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.25.linear_attn.in_proj_b.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.25.linear_attn.in_proj_qkv.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.25.linear_attn.in_proj_qkv.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.25.linear_attn.in_proj_qkv.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.25.linear_attn.in_proj_z.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.25.linear_attn.in_proj_z.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.25.linear_attn.in_proj_z.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.25.linear_attn.norm.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.25.linear_attn.out_proj.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.25.linear_attn.out_proj.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.25.linear_attn.out_proj.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.25.mlp.down_proj.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.25.mlp.down_proj.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.25.mlp.down_proj.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.25.mlp.gate_proj.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.25.mlp.gate_proj.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.25.mlp.gate_proj.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.25.mlp.up_proj.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.25.mlp.up_proj.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.25.mlp.up_proj.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.25.post_attention_layernorm.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.26.input_layernorm.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.26.linear_attn.A_log": "model-00001-of-00002.safetensors", + "language_model.model.layers.26.linear_attn.conv1d.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.26.linear_attn.dt_bias": "model-00001-of-00002.safetensors", + "language_model.model.layers.26.linear_attn.in_proj_a.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.26.linear_attn.in_proj_a.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.26.linear_attn.in_proj_a.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.26.linear_attn.in_proj_b.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.26.linear_attn.in_proj_b.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.26.linear_attn.in_proj_b.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.26.linear_attn.in_proj_qkv.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.26.linear_attn.in_proj_qkv.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.26.linear_attn.in_proj_qkv.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.26.linear_attn.in_proj_z.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.26.linear_attn.in_proj_z.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.26.linear_attn.in_proj_z.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.26.linear_attn.norm.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.26.linear_attn.out_proj.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.26.linear_attn.out_proj.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.26.linear_attn.out_proj.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.26.mlp.down_proj.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.26.mlp.down_proj.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.26.mlp.down_proj.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.26.mlp.gate_proj.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.26.mlp.gate_proj.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.26.mlp.gate_proj.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.26.mlp.up_proj.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.26.mlp.up_proj.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.26.mlp.up_proj.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.26.post_attention_layernorm.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.27.input_layernorm.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.27.mlp.down_proj.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.27.mlp.down_proj.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.27.mlp.down_proj.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.27.mlp.gate_proj.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.27.mlp.gate_proj.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.27.mlp.gate_proj.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.27.mlp.up_proj.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.27.mlp.up_proj.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.27.mlp.up_proj.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.27.post_attention_layernorm.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.27.self_attn.k_norm.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.27.self_attn.k_proj.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.27.self_attn.k_proj.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.27.self_attn.k_proj.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.27.self_attn.o_proj.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.27.self_attn.o_proj.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.27.self_attn.o_proj.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.27.self_attn.q_norm.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.27.self_attn.q_proj.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.27.self_attn.q_proj.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.27.self_attn.q_proj.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.27.self_attn.v_proj.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.27.self_attn.v_proj.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.27.self_attn.v_proj.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.28.input_layernorm.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.28.linear_attn.A_log": "model-00001-of-00002.safetensors", + "language_model.model.layers.28.linear_attn.conv1d.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.28.linear_attn.dt_bias": "model-00001-of-00002.safetensors", + "language_model.model.layers.28.linear_attn.in_proj_a.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.28.linear_attn.in_proj_a.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.28.linear_attn.in_proj_a.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.28.linear_attn.in_proj_b.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.28.linear_attn.in_proj_b.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.28.linear_attn.in_proj_b.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.28.linear_attn.in_proj_qkv.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.28.linear_attn.in_proj_qkv.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.28.linear_attn.in_proj_qkv.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.28.linear_attn.in_proj_z.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.28.linear_attn.in_proj_z.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.28.linear_attn.in_proj_z.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.28.linear_attn.norm.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.28.linear_attn.out_proj.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.28.linear_attn.out_proj.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.28.linear_attn.out_proj.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.28.mlp.down_proj.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.28.mlp.down_proj.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.28.mlp.down_proj.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.28.mlp.gate_proj.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.28.mlp.gate_proj.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.28.mlp.gate_proj.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.28.mlp.up_proj.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.28.mlp.up_proj.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.28.mlp.up_proj.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.28.post_attention_layernorm.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.29.input_layernorm.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.29.linear_attn.A_log": "model-00001-of-00002.safetensors", + "language_model.model.layers.29.linear_attn.conv1d.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.29.linear_attn.dt_bias": "model-00001-of-00002.safetensors", + "language_model.model.layers.29.linear_attn.in_proj_a.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.29.linear_attn.in_proj_a.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.29.linear_attn.in_proj_a.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.29.linear_attn.in_proj_b.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.29.linear_attn.in_proj_b.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.29.linear_attn.in_proj_b.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.29.linear_attn.in_proj_qkv.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.29.linear_attn.in_proj_qkv.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.29.linear_attn.in_proj_qkv.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.29.linear_attn.in_proj_z.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.29.linear_attn.in_proj_z.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.29.linear_attn.in_proj_z.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.29.linear_attn.norm.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.29.linear_attn.out_proj.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.29.linear_attn.out_proj.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.29.linear_attn.out_proj.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.29.mlp.down_proj.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.29.mlp.down_proj.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.29.mlp.down_proj.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.29.mlp.gate_proj.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.29.mlp.gate_proj.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.29.mlp.gate_proj.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.29.mlp.up_proj.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.29.mlp.up_proj.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.29.mlp.up_proj.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.29.post_attention_layernorm.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.3.input_layernorm.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.3.mlp.down_proj.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.3.mlp.down_proj.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.3.mlp.down_proj.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.3.mlp.gate_proj.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.3.mlp.gate_proj.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.3.mlp.gate_proj.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.3.mlp.up_proj.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.3.mlp.up_proj.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.3.mlp.up_proj.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.3.post_attention_layernorm.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.3.self_attn.k_norm.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.3.self_attn.k_proj.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.3.self_attn.k_proj.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.3.self_attn.k_proj.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.3.self_attn.o_proj.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.3.self_attn.o_proj.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.3.self_attn.o_proj.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.3.self_attn.q_norm.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.3.self_attn.q_proj.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.3.self_attn.q_proj.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.3.self_attn.q_proj.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.3.self_attn.v_proj.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.3.self_attn.v_proj.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.3.self_attn.v_proj.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.30.input_layernorm.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.30.linear_attn.A_log": "model-00001-of-00002.safetensors", + "language_model.model.layers.30.linear_attn.conv1d.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.30.linear_attn.dt_bias": "model-00001-of-00002.safetensors", + "language_model.model.layers.30.linear_attn.in_proj_a.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.30.linear_attn.in_proj_a.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.30.linear_attn.in_proj_a.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.30.linear_attn.in_proj_b.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.30.linear_attn.in_proj_b.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.30.linear_attn.in_proj_b.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.30.linear_attn.in_proj_qkv.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.30.linear_attn.in_proj_qkv.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.30.linear_attn.in_proj_qkv.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.30.linear_attn.in_proj_z.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.30.linear_attn.in_proj_z.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.30.linear_attn.in_proj_z.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.30.linear_attn.norm.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.30.linear_attn.out_proj.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.30.linear_attn.out_proj.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.30.linear_attn.out_proj.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.30.mlp.down_proj.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.30.mlp.down_proj.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.30.mlp.down_proj.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.30.mlp.gate_proj.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.30.mlp.gate_proj.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.30.mlp.gate_proj.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.30.mlp.up_proj.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.30.mlp.up_proj.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.30.mlp.up_proj.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.30.post_attention_layernorm.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.31.input_layernorm.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.31.mlp.down_proj.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.31.mlp.down_proj.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.31.mlp.down_proj.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.31.mlp.gate_proj.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.31.mlp.gate_proj.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.31.mlp.gate_proj.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.31.mlp.up_proj.biases": "model-00002-of-00002.safetensors", + "language_model.model.layers.31.mlp.up_proj.scales": "model-00002-of-00002.safetensors", + "language_model.model.layers.31.mlp.up_proj.weight": "model-00002-of-00002.safetensors", + "language_model.model.layers.31.post_attention_layernorm.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.31.self_attn.k_norm.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.31.self_attn.k_proj.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.31.self_attn.k_proj.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.31.self_attn.k_proj.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.31.self_attn.o_proj.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.31.self_attn.o_proj.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.31.self_attn.o_proj.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.31.self_attn.q_norm.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.31.self_attn.q_proj.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.31.self_attn.q_proj.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.31.self_attn.q_proj.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.31.self_attn.v_proj.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.31.self_attn.v_proj.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.31.self_attn.v_proj.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.4.input_layernorm.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.4.linear_attn.A_log": "model-00001-of-00002.safetensors", + "language_model.model.layers.4.linear_attn.conv1d.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.4.linear_attn.dt_bias": "model-00001-of-00002.safetensors", + "language_model.model.layers.4.linear_attn.in_proj_a.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.4.linear_attn.in_proj_a.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.4.linear_attn.in_proj_a.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.4.linear_attn.in_proj_b.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.4.linear_attn.in_proj_b.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.4.linear_attn.in_proj_b.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.4.linear_attn.in_proj_qkv.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.4.linear_attn.in_proj_qkv.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.4.linear_attn.in_proj_qkv.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.4.linear_attn.in_proj_z.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.4.linear_attn.in_proj_z.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.4.linear_attn.in_proj_z.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.4.linear_attn.norm.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.4.linear_attn.out_proj.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.4.linear_attn.out_proj.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.4.linear_attn.out_proj.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.4.mlp.down_proj.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.4.mlp.down_proj.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.4.mlp.down_proj.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.4.mlp.gate_proj.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.4.mlp.gate_proj.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.4.mlp.gate_proj.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.4.mlp.up_proj.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.4.mlp.up_proj.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.4.mlp.up_proj.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.4.post_attention_layernorm.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.5.input_layernorm.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.5.linear_attn.A_log": "model-00001-of-00002.safetensors", + "language_model.model.layers.5.linear_attn.conv1d.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.5.linear_attn.dt_bias": "model-00001-of-00002.safetensors", + "language_model.model.layers.5.linear_attn.in_proj_a.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.5.linear_attn.in_proj_a.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.5.linear_attn.in_proj_a.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.5.linear_attn.in_proj_b.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.5.linear_attn.in_proj_b.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.5.linear_attn.in_proj_b.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.5.linear_attn.in_proj_qkv.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.5.linear_attn.in_proj_qkv.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.5.linear_attn.in_proj_qkv.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.5.linear_attn.in_proj_z.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.5.linear_attn.in_proj_z.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.5.linear_attn.in_proj_z.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.5.linear_attn.norm.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.5.linear_attn.out_proj.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.5.linear_attn.out_proj.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.5.linear_attn.out_proj.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.5.mlp.down_proj.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.5.mlp.down_proj.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.5.mlp.down_proj.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.5.mlp.gate_proj.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.5.mlp.gate_proj.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.5.mlp.gate_proj.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.5.mlp.up_proj.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.5.mlp.up_proj.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.5.mlp.up_proj.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.5.post_attention_layernorm.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.6.input_layernorm.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.6.linear_attn.A_log": "model-00001-of-00002.safetensors", + "language_model.model.layers.6.linear_attn.conv1d.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.6.linear_attn.dt_bias": "model-00001-of-00002.safetensors", + "language_model.model.layers.6.linear_attn.in_proj_a.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.6.linear_attn.in_proj_a.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.6.linear_attn.in_proj_a.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.6.linear_attn.in_proj_b.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.6.linear_attn.in_proj_b.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.6.linear_attn.in_proj_b.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.6.linear_attn.in_proj_qkv.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.6.linear_attn.in_proj_qkv.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.6.linear_attn.in_proj_qkv.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.6.linear_attn.in_proj_z.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.6.linear_attn.in_proj_z.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.6.linear_attn.in_proj_z.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.6.linear_attn.norm.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.6.linear_attn.out_proj.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.6.linear_attn.out_proj.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.6.linear_attn.out_proj.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.6.mlp.down_proj.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.6.mlp.down_proj.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.6.mlp.down_proj.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.6.mlp.gate_proj.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.6.mlp.gate_proj.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.6.mlp.gate_proj.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.6.mlp.up_proj.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.6.mlp.up_proj.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.6.mlp.up_proj.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.6.post_attention_layernorm.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.7.input_layernorm.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.7.mlp.down_proj.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.7.mlp.down_proj.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.7.mlp.down_proj.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.7.mlp.gate_proj.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.7.mlp.gate_proj.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.7.mlp.gate_proj.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.7.mlp.up_proj.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.7.mlp.up_proj.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.7.mlp.up_proj.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.7.post_attention_layernorm.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.7.self_attn.k_norm.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.7.self_attn.k_proj.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.7.self_attn.k_proj.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.7.self_attn.k_proj.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.7.self_attn.o_proj.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.7.self_attn.o_proj.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.7.self_attn.o_proj.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.7.self_attn.q_norm.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.7.self_attn.q_proj.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.7.self_attn.q_proj.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.7.self_attn.q_proj.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.7.self_attn.v_proj.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.7.self_attn.v_proj.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.7.self_attn.v_proj.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.8.input_layernorm.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.8.linear_attn.A_log": "model-00001-of-00002.safetensors", + "language_model.model.layers.8.linear_attn.conv1d.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.8.linear_attn.dt_bias": "model-00001-of-00002.safetensors", + "language_model.model.layers.8.linear_attn.in_proj_a.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.8.linear_attn.in_proj_a.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.8.linear_attn.in_proj_a.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.8.linear_attn.in_proj_b.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.8.linear_attn.in_proj_b.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.8.linear_attn.in_proj_b.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.8.linear_attn.in_proj_qkv.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.8.linear_attn.in_proj_qkv.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.8.linear_attn.in_proj_qkv.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.8.linear_attn.in_proj_z.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.8.linear_attn.in_proj_z.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.8.linear_attn.in_proj_z.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.8.linear_attn.norm.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.8.linear_attn.out_proj.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.8.linear_attn.out_proj.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.8.linear_attn.out_proj.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.8.mlp.down_proj.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.8.mlp.down_proj.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.8.mlp.down_proj.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.8.mlp.gate_proj.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.8.mlp.gate_proj.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.8.mlp.gate_proj.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.8.mlp.up_proj.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.8.mlp.up_proj.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.8.mlp.up_proj.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.8.post_attention_layernorm.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.9.input_layernorm.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.9.linear_attn.A_log": "model-00001-of-00002.safetensors", + "language_model.model.layers.9.linear_attn.conv1d.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.9.linear_attn.dt_bias": "model-00001-of-00002.safetensors", + "language_model.model.layers.9.linear_attn.in_proj_a.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.9.linear_attn.in_proj_a.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.9.linear_attn.in_proj_a.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.9.linear_attn.in_proj_b.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.9.linear_attn.in_proj_b.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.9.linear_attn.in_proj_b.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.9.linear_attn.in_proj_qkv.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.9.linear_attn.in_proj_qkv.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.9.linear_attn.in_proj_qkv.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.9.linear_attn.in_proj_z.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.9.linear_attn.in_proj_z.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.9.linear_attn.in_proj_z.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.9.linear_attn.norm.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.9.linear_attn.out_proj.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.9.linear_attn.out_proj.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.9.linear_attn.out_proj.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.9.mlp.down_proj.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.9.mlp.down_proj.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.9.mlp.down_proj.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.9.mlp.gate_proj.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.9.mlp.gate_proj.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.9.mlp.gate_proj.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.9.mlp.up_proj.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.9.mlp.up_proj.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.9.mlp.up_proj.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.9.post_attention_layernorm.weight": "model-00001-of-00002.safetensors", + "language_model.model.norm.weight": "model-00002-of-00002.safetensors", + "vision_tower.blocks.0.attn.proj.bias": "model-00001-of-00002.safetensors", + "vision_tower.blocks.0.attn.proj.weight": "model-00001-of-00002.safetensors", + "vision_tower.blocks.0.attn.qkv.bias": "model-00001-of-00002.safetensors", + "vision_tower.blocks.0.attn.qkv.weight": "model-00001-of-00002.safetensors", + "vision_tower.blocks.0.mlp.linear_fc1.bias": "model-00001-of-00002.safetensors", + "vision_tower.blocks.0.mlp.linear_fc1.weight": "model-00001-of-00002.safetensors", + "vision_tower.blocks.0.mlp.linear_fc2.bias": "model-00001-of-00002.safetensors", + "vision_tower.blocks.0.mlp.linear_fc2.weight": "model-00001-of-00002.safetensors", + "vision_tower.blocks.0.norm1.bias": "model-00001-of-00002.safetensors", + "vision_tower.blocks.0.norm1.weight": "model-00001-of-00002.safetensors", + "vision_tower.blocks.0.norm2.bias": "model-00001-of-00002.safetensors", + "vision_tower.blocks.0.norm2.weight": "model-00001-of-00002.safetensors", + "vision_tower.blocks.1.attn.proj.bias": "model-00001-of-00002.safetensors", + "vision_tower.blocks.1.attn.proj.weight": "model-00001-of-00002.safetensors", + "vision_tower.blocks.1.attn.qkv.bias": "model-00001-of-00002.safetensors", + "vision_tower.blocks.1.attn.qkv.weight": "model-00001-of-00002.safetensors", + "vision_tower.blocks.1.mlp.linear_fc1.bias": "model-00001-of-00002.safetensors", + "vision_tower.blocks.1.mlp.linear_fc1.weight": "model-00001-of-00002.safetensors", + "vision_tower.blocks.1.mlp.linear_fc2.bias": "model-00001-of-00002.safetensors", + "vision_tower.blocks.1.mlp.linear_fc2.weight": "model-00001-of-00002.safetensors", + "vision_tower.blocks.1.norm1.bias": "model-00001-of-00002.safetensors", + "vision_tower.blocks.1.norm1.weight": "model-00001-of-00002.safetensors", + "vision_tower.blocks.1.norm2.bias": "model-00001-of-00002.safetensors", + "vision_tower.blocks.1.norm2.weight": "model-00001-of-00002.safetensors", + "vision_tower.blocks.10.attn.proj.bias": "model-00001-of-00002.safetensors", + "vision_tower.blocks.10.attn.proj.weight": "model-00001-of-00002.safetensors", + "vision_tower.blocks.10.attn.qkv.bias": "model-00001-of-00002.safetensors", + "vision_tower.blocks.10.attn.qkv.weight": "model-00001-of-00002.safetensors", + "vision_tower.blocks.10.mlp.linear_fc1.bias": "model-00001-of-00002.safetensors", + "vision_tower.blocks.10.mlp.linear_fc1.weight": "model-00001-of-00002.safetensors", + "vision_tower.blocks.10.mlp.linear_fc2.bias": "model-00001-of-00002.safetensors", + "vision_tower.blocks.10.mlp.linear_fc2.weight": "model-00001-of-00002.safetensors", + "vision_tower.blocks.10.norm1.bias": "model-00001-of-00002.safetensors", + "vision_tower.blocks.10.norm1.weight": "model-00001-of-00002.safetensors", + "vision_tower.blocks.10.norm2.bias": "model-00001-of-00002.safetensors", + "vision_tower.blocks.10.norm2.weight": "model-00001-of-00002.safetensors", + "vision_tower.blocks.11.attn.proj.bias": "model-00001-of-00002.safetensors", + "vision_tower.blocks.11.attn.proj.weight": "model-00001-of-00002.safetensors", + "vision_tower.blocks.11.attn.qkv.bias": "model-00001-of-00002.safetensors", + "vision_tower.blocks.11.attn.qkv.weight": "model-00001-of-00002.safetensors", + "vision_tower.blocks.11.mlp.linear_fc1.bias": "model-00001-of-00002.safetensors", + "vision_tower.blocks.11.mlp.linear_fc1.weight": "model-00001-of-00002.safetensors", + "vision_tower.blocks.11.mlp.linear_fc2.bias": "model-00001-of-00002.safetensors", + "vision_tower.blocks.11.mlp.linear_fc2.weight": "model-00001-of-00002.safetensors", + "vision_tower.blocks.11.norm1.bias": "model-00001-of-00002.safetensors", + "vision_tower.blocks.11.norm1.weight": "model-00001-of-00002.safetensors", + "vision_tower.blocks.11.norm2.bias": "model-00001-of-00002.safetensors", + "vision_tower.blocks.11.norm2.weight": "model-00001-of-00002.safetensors", + "vision_tower.blocks.12.attn.proj.bias": "model-00001-of-00002.safetensors", + "vision_tower.blocks.12.attn.proj.weight": "model-00001-of-00002.safetensors", + "vision_tower.blocks.12.attn.qkv.bias": "model-00001-of-00002.safetensors", + "vision_tower.blocks.12.attn.qkv.weight": "model-00001-of-00002.safetensors", + "vision_tower.blocks.12.mlp.linear_fc1.bias": "model-00001-of-00002.safetensors", + "vision_tower.blocks.12.mlp.linear_fc1.weight": "model-00001-of-00002.safetensors", + "vision_tower.blocks.12.mlp.linear_fc2.bias": "model-00001-of-00002.safetensors", + "vision_tower.blocks.12.mlp.linear_fc2.weight": "model-00001-of-00002.safetensors", + "vision_tower.blocks.12.norm1.bias": "model-00001-of-00002.safetensors", + "vision_tower.blocks.12.norm1.weight": "model-00001-of-00002.safetensors", + "vision_tower.blocks.12.norm2.bias": "model-00001-of-00002.safetensors", + "vision_tower.blocks.12.norm2.weight": "model-00001-of-00002.safetensors", + "vision_tower.blocks.13.attn.proj.bias": "model-00001-of-00002.safetensors", + "vision_tower.blocks.13.attn.proj.weight": "model-00001-of-00002.safetensors", + "vision_tower.blocks.13.attn.qkv.bias": "model-00001-of-00002.safetensors", + "vision_tower.blocks.13.attn.qkv.weight": "model-00001-of-00002.safetensors", + "vision_tower.blocks.13.mlp.linear_fc1.bias": "model-00001-of-00002.safetensors", + "vision_tower.blocks.13.mlp.linear_fc1.weight": "model-00001-of-00002.safetensors", + "vision_tower.blocks.13.mlp.linear_fc2.bias": "model-00001-of-00002.safetensors", + "vision_tower.blocks.13.mlp.linear_fc2.weight": "model-00001-of-00002.safetensors", + "vision_tower.blocks.13.norm1.bias": "model-00001-of-00002.safetensors", + "vision_tower.blocks.13.norm1.weight": "model-00001-of-00002.safetensors", + "vision_tower.blocks.13.norm2.bias": "model-00001-of-00002.safetensors", + "vision_tower.blocks.13.norm2.weight": "model-00001-of-00002.safetensors", + "vision_tower.blocks.14.attn.proj.bias": "model-00001-of-00002.safetensors", + "vision_tower.blocks.14.attn.proj.weight": "model-00001-of-00002.safetensors", + "vision_tower.blocks.14.attn.qkv.bias": "model-00001-of-00002.safetensors", + "vision_tower.blocks.14.attn.qkv.weight": "model-00001-of-00002.safetensors", + "vision_tower.blocks.14.mlp.linear_fc1.bias": "model-00001-of-00002.safetensors", + "vision_tower.blocks.14.mlp.linear_fc1.weight": "model-00001-of-00002.safetensors", + "vision_tower.blocks.14.mlp.linear_fc2.bias": "model-00001-of-00002.safetensors", + "vision_tower.blocks.14.mlp.linear_fc2.weight": "model-00001-of-00002.safetensors", + "vision_tower.blocks.14.norm1.bias": "model-00001-of-00002.safetensors", + "vision_tower.blocks.14.norm1.weight": "model-00001-of-00002.safetensors", + "vision_tower.blocks.14.norm2.bias": "model-00001-of-00002.safetensors", + "vision_tower.blocks.14.norm2.weight": "model-00001-of-00002.safetensors", + "vision_tower.blocks.15.attn.proj.bias": "model-00001-of-00002.safetensors", + "vision_tower.blocks.15.attn.proj.weight": "model-00001-of-00002.safetensors", + "vision_tower.blocks.15.attn.qkv.bias": "model-00001-of-00002.safetensors", + "vision_tower.blocks.15.attn.qkv.weight": "model-00001-of-00002.safetensors", + "vision_tower.blocks.15.mlp.linear_fc1.bias": "model-00001-of-00002.safetensors", + "vision_tower.blocks.15.mlp.linear_fc1.weight": "model-00001-of-00002.safetensors", + "vision_tower.blocks.15.mlp.linear_fc2.bias": "model-00001-of-00002.safetensors", + "vision_tower.blocks.15.mlp.linear_fc2.weight": "model-00001-of-00002.safetensors", + "vision_tower.blocks.15.norm1.bias": "model-00001-of-00002.safetensors", + "vision_tower.blocks.15.norm1.weight": "model-00001-of-00002.safetensors", + "vision_tower.blocks.15.norm2.bias": "model-00001-of-00002.safetensors", + "vision_tower.blocks.15.norm2.weight": "model-00001-of-00002.safetensors", + "vision_tower.blocks.16.attn.proj.bias": "model-00001-of-00002.safetensors", + "vision_tower.blocks.16.attn.proj.weight": "model-00001-of-00002.safetensors", + "vision_tower.blocks.16.attn.qkv.bias": "model-00001-of-00002.safetensors", + "vision_tower.blocks.16.attn.qkv.weight": "model-00001-of-00002.safetensors", + "vision_tower.blocks.16.mlp.linear_fc1.bias": "model-00001-of-00002.safetensors", + "vision_tower.blocks.16.mlp.linear_fc1.weight": "model-00001-of-00002.safetensors", + "vision_tower.blocks.16.mlp.linear_fc2.bias": "model-00001-of-00002.safetensors", + "vision_tower.blocks.16.mlp.linear_fc2.weight": "model-00001-of-00002.safetensors", + "vision_tower.blocks.16.norm1.bias": "model-00001-of-00002.safetensors", + "vision_tower.blocks.16.norm1.weight": "model-00001-of-00002.safetensors", + "vision_tower.blocks.16.norm2.bias": "model-00001-of-00002.safetensors", + "vision_tower.blocks.16.norm2.weight": "model-00001-of-00002.safetensors", + "vision_tower.blocks.17.attn.proj.bias": "model-00001-of-00002.safetensors", + "vision_tower.blocks.17.attn.proj.weight": "model-00001-of-00002.safetensors", + "vision_tower.blocks.17.attn.qkv.bias": "model-00001-of-00002.safetensors", + "vision_tower.blocks.17.attn.qkv.weight": "model-00001-of-00002.safetensors", + "vision_tower.blocks.17.mlp.linear_fc1.bias": "model-00001-of-00002.safetensors", + "vision_tower.blocks.17.mlp.linear_fc1.weight": "model-00001-of-00002.safetensors", + "vision_tower.blocks.17.mlp.linear_fc2.bias": "model-00001-of-00002.safetensors", + "vision_tower.blocks.17.mlp.linear_fc2.weight": "model-00001-of-00002.safetensors", + "vision_tower.blocks.17.norm1.bias": "model-00001-of-00002.safetensors", + "vision_tower.blocks.17.norm1.weight": "model-00001-of-00002.safetensors", + "vision_tower.blocks.17.norm2.bias": "model-00001-of-00002.safetensors", + "vision_tower.blocks.17.norm2.weight": "model-00001-of-00002.safetensors", + "vision_tower.blocks.18.attn.proj.bias": "model-00001-of-00002.safetensors", + "vision_tower.blocks.18.attn.proj.weight": "model-00001-of-00002.safetensors", + "vision_tower.blocks.18.attn.qkv.bias": "model-00001-of-00002.safetensors", + "vision_tower.blocks.18.attn.qkv.weight": "model-00001-of-00002.safetensors", + "vision_tower.blocks.18.mlp.linear_fc1.bias": "model-00001-of-00002.safetensors", + "vision_tower.blocks.18.mlp.linear_fc1.weight": "model-00001-of-00002.safetensors", + "vision_tower.blocks.18.mlp.linear_fc2.bias": "model-00001-of-00002.safetensors", + "vision_tower.blocks.18.mlp.linear_fc2.weight": "model-00001-of-00002.safetensors", + "vision_tower.blocks.18.norm1.bias": "model-00001-of-00002.safetensors", + "vision_tower.blocks.18.norm1.weight": "model-00001-of-00002.safetensors", + "vision_tower.blocks.18.norm2.bias": "model-00001-of-00002.safetensors", + "vision_tower.blocks.18.norm2.weight": "model-00001-of-00002.safetensors", + "vision_tower.blocks.19.attn.proj.bias": "model-00001-of-00002.safetensors", + "vision_tower.blocks.19.attn.proj.weight": "model-00001-of-00002.safetensors", + "vision_tower.blocks.19.attn.qkv.bias": "model-00001-of-00002.safetensors", + "vision_tower.blocks.19.attn.qkv.weight": "model-00001-of-00002.safetensors", + "vision_tower.blocks.19.mlp.linear_fc1.bias": "model-00001-of-00002.safetensors", + "vision_tower.blocks.19.mlp.linear_fc1.weight": "model-00001-of-00002.safetensors", + "vision_tower.blocks.19.mlp.linear_fc2.bias": "model-00001-of-00002.safetensors", + "vision_tower.blocks.19.mlp.linear_fc2.weight": "model-00001-of-00002.safetensors", + "vision_tower.blocks.19.norm1.bias": "model-00001-of-00002.safetensors", + "vision_tower.blocks.19.norm1.weight": "model-00001-of-00002.safetensors", + "vision_tower.blocks.19.norm2.bias": "model-00001-of-00002.safetensors", + "vision_tower.blocks.19.norm2.weight": "model-00001-of-00002.safetensors", + "vision_tower.blocks.2.attn.proj.bias": "model-00001-of-00002.safetensors", + "vision_tower.blocks.2.attn.proj.weight": "model-00001-of-00002.safetensors", + "vision_tower.blocks.2.attn.qkv.bias": "model-00001-of-00002.safetensors", + "vision_tower.blocks.2.attn.qkv.weight": "model-00001-of-00002.safetensors", + "vision_tower.blocks.2.mlp.linear_fc1.bias": "model-00001-of-00002.safetensors", + "vision_tower.blocks.2.mlp.linear_fc1.weight": "model-00001-of-00002.safetensors", + "vision_tower.blocks.2.mlp.linear_fc2.bias": "model-00001-of-00002.safetensors", + "vision_tower.blocks.2.mlp.linear_fc2.weight": "model-00001-of-00002.safetensors", + "vision_tower.blocks.2.norm1.bias": "model-00001-of-00002.safetensors", + "vision_tower.blocks.2.norm1.weight": "model-00001-of-00002.safetensors", + "vision_tower.blocks.2.norm2.bias": "model-00001-of-00002.safetensors", + "vision_tower.blocks.2.norm2.weight": "model-00001-of-00002.safetensors", + "vision_tower.blocks.20.attn.proj.bias": "model-00001-of-00002.safetensors", + "vision_tower.blocks.20.attn.proj.weight": "model-00001-of-00002.safetensors", + "vision_tower.blocks.20.attn.qkv.bias": "model-00001-of-00002.safetensors", + "vision_tower.blocks.20.attn.qkv.weight": "model-00001-of-00002.safetensors", + "vision_tower.blocks.20.mlp.linear_fc1.bias": "model-00001-of-00002.safetensors", + "vision_tower.blocks.20.mlp.linear_fc1.weight": "model-00001-of-00002.safetensors", + "vision_tower.blocks.20.mlp.linear_fc2.bias": "model-00001-of-00002.safetensors", + "vision_tower.blocks.20.mlp.linear_fc2.weight": "model-00001-of-00002.safetensors", + "vision_tower.blocks.20.norm1.bias": "model-00001-of-00002.safetensors", + "vision_tower.blocks.20.norm1.weight": "model-00001-of-00002.safetensors", + "vision_tower.blocks.20.norm2.bias": "model-00001-of-00002.safetensors", + "vision_tower.blocks.20.norm2.weight": "model-00001-of-00002.safetensors", + "vision_tower.blocks.21.attn.proj.bias": "model-00001-of-00002.safetensors", + "vision_tower.blocks.21.attn.proj.weight": "model-00001-of-00002.safetensors", + "vision_tower.blocks.21.attn.qkv.bias": "model-00001-of-00002.safetensors", + "vision_tower.blocks.21.attn.qkv.weight": "model-00001-of-00002.safetensors", + "vision_tower.blocks.21.mlp.linear_fc1.bias": "model-00001-of-00002.safetensors", + "vision_tower.blocks.21.mlp.linear_fc1.weight": "model-00001-of-00002.safetensors", + "vision_tower.blocks.21.mlp.linear_fc2.bias": "model-00001-of-00002.safetensors", + "vision_tower.blocks.21.mlp.linear_fc2.weight": "model-00001-of-00002.safetensors", + "vision_tower.blocks.21.norm1.bias": "model-00001-of-00002.safetensors", + "vision_tower.blocks.21.norm1.weight": "model-00001-of-00002.safetensors", + "vision_tower.blocks.21.norm2.bias": "model-00001-of-00002.safetensors", + "vision_tower.blocks.21.norm2.weight": "model-00001-of-00002.safetensors", + "vision_tower.blocks.22.attn.proj.bias": "model-00001-of-00002.safetensors", + "vision_tower.blocks.22.attn.proj.weight": "model-00001-of-00002.safetensors", + "vision_tower.blocks.22.attn.qkv.bias": "model-00001-of-00002.safetensors", + "vision_tower.blocks.22.attn.qkv.weight": "model-00001-of-00002.safetensors", + "vision_tower.blocks.22.mlp.linear_fc1.bias": "model-00001-of-00002.safetensors", + "vision_tower.blocks.22.mlp.linear_fc1.weight": "model-00001-of-00002.safetensors", + "vision_tower.blocks.22.mlp.linear_fc2.bias": "model-00001-of-00002.safetensors", + "vision_tower.blocks.22.mlp.linear_fc2.weight": "model-00001-of-00002.safetensors", + "vision_tower.blocks.22.norm1.bias": "model-00001-of-00002.safetensors", + "vision_tower.blocks.22.norm1.weight": "model-00001-of-00002.safetensors", + "vision_tower.blocks.22.norm2.bias": "model-00001-of-00002.safetensors", + "vision_tower.blocks.22.norm2.weight": "model-00001-of-00002.safetensors", + "vision_tower.blocks.23.attn.proj.bias": "model-00001-of-00002.safetensors", + "vision_tower.blocks.23.attn.proj.weight": "model-00001-of-00002.safetensors", + "vision_tower.blocks.23.attn.qkv.bias": "model-00001-of-00002.safetensors", + "vision_tower.blocks.23.attn.qkv.weight": "model-00001-of-00002.safetensors", + "vision_tower.blocks.23.mlp.linear_fc1.bias": "model-00001-of-00002.safetensors", + "vision_tower.blocks.23.mlp.linear_fc1.weight": "model-00001-of-00002.safetensors", + "vision_tower.blocks.23.mlp.linear_fc2.bias": "model-00001-of-00002.safetensors", + "vision_tower.blocks.23.mlp.linear_fc2.weight": "model-00001-of-00002.safetensors", + "vision_tower.blocks.23.norm1.bias": "model-00001-of-00002.safetensors", + "vision_tower.blocks.23.norm1.weight": "model-00001-of-00002.safetensors", + "vision_tower.blocks.23.norm2.bias": "model-00001-of-00002.safetensors", + "vision_tower.blocks.23.norm2.weight": "model-00001-of-00002.safetensors", + "vision_tower.blocks.24.attn.proj.bias": "model-00001-of-00002.safetensors", + "vision_tower.blocks.24.attn.proj.weight": "model-00001-of-00002.safetensors", + "vision_tower.blocks.24.attn.qkv.bias": "model-00001-of-00002.safetensors", + "vision_tower.blocks.24.attn.qkv.weight": "model-00001-of-00002.safetensors", + "vision_tower.blocks.24.mlp.linear_fc1.bias": "model-00001-of-00002.safetensors", + "vision_tower.blocks.24.mlp.linear_fc1.weight": "model-00001-of-00002.safetensors", + "vision_tower.blocks.24.mlp.linear_fc2.bias": "model-00001-of-00002.safetensors", + "vision_tower.blocks.24.mlp.linear_fc2.weight": "model-00001-of-00002.safetensors", + "vision_tower.blocks.24.norm1.bias": "model-00001-of-00002.safetensors", + "vision_tower.blocks.24.norm1.weight": "model-00001-of-00002.safetensors", + "vision_tower.blocks.24.norm2.bias": "model-00001-of-00002.safetensors", + "vision_tower.blocks.24.norm2.weight": "model-00001-of-00002.safetensors", + "vision_tower.blocks.25.attn.proj.bias": "model-00001-of-00002.safetensors", + "vision_tower.blocks.25.attn.proj.weight": "model-00001-of-00002.safetensors", + "vision_tower.blocks.25.attn.qkv.bias": "model-00001-of-00002.safetensors", + "vision_tower.blocks.25.attn.qkv.weight": "model-00001-of-00002.safetensors", + "vision_tower.blocks.25.mlp.linear_fc1.bias": "model-00001-of-00002.safetensors", + "vision_tower.blocks.25.mlp.linear_fc1.weight": "model-00001-of-00002.safetensors", + "vision_tower.blocks.25.mlp.linear_fc2.bias": "model-00001-of-00002.safetensors", + "vision_tower.blocks.25.mlp.linear_fc2.weight": "model-00001-of-00002.safetensors", + "vision_tower.blocks.25.norm1.bias": "model-00001-of-00002.safetensors", + "vision_tower.blocks.25.norm1.weight": "model-00001-of-00002.safetensors", + "vision_tower.blocks.25.norm2.bias": "model-00001-of-00002.safetensors", + "vision_tower.blocks.25.norm2.weight": "model-00001-of-00002.safetensors", + "vision_tower.blocks.26.attn.proj.bias": "model-00001-of-00002.safetensors", + "vision_tower.blocks.26.attn.proj.weight": "model-00001-of-00002.safetensors", + "vision_tower.blocks.26.attn.qkv.bias": "model-00001-of-00002.safetensors", + "vision_tower.blocks.26.attn.qkv.weight": "model-00001-of-00002.safetensors", + "vision_tower.blocks.26.mlp.linear_fc1.bias": "model-00001-of-00002.safetensors", + "vision_tower.blocks.26.mlp.linear_fc1.weight": "model-00001-of-00002.safetensors", + "vision_tower.blocks.26.mlp.linear_fc2.bias": "model-00001-of-00002.safetensors", + "vision_tower.blocks.26.mlp.linear_fc2.weight": "model-00001-of-00002.safetensors", + "vision_tower.blocks.26.norm1.bias": "model-00001-of-00002.safetensors", + "vision_tower.blocks.26.norm1.weight": "model-00001-of-00002.safetensors", + "vision_tower.blocks.26.norm2.bias": "model-00001-of-00002.safetensors", + "vision_tower.blocks.26.norm2.weight": "model-00001-of-00002.safetensors", + "vision_tower.blocks.3.attn.proj.bias": "model-00001-of-00002.safetensors", + "vision_tower.blocks.3.attn.proj.weight": "model-00001-of-00002.safetensors", + "vision_tower.blocks.3.attn.qkv.bias": "model-00001-of-00002.safetensors", + "vision_tower.blocks.3.attn.qkv.weight": "model-00001-of-00002.safetensors", + "vision_tower.blocks.3.mlp.linear_fc1.bias": "model-00001-of-00002.safetensors", + "vision_tower.blocks.3.mlp.linear_fc1.weight": "model-00001-of-00002.safetensors", + "vision_tower.blocks.3.mlp.linear_fc2.bias": "model-00001-of-00002.safetensors", + "vision_tower.blocks.3.mlp.linear_fc2.weight": "model-00001-of-00002.safetensors", + "vision_tower.blocks.3.norm1.bias": "model-00001-of-00002.safetensors", + "vision_tower.blocks.3.norm1.weight": "model-00001-of-00002.safetensors", + "vision_tower.blocks.3.norm2.bias": "model-00001-of-00002.safetensors", + "vision_tower.blocks.3.norm2.weight": "model-00001-of-00002.safetensors", + "vision_tower.blocks.4.attn.proj.bias": "model-00001-of-00002.safetensors", + "vision_tower.blocks.4.attn.proj.weight": "model-00001-of-00002.safetensors", + "vision_tower.blocks.4.attn.qkv.bias": "model-00001-of-00002.safetensors", + "vision_tower.blocks.4.attn.qkv.weight": "model-00001-of-00002.safetensors", + "vision_tower.blocks.4.mlp.linear_fc1.bias": "model-00001-of-00002.safetensors", + "vision_tower.blocks.4.mlp.linear_fc1.weight": "model-00001-of-00002.safetensors", + "vision_tower.blocks.4.mlp.linear_fc2.bias": "model-00001-of-00002.safetensors", + "vision_tower.blocks.4.mlp.linear_fc2.weight": "model-00001-of-00002.safetensors", + "vision_tower.blocks.4.norm1.bias": "model-00001-of-00002.safetensors", + "vision_tower.blocks.4.norm1.weight": "model-00001-of-00002.safetensors", + "vision_tower.blocks.4.norm2.bias": "model-00001-of-00002.safetensors", + "vision_tower.blocks.4.norm2.weight": "model-00001-of-00002.safetensors", + "vision_tower.blocks.5.attn.proj.bias": "model-00001-of-00002.safetensors", + "vision_tower.blocks.5.attn.proj.weight": "model-00001-of-00002.safetensors", + "vision_tower.blocks.5.attn.qkv.bias": "model-00001-of-00002.safetensors", + "vision_tower.blocks.5.attn.qkv.weight": "model-00001-of-00002.safetensors", + "vision_tower.blocks.5.mlp.linear_fc1.bias": "model-00001-of-00002.safetensors", + "vision_tower.blocks.5.mlp.linear_fc1.weight": "model-00001-of-00002.safetensors", + "vision_tower.blocks.5.mlp.linear_fc2.bias": "model-00001-of-00002.safetensors", + "vision_tower.blocks.5.mlp.linear_fc2.weight": "model-00001-of-00002.safetensors", + "vision_tower.blocks.5.norm1.bias": "model-00001-of-00002.safetensors", + "vision_tower.blocks.5.norm1.weight": "model-00001-of-00002.safetensors", + "vision_tower.blocks.5.norm2.bias": "model-00001-of-00002.safetensors", + "vision_tower.blocks.5.norm2.weight": "model-00001-of-00002.safetensors", + "vision_tower.blocks.6.attn.proj.bias": "model-00001-of-00002.safetensors", + "vision_tower.blocks.6.attn.proj.weight": "model-00001-of-00002.safetensors", + "vision_tower.blocks.6.attn.qkv.bias": "model-00001-of-00002.safetensors", + "vision_tower.blocks.6.attn.qkv.weight": "model-00001-of-00002.safetensors", + "vision_tower.blocks.6.mlp.linear_fc1.bias": "model-00001-of-00002.safetensors", + "vision_tower.blocks.6.mlp.linear_fc1.weight": "model-00001-of-00002.safetensors", + "vision_tower.blocks.6.mlp.linear_fc2.bias": "model-00001-of-00002.safetensors", + "vision_tower.blocks.6.mlp.linear_fc2.weight": "model-00001-of-00002.safetensors", + "vision_tower.blocks.6.norm1.bias": "model-00001-of-00002.safetensors", + "vision_tower.blocks.6.norm1.weight": "model-00001-of-00002.safetensors", + "vision_tower.blocks.6.norm2.bias": "model-00001-of-00002.safetensors", + "vision_tower.blocks.6.norm2.weight": "model-00001-of-00002.safetensors", + "vision_tower.blocks.7.attn.proj.bias": "model-00001-of-00002.safetensors", + "vision_tower.blocks.7.attn.proj.weight": "model-00001-of-00002.safetensors", + "vision_tower.blocks.7.attn.qkv.bias": "model-00001-of-00002.safetensors", + "vision_tower.blocks.7.attn.qkv.weight": "model-00001-of-00002.safetensors", + "vision_tower.blocks.7.mlp.linear_fc1.bias": "model-00001-of-00002.safetensors", + "vision_tower.blocks.7.mlp.linear_fc1.weight": "model-00001-of-00002.safetensors", + "vision_tower.blocks.7.mlp.linear_fc2.bias": "model-00001-of-00002.safetensors", + "vision_tower.blocks.7.mlp.linear_fc2.weight": "model-00001-of-00002.safetensors", + "vision_tower.blocks.7.norm1.bias": "model-00001-of-00002.safetensors", + "vision_tower.blocks.7.norm1.weight": "model-00001-of-00002.safetensors", + "vision_tower.blocks.7.norm2.bias": "model-00001-of-00002.safetensors", + "vision_tower.blocks.7.norm2.weight": "model-00001-of-00002.safetensors", + "vision_tower.blocks.8.attn.proj.bias": "model-00001-of-00002.safetensors", + "vision_tower.blocks.8.attn.proj.weight": "model-00001-of-00002.safetensors", + "vision_tower.blocks.8.attn.qkv.bias": "model-00001-of-00002.safetensors", + "vision_tower.blocks.8.attn.qkv.weight": "model-00001-of-00002.safetensors", + "vision_tower.blocks.8.mlp.linear_fc1.bias": "model-00001-of-00002.safetensors", + "vision_tower.blocks.8.mlp.linear_fc1.weight": "model-00001-of-00002.safetensors", + "vision_tower.blocks.8.mlp.linear_fc2.bias": "model-00001-of-00002.safetensors", + "vision_tower.blocks.8.mlp.linear_fc2.weight": "model-00001-of-00002.safetensors", + "vision_tower.blocks.8.norm1.bias": "model-00001-of-00002.safetensors", + "vision_tower.blocks.8.norm1.weight": "model-00001-of-00002.safetensors", + "vision_tower.blocks.8.norm2.bias": "model-00001-of-00002.safetensors", + "vision_tower.blocks.8.norm2.weight": "model-00001-of-00002.safetensors", + "vision_tower.blocks.9.attn.proj.bias": "model-00001-of-00002.safetensors", + "vision_tower.blocks.9.attn.proj.weight": "model-00001-of-00002.safetensors", + "vision_tower.blocks.9.attn.qkv.bias": "model-00001-of-00002.safetensors", + "vision_tower.blocks.9.attn.qkv.weight": "model-00001-of-00002.safetensors", + "vision_tower.blocks.9.mlp.linear_fc1.bias": "model-00001-of-00002.safetensors", + "vision_tower.blocks.9.mlp.linear_fc1.weight": "model-00001-of-00002.safetensors", + "vision_tower.blocks.9.mlp.linear_fc2.bias": "model-00001-of-00002.safetensors", + "vision_tower.blocks.9.mlp.linear_fc2.weight": "model-00001-of-00002.safetensors", + "vision_tower.blocks.9.norm1.bias": "model-00001-of-00002.safetensors", + "vision_tower.blocks.9.norm1.weight": "model-00001-of-00002.safetensors", + "vision_tower.blocks.9.norm2.bias": "model-00001-of-00002.safetensors", + "vision_tower.blocks.9.norm2.weight": "model-00001-of-00002.safetensors", + "vision_tower.merger.linear_fc1.bias": "model-00001-of-00002.safetensors", + "vision_tower.merger.linear_fc1.weight": "model-00001-of-00002.safetensors", + "vision_tower.merger.linear_fc2.bias": "model-00001-of-00002.safetensors", + "vision_tower.merger.linear_fc2.weight": "model-00001-of-00002.safetensors", + "vision_tower.merger.norm.bias": "model-00001-of-00002.safetensors", + "vision_tower.merger.norm.weight": "model-00001-of-00002.safetensors", + "vision_tower.patch_embed.proj.bias": "model-00001-of-00002.safetensors", + "vision_tower.patch_embed.proj.weight": "model-00001-of-00002.safetensors", + "vision_tower.pos_embed.weight": "model-00001-of-00002.safetensors" + } +} \ No newline at end of file diff --git a/chat/mlx/mlx-community/Qwen3.5-9B-MLX-4bit/preprocessor_config.json b/chat/mlx/mlx-community/Qwen3.5-9B-MLX-4bit/preprocessor_config.json new file mode 100644 index 0000000..2ea84a4 --- /dev/null +++ b/chat/mlx/mlx-community/Qwen3.5-9B-MLX-4bit/preprocessor_config.json @@ -0,0 +1,21 @@ +{ + "size": { + "longest_edge": 16777216, + "shortest_edge": 65536 + }, + "patch_size": 16, + "temporal_patch_size": 2, + "merge_size": 2, + "image_mean": [ + 0.5, + 0.5, + 0.5 + ], + "image_std": [ + 0.5, + 0.5, + 0.5 + ], + "processor_class": "Qwen3VLProcessor", + "image_processor_type": "Qwen2VLImageProcessorFast" +} \ No newline at end of file diff --git a/chat/mlx/mlx-community/Qwen3.5-9B-MLX-4bit/processor_config.json b/chat/mlx/mlx-community/Qwen3.5-9B-MLX-4bit/processor_config.json new file mode 100644 index 0000000..7ad6acd --- /dev/null +++ b/chat/mlx/mlx-community/Qwen3.5-9B-MLX-4bit/processor_config.json @@ -0,0 +1,63 @@ +{ + "image_processor": { + "data_format": "channels_first", + "do_convert_rgb": true, + "do_normalize": true, + "do_rescale": true, + "do_resize": true, + "image_mean": [ + 0.5, + 0.5, + 0.5 + ], + "image_processor_type": "Qwen2VLImageProcessorFast", + "image_std": [ + 0.5, + 0.5, + 0.5 + ], + "merge_size": 2, + "patch_size": 16, + "resample": 3, + "rescale_factor": 0.00392156862745098, + "size": { + "longest_edge": 16777216, + "shortest_edge": 65536 + }, + "temporal_patch_size": 2 + }, + "processor_class": "Qwen3VLProcessor", + "video_processor": { + "data_format": "channels_first", + "default_to_square": true, + "do_convert_rgb": true, + "do_normalize": true, + "do_rescale": true, + "do_resize": true, + "do_sample_frames": true, + "fps": 2, + "image_mean": [ + 0.5, + 0.5, + 0.5 + ], + "image_std": [ + 0.5, + 0.5, + 0.5 + ], + "max_frames": 768, + "merge_size": 2, + "min_frames": 4, + "patch_size": 16, + "resample": 3, + "rescale_factor": 0.00392156862745098, + "return_metadata": false, + "size": { + "longest_edge": 25165824, + "shortest_edge": 4096 + }, + "temporal_patch_size": 2, + "video_processor_type": "Qwen3VLVideoProcessor" + } +} diff --git a/chat/mlx/mlx-community/Qwen3.5-9B-MLX-4bit/tokenizer.json b/chat/mlx/mlx-community/Qwen3.5-9B-MLX-4bit/tokenizer.json new file mode 100644 index 0000000..67741b0 --- /dev/null +++ b/chat/mlx/mlx-community/Qwen3.5-9B-MLX-4bit/tokenizer.json @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:87a7830d63fcf43bf241c3c5242e96e62dd3fdc29224ca26fed8ea333db72de4 +size 19989343 diff --git a/chat/mlx/mlx-community/Qwen3.5-9B-MLX-4bit/tokenizer_config.json b/chat/mlx/mlx-community/Qwen3.5-9B-MLX-4bit/tokenizer_config.json new file mode 100644 index 0000000..a068e24 --- /dev/null +++ b/chat/mlx/mlx-community/Qwen3.5-9B-MLX-4bit/tokenizer_config.json @@ -0,0 +1,32 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|im_end|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": true, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "processor_class": "Qwen3VLProcessor", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/chat/mlx/mlx-community/Qwen3.5-9B-MLX-4bit/video_preprocessor_config.json b/chat/mlx/mlx-community/Qwen3.5-9B-MLX-4bit/video_preprocessor_config.json new file mode 100644 index 0000000..3ba673a --- /dev/null +++ b/chat/mlx/mlx-community/Qwen3.5-9B-MLX-4bit/video_preprocessor_config.json @@ -0,0 +1,21 @@ +{ + "size": { + "longest_edge": 25165824, + "shortest_edge": 4096 + }, + "patch_size": 16, + "temporal_patch_size": 2, + "merge_size": 2, + "image_mean": [ + 0.5, + 0.5, + 0.5 + ], + "image_std": [ + 0.5, + 0.5, + 0.5 + ], + "processor_class": "Qwen3VLProcessor", + "video_processor_type": "Qwen3VLVideoProcessor" +} \ No newline at end of file diff --git a/chat/mlx/mlx-community/Qwen3.5-9B-MLX-4bit/vocab.json b/chat/mlx/mlx-community/Qwen3.5-9B-MLX-4bit/vocab.json new file mode 100644 index 0000000..d32f7ed --- /dev/null +++ b/chat/mlx/mlx-community/Qwen3.5-9B-MLX-4bit/vocab.json @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:ce99b4cb2983d118806ce0a8b777a35b093e2000a503ebde25853284c9dfa003 +size 6722759 diff --git a/chat/mlx/mlx-community/Qwen3.6-35B-A3B-4bit/.gitattributes b/chat/mlx/mlx-community/Qwen3.6-35B-A3B-4bit/.gitattributes new file mode 100644 index 0000000..52373fe --- /dev/null +++ b/chat/mlx/mlx-community/Qwen3.6-35B-A3B-4bit/.gitattributes @@ -0,0 +1,36 @@ +*.7z filter=lfs diff=lfs merge=lfs -text +*.arrow filter=lfs diff=lfs merge=lfs -text +*.bin filter=lfs diff=lfs merge=lfs -text +*.bz2 filter=lfs diff=lfs merge=lfs -text +*.ckpt filter=lfs diff=lfs merge=lfs -text +*.ftz filter=lfs diff=lfs merge=lfs -text +*.gz filter=lfs diff=lfs merge=lfs -text +*.h5 filter=lfs diff=lfs merge=lfs -text +*.joblib filter=lfs diff=lfs merge=lfs -text +*.lfs.* filter=lfs diff=lfs merge=lfs -text +*.mlmodel filter=lfs diff=lfs merge=lfs -text +*.model filter=lfs diff=lfs merge=lfs -text +*.msgpack filter=lfs diff=lfs merge=lfs -text +*.npy filter=lfs diff=lfs merge=lfs -text +*.npz filter=lfs diff=lfs merge=lfs -text +*.onnx filter=lfs diff=lfs merge=lfs -text +*.ot filter=lfs diff=lfs merge=lfs -text +*.parquet filter=lfs diff=lfs merge=lfs -text +*.pb filter=lfs diff=lfs merge=lfs -text +*.pickle filter=lfs diff=lfs merge=lfs -text +*.pkl filter=lfs diff=lfs merge=lfs -text +*.pt filter=lfs diff=lfs merge=lfs -text +*.pth filter=lfs diff=lfs merge=lfs -text +*.rar filter=lfs diff=lfs merge=lfs -text +*.safetensors filter=lfs diff=lfs merge=lfs -text +saved_model/**/* filter=lfs diff=lfs merge=lfs -text +*.tar.* filter=lfs diff=lfs merge=lfs -text +*.tar filter=lfs diff=lfs merge=lfs -text +*.tflite filter=lfs diff=lfs merge=lfs -text +*.tgz filter=lfs diff=lfs merge=lfs -text +*.wasm filter=lfs diff=lfs merge=lfs -text +*.xz filter=lfs diff=lfs merge=lfs -text +*.zip filter=lfs diff=lfs merge=lfs -text +*.zst filter=lfs diff=lfs merge=lfs -text +*tfevents* filter=lfs diff=lfs merge=lfs -text +tokenizer.json filter=lfs diff=lfs merge=lfs -text diff --git a/chat/mlx/mlx-community/Qwen3.6-35B-A3B-4bit/README.md b/chat/mlx/mlx-community/Qwen3.6-35B-A3B-4bit/README.md new file mode 100644 index 0000000..6bb7630 --- /dev/null +++ b/chat/mlx/mlx-community/Qwen3.6-35B-A3B-4bit/README.md @@ -0,0 +1,25 @@ +--- +library_name: mlx +license: apache-2.0 +license_link: https://huggingface.co/Qwen/Qwen3.6-35B-A3B/blob/main/LICENSE +pipeline_tag: image-text-to-text +tags: +- mlx +base_model: Qwen/Qwen3.6-35B-A3B +--- + +# mlx-community/Qwen3.6-35B-A3B-4bit + +This model was converted to MLX format from [`Qwen/Qwen3.6-35B-A3B`](https://huggingface.co/Qwen/Qwen3.6-35B-A3B) +using mlx-vlm version **0.4.4**. +Refer to the [original model card](https://huggingface.co/Qwen/Qwen3.6-35B-A3B) for more details on the model. + +## Use with mlx + +```bash +pip install -U mlx-vlm +``` + +```bash +python -m mlx_vlm.generate --model mlx-community/Qwen3.6-35B-A3B-4bit --max-tokens 100 --temperature 0.0 --prompt "Describe this image." --image +``` diff --git a/chat/mlx/mlx-community/Qwen3.6-35B-A3B-4bit/chat_template.jinja b/chat/mlx/mlx-community/Qwen3.6-35B-A3B-4bit/chat_template.jinja new file mode 100644 index 0000000..a8755d8 --- /dev/null +++ b/chat/mlx/mlx-community/Qwen3.6-35B-A3B-4bit/chat_template.jinja @@ -0,0 +1,154 @@ +{%- set image_count = namespace(value=0) %} +{%- set video_count = namespace(value=0) %} +{%- macro render_content(content, do_vision_count, is_system_content=false) %} + {%- if content is string %} + {{- content }} + {%- elif content is iterable and content is not mapping %} + {%- for item in content %} + {%- if 'image' in item or 'image_url' in item or item.type == 'image' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain images.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set image_count.value = image_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Picture ' ~ image_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|image_pad|><|vision_end|>' }} + {%- elif 'video' in item or item.type == 'video' %} + {%- if is_system_content %} + {{- raise_exception('System message cannot contain videos.') }} + {%- endif %} + {%- if do_vision_count %} + {%- set video_count.value = video_count.value + 1 %} + {%- endif %} + {%- if add_vision_id %} + {{- 'Video ' ~ video_count.value ~ ': ' }} + {%- endif %} + {{- '<|vision_start|><|video_pad|><|vision_end|>' }} + {%- elif 'text' in item %} + {{- item.text }} + {%- else %} + {{- raise_exception('Unexpected item type in content.') }} + {%- endif %} + {%- endfor %} + {%- elif content is none or content is undefined %} + {{- '' }} + {%- else %} + {{- raise_exception('Unexpected content type.') }} + {%- endif %} +{%- endmacro %} +{%- if not messages %} + {{- raise_exception('No messages provided.') }} +{%- endif %} +{%- if tools and tools is iterable and tools is not mapping %} + {{- '<|im_start|>system\n' }} + {{- "# Tools\n\nYou have access to the following functions:\n\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n" }} + {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {%- if content %} + {{- '\n\n' + content }} + {%- endif %} + {%- endif %} + {{- '<|im_end|>\n' }} +{%- else %} + {%- if messages[0].role == 'system' %} + {%- set content = render_content(messages[0].content, false, true)|trim %} + {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" %} + {%- set content = render_content(message.content, false)|trim %} + {%- if not(content.startswith('') and content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if ns.multi_step_tool %} + {{- raise_exception('No user query found in messages.') }} +{%- endif %} +{%- for message in messages %} + {%- set content = render_content(message.content, true)|trim %} + {%- if message.role == "system" %} + {%- if not loop.first %} + {{- raise_exception('System message must be at the beginning.') }} + {%- endif %} + {%- elif message.role == "user" %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- set reasoning_content = reasoning_content|trim %} + {%- if (preserve_thinking is defined and preserve_thinking is true) or (loop.index0 > ns.last_query_index) %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %} + {%- for tool_call in message.tool_calls %} + {%- if tool_call.function is defined %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {%- if loop.first %} + {%- if content|trim %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n\n' }} + {%- endif %} + {%- else %} + {{- '\n\n\n' }} + {%- endif %} + {%- if tool_call.arguments is defined %} + {%- for args_name, args_value in tool_call.arguments|items %} + {{- '\n' }} + {%- set args_value = args_value | string if args_value is string else args_value | tojson | safe %} + {{- args_value }} + {{- '\n\n' }} + {%- endfor %} + {%- endif %} + {{- '\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.previtem and loop.previtem.role != "tool" %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if not loop.last and loop.nextitem.role != "tool" %} + {{- '<|im_end|>\n' }} + {%- elif loop.last %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- else %} + {{- raise_exception('Unexpected message role.') }} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- else %} + {{- '\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/chat/mlx/mlx-community/Qwen3.6-35B-A3B-4bit/config.json b/chat/mlx/mlx-community/Qwen3.6-35B-A3B-4bit/config.json new file mode 100644 index 0000000..e3a2334 --- /dev/null +++ b/chat/mlx/mlx-community/Qwen3.6-35B-A3B-4bit/config.json @@ -0,0 +1,773 @@ +{ + "architectures": [ + "Qwen3_5MoeForConditionalGeneration" + ], + "eos_token_id": [ + 248046, + 248044 + ], + "image_token_id": 248056, + "model_type": "qwen3_5_moe", + "quantization": { + "group_size": 64, + "bits": 4, + "mode": "affine", + "language_model.model.layers.0.mlp.gate": { + "group_size": 64, + "bits": 8 + }, + "language_model.model.layers.0.mlp.shared_expert_gate": { + "group_size": 64, + "bits": 8 + }, + "language_model.model.layers.1.mlp.gate": { + "group_size": 64, + "bits": 8 + }, + "language_model.model.layers.1.mlp.shared_expert_gate": { + "group_size": 64, + "bits": 8 + }, + "language_model.model.layers.2.mlp.gate": { + "group_size": 64, + "bits": 8 + }, + "language_model.model.layers.2.mlp.shared_expert_gate": { + "group_size": 64, + "bits": 8 + }, + "language_model.model.layers.3.mlp.gate": { + "group_size": 64, + "bits": 8 + }, + "language_model.model.layers.3.mlp.shared_expert_gate": { + "group_size": 64, + "bits": 8 + }, + "language_model.model.layers.4.mlp.gate": { + "group_size": 64, + "bits": 8 + }, + "language_model.model.layers.4.mlp.shared_expert_gate": { + "group_size": 64, + "bits": 8 + }, + "language_model.model.layers.5.mlp.gate": { + "group_size": 64, + "bits": 8 + }, + "language_model.model.layers.5.mlp.shared_expert_gate": { + "group_size": 64, + "bits": 8 + }, + "language_model.model.layers.6.mlp.gate": { + "group_size": 64, + "bits": 8 + }, + "language_model.model.layers.6.mlp.shared_expert_gate": { + "group_size": 64, + "bits": 8 + }, + "language_model.model.layers.7.mlp.gate": { + "group_size": 64, + "bits": 8 + }, + "language_model.model.layers.7.mlp.shared_expert_gate": { + "group_size": 64, + "bits": 8 + }, + "language_model.model.layers.8.mlp.gate": { + "group_size": 64, + "bits": 8 + }, + "language_model.model.layers.8.mlp.shared_expert_gate": { + "group_size": 64, + "bits": 8 + }, + "language_model.model.layers.9.mlp.gate": { + "group_size": 64, + "bits": 8 + }, + "language_model.model.layers.9.mlp.shared_expert_gate": { + "group_size": 64, + "bits": 8 + }, + "language_model.model.layers.10.mlp.gate": { + "group_size": 64, + "bits": 8 + }, + "language_model.model.layers.10.mlp.shared_expert_gate": { + "group_size": 64, + "bits": 8 + }, + "language_model.model.layers.11.mlp.gate": { + "group_size": 64, + "bits": 8 + }, + "language_model.model.layers.11.mlp.shared_expert_gate": { + "group_size": 64, + "bits": 8 + }, + "language_model.model.layers.12.mlp.gate": { + "group_size": 64, + "bits": 8 + }, + "language_model.model.layers.12.mlp.shared_expert_gate": { + "group_size": 64, + "bits": 8 + }, + "language_model.model.layers.13.mlp.gate": { + "group_size": 64, + "bits": 8 + }, + "language_model.model.layers.13.mlp.shared_expert_gate": { + "group_size": 64, + "bits": 8 + }, + "language_model.model.layers.14.mlp.gate": { + "group_size": 64, + "bits": 8 + }, + "language_model.model.layers.14.mlp.shared_expert_gate": { + "group_size": 64, + "bits": 8 + }, + "language_model.model.layers.15.mlp.gate": { + "group_size": 64, + "bits": 8 + }, + "language_model.model.layers.15.mlp.shared_expert_gate": { + "group_size": 64, + "bits": 8 + }, + "language_model.model.layers.16.mlp.gate": { + "group_size": 64, + "bits": 8 + }, + "language_model.model.layers.16.mlp.shared_expert_gate": { + "group_size": 64, + "bits": 8 + }, + "language_model.model.layers.17.mlp.gate": { + "group_size": 64, + "bits": 8 + }, + "language_model.model.layers.17.mlp.shared_expert_gate": { + "group_size": 64, + "bits": 8 + }, + "language_model.model.layers.18.mlp.gate": { + "group_size": 64, + "bits": 8 + }, + "language_model.model.layers.18.mlp.shared_expert_gate": { + "group_size": 64, + "bits": 8 + }, + "language_model.model.layers.19.mlp.gate": { + "group_size": 64, + "bits": 8 + }, + "language_model.model.layers.19.mlp.shared_expert_gate": { + "group_size": 64, + "bits": 8 + }, + "language_model.model.layers.20.mlp.gate": { + "group_size": 64, + "bits": 8 + }, + "language_model.model.layers.20.mlp.shared_expert_gate": { + "group_size": 64, + "bits": 8 + }, + "language_model.model.layers.21.mlp.gate": { + "group_size": 64, + "bits": 8 + }, + "language_model.model.layers.21.mlp.shared_expert_gate": { + "group_size": 64, + "bits": 8 + }, + "language_model.model.layers.22.mlp.gate": { + "group_size": 64, + "bits": 8 + }, + "language_model.model.layers.22.mlp.shared_expert_gate": { + "group_size": 64, + "bits": 8 + }, + "language_model.model.layers.23.mlp.gate": { + "group_size": 64, + "bits": 8 + }, + "language_model.model.layers.23.mlp.shared_expert_gate": { + "group_size": 64, + "bits": 8 + }, + "language_model.model.layers.24.mlp.gate": { + "group_size": 64, + "bits": 8 + }, + "language_model.model.layers.24.mlp.shared_expert_gate": { + "group_size": 64, + "bits": 8 + }, + "language_model.model.layers.25.mlp.gate": { + "group_size": 64, + "bits": 8 + }, + "language_model.model.layers.25.mlp.shared_expert_gate": { + "group_size": 64, + "bits": 8 + }, + "language_model.model.layers.26.mlp.gate": { + "group_size": 64, + "bits": 8 + }, + "language_model.model.layers.26.mlp.shared_expert_gate": { + "group_size": 64, + "bits": 8 + }, + "language_model.model.layers.27.mlp.gate": { + "group_size": 64, + "bits": 8 + }, + "language_model.model.layers.27.mlp.shared_expert_gate": { + "group_size": 64, + "bits": 8 + }, + "language_model.model.layers.28.mlp.gate": { + "group_size": 64, + "bits": 8 + }, + "language_model.model.layers.28.mlp.shared_expert_gate": { + "group_size": 64, + "bits": 8 + }, + "language_model.model.layers.29.mlp.gate": { + "group_size": 64, + "bits": 8 + }, + "language_model.model.layers.29.mlp.shared_expert_gate": { + "group_size": 64, + "bits": 8 + }, + "language_model.model.layers.30.mlp.gate": { + "group_size": 64, + "bits": 8 + }, + "language_model.model.layers.30.mlp.shared_expert_gate": { + "group_size": 64, + "bits": 8 + }, + "language_model.model.layers.31.mlp.gate": { + "group_size": 64, + "bits": 8 + }, + "language_model.model.layers.31.mlp.shared_expert_gate": { + "group_size": 64, + "bits": 8 + }, + "language_model.model.layers.32.mlp.gate": { + "group_size": 64, + "bits": 8 + }, + "language_model.model.layers.32.mlp.shared_expert_gate": { + "group_size": 64, + "bits": 8 + }, + "language_model.model.layers.33.mlp.gate": { + "group_size": 64, + "bits": 8 + }, + "language_model.model.layers.33.mlp.shared_expert_gate": { + "group_size": 64, + "bits": 8 + }, + "language_model.model.layers.34.mlp.gate": { + "group_size": 64, + "bits": 8 + }, + "language_model.model.layers.34.mlp.shared_expert_gate": { + "group_size": 64, + "bits": 8 + }, + "language_model.model.layers.35.mlp.gate": { + "group_size": 64, + "bits": 8 + }, + "language_model.model.layers.35.mlp.shared_expert_gate": { + "group_size": 64, + "bits": 8 + }, + "language_model.model.layers.36.mlp.gate": { + "group_size": 64, + "bits": 8 + }, + "language_model.model.layers.36.mlp.shared_expert_gate": { + "group_size": 64, + "bits": 8 + }, + "language_model.model.layers.37.mlp.gate": { + "group_size": 64, + "bits": 8 + }, + "language_model.model.layers.37.mlp.shared_expert_gate": { + "group_size": 64, + "bits": 8 + }, + "language_model.model.layers.38.mlp.gate": { + "group_size": 64, + "bits": 8 + }, + "language_model.model.layers.38.mlp.shared_expert_gate": { + "group_size": 64, + "bits": 8 + }, + "language_model.model.layers.39.mlp.gate": { + "group_size": 64, + "bits": 8 + }, + "language_model.model.layers.39.mlp.shared_expert_gate": { + "group_size": 64, + "bits": 8 + } + }, + "quantization_config": { + "group_size": 64, + "bits": 4, + "mode": "affine", + "language_model.model.layers.0.mlp.gate": { + "group_size": 64, + "bits": 8 + }, + "language_model.model.layers.0.mlp.shared_expert_gate": { + "group_size": 64, + "bits": 8 + }, + "language_model.model.layers.1.mlp.gate": { + "group_size": 64, + "bits": 8 + }, + "language_model.model.layers.1.mlp.shared_expert_gate": { + "group_size": 64, + "bits": 8 + }, + "language_model.model.layers.2.mlp.gate": { + "group_size": 64, + "bits": 8 + }, + "language_model.model.layers.2.mlp.shared_expert_gate": { + "group_size": 64, + "bits": 8 + }, + "language_model.model.layers.3.mlp.gate": { + "group_size": 64, + "bits": 8 + }, + "language_model.model.layers.3.mlp.shared_expert_gate": { + "group_size": 64, + "bits": 8 + }, + "language_model.model.layers.4.mlp.gate": { + "group_size": 64, + "bits": 8 + }, + "language_model.model.layers.4.mlp.shared_expert_gate": { + "group_size": 64, + "bits": 8 + }, + "language_model.model.layers.5.mlp.gate": { + "group_size": 64, + "bits": 8 + }, + "language_model.model.layers.5.mlp.shared_expert_gate": { + "group_size": 64, + "bits": 8 + }, + "language_model.model.layers.6.mlp.gate": { + "group_size": 64, + "bits": 8 + }, + "language_model.model.layers.6.mlp.shared_expert_gate": { + "group_size": 64, + "bits": 8 + }, + "language_model.model.layers.7.mlp.gate": { + "group_size": 64, + "bits": 8 + }, + "language_model.model.layers.7.mlp.shared_expert_gate": { + "group_size": 64, + "bits": 8 + }, + "language_model.model.layers.8.mlp.gate": { + "group_size": 64, + "bits": 8 + }, + "language_model.model.layers.8.mlp.shared_expert_gate": { + "group_size": 64, + "bits": 8 + }, + "language_model.model.layers.9.mlp.gate": { + "group_size": 64, + "bits": 8 + }, + "language_model.model.layers.9.mlp.shared_expert_gate": { + "group_size": 64, + "bits": 8 + }, + "language_model.model.layers.10.mlp.gate": { + "group_size": 64, + "bits": 8 + }, + "language_model.model.layers.10.mlp.shared_expert_gate": { + "group_size": 64, + "bits": 8 + }, + "language_model.model.layers.11.mlp.gate": { + "group_size": 64, + "bits": 8 + }, + "language_model.model.layers.11.mlp.shared_expert_gate": { + "group_size": 64, + "bits": 8 + }, + "language_model.model.layers.12.mlp.gate": { + "group_size": 64, + "bits": 8 + }, + "language_model.model.layers.12.mlp.shared_expert_gate": { + "group_size": 64, + "bits": 8 + }, + "language_model.model.layers.13.mlp.gate": { + "group_size": 64, + "bits": 8 + }, + "language_model.model.layers.13.mlp.shared_expert_gate": { + "group_size": 64, + "bits": 8 + }, + "language_model.model.layers.14.mlp.gate": { + "group_size": 64, + "bits": 8 + }, + "language_model.model.layers.14.mlp.shared_expert_gate": { + "group_size": 64, + "bits": 8 + }, + "language_model.model.layers.15.mlp.gate": { + "group_size": 64, + "bits": 8 + }, + "language_model.model.layers.15.mlp.shared_expert_gate": { + "group_size": 64, + "bits": 8 + }, + "language_model.model.layers.16.mlp.gate": { + "group_size": 64, + "bits": 8 + }, + "language_model.model.layers.16.mlp.shared_expert_gate": { + "group_size": 64, + "bits": 8 + }, + "language_model.model.layers.17.mlp.gate": { + "group_size": 64, + "bits": 8 + }, + "language_model.model.layers.17.mlp.shared_expert_gate": { + "group_size": 64, + "bits": 8 + }, + "language_model.model.layers.18.mlp.gate": { + "group_size": 64, + "bits": 8 + }, + "language_model.model.layers.18.mlp.shared_expert_gate": { + "group_size": 64, + "bits": 8 + }, + "language_model.model.layers.19.mlp.gate": { + "group_size": 64, + "bits": 8 + }, + "language_model.model.layers.19.mlp.shared_expert_gate": { + "group_size": 64, + "bits": 8 + }, + "language_model.model.layers.20.mlp.gate": { + "group_size": 64, + "bits": 8 + }, + "language_model.model.layers.20.mlp.shared_expert_gate": { + "group_size": 64, + "bits": 8 + }, + "language_model.model.layers.21.mlp.gate": { + "group_size": 64, + "bits": 8 + }, + "language_model.model.layers.21.mlp.shared_expert_gate": { + "group_size": 64, + "bits": 8 + }, + "language_model.model.layers.22.mlp.gate": { + "group_size": 64, + "bits": 8 + }, + "language_model.model.layers.22.mlp.shared_expert_gate": { + "group_size": 64, + "bits": 8 + }, + "language_model.model.layers.23.mlp.gate": { + "group_size": 64, + "bits": 8 + }, + "language_model.model.layers.23.mlp.shared_expert_gate": { + "group_size": 64, + "bits": 8 + }, + "language_model.model.layers.24.mlp.gate": { + "group_size": 64, + "bits": 8 + }, + "language_model.model.layers.24.mlp.shared_expert_gate": { + "group_size": 64, + "bits": 8 + }, + "language_model.model.layers.25.mlp.gate": { + "group_size": 64, + "bits": 8 + }, + "language_model.model.layers.25.mlp.shared_expert_gate": { + "group_size": 64, + "bits": 8 + }, + "language_model.model.layers.26.mlp.gate": { + "group_size": 64, + "bits": 8 + }, + "language_model.model.layers.26.mlp.shared_expert_gate": { + "group_size": 64, + "bits": 8 + }, + "language_model.model.layers.27.mlp.gate": { + "group_size": 64, + "bits": 8 + }, + "language_model.model.layers.27.mlp.shared_expert_gate": { + "group_size": 64, + "bits": 8 + }, + "language_model.model.layers.28.mlp.gate": { + "group_size": 64, + "bits": 8 + }, + "language_model.model.layers.28.mlp.shared_expert_gate": { + "group_size": 64, + "bits": 8 + }, + "language_model.model.layers.29.mlp.gate": { + "group_size": 64, + "bits": 8 + }, + "language_model.model.layers.29.mlp.shared_expert_gate": { + "group_size": 64, + "bits": 8 + }, + "language_model.model.layers.30.mlp.gate": { + "group_size": 64, + "bits": 8 + }, + "language_model.model.layers.30.mlp.shared_expert_gate": { + "group_size": 64, + "bits": 8 + }, + "language_model.model.layers.31.mlp.gate": { + "group_size": 64, + "bits": 8 + }, + "language_model.model.layers.31.mlp.shared_expert_gate": { + "group_size": 64, + "bits": 8 + }, + "language_model.model.layers.32.mlp.gate": { + "group_size": 64, + "bits": 8 + }, + "language_model.model.layers.32.mlp.shared_expert_gate": { + "group_size": 64, + "bits": 8 + }, + "language_model.model.layers.33.mlp.gate": { + "group_size": 64, + "bits": 8 + }, + "language_model.model.layers.33.mlp.shared_expert_gate": { + "group_size": 64, + "bits": 8 + }, + "language_model.model.layers.34.mlp.gate": { + "group_size": 64, + "bits": 8 + }, + "language_model.model.layers.34.mlp.shared_expert_gate": { + "group_size": 64, + "bits": 8 + }, + "language_model.model.layers.35.mlp.gate": { + "group_size": 64, + "bits": 8 + }, + "language_model.model.layers.35.mlp.shared_expert_gate": { + "group_size": 64, + "bits": 8 + }, + "language_model.model.layers.36.mlp.gate": { + "group_size": 64, + "bits": 8 + }, + "language_model.model.layers.36.mlp.shared_expert_gate": { + "group_size": 64, + "bits": 8 + }, + "language_model.model.layers.37.mlp.gate": { + "group_size": 64, + "bits": 8 + }, + "language_model.model.layers.37.mlp.shared_expert_gate": { + "group_size": 64, + "bits": 8 + }, + "language_model.model.layers.38.mlp.gate": { + "group_size": 64, + "bits": 8 + }, + "language_model.model.layers.38.mlp.shared_expert_gate": { + "group_size": 64, + "bits": 8 + }, + "language_model.model.layers.39.mlp.gate": { + "group_size": 64, + "bits": 8 + }, + "language_model.model.layers.39.mlp.shared_expert_gate": { + "group_size": 64, + "bits": 8 + } + }, + "text_config": { + "attention_bias": false, + "attention_dropout": 0.0, + "attn_output_gate": true, + "bos_token_id": 248044, + "dtype": "bfloat16", + "eos_token_id": 248044, + "full_attention_interval": 4, + "head_dim": 256, + "hidden_act": "silu", + "hidden_size": 2048, + "initializer_range": 0.02, + "layer_types": [ + "linear_attention", + "linear_attention", + "linear_attention", + "full_attention", + "linear_attention", + "linear_attention", + "linear_attention", + "full_attention", + "linear_attention", + "linear_attention", + "linear_attention", + "full_attention", + "linear_attention", + "linear_attention", + "linear_attention", + "full_attention", + "linear_attention", + "linear_attention", + "linear_attention", + "full_attention", + "linear_attention", + "linear_attention", + "linear_attention", + "full_attention", + "linear_attention", + "linear_attention", + "linear_attention", + "full_attention", + "linear_attention", + "linear_attention", + "linear_attention", + "full_attention", + "linear_attention", + "linear_attention", + "linear_attention", + "full_attention", + "linear_attention", + "linear_attention", + "linear_attention", + "full_attention" + ], + "linear_conv_kernel_dim": 4, + "linear_key_head_dim": 128, + "linear_num_key_heads": 16, + "linear_num_value_heads": 32, + "linear_value_head_dim": 128, + "mamba_ssm_dtype": "float32", + "max_position_embeddings": 262144, + "model_type": "qwen3_5_moe_text", + "moe_intermediate_size": 512, + "mtp_num_hidden_layers": 1, + "mtp_use_dedicated_embeddings": false, + "num_attention_heads": 16, + "num_experts": 256, + "num_experts_per_tok": 8, + "num_hidden_layers": 40, + "num_key_value_heads": 2, + "output_router_logits": false, + "pad_token_id": null, + "partial_rotary_factor": 0.25, + "rms_norm_eps": 1e-06, + "rope_parameters": { + "mrope_interleaved": true, + "mrope_section": [ + 11, + 11, + 10 + ], + "partial_rotary_factor": 0.25, + "rope_theta": 10000000, + "rope_type": "default" + }, + "router_aux_loss_coef": 0.001, + "shared_expert_intermediate_size": 512, + "tie_word_embeddings": false, + "use_cache": true, + "vocab_size": 248320 + }, + "tie_word_embeddings": false, + "transformers_version": "4.57.1", + "video_token_id": 248057, + "vision_config": { + "deepstack_visual_indexes": [], + "depth": 27, + "hidden_act": "gelu_pytorch_tanh", + "hidden_size": 1152, + "in_channels": 3, + "initializer_range": 0.02, + "intermediate_size": 4304, + "model_type": "qwen3_5_moe", + "num_heads": 16, + "num_position_embeddings": 2304, + "out_hidden_size": 2048, + "patch_size": 16, + "spatial_merge_size": 2, + "temporal_patch_size": 2 + }, + "vision_end_token_id": 248054, + "vision_start_token_id": 248053 +} \ No newline at end of file diff --git a/chat/mlx/mlx-community/Qwen3.6-35B-A3B-4bit/configuration.json b/chat/mlx/mlx-community/Qwen3.6-35B-A3B-4bit/configuration.json new file mode 100644 index 0000000..d24dba9 --- /dev/null +++ b/chat/mlx/mlx-community/Qwen3.6-35B-A3B-4bit/configuration.json @@ -0,0 +1 @@ +{"framework":"Pytorch","task":"visual-question-answering"} \ No newline at end of file diff --git a/chat/mlx/mlx-community/Qwen3.6-35B-A3B-4bit/generation_config.json b/chat/mlx/mlx-community/Qwen3.6-35B-A3B-4bit/generation_config.json new file mode 100644 index 0000000..023756c --- /dev/null +++ b/chat/mlx/mlx-community/Qwen3.6-35B-A3B-4bit/generation_config.json @@ -0,0 +1,12 @@ +{ + "bos_token_id": 248044, + "do_sample": true, + "eos_token_id": [ + 248046, + 248044 + ], + "pad_token_id": 248044, + "temperature": 1.0, + "top_k": 20, + "top_p": 0.95 +} diff --git a/chat/mlx/mlx-community/Qwen3.6-35B-A3B-4bit/model-00001-of-00004.safetensors b/chat/mlx/mlx-community/Qwen3.6-35B-A3B-4bit/model-00001-of-00004.safetensors new file mode 100644 index 0000000..a2b31c0 --- /dev/null +++ b/chat/mlx/mlx-community/Qwen3.6-35B-A3B-4bit/model-00001-of-00004.safetensors @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:09f3e6ecb0b7af6e6a38bc8169a134c821b0924c2679b2bb8f4426ad38d032b8 +size 5288196018 diff --git a/chat/mlx/mlx-community/Qwen3.6-35B-A3B-4bit/model-00002-of-00004.safetensors b/chat/mlx/mlx-community/Qwen3.6-35B-A3B-4bit/model-00002-of-00004.safetensors new file mode 100644 index 0000000..6ef94e6 --- /dev/null +++ b/chat/mlx/mlx-community/Qwen3.6-35B-A3B-4bit/model-00002-of-00004.safetensors @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:31dcdb1c49eebdb1505bd14e3cb33f9cf900bd2546b638f2464694ae763a033f +size 5368472749 diff --git a/chat/mlx/mlx-community/Qwen3.6-35B-A3B-4bit/model-00003-of-00004.safetensors b/chat/mlx/mlx-community/Qwen3.6-35B-A3B-4bit/model-00003-of-00004.safetensors new file mode 100644 index 0000000..3fc47ae --- /dev/null +++ b/chat/mlx/mlx-community/Qwen3.6-35B-A3B-4bit/model-00003-of-00004.safetensors @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:3e66de06a1f03dade16a612a368cfce4a4c9caa4efd7d28185454384082cec03 +size 5368324139 diff --git a/chat/mlx/mlx-community/Qwen3.6-35B-A3B-4bit/model-00004-of-00004.safetensors b/chat/mlx/mlx-community/Qwen3.6-35B-A3B-4bit/model-00004-of-00004.safetensors new file mode 100644 index 0000000..6103cd4 --- /dev/null +++ b/chat/mlx/mlx-community/Qwen3.6-35B-A3B-4bit/model-00004-of-00004.safetensors @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:a5d0cf03519c26f8b506df6b0ba60526e5c08c8cea22d0c21ce92950e58a5422 +size 4377211365 diff --git a/chat/mlx/mlx-community/Qwen3.6-35B-A3B-4bit/model.safetensors.index.json b/chat/mlx/mlx-community/Qwen3.6-35B-A3B-4bit/model.safetensors.index.json new file mode 100644 index 0000000..f714d29 --- /dev/null +++ b/chat/mlx/mlx-community/Qwen3.6-35B-A3B-4bit/model.safetensors.index.json @@ -0,0 +1,2097 @@ +{ + "metadata": { + "total_size": 20401929952 + }, + "weight_map": { + "language_model.lm_head.biases": "model-00004-of-00004.safetensors", + "language_model.lm_head.scales": "model-00004-of-00004.safetensors", + "language_model.lm_head.weight": "model-00004-of-00004.safetensors", + "language_model.model.embed_tokens.biases": "model-00001-of-00004.safetensors", + "language_model.model.embed_tokens.scales": "model-00001-of-00004.safetensors", + "language_model.model.embed_tokens.weight": "model-00001-of-00004.safetensors", + "language_model.model.layers.0.input_layernorm.weight": "model-00001-of-00004.safetensors", + "language_model.model.layers.0.linear_attn.A_log": "model-00001-of-00004.safetensors", + "language_model.model.layers.0.linear_attn.conv1d.weight": "model-00001-of-00004.safetensors", + "language_model.model.layers.0.linear_attn.dt_bias": "model-00001-of-00004.safetensors", + "language_model.model.layers.0.linear_attn.in_proj_a.biases": "model-00001-of-00004.safetensors", + "language_model.model.layers.0.linear_attn.in_proj_a.scales": "model-00001-of-00004.safetensors", + "language_model.model.layers.0.linear_attn.in_proj_a.weight": "model-00001-of-00004.safetensors", + "language_model.model.layers.0.linear_attn.in_proj_b.biases": "model-00001-of-00004.safetensors", + "language_model.model.layers.0.linear_attn.in_proj_b.scales": "model-00001-of-00004.safetensors", + "language_model.model.layers.0.linear_attn.in_proj_b.weight": "model-00001-of-00004.safetensors", + "language_model.model.layers.0.linear_attn.in_proj_qkv.biases": "model-00001-of-00004.safetensors", + "language_model.model.layers.0.linear_attn.in_proj_qkv.scales": "model-00001-of-00004.safetensors", + "language_model.model.layers.0.linear_attn.in_proj_qkv.weight": "model-00001-of-00004.safetensors", + "language_model.model.layers.0.linear_attn.in_proj_z.biases": "model-00001-of-00004.safetensors", + "language_model.model.layers.0.linear_attn.in_proj_z.scales": "model-00001-of-00004.safetensors", + "language_model.model.layers.0.linear_attn.in_proj_z.weight": "model-00001-of-00004.safetensors", + "language_model.model.layers.0.linear_attn.norm.weight": "model-00001-of-00004.safetensors", + "language_model.model.layers.0.linear_attn.out_proj.biases": "model-00001-of-00004.safetensors", + "language_model.model.layers.0.linear_attn.out_proj.scales": "model-00001-of-00004.safetensors", + "language_model.model.layers.0.linear_attn.out_proj.weight": "model-00001-of-00004.safetensors", + "language_model.model.layers.0.mlp.gate.biases": "model-00001-of-00004.safetensors", + "language_model.model.layers.0.mlp.gate.scales": "model-00001-of-00004.safetensors", + "language_model.model.layers.0.mlp.gate.weight": "model-00001-of-00004.safetensors", + "language_model.model.layers.0.mlp.shared_expert.down_proj.biases": "model-00001-of-00004.safetensors", + "language_model.model.layers.0.mlp.shared_expert.down_proj.scales": "model-00001-of-00004.safetensors", + "language_model.model.layers.0.mlp.shared_expert.down_proj.weight": "model-00001-of-00004.safetensors", + "language_model.model.layers.0.mlp.shared_expert.gate_proj.biases": "model-00001-of-00004.safetensors", + "language_model.model.layers.0.mlp.shared_expert.gate_proj.scales": "model-00001-of-00004.safetensors", + "language_model.model.layers.0.mlp.shared_expert.gate_proj.weight": "model-00001-of-00004.safetensors", + "language_model.model.layers.0.mlp.shared_expert.up_proj.biases": "model-00001-of-00004.safetensors", + "language_model.model.layers.0.mlp.shared_expert.up_proj.scales": "model-00001-of-00004.safetensors", + "language_model.model.layers.0.mlp.shared_expert.up_proj.weight": "model-00001-of-00004.safetensors", + "language_model.model.layers.0.mlp.shared_expert_gate.biases": "model-00001-of-00004.safetensors", + "language_model.model.layers.0.mlp.shared_expert_gate.scales": "model-00001-of-00004.safetensors", + "language_model.model.layers.0.mlp.shared_expert_gate.weight": "model-00001-of-00004.safetensors", + "language_model.model.layers.0.mlp.switch_mlp.down_proj.biases": "model-00001-of-00004.safetensors", + "language_model.model.layers.0.mlp.switch_mlp.down_proj.scales": "model-00001-of-00004.safetensors", + "language_model.model.layers.0.mlp.switch_mlp.down_proj.weight": "model-00001-of-00004.safetensors", + "language_model.model.layers.0.mlp.switch_mlp.gate_proj.biases": "model-00001-of-00004.safetensors", + "language_model.model.layers.0.mlp.switch_mlp.gate_proj.scales": "model-00001-of-00004.safetensors", + "language_model.model.layers.0.mlp.switch_mlp.gate_proj.weight": "model-00001-of-00004.safetensors", + "language_model.model.layers.0.mlp.switch_mlp.up_proj.biases": "model-00001-of-00004.safetensors", + "language_model.model.layers.0.mlp.switch_mlp.up_proj.scales": "model-00001-of-00004.safetensors", + "language_model.model.layers.0.mlp.switch_mlp.up_proj.weight": "model-00001-of-00004.safetensors", + "language_model.model.layers.0.post_attention_layernorm.weight": "model-00001-of-00004.safetensors", + "language_model.model.layers.1.input_layernorm.weight": "model-00001-of-00004.safetensors", + "language_model.model.layers.1.linear_attn.A_log": "model-00001-of-00004.safetensors", + "language_model.model.layers.1.linear_attn.conv1d.weight": "model-00001-of-00004.safetensors", + "language_model.model.layers.1.linear_attn.dt_bias": "model-00001-of-00004.safetensors", + "language_model.model.layers.1.linear_attn.in_proj_a.biases": "model-00001-of-00004.safetensors", + "language_model.model.layers.1.linear_attn.in_proj_a.scales": "model-00001-of-00004.safetensors", + "language_model.model.layers.1.linear_attn.in_proj_a.weight": "model-00001-of-00004.safetensors", + "language_model.model.layers.1.linear_attn.in_proj_b.biases": "model-00001-of-00004.safetensors", + "language_model.model.layers.1.linear_attn.in_proj_b.scales": "model-00001-of-00004.safetensors", + "language_model.model.layers.1.linear_attn.in_proj_b.weight": "model-00001-of-00004.safetensors", + "language_model.model.layers.1.linear_attn.in_proj_qkv.biases": "model-00001-of-00004.safetensors", + "language_model.model.layers.1.linear_attn.in_proj_qkv.scales": "model-00001-of-00004.safetensors", + "language_model.model.layers.1.linear_attn.in_proj_qkv.weight": "model-00001-of-00004.safetensors", + "language_model.model.layers.1.linear_attn.in_proj_z.biases": "model-00001-of-00004.safetensors", + "language_model.model.layers.1.linear_attn.in_proj_z.scales": "model-00001-of-00004.safetensors", + "language_model.model.layers.1.linear_attn.in_proj_z.weight": "model-00001-of-00004.safetensors", + "language_model.model.layers.1.linear_attn.norm.weight": "model-00001-of-00004.safetensors", + "language_model.model.layers.1.linear_attn.out_proj.biases": "model-00001-of-00004.safetensors", + "language_model.model.layers.1.linear_attn.out_proj.scales": "model-00001-of-00004.safetensors", + "language_model.model.layers.1.linear_attn.out_proj.weight": "model-00001-of-00004.safetensors", + "language_model.model.layers.1.mlp.gate.biases": "model-00001-of-00004.safetensors", + "language_model.model.layers.1.mlp.gate.scales": "model-00001-of-00004.safetensors", + "language_model.model.layers.1.mlp.gate.weight": "model-00001-of-00004.safetensors", + "language_model.model.layers.1.mlp.shared_expert.down_proj.biases": "model-00001-of-00004.safetensors", + "language_model.model.layers.1.mlp.shared_expert.down_proj.scales": "model-00001-of-00004.safetensors", + "language_model.model.layers.1.mlp.shared_expert.down_proj.weight": "model-00001-of-00004.safetensors", + "language_model.model.layers.1.mlp.shared_expert.gate_proj.biases": "model-00001-of-00004.safetensors", + "language_model.model.layers.1.mlp.shared_expert.gate_proj.scales": "model-00001-of-00004.safetensors", + "language_model.model.layers.1.mlp.shared_expert.gate_proj.weight": "model-00001-of-00004.safetensors", + "language_model.model.layers.1.mlp.shared_expert.up_proj.biases": "model-00001-of-00004.safetensors", + "language_model.model.layers.1.mlp.shared_expert.up_proj.scales": "model-00001-of-00004.safetensors", + "language_model.model.layers.1.mlp.shared_expert.up_proj.weight": "model-00001-of-00004.safetensors", + "language_model.model.layers.1.mlp.shared_expert_gate.biases": "model-00001-of-00004.safetensors", + "language_model.model.layers.1.mlp.shared_expert_gate.scales": "model-00001-of-00004.safetensors", + "language_model.model.layers.1.mlp.shared_expert_gate.weight": "model-00001-of-00004.safetensors", + "language_model.model.layers.1.mlp.switch_mlp.down_proj.biases": "model-00001-of-00004.safetensors", + "language_model.model.layers.1.mlp.switch_mlp.down_proj.scales": "model-00001-of-00004.safetensors", + "language_model.model.layers.1.mlp.switch_mlp.down_proj.weight": "model-00001-of-00004.safetensors", + "language_model.model.layers.1.mlp.switch_mlp.gate_proj.biases": "model-00001-of-00004.safetensors", + "language_model.model.layers.1.mlp.switch_mlp.gate_proj.scales": "model-00001-of-00004.safetensors", + "language_model.model.layers.1.mlp.switch_mlp.gate_proj.weight": "model-00001-of-00004.safetensors", + "language_model.model.layers.1.mlp.switch_mlp.up_proj.biases": "model-00001-of-00004.safetensors", + "language_model.model.layers.1.mlp.switch_mlp.up_proj.scales": "model-00001-of-00004.safetensors", + "language_model.model.layers.1.mlp.switch_mlp.up_proj.weight": "model-00001-of-00004.safetensors", + "language_model.model.layers.1.post_attention_layernorm.weight": "model-00001-of-00004.safetensors", + "language_model.model.layers.10.input_layernorm.weight": "model-00002-of-00004.safetensors", + "language_model.model.layers.10.linear_attn.A_log": "model-00002-of-00004.safetensors", + "language_model.model.layers.10.linear_attn.conv1d.weight": "model-00002-of-00004.safetensors", + "language_model.model.layers.10.linear_attn.dt_bias": "model-00002-of-00004.safetensors", + "language_model.model.layers.10.linear_attn.in_proj_a.biases": "model-00002-of-00004.safetensors", + "language_model.model.layers.10.linear_attn.in_proj_a.scales": "model-00002-of-00004.safetensors", + "language_model.model.layers.10.linear_attn.in_proj_a.weight": "model-00002-of-00004.safetensors", + "language_model.model.layers.10.linear_attn.in_proj_b.biases": "model-00002-of-00004.safetensors", + "language_model.model.layers.10.linear_attn.in_proj_b.scales": "model-00002-of-00004.safetensors", + "language_model.model.layers.10.linear_attn.in_proj_b.weight": "model-00002-of-00004.safetensors", + "language_model.model.layers.10.linear_attn.in_proj_qkv.biases": "model-00002-of-00004.safetensors", + "language_model.model.layers.10.linear_attn.in_proj_qkv.scales": "model-00002-of-00004.safetensors", + "language_model.model.layers.10.linear_attn.in_proj_qkv.weight": "model-00002-of-00004.safetensors", + "language_model.model.layers.10.linear_attn.in_proj_z.biases": "model-00002-of-00004.safetensors", + "language_model.model.layers.10.linear_attn.in_proj_z.scales": "model-00002-of-00004.safetensors", + "language_model.model.layers.10.linear_attn.in_proj_z.weight": "model-00002-of-00004.safetensors", + "language_model.model.layers.10.linear_attn.norm.weight": "model-00002-of-00004.safetensors", + "language_model.model.layers.10.linear_attn.out_proj.biases": "model-00002-of-00004.safetensors", + "language_model.model.layers.10.linear_attn.out_proj.scales": "model-00002-of-00004.safetensors", + "language_model.model.layers.10.linear_attn.out_proj.weight": "model-00002-of-00004.safetensors", + "language_model.model.layers.10.mlp.gate.biases": "model-00002-of-00004.safetensors", + "language_model.model.layers.10.mlp.gate.scales": "model-00002-of-00004.safetensors", + "language_model.model.layers.10.mlp.gate.weight": "model-00002-of-00004.safetensors", + "language_model.model.layers.10.mlp.shared_expert.down_proj.biases": "model-00002-of-00004.safetensors", + "language_model.model.layers.10.mlp.shared_expert.down_proj.scales": "model-00002-of-00004.safetensors", + "language_model.model.layers.10.mlp.shared_expert.down_proj.weight": "model-00002-of-00004.safetensors", + "language_model.model.layers.10.mlp.shared_expert.gate_proj.biases": "model-00002-of-00004.safetensors", + "language_model.model.layers.10.mlp.shared_expert.gate_proj.scales": "model-00002-of-00004.safetensors", + "language_model.model.layers.10.mlp.shared_expert.gate_proj.weight": "model-00002-of-00004.safetensors", + "language_model.model.layers.10.mlp.shared_expert.up_proj.biases": "model-00002-of-00004.safetensors", + "language_model.model.layers.10.mlp.shared_expert.up_proj.scales": "model-00002-of-00004.safetensors", + "language_model.model.layers.10.mlp.shared_expert.up_proj.weight": "model-00002-of-00004.safetensors", + "language_model.model.layers.10.mlp.shared_expert_gate.biases": "model-00002-of-00004.safetensors", + "language_model.model.layers.10.mlp.shared_expert_gate.scales": "model-00002-of-00004.safetensors", + "language_model.model.layers.10.mlp.shared_expert_gate.weight": "model-00002-of-00004.safetensors", + "language_model.model.layers.10.mlp.switch_mlp.down_proj.biases": "model-00002-of-00004.safetensors", + "language_model.model.layers.10.mlp.switch_mlp.down_proj.scales": "model-00002-of-00004.safetensors", + "language_model.model.layers.10.mlp.switch_mlp.down_proj.weight": "model-00002-of-00004.safetensors", + "language_model.model.layers.10.mlp.switch_mlp.gate_proj.biases": "model-00002-of-00004.safetensors", + "language_model.model.layers.10.mlp.switch_mlp.gate_proj.scales": "model-00002-of-00004.safetensors", + "language_model.model.layers.10.mlp.switch_mlp.gate_proj.weight": "model-00002-of-00004.safetensors", + "language_model.model.layers.10.mlp.switch_mlp.up_proj.biases": "model-00002-of-00004.safetensors", + "language_model.model.layers.10.mlp.switch_mlp.up_proj.scales": "model-00002-of-00004.safetensors", + "language_model.model.layers.10.mlp.switch_mlp.up_proj.weight": "model-00002-of-00004.safetensors", + "language_model.model.layers.10.post_attention_layernorm.weight": "model-00002-of-00004.safetensors", + "language_model.model.layers.11.input_layernorm.weight": "model-00002-of-00004.safetensors", + "language_model.model.layers.11.mlp.gate.biases": "model-00002-of-00004.safetensors", + "language_model.model.layers.11.mlp.gate.scales": "model-00002-of-00004.safetensors", + "language_model.model.layers.11.mlp.gate.weight": "model-00002-of-00004.safetensors", + "language_model.model.layers.11.mlp.shared_expert.down_proj.biases": "model-00002-of-00004.safetensors", + "language_model.model.layers.11.mlp.shared_expert.down_proj.scales": "model-00002-of-00004.safetensors", + "language_model.model.layers.11.mlp.shared_expert.down_proj.weight": "model-00002-of-00004.safetensors", + "language_model.model.layers.11.mlp.shared_expert.gate_proj.biases": "model-00002-of-00004.safetensors", + "language_model.model.layers.11.mlp.shared_expert.gate_proj.scales": "model-00002-of-00004.safetensors", + "language_model.model.layers.11.mlp.shared_expert.gate_proj.weight": "model-00002-of-00004.safetensors", + "language_model.model.layers.11.mlp.shared_expert.up_proj.biases": "model-00002-of-00004.safetensors", + "language_model.model.layers.11.mlp.shared_expert.up_proj.scales": "model-00002-of-00004.safetensors", + "language_model.model.layers.11.mlp.shared_expert.up_proj.weight": "model-00002-of-00004.safetensors", + "language_model.model.layers.11.mlp.shared_expert_gate.biases": "model-00002-of-00004.safetensors", + "language_model.model.layers.11.mlp.shared_expert_gate.scales": "model-00002-of-00004.safetensors", + "language_model.model.layers.11.mlp.shared_expert_gate.weight": "model-00002-of-00004.safetensors", + "language_model.model.layers.11.mlp.switch_mlp.down_proj.biases": "model-00002-of-00004.safetensors", + "language_model.model.layers.11.mlp.switch_mlp.down_proj.scales": "model-00002-of-00004.safetensors", + "language_model.model.layers.11.mlp.switch_mlp.down_proj.weight": "model-00002-of-00004.safetensors", + "language_model.model.layers.11.mlp.switch_mlp.gate_proj.biases": "model-00002-of-00004.safetensors", + "language_model.model.layers.11.mlp.switch_mlp.gate_proj.scales": "model-00002-of-00004.safetensors", + "language_model.model.layers.11.mlp.switch_mlp.gate_proj.weight": "model-00002-of-00004.safetensors", + "language_model.model.layers.11.mlp.switch_mlp.up_proj.biases": "model-00002-of-00004.safetensors", + "language_model.model.layers.11.mlp.switch_mlp.up_proj.scales": "model-00002-of-00004.safetensors", + "language_model.model.layers.11.mlp.switch_mlp.up_proj.weight": "model-00002-of-00004.safetensors", + "language_model.model.layers.11.post_attention_layernorm.weight": "model-00002-of-00004.safetensors", + "language_model.model.layers.11.self_attn.k_norm.weight": "model-00002-of-00004.safetensors", + "language_model.model.layers.11.self_attn.k_proj.biases": "model-00002-of-00004.safetensors", + "language_model.model.layers.11.self_attn.k_proj.scales": "model-00002-of-00004.safetensors", + "language_model.model.layers.11.self_attn.k_proj.weight": "model-00002-of-00004.safetensors", + "language_model.model.layers.11.self_attn.o_proj.biases": "model-00002-of-00004.safetensors", + "language_model.model.layers.11.self_attn.o_proj.scales": "model-00002-of-00004.safetensors", + "language_model.model.layers.11.self_attn.o_proj.weight": "model-00002-of-00004.safetensors", + "language_model.model.layers.11.self_attn.q_norm.weight": "model-00002-of-00004.safetensors", + "language_model.model.layers.11.self_attn.q_proj.biases": "model-00002-of-00004.safetensors", + "language_model.model.layers.11.self_attn.q_proj.scales": "model-00002-of-00004.safetensors", + "language_model.model.layers.11.self_attn.q_proj.weight": "model-00002-of-00004.safetensors", + "language_model.model.layers.11.self_attn.v_proj.biases": "model-00002-of-00004.safetensors", + "language_model.model.layers.11.self_attn.v_proj.scales": "model-00002-of-00004.safetensors", + "language_model.model.layers.11.self_attn.v_proj.weight": "model-00002-of-00004.safetensors", + "language_model.model.layers.12.input_layernorm.weight": "model-00002-of-00004.safetensors", + "language_model.model.layers.12.linear_attn.A_log": "model-00002-of-00004.safetensors", + "language_model.model.layers.12.linear_attn.conv1d.weight": "model-00002-of-00004.safetensors", + "language_model.model.layers.12.linear_attn.dt_bias": "model-00002-of-00004.safetensors", + "language_model.model.layers.12.linear_attn.in_proj_a.biases": "model-00002-of-00004.safetensors", + "language_model.model.layers.12.linear_attn.in_proj_a.scales": "model-00002-of-00004.safetensors", + "language_model.model.layers.12.linear_attn.in_proj_a.weight": "model-00002-of-00004.safetensors", + "language_model.model.layers.12.linear_attn.in_proj_b.biases": "model-00002-of-00004.safetensors", + "language_model.model.layers.12.linear_attn.in_proj_b.scales": "model-00002-of-00004.safetensors", + "language_model.model.layers.12.linear_attn.in_proj_b.weight": "model-00002-of-00004.safetensors", + "language_model.model.layers.12.linear_attn.in_proj_qkv.biases": "model-00002-of-00004.safetensors", + "language_model.model.layers.12.linear_attn.in_proj_qkv.scales": "model-00002-of-00004.safetensors", + "language_model.model.layers.12.linear_attn.in_proj_qkv.weight": "model-00002-of-00004.safetensors", + "language_model.model.layers.12.linear_attn.in_proj_z.biases": "model-00002-of-00004.safetensors", + "language_model.model.layers.12.linear_attn.in_proj_z.scales": "model-00002-of-00004.safetensors", + "language_model.model.layers.12.linear_attn.in_proj_z.weight": "model-00002-of-00004.safetensors", + "language_model.model.layers.12.linear_attn.norm.weight": "model-00002-of-00004.safetensors", + "language_model.model.layers.12.linear_attn.out_proj.biases": "model-00002-of-00004.safetensors", + "language_model.model.layers.12.linear_attn.out_proj.scales": "model-00002-of-00004.safetensors", + "language_model.model.layers.12.linear_attn.out_proj.weight": "model-00002-of-00004.safetensors", + "language_model.model.layers.12.mlp.gate.biases": "model-00002-of-00004.safetensors", + "language_model.model.layers.12.mlp.gate.scales": "model-00002-of-00004.safetensors", + "language_model.model.layers.12.mlp.gate.weight": "model-00002-of-00004.safetensors", + "language_model.model.layers.12.mlp.shared_expert.down_proj.biases": "model-00002-of-00004.safetensors", + "language_model.model.layers.12.mlp.shared_expert.down_proj.scales": "model-00002-of-00004.safetensors", + "language_model.model.layers.12.mlp.shared_expert.down_proj.weight": "model-00002-of-00004.safetensors", + "language_model.model.layers.12.mlp.shared_expert.gate_proj.biases": "model-00002-of-00004.safetensors", + "language_model.model.layers.12.mlp.shared_expert.gate_proj.scales": "model-00002-of-00004.safetensors", + "language_model.model.layers.12.mlp.shared_expert.gate_proj.weight": "model-00002-of-00004.safetensors", + "language_model.model.layers.12.mlp.shared_expert.up_proj.biases": "model-00002-of-00004.safetensors", + "language_model.model.layers.12.mlp.shared_expert.up_proj.scales": "model-00002-of-00004.safetensors", + "language_model.model.layers.12.mlp.shared_expert.up_proj.weight": "model-00002-of-00004.safetensors", + "language_model.model.layers.12.mlp.shared_expert_gate.biases": "model-00002-of-00004.safetensors", + "language_model.model.layers.12.mlp.shared_expert_gate.scales": "model-00002-of-00004.safetensors", + "language_model.model.layers.12.mlp.shared_expert_gate.weight": "model-00002-of-00004.safetensors", + "language_model.model.layers.12.mlp.switch_mlp.down_proj.biases": "model-00002-of-00004.safetensors", + "language_model.model.layers.12.mlp.switch_mlp.down_proj.scales": "model-00002-of-00004.safetensors", + "language_model.model.layers.12.mlp.switch_mlp.down_proj.weight": "model-00002-of-00004.safetensors", + "language_model.model.layers.12.mlp.switch_mlp.gate_proj.biases": "model-00002-of-00004.safetensors", + "language_model.model.layers.12.mlp.switch_mlp.gate_proj.scales": "model-00002-of-00004.safetensors", + "language_model.model.layers.12.mlp.switch_mlp.gate_proj.weight": "model-00002-of-00004.safetensors", + "language_model.model.layers.12.mlp.switch_mlp.up_proj.biases": "model-00002-of-00004.safetensors", + "language_model.model.layers.12.mlp.switch_mlp.up_proj.scales": "model-00002-of-00004.safetensors", + "language_model.model.layers.12.mlp.switch_mlp.up_proj.weight": "model-00002-of-00004.safetensors", + "language_model.model.layers.12.post_attention_layernorm.weight": "model-00002-of-00004.safetensors", + "language_model.model.layers.13.input_layernorm.weight": "model-00002-of-00004.safetensors", + "language_model.model.layers.13.linear_attn.A_log": "model-00002-of-00004.safetensors", + "language_model.model.layers.13.linear_attn.conv1d.weight": "model-00002-of-00004.safetensors", + "language_model.model.layers.13.linear_attn.dt_bias": "model-00002-of-00004.safetensors", + "language_model.model.layers.13.linear_attn.in_proj_a.biases": "model-00002-of-00004.safetensors", + "language_model.model.layers.13.linear_attn.in_proj_a.scales": "model-00002-of-00004.safetensors", + "language_model.model.layers.13.linear_attn.in_proj_a.weight": "model-00002-of-00004.safetensors", + "language_model.model.layers.13.linear_attn.in_proj_b.biases": "model-00002-of-00004.safetensors", + "language_model.model.layers.13.linear_attn.in_proj_b.scales": "model-00002-of-00004.safetensors", + "language_model.model.layers.13.linear_attn.in_proj_b.weight": "model-00002-of-00004.safetensors", + "language_model.model.layers.13.linear_attn.in_proj_qkv.biases": "model-00002-of-00004.safetensors", + "language_model.model.layers.13.linear_attn.in_proj_qkv.scales": "model-00002-of-00004.safetensors", + "language_model.model.layers.13.linear_attn.in_proj_qkv.weight": "model-00002-of-00004.safetensors", + "language_model.model.layers.13.linear_attn.in_proj_z.biases": "model-00002-of-00004.safetensors", + "language_model.model.layers.13.linear_attn.in_proj_z.scales": "model-00002-of-00004.safetensors", + "language_model.model.layers.13.linear_attn.in_proj_z.weight": "model-00002-of-00004.safetensors", + "language_model.model.layers.13.linear_attn.norm.weight": "model-00002-of-00004.safetensors", + "language_model.model.layers.13.linear_attn.out_proj.biases": "model-00002-of-00004.safetensors", + "language_model.model.layers.13.linear_attn.out_proj.scales": "model-00002-of-00004.safetensors", + "language_model.model.layers.13.linear_attn.out_proj.weight": "model-00002-of-00004.safetensors", + "language_model.model.layers.13.mlp.gate.biases": "model-00002-of-00004.safetensors", + "language_model.model.layers.13.mlp.gate.scales": "model-00002-of-00004.safetensors", + "language_model.model.layers.13.mlp.gate.weight": "model-00002-of-00004.safetensors", + "language_model.model.layers.13.mlp.shared_expert.down_proj.biases": "model-00002-of-00004.safetensors", + "language_model.model.layers.13.mlp.shared_expert.down_proj.scales": "model-00002-of-00004.safetensors", + "language_model.model.layers.13.mlp.shared_expert.down_proj.weight": "model-00002-of-00004.safetensors", + "language_model.model.layers.13.mlp.shared_expert.gate_proj.biases": "model-00002-of-00004.safetensors", + "language_model.model.layers.13.mlp.shared_expert.gate_proj.scales": "model-00002-of-00004.safetensors", + "language_model.model.layers.13.mlp.shared_expert.gate_proj.weight": "model-00002-of-00004.safetensors", + "language_model.model.layers.13.mlp.shared_expert.up_proj.biases": "model-00002-of-00004.safetensors", + "language_model.model.layers.13.mlp.shared_expert.up_proj.scales": "model-00002-of-00004.safetensors", + "language_model.model.layers.13.mlp.shared_expert.up_proj.weight": "model-00002-of-00004.safetensors", + "language_model.model.layers.13.mlp.shared_expert_gate.biases": "model-00002-of-00004.safetensors", + "language_model.model.layers.13.mlp.shared_expert_gate.scales": "model-00002-of-00004.safetensors", + "language_model.model.layers.13.mlp.shared_expert_gate.weight": "model-00002-of-00004.safetensors", + "language_model.model.layers.13.mlp.switch_mlp.down_proj.biases": "model-00002-of-00004.safetensors", + "language_model.model.layers.13.mlp.switch_mlp.down_proj.scales": "model-00002-of-00004.safetensors", + "language_model.model.layers.13.mlp.switch_mlp.down_proj.weight": "model-00002-of-00004.safetensors", + "language_model.model.layers.13.mlp.switch_mlp.gate_proj.biases": "model-00002-of-00004.safetensors", + "language_model.model.layers.13.mlp.switch_mlp.gate_proj.scales": "model-00002-of-00004.safetensors", + "language_model.model.layers.13.mlp.switch_mlp.gate_proj.weight": "model-00002-of-00004.safetensors", + "language_model.model.layers.13.mlp.switch_mlp.up_proj.biases": "model-00002-of-00004.safetensors", + "language_model.model.layers.13.mlp.switch_mlp.up_proj.scales": "model-00002-of-00004.safetensors", + "language_model.model.layers.13.mlp.switch_mlp.up_proj.weight": "model-00002-of-00004.safetensors", + "language_model.model.layers.13.post_attention_layernorm.weight": "model-00002-of-00004.safetensors", + "language_model.model.layers.14.input_layernorm.weight": "model-00002-of-00004.safetensors", + "language_model.model.layers.14.linear_attn.A_log": "model-00002-of-00004.safetensors", + "language_model.model.layers.14.linear_attn.conv1d.weight": "model-00002-of-00004.safetensors", + "language_model.model.layers.14.linear_attn.dt_bias": "model-00002-of-00004.safetensors", + "language_model.model.layers.14.linear_attn.in_proj_a.biases": "model-00002-of-00004.safetensors", + "language_model.model.layers.14.linear_attn.in_proj_a.scales": "model-00002-of-00004.safetensors", + "language_model.model.layers.14.linear_attn.in_proj_a.weight": "model-00002-of-00004.safetensors", + "language_model.model.layers.14.linear_attn.in_proj_b.biases": "model-00002-of-00004.safetensors", + "language_model.model.layers.14.linear_attn.in_proj_b.scales": "model-00002-of-00004.safetensors", + "language_model.model.layers.14.linear_attn.in_proj_b.weight": "model-00002-of-00004.safetensors", + "language_model.model.layers.14.linear_attn.in_proj_qkv.biases": "model-00002-of-00004.safetensors", + "language_model.model.layers.14.linear_attn.in_proj_qkv.scales": "model-00002-of-00004.safetensors", + "language_model.model.layers.14.linear_attn.in_proj_qkv.weight": "model-00002-of-00004.safetensors", + "language_model.model.layers.14.linear_attn.in_proj_z.biases": "model-00002-of-00004.safetensors", + "language_model.model.layers.14.linear_attn.in_proj_z.scales": "model-00002-of-00004.safetensors", + "language_model.model.layers.14.linear_attn.in_proj_z.weight": "model-00002-of-00004.safetensors", + "language_model.model.layers.14.linear_attn.norm.weight": "model-00002-of-00004.safetensors", + "language_model.model.layers.14.linear_attn.out_proj.biases": "model-00002-of-00004.safetensors", + "language_model.model.layers.14.linear_attn.out_proj.scales": "model-00002-of-00004.safetensors", + "language_model.model.layers.14.linear_attn.out_proj.weight": "model-00002-of-00004.safetensors", + "language_model.model.layers.14.mlp.gate.biases": "model-00002-of-00004.safetensors", + "language_model.model.layers.14.mlp.gate.scales": "model-00002-of-00004.safetensors", + "language_model.model.layers.14.mlp.gate.weight": "model-00002-of-00004.safetensors", + "language_model.model.layers.14.mlp.shared_expert.down_proj.biases": "model-00002-of-00004.safetensors", + "language_model.model.layers.14.mlp.shared_expert.down_proj.scales": "model-00002-of-00004.safetensors", + "language_model.model.layers.14.mlp.shared_expert.down_proj.weight": "model-00002-of-00004.safetensors", + "language_model.model.layers.14.mlp.shared_expert.gate_proj.biases": "model-00002-of-00004.safetensors", + "language_model.model.layers.14.mlp.shared_expert.gate_proj.scales": "model-00002-of-00004.safetensors", + "language_model.model.layers.14.mlp.shared_expert.gate_proj.weight": "model-00002-of-00004.safetensors", + "language_model.model.layers.14.mlp.shared_expert.up_proj.biases": "model-00002-of-00004.safetensors", + "language_model.model.layers.14.mlp.shared_expert.up_proj.scales": "model-00002-of-00004.safetensors", + "language_model.model.layers.14.mlp.shared_expert.up_proj.weight": "model-00002-of-00004.safetensors", + "language_model.model.layers.14.mlp.shared_expert_gate.biases": "model-00002-of-00004.safetensors", + "language_model.model.layers.14.mlp.shared_expert_gate.scales": "model-00002-of-00004.safetensors", + "language_model.model.layers.14.mlp.shared_expert_gate.weight": "model-00002-of-00004.safetensors", + "language_model.model.layers.14.mlp.switch_mlp.down_proj.biases": "model-00002-of-00004.safetensors", + "language_model.model.layers.14.mlp.switch_mlp.down_proj.scales": "model-00002-of-00004.safetensors", + "language_model.model.layers.14.mlp.switch_mlp.down_proj.weight": "model-00002-of-00004.safetensors", + "language_model.model.layers.14.mlp.switch_mlp.gate_proj.biases": "model-00002-of-00004.safetensors", + "language_model.model.layers.14.mlp.switch_mlp.gate_proj.scales": "model-00002-of-00004.safetensors", + "language_model.model.layers.14.mlp.switch_mlp.gate_proj.weight": "model-00002-of-00004.safetensors", + "language_model.model.layers.14.mlp.switch_mlp.up_proj.biases": "model-00002-of-00004.safetensors", + "language_model.model.layers.14.mlp.switch_mlp.up_proj.scales": "model-00002-of-00004.safetensors", + "language_model.model.layers.14.mlp.switch_mlp.up_proj.weight": "model-00002-of-00004.safetensors", + "language_model.model.layers.14.post_attention_layernorm.weight": "model-00002-of-00004.safetensors", + "language_model.model.layers.15.input_layernorm.weight": "model-00002-of-00004.safetensors", + "language_model.model.layers.15.mlp.gate.biases": "model-00002-of-00004.safetensors", + "language_model.model.layers.15.mlp.gate.scales": "model-00002-of-00004.safetensors", + "language_model.model.layers.15.mlp.gate.weight": "model-00002-of-00004.safetensors", + "language_model.model.layers.15.mlp.shared_expert.down_proj.biases": "model-00002-of-00004.safetensors", + "language_model.model.layers.15.mlp.shared_expert.down_proj.scales": "model-00002-of-00004.safetensors", + "language_model.model.layers.15.mlp.shared_expert.down_proj.weight": "model-00002-of-00004.safetensors", + "language_model.model.layers.15.mlp.shared_expert.gate_proj.biases": "model-00002-of-00004.safetensors", + "language_model.model.layers.15.mlp.shared_expert.gate_proj.scales": "model-00002-of-00004.safetensors", + "language_model.model.layers.15.mlp.shared_expert.gate_proj.weight": "model-00002-of-00004.safetensors", + "language_model.model.layers.15.mlp.shared_expert.up_proj.biases": "model-00002-of-00004.safetensors", + "language_model.model.layers.15.mlp.shared_expert.up_proj.scales": "model-00002-of-00004.safetensors", + "language_model.model.layers.15.mlp.shared_expert.up_proj.weight": "model-00002-of-00004.safetensors", + "language_model.model.layers.15.mlp.shared_expert_gate.biases": "model-00002-of-00004.safetensors", + "language_model.model.layers.15.mlp.shared_expert_gate.scales": "model-00002-of-00004.safetensors", + "language_model.model.layers.15.mlp.shared_expert_gate.weight": "model-00002-of-00004.safetensors", + "language_model.model.layers.15.mlp.switch_mlp.down_proj.biases": "model-00002-of-00004.safetensors", + "language_model.model.layers.15.mlp.switch_mlp.down_proj.scales": "model-00002-of-00004.safetensors", + "language_model.model.layers.15.mlp.switch_mlp.down_proj.weight": "model-00002-of-00004.safetensors", + "language_model.model.layers.15.mlp.switch_mlp.gate_proj.biases": "model-00002-of-00004.safetensors", + "language_model.model.layers.15.mlp.switch_mlp.gate_proj.scales": "model-00002-of-00004.safetensors", + "language_model.model.layers.15.mlp.switch_mlp.gate_proj.weight": "model-00002-of-00004.safetensors", + "language_model.model.layers.15.mlp.switch_mlp.up_proj.biases": "model-00002-of-00004.safetensors", + "language_model.model.layers.15.mlp.switch_mlp.up_proj.scales": "model-00002-of-00004.safetensors", + "language_model.model.layers.15.mlp.switch_mlp.up_proj.weight": "model-00002-of-00004.safetensors", + "language_model.model.layers.15.post_attention_layernorm.weight": "model-00002-of-00004.safetensors", + "language_model.model.layers.15.self_attn.k_norm.weight": "model-00002-of-00004.safetensors", + "language_model.model.layers.15.self_attn.k_proj.biases": "model-00002-of-00004.safetensors", + "language_model.model.layers.15.self_attn.k_proj.scales": "model-00002-of-00004.safetensors", + "language_model.model.layers.15.self_attn.k_proj.weight": "model-00002-of-00004.safetensors", + "language_model.model.layers.15.self_attn.o_proj.biases": "model-00002-of-00004.safetensors", + "language_model.model.layers.15.self_attn.o_proj.scales": "model-00002-of-00004.safetensors", + "language_model.model.layers.15.self_attn.o_proj.weight": "model-00002-of-00004.safetensors", + "language_model.model.layers.15.self_attn.q_norm.weight": "model-00002-of-00004.safetensors", + "language_model.model.layers.15.self_attn.q_proj.biases": "model-00002-of-00004.safetensors", + "language_model.model.layers.15.self_attn.q_proj.scales": "model-00002-of-00004.safetensors", + "language_model.model.layers.15.self_attn.q_proj.weight": "model-00002-of-00004.safetensors", + "language_model.model.layers.15.self_attn.v_proj.biases": "model-00002-of-00004.safetensors", + "language_model.model.layers.15.self_attn.v_proj.scales": "model-00002-of-00004.safetensors", + "language_model.model.layers.15.self_attn.v_proj.weight": "model-00002-of-00004.safetensors", + "language_model.model.layers.16.input_layernorm.weight": "model-00002-of-00004.safetensors", + "language_model.model.layers.16.linear_attn.A_log": "model-00002-of-00004.safetensors", + "language_model.model.layers.16.linear_attn.conv1d.weight": "model-00002-of-00004.safetensors", + "language_model.model.layers.16.linear_attn.dt_bias": "model-00002-of-00004.safetensors", + "language_model.model.layers.16.linear_attn.in_proj_a.biases": "model-00002-of-00004.safetensors", + "language_model.model.layers.16.linear_attn.in_proj_a.scales": "model-00002-of-00004.safetensors", + "language_model.model.layers.16.linear_attn.in_proj_a.weight": "model-00002-of-00004.safetensors", + "language_model.model.layers.16.linear_attn.in_proj_b.biases": "model-00002-of-00004.safetensors", + "language_model.model.layers.16.linear_attn.in_proj_b.scales": "model-00002-of-00004.safetensors", + "language_model.model.layers.16.linear_attn.in_proj_b.weight": "model-00002-of-00004.safetensors", + "language_model.model.layers.16.linear_attn.in_proj_qkv.biases": "model-00002-of-00004.safetensors", + "language_model.model.layers.16.linear_attn.in_proj_qkv.scales": "model-00002-of-00004.safetensors", + "language_model.model.layers.16.linear_attn.in_proj_qkv.weight": "model-00002-of-00004.safetensors", + "language_model.model.layers.16.linear_attn.in_proj_z.biases": "model-00002-of-00004.safetensors", + "language_model.model.layers.16.linear_attn.in_proj_z.scales": "model-00002-of-00004.safetensors", + "language_model.model.layers.16.linear_attn.in_proj_z.weight": "model-00002-of-00004.safetensors", + "language_model.model.layers.16.linear_attn.norm.weight": "model-00002-of-00004.safetensors", + "language_model.model.layers.16.linear_attn.out_proj.biases": "model-00002-of-00004.safetensors", + "language_model.model.layers.16.linear_attn.out_proj.scales": "model-00002-of-00004.safetensors", + "language_model.model.layers.16.linear_attn.out_proj.weight": "model-00002-of-00004.safetensors", + "language_model.model.layers.16.mlp.gate.biases": "model-00002-of-00004.safetensors", + "language_model.model.layers.16.mlp.gate.scales": "model-00002-of-00004.safetensors", + "language_model.model.layers.16.mlp.gate.weight": "model-00002-of-00004.safetensors", + "language_model.model.layers.16.mlp.shared_expert.down_proj.biases": "model-00002-of-00004.safetensors", + "language_model.model.layers.16.mlp.shared_expert.down_proj.scales": "model-00002-of-00004.safetensors", + "language_model.model.layers.16.mlp.shared_expert.down_proj.weight": "model-00002-of-00004.safetensors", + "language_model.model.layers.16.mlp.shared_expert.gate_proj.biases": "model-00002-of-00004.safetensors", + "language_model.model.layers.16.mlp.shared_expert.gate_proj.scales": "model-00002-of-00004.safetensors", + "language_model.model.layers.16.mlp.shared_expert.gate_proj.weight": "model-00002-of-00004.safetensors", + "language_model.model.layers.16.mlp.shared_expert.up_proj.biases": "model-00002-of-00004.safetensors", + "language_model.model.layers.16.mlp.shared_expert.up_proj.scales": "model-00002-of-00004.safetensors", + "language_model.model.layers.16.mlp.shared_expert.up_proj.weight": "model-00002-of-00004.safetensors", + "language_model.model.layers.16.mlp.shared_expert_gate.biases": "model-00002-of-00004.safetensors", + "language_model.model.layers.16.mlp.shared_expert_gate.scales": "model-00002-of-00004.safetensors", + "language_model.model.layers.16.mlp.shared_expert_gate.weight": "model-00002-of-00004.safetensors", + "language_model.model.layers.16.mlp.switch_mlp.down_proj.biases": "model-00002-of-00004.safetensors", + "language_model.model.layers.16.mlp.switch_mlp.down_proj.scales": "model-00002-of-00004.safetensors", + "language_model.model.layers.16.mlp.switch_mlp.down_proj.weight": "model-00002-of-00004.safetensors", + "language_model.model.layers.16.mlp.switch_mlp.gate_proj.biases": "model-00002-of-00004.safetensors", + "language_model.model.layers.16.mlp.switch_mlp.gate_proj.scales": "model-00002-of-00004.safetensors", + "language_model.model.layers.16.mlp.switch_mlp.gate_proj.weight": "model-00002-of-00004.safetensors", + "language_model.model.layers.16.mlp.switch_mlp.up_proj.biases": "model-00002-of-00004.safetensors", + "language_model.model.layers.16.mlp.switch_mlp.up_proj.scales": "model-00002-of-00004.safetensors", + "language_model.model.layers.16.mlp.switch_mlp.up_proj.weight": "model-00002-of-00004.safetensors", + "language_model.model.layers.16.post_attention_layernorm.weight": "model-00002-of-00004.safetensors", + "language_model.model.layers.17.input_layernorm.weight": "model-00002-of-00004.safetensors", + "language_model.model.layers.17.linear_attn.A_log": "model-00002-of-00004.safetensors", + "language_model.model.layers.17.linear_attn.conv1d.weight": "model-00002-of-00004.safetensors", + "language_model.model.layers.17.linear_attn.dt_bias": "model-00002-of-00004.safetensors", + "language_model.model.layers.17.linear_attn.in_proj_a.biases": "model-00002-of-00004.safetensors", + "language_model.model.layers.17.linear_attn.in_proj_a.scales": "model-00002-of-00004.safetensors", + "language_model.model.layers.17.linear_attn.in_proj_a.weight": "model-00002-of-00004.safetensors", + "language_model.model.layers.17.linear_attn.in_proj_b.biases": "model-00002-of-00004.safetensors", + "language_model.model.layers.17.linear_attn.in_proj_b.scales": "model-00002-of-00004.safetensors", + "language_model.model.layers.17.linear_attn.in_proj_b.weight": "model-00002-of-00004.safetensors", + "language_model.model.layers.17.linear_attn.in_proj_qkv.biases": "model-00002-of-00004.safetensors", + "language_model.model.layers.17.linear_attn.in_proj_qkv.scales": "model-00002-of-00004.safetensors", + "language_model.model.layers.17.linear_attn.in_proj_qkv.weight": "model-00002-of-00004.safetensors", + "language_model.model.layers.17.linear_attn.in_proj_z.biases": "model-00002-of-00004.safetensors", + "language_model.model.layers.17.linear_attn.in_proj_z.scales": "model-00002-of-00004.safetensors", + "language_model.model.layers.17.linear_attn.in_proj_z.weight": "model-00002-of-00004.safetensors", + "language_model.model.layers.17.linear_attn.norm.weight": "model-00002-of-00004.safetensors", + "language_model.model.layers.17.linear_attn.out_proj.biases": "model-00002-of-00004.safetensors", + "language_model.model.layers.17.linear_attn.out_proj.scales": "model-00002-of-00004.safetensors", + "language_model.model.layers.17.linear_attn.out_proj.weight": "model-00002-of-00004.safetensors", + "language_model.model.layers.17.mlp.gate.biases": "model-00002-of-00004.safetensors", + "language_model.model.layers.17.mlp.gate.scales": "model-00002-of-00004.safetensors", + "language_model.model.layers.17.mlp.gate.weight": "model-00002-of-00004.safetensors", + "language_model.model.layers.17.mlp.shared_expert.down_proj.biases": "model-00002-of-00004.safetensors", + "language_model.model.layers.17.mlp.shared_expert.down_proj.scales": "model-00002-of-00004.safetensors", + "language_model.model.layers.17.mlp.shared_expert.down_proj.weight": "model-00002-of-00004.safetensors", + "language_model.model.layers.17.mlp.shared_expert.gate_proj.biases": "model-00002-of-00004.safetensors", + "language_model.model.layers.17.mlp.shared_expert.gate_proj.scales": "model-00002-of-00004.safetensors", + "language_model.model.layers.17.mlp.shared_expert.gate_proj.weight": "model-00002-of-00004.safetensors", + "language_model.model.layers.17.mlp.shared_expert.up_proj.biases": "model-00002-of-00004.safetensors", + "language_model.model.layers.17.mlp.shared_expert.up_proj.scales": "model-00002-of-00004.safetensors", + "language_model.model.layers.17.mlp.shared_expert.up_proj.weight": "model-00002-of-00004.safetensors", + "language_model.model.layers.17.mlp.shared_expert_gate.biases": "model-00002-of-00004.safetensors", + "language_model.model.layers.17.mlp.shared_expert_gate.scales": "model-00002-of-00004.safetensors", + "language_model.model.layers.17.mlp.shared_expert_gate.weight": "model-00002-of-00004.safetensors", + "language_model.model.layers.17.mlp.switch_mlp.down_proj.biases": "model-00002-of-00004.safetensors", + "language_model.model.layers.17.mlp.switch_mlp.down_proj.scales": "model-00002-of-00004.safetensors", + "language_model.model.layers.17.mlp.switch_mlp.down_proj.weight": "model-00002-of-00004.safetensors", + "language_model.model.layers.17.mlp.switch_mlp.gate_proj.biases": "model-00002-of-00004.safetensors", + "language_model.model.layers.17.mlp.switch_mlp.gate_proj.scales": "model-00002-of-00004.safetensors", + "language_model.model.layers.17.mlp.switch_mlp.gate_proj.weight": "model-00002-of-00004.safetensors", + "language_model.model.layers.17.mlp.switch_mlp.up_proj.biases": "model-00002-of-00004.safetensors", + "language_model.model.layers.17.mlp.switch_mlp.up_proj.scales": "model-00002-of-00004.safetensors", + "language_model.model.layers.17.mlp.switch_mlp.up_proj.weight": "model-00002-of-00004.safetensors", + "language_model.model.layers.17.post_attention_layernorm.weight": "model-00002-of-00004.safetensors", + "language_model.model.layers.18.input_layernorm.weight": "model-00002-of-00004.safetensors", + "language_model.model.layers.18.linear_attn.A_log": "model-00002-of-00004.safetensors", + "language_model.model.layers.18.linear_attn.conv1d.weight": "model-00002-of-00004.safetensors", + "language_model.model.layers.18.linear_attn.dt_bias": "model-00002-of-00004.safetensors", + "language_model.model.layers.18.linear_attn.in_proj_a.biases": "model-00002-of-00004.safetensors", + "language_model.model.layers.18.linear_attn.in_proj_a.scales": "model-00002-of-00004.safetensors", + "language_model.model.layers.18.linear_attn.in_proj_a.weight": "model-00002-of-00004.safetensors", + "language_model.model.layers.18.linear_attn.in_proj_b.biases": "model-00002-of-00004.safetensors", + "language_model.model.layers.18.linear_attn.in_proj_b.scales": "model-00002-of-00004.safetensors", + "language_model.model.layers.18.linear_attn.in_proj_b.weight": "model-00002-of-00004.safetensors", + "language_model.model.layers.18.linear_attn.in_proj_qkv.biases": "model-00002-of-00004.safetensors", + "language_model.model.layers.18.linear_attn.in_proj_qkv.scales": "model-00002-of-00004.safetensors", + "language_model.model.layers.18.linear_attn.in_proj_qkv.weight": "model-00002-of-00004.safetensors", + "language_model.model.layers.18.linear_attn.in_proj_z.biases": "model-00002-of-00004.safetensors", + "language_model.model.layers.18.linear_attn.in_proj_z.scales": "model-00002-of-00004.safetensors", + "language_model.model.layers.18.linear_attn.in_proj_z.weight": "model-00002-of-00004.safetensors", + "language_model.model.layers.18.linear_attn.norm.weight": "model-00002-of-00004.safetensors", + "language_model.model.layers.18.linear_attn.out_proj.biases": "model-00002-of-00004.safetensors", + "language_model.model.layers.18.linear_attn.out_proj.scales": "model-00002-of-00004.safetensors", + "language_model.model.layers.18.linear_attn.out_proj.weight": "model-00002-of-00004.safetensors", + "language_model.model.layers.18.mlp.gate.biases": "model-00002-of-00004.safetensors", + "language_model.model.layers.18.mlp.gate.scales": "model-00002-of-00004.safetensors", + "language_model.model.layers.18.mlp.gate.weight": "model-00002-of-00004.safetensors", + "language_model.model.layers.18.mlp.shared_expert.down_proj.biases": "model-00002-of-00004.safetensors", + "language_model.model.layers.18.mlp.shared_expert.down_proj.scales": "model-00002-of-00004.safetensors", + "language_model.model.layers.18.mlp.shared_expert.down_proj.weight": "model-00002-of-00004.safetensors", + "language_model.model.layers.18.mlp.shared_expert.gate_proj.biases": "model-00002-of-00004.safetensors", + "language_model.model.layers.18.mlp.shared_expert.gate_proj.scales": "model-00002-of-00004.safetensors", + "language_model.model.layers.18.mlp.shared_expert.gate_proj.weight": "model-00002-of-00004.safetensors", + "language_model.model.layers.18.mlp.shared_expert.up_proj.biases": "model-00002-of-00004.safetensors", + "language_model.model.layers.18.mlp.shared_expert.up_proj.scales": "model-00002-of-00004.safetensors", + "language_model.model.layers.18.mlp.shared_expert.up_proj.weight": "model-00002-of-00004.safetensors", + "language_model.model.layers.18.mlp.shared_expert_gate.biases": "model-00002-of-00004.safetensors", + "language_model.model.layers.18.mlp.shared_expert_gate.scales": "model-00002-of-00004.safetensors", + "language_model.model.layers.18.mlp.shared_expert_gate.weight": "model-00002-of-00004.safetensors", + "language_model.model.layers.18.mlp.switch_mlp.down_proj.biases": "model-00002-of-00004.safetensors", + "language_model.model.layers.18.mlp.switch_mlp.down_proj.scales": "model-00002-of-00004.safetensors", + "language_model.model.layers.18.mlp.switch_mlp.down_proj.weight": "model-00002-of-00004.safetensors", + "language_model.model.layers.18.mlp.switch_mlp.gate_proj.biases": "model-00002-of-00004.safetensors", + "language_model.model.layers.18.mlp.switch_mlp.gate_proj.scales": "model-00002-of-00004.safetensors", + "language_model.model.layers.18.mlp.switch_mlp.gate_proj.weight": "model-00002-of-00004.safetensors", + "language_model.model.layers.18.mlp.switch_mlp.up_proj.biases": "model-00002-of-00004.safetensors", + "language_model.model.layers.18.mlp.switch_mlp.up_proj.scales": "model-00002-of-00004.safetensors", + "language_model.model.layers.18.mlp.switch_mlp.up_proj.weight": "model-00002-of-00004.safetensors", + "language_model.model.layers.18.post_attention_layernorm.weight": "model-00002-of-00004.safetensors", + "language_model.model.layers.19.input_layernorm.weight": "model-00002-of-00004.safetensors", + "language_model.model.layers.19.mlp.gate.biases": "model-00002-of-00004.safetensors", + "language_model.model.layers.19.mlp.gate.scales": "model-00002-of-00004.safetensors", + "language_model.model.layers.19.mlp.gate.weight": "model-00002-of-00004.safetensors", + "language_model.model.layers.19.mlp.shared_expert.down_proj.biases": "model-00002-of-00004.safetensors", + "language_model.model.layers.19.mlp.shared_expert.down_proj.scales": "model-00002-of-00004.safetensors", + "language_model.model.layers.19.mlp.shared_expert.down_proj.weight": "model-00002-of-00004.safetensors", + "language_model.model.layers.19.mlp.shared_expert.gate_proj.biases": "model-00002-of-00004.safetensors", + "language_model.model.layers.19.mlp.shared_expert.gate_proj.scales": "model-00002-of-00004.safetensors", + "language_model.model.layers.19.mlp.shared_expert.gate_proj.weight": "model-00002-of-00004.safetensors", + "language_model.model.layers.19.mlp.shared_expert.up_proj.biases": "model-00002-of-00004.safetensors", + "language_model.model.layers.19.mlp.shared_expert.up_proj.scales": "model-00002-of-00004.safetensors", + "language_model.model.layers.19.mlp.shared_expert.up_proj.weight": "model-00002-of-00004.safetensors", + "language_model.model.layers.19.mlp.shared_expert_gate.biases": "model-00002-of-00004.safetensors", + "language_model.model.layers.19.mlp.shared_expert_gate.scales": "model-00002-of-00004.safetensors", + "language_model.model.layers.19.mlp.shared_expert_gate.weight": "model-00002-of-00004.safetensors", + "language_model.model.layers.19.mlp.switch_mlp.down_proj.biases": "model-00002-of-00004.safetensors", + "language_model.model.layers.19.mlp.switch_mlp.down_proj.scales": "model-00002-of-00004.safetensors", + "language_model.model.layers.19.mlp.switch_mlp.down_proj.weight": "model-00002-of-00004.safetensors", + "language_model.model.layers.19.mlp.switch_mlp.gate_proj.biases": "model-00002-of-00004.safetensors", + "language_model.model.layers.19.mlp.switch_mlp.gate_proj.scales": "model-00002-of-00004.safetensors", + "language_model.model.layers.19.mlp.switch_mlp.gate_proj.weight": "model-00002-of-00004.safetensors", + "language_model.model.layers.19.mlp.switch_mlp.up_proj.biases": "model-00002-of-00004.safetensors", + "language_model.model.layers.19.mlp.switch_mlp.up_proj.scales": "model-00002-of-00004.safetensors", + "language_model.model.layers.19.mlp.switch_mlp.up_proj.weight": "model-00002-of-00004.safetensors", + "language_model.model.layers.19.post_attention_layernorm.weight": "model-00002-of-00004.safetensors", + "language_model.model.layers.19.self_attn.k_norm.weight": "model-00002-of-00004.safetensors", + "language_model.model.layers.19.self_attn.k_proj.biases": "model-00002-of-00004.safetensors", + "language_model.model.layers.19.self_attn.k_proj.scales": "model-00002-of-00004.safetensors", + "language_model.model.layers.19.self_attn.k_proj.weight": "model-00002-of-00004.safetensors", + "language_model.model.layers.19.self_attn.o_proj.biases": "model-00002-of-00004.safetensors", + "language_model.model.layers.19.self_attn.o_proj.scales": "model-00002-of-00004.safetensors", + "language_model.model.layers.19.self_attn.o_proj.weight": "model-00002-of-00004.safetensors", + "language_model.model.layers.19.self_attn.q_norm.weight": "model-00002-of-00004.safetensors", + "language_model.model.layers.19.self_attn.q_proj.biases": "model-00002-of-00004.safetensors", + "language_model.model.layers.19.self_attn.q_proj.scales": "model-00002-of-00004.safetensors", + "language_model.model.layers.19.self_attn.q_proj.weight": "model-00002-of-00004.safetensors", + "language_model.model.layers.19.self_attn.v_proj.biases": "model-00002-of-00004.safetensors", + "language_model.model.layers.19.self_attn.v_proj.scales": "model-00002-of-00004.safetensors", + "language_model.model.layers.19.self_attn.v_proj.weight": "model-00002-of-00004.safetensors", + "language_model.model.layers.2.input_layernorm.weight": "model-00001-of-00004.safetensors", + "language_model.model.layers.2.linear_attn.A_log": "model-00001-of-00004.safetensors", + "language_model.model.layers.2.linear_attn.conv1d.weight": "model-00001-of-00004.safetensors", + "language_model.model.layers.2.linear_attn.dt_bias": "model-00001-of-00004.safetensors", + "language_model.model.layers.2.linear_attn.in_proj_a.biases": "model-00001-of-00004.safetensors", + "language_model.model.layers.2.linear_attn.in_proj_a.scales": "model-00001-of-00004.safetensors", + "language_model.model.layers.2.linear_attn.in_proj_a.weight": "model-00001-of-00004.safetensors", + "language_model.model.layers.2.linear_attn.in_proj_b.biases": "model-00001-of-00004.safetensors", + "language_model.model.layers.2.linear_attn.in_proj_b.scales": "model-00001-of-00004.safetensors", + "language_model.model.layers.2.linear_attn.in_proj_b.weight": "model-00001-of-00004.safetensors", + "language_model.model.layers.2.linear_attn.in_proj_qkv.biases": "model-00001-of-00004.safetensors", + "language_model.model.layers.2.linear_attn.in_proj_qkv.scales": "model-00001-of-00004.safetensors", + "language_model.model.layers.2.linear_attn.in_proj_qkv.weight": "model-00001-of-00004.safetensors", + "language_model.model.layers.2.linear_attn.in_proj_z.biases": "model-00001-of-00004.safetensors", + "language_model.model.layers.2.linear_attn.in_proj_z.scales": "model-00001-of-00004.safetensors", + "language_model.model.layers.2.linear_attn.in_proj_z.weight": "model-00001-of-00004.safetensors", + "language_model.model.layers.2.linear_attn.norm.weight": "model-00001-of-00004.safetensors", + "language_model.model.layers.2.linear_attn.out_proj.biases": "model-00001-of-00004.safetensors", + "language_model.model.layers.2.linear_attn.out_proj.scales": "model-00001-of-00004.safetensors", + "language_model.model.layers.2.linear_attn.out_proj.weight": "model-00001-of-00004.safetensors", + "language_model.model.layers.2.mlp.gate.biases": "model-00001-of-00004.safetensors", + "language_model.model.layers.2.mlp.gate.scales": "model-00001-of-00004.safetensors", + "language_model.model.layers.2.mlp.gate.weight": "model-00001-of-00004.safetensors", + "language_model.model.layers.2.mlp.shared_expert.down_proj.biases": "model-00001-of-00004.safetensors", + "language_model.model.layers.2.mlp.shared_expert.down_proj.scales": "model-00001-of-00004.safetensors", + "language_model.model.layers.2.mlp.shared_expert.down_proj.weight": "model-00001-of-00004.safetensors", + "language_model.model.layers.2.mlp.shared_expert.gate_proj.biases": "model-00001-of-00004.safetensors", + "language_model.model.layers.2.mlp.shared_expert.gate_proj.scales": "model-00001-of-00004.safetensors", + "language_model.model.layers.2.mlp.shared_expert.gate_proj.weight": "model-00001-of-00004.safetensors", + "language_model.model.layers.2.mlp.shared_expert.up_proj.biases": "model-00001-of-00004.safetensors", + "language_model.model.layers.2.mlp.shared_expert.up_proj.scales": "model-00001-of-00004.safetensors", + "language_model.model.layers.2.mlp.shared_expert.up_proj.weight": "model-00001-of-00004.safetensors", + "language_model.model.layers.2.mlp.shared_expert_gate.biases": "model-00001-of-00004.safetensors", + "language_model.model.layers.2.mlp.shared_expert_gate.scales": "model-00001-of-00004.safetensors", + "language_model.model.layers.2.mlp.shared_expert_gate.weight": "model-00001-of-00004.safetensors", + "language_model.model.layers.2.mlp.switch_mlp.down_proj.biases": "model-00001-of-00004.safetensors", + "language_model.model.layers.2.mlp.switch_mlp.down_proj.scales": "model-00001-of-00004.safetensors", + "language_model.model.layers.2.mlp.switch_mlp.down_proj.weight": "model-00001-of-00004.safetensors", + "language_model.model.layers.2.mlp.switch_mlp.gate_proj.biases": "model-00001-of-00004.safetensors", + "language_model.model.layers.2.mlp.switch_mlp.gate_proj.scales": "model-00001-of-00004.safetensors", + "language_model.model.layers.2.mlp.switch_mlp.gate_proj.weight": "model-00001-of-00004.safetensors", + "language_model.model.layers.2.mlp.switch_mlp.up_proj.biases": "model-00001-of-00004.safetensors", + "language_model.model.layers.2.mlp.switch_mlp.up_proj.scales": "model-00001-of-00004.safetensors", + "language_model.model.layers.2.mlp.switch_mlp.up_proj.weight": "model-00001-of-00004.safetensors", + "language_model.model.layers.2.post_attention_layernorm.weight": "model-00001-of-00004.safetensors", + "language_model.model.layers.20.input_layernorm.weight": "model-00003-of-00004.safetensors", + "language_model.model.layers.20.linear_attn.A_log": "model-00003-of-00004.safetensors", + "language_model.model.layers.20.linear_attn.conv1d.weight": "model-00002-of-00004.safetensors", + "language_model.model.layers.20.linear_attn.dt_bias": "model-00003-of-00004.safetensors", + "language_model.model.layers.20.linear_attn.in_proj_a.biases": "model-00003-of-00004.safetensors", + "language_model.model.layers.20.linear_attn.in_proj_a.scales": "model-00003-of-00004.safetensors", + "language_model.model.layers.20.linear_attn.in_proj_a.weight": "model-00003-of-00004.safetensors", + "language_model.model.layers.20.linear_attn.in_proj_b.biases": "model-00003-of-00004.safetensors", + "language_model.model.layers.20.linear_attn.in_proj_b.scales": "model-00003-of-00004.safetensors", + "language_model.model.layers.20.linear_attn.in_proj_b.weight": "model-00003-of-00004.safetensors", + "language_model.model.layers.20.linear_attn.in_proj_qkv.biases": "model-00003-of-00004.safetensors", + "language_model.model.layers.20.linear_attn.in_proj_qkv.scales": "model-00002-of-00004.safetensors", + "language_model.model.layers.20.linear_attn.in_proj_qkv.weight": "model-00002-of-00004.safetensors", + "language_model.model.layers.20.linear_attn.in_proj_z.biases": "model-00003-of-00004.safetensors", + "language_model.model.layers.20.linear_attn.in_proj_z.scales": "model-00003-of-00004.safetensors", + "language_model.model.layers.20.linear_attn.in_proj_z.weight": "model-00003-of-00004.safetensors", + "language_model.model.layers.20.linear_attn.norm.weight": "model-00003-of-00004.safetensors", + "language_model.model.layers.20.linear_attn.out_proj.biases": "model-00003-of-00004.safetensors", + "language_model.model.layers.20.linear_attn.out_proj.scales": "model-00003-of-00004.safetensors", + "language_model.model.layers.20.linear_attn.out_proj.weight": "model-00003-of-00004.safetensors", + "language_model.model.layers.20.mlp.gate.biases": "model-00003-of-00004.safetensors", + "language_model.model.layers.20.mlp.gate.scales": "model-00003-of-00004.safetensors", + "language_model.model.layers.20.mlp.gate.weight": "model-00003-of-00004.safetensors", + "language_model.model.layers.20.mlp.shared_expert.down_proj.biases": "model-00003-of-00004.safetensors", + "language_model.model.layers.20.mlp.shared_expert.down_proj.scales": "model-00003-of-00004.safetensors", + "language_model.model.layers.20.mlp.shared_expert.down_proj.weight": "model-00003-of-00004.safetensors", + "language_model.model.layers.20.mlp.shared_expert.gate_proj.biases": "model-00003-of-00004.safetensors", + "language_model.model.layers.20.mlp.shared_expert.gate_proj.scales": "model-00003-of-00004.safetensors", + "language_model.model.layers.20.mlp.shared_expert.gate_proj.weight": "model-00003-of-00004.safetensors", + "language_model.model.layers.20.mlp.shared_expert.up_proj.biases": "model-00003-of-00004.safetensors", + "language_model.model.layers.20.mlp.shared_expert.up_proj.scales": "model-00003-of-00004.safetensors", + "language_model.model.layers.20.mlp.shared_expert.up_proj.weight": "model-00003-of-00004.safetensors", + "language_model.model.layers.20.mlp.shared_expert_gate.biases": "model-00003-of-00004.safetensors", + "language_model.model.layers.20.mlp.shared_expert_gate.scales": "model-00003-of-00004.safetensors", + "language_model.model.layers.20.mlp.shared_expert_gate.weight": "model-00003-of-00004.safetensors", + "language_model.model.layers.20.mlp.switch_mlp.down_proj.biases": "model-00003-of-00004.safetensors", + "language_model.model.layers.20.mlp.switch_mlp.down_proj.scales": "model-00003-of-00004.safetensors", + "language_model.model.layers.20.mlp.switch_mlp.down_proj.weight": "model-00003-of-00004.safetensors", + "language_model.model.layers.20.mlp.switch_mlp.gate_proj.biases": "model-00003-of-00004.safetensors", + "language_model.model.layers.20.mlp.switch_mlp.gate_proj.scales": "model-00003-of-00004.safetensors", + "language_model.model.layers.20.mlp.switch_mlp.gate_proj.weight": "model-00003-of-00004.safetensors", + "language_model.model.layers.20.mlp.switch_mlp.up_proj.biases": "model-00003-of-00004.safetensors", + "language_model.model.layers.20.mlp.switch_mlp.up_proj.scales": "model-00003-of-00004.safetensors", + "language_model.model.layers.20.mlp.switch_mlp.up_proj.weight": "model-00003-of-00004.safetensors", + "language_model.model.layers.20.post_attention_layernorm.weight": "model-00003-of-00004.safetensors", + "language_model.model.layers.21.input_layernorm.weight": "model-00003-of-00004.safetensors", + "language_model.model.layers.21.linear_attn.A_log": "model-00003-of-00004.safetensors", + "language_model.model.layers.21.linear_attn.conv1d.weight": "model-00003-of-00004.safetensors", + "language_model.model.layers.21.linear_attn.dt_bias": "model-00003-of-00004.safetensors", + "language_model.model.layers.21.linear_attn.in_proj_a.biases": "model-00003-of-00004.safetensors", + "language_model.model.layers.21.linear_attn.in_proj_a.scales": "model-00003-of-00004.safetensors", + "language_model.model.layers.21.linear_attn.in_proj_a.weight": "model-00003-of-00004.safetensors", + "language_model.model.layers.21.linear_attn.in_proj_b.biases": "model-00003-of-00004.safetensors", + "language_model.model.layers.21.linear_attn.in_proj_b.scales": "model-00003-of-00004.safetensors", + "language_model.model.layers.21.linear_attn.in_proj_b.weight": "model-00003-of-00004.safetensors", + "language_model.model.layers.21.linear_attn.in_proj_qkv.biases": "model-00003-of-00004.safetensors", + "language_model.model.layers.21.linear_attn.in_proj_qkv.scales": "model-00003-of-00004.safetensors", + "language_model.model.layers.21.linear_attn.in_proj_qkv.weight": "model-00003-of-00004.safetensors", + "language_model.model.layers.21.linear_attn.in_proj_z.biases": "model-00003-of-00004.safetensors", + "language_model.model.layers.21.linear_attn.in_proj_z.scales": "model-00003-of-00004.safetensors", + "language_model.model.layers.21.linear_attn.in_proj_z.weight": "model-00003-of-00004.safetensors", + "language_model.model.layers.21.linear_attn.norm.weight": "model-00003-of-00004.safetensors", + "language_model.model.layers.21.linear_attn.out_proj.biases": "model-00003-of-00004.safetensors", + "language_model.model.layers.21.linear_attn.out_proj.scales": "model-00003-of-00004.safetensors", + "language_model.model.layers.21.linear_attn.out_proj.weight": "model-00003-of-00004.safetensors", + "language_model.model.layers.21.mlp.gate.biases": "model-00003-of-00004.safetensors", + "language_model.model.layers.21.mlp.gate.scales": "model-00003-of-00004.safetensors", + "language_model.model.layers.21.mlp.gate.weight": "model-00003-of-00004.safetensors", + "language_model.model.layers.21.mlp.shared_expert.down_proj.biases": "model-00003-of-00004.safetensors", + "language_model.model.layers.21.mlp.shared_expert.down_proj.scales": "model-00003-of-00004.safetensors", + "language_model.model.layers.21.mlp.shared_expert.down_proj.weight": "model-00003-of-00004.safetensors", + "language_model.model.layers.21.mlp.shared_expert.gate_proj.biases": "model-00003-of-00004.safetensors", + "language_model.model.layers.21.mlp.shared_expert.gate_proj.scales": "model-00003-of-00004.safetensors", + "language_model.model.layers.21.mlp.shared_expert.gate_proj.weight": "model-00003-of-00004.safetensors", + "language_model.model.layers.21.mlp.shared_expert.up_proj.biases": "model-00003-of-00004.safetensors", + "language_model.model.layers.21.mlp.shared_expert.up_proj.scales": "model-00003-of-00004.safetensors", + "language_model.model.layers.21.mlp.shared_expert.up_proj.weight": "model-00003-of-00004.safetensors", + "language_model.model.layers.21.mlp.shared_expert_gate.biases": "model-00003-of-00004.safetensors", + "language_model.model.layers.21.mlp.shared_expert_gate.scales": "model-00003-of-00004.safetensors", + "language_model.model.layers.21.mlp.shared_expert_gate.weight": "model-00003-of-00004.safetensors", + "language_model.model.layers.21.mlp.switch_mlp.down_proj.biases": "model-00003-of-00004.safetensors", + "language_model.model.layers.21.mlp.switch_mlp.down_proj.scales": "model-00003-of-00004.safetensors", + "language_model.model.layers.21.mlp.switch_mlp.down_proj.weight": "model-00003-of-00004.safetensors", + "language_model.model.layers.21.mlp.switch_mlp.gate_proj.biases": "model-00003-of-00004.safetensors", + "language_model.model.layers.21.mlp.switch_mlp.gate_proj.scales": "model-00003-of-00004.safetensors", + "language_model.model.layers.21.mlp.switch_mlp.gate_proj.weight": "model-00003-of-00004.safetensors", + "language_model.model.layers.21.mlp.switch_mlp.up_proj.biases": "model-00003-of-00004.safetensors", + "language_model.model.layers.21.mlp.switch_mlp.up_proj.scales": "model-00003-of-00004.safetensors", + "language_model.model.layers.21.mlp.switch_mlp.up_proj.weight": "model-00003-of-00004.safetensors", + "language_model.model.layers.21.post_attention_layernorm.weight": "model-00003-of-00004.safetensors", + "language_model.model.layers.22.input_layernorm.weight": "model-00003-of-00004.safetensors", + "language_model.model.layers.22.linear_attn.A_log": "model-00003-of-00004.safetensors", + "language_model.model.layers.22.linear_attn.conv1d.weight": "model-00003-of-00004.safetensors", + "language_model.model.layers.22.linear_attn.dt_bias": "model-00003-of-00004.safetensors", + "language_model.model.layers.22.linear_attn.in_proj_a.biases": "model-00003-of-00004.safetensors", + "language_model.model.layers.22.linear_attn.in_proj_a.scales": "model-00003-of-00004.safetensors", + "language_model.model.layers.22.linear_attn.in_proj_a.weight": "model-00003-of-00004.safetensors", + "language_model.model.layers.22.linear_attn.in_proj_b.biases": "model-00003-of-00004.safetensors", + "language_model.model.layers.22.linear_attn.in_proj_b.scales": "model-00003-of-00004.safetensors", + "language_model.model.layers.22.linear_attn.in_proj_b.weight": "model-00003-of-00004.safetensors", + "language_model.model.layers.22.linear_attn.in_proj_qkv.biases": "model-00003-of-00004.safetensors", + "language_model.model.layers.22.linear_attn.in_proj_qkv.scales": "model-00003-of-00004.safetensors", + "language_model.model.layers.22.linear_attn.in_proj_qkv.weight": "model-00003-of-00004.safetensors", + "language_model.model.layers.22.linear_attn.in_proj_z.biases": "model-00003-of-00004.safetensors", + "language_model.model.layers.22.linear_attn.in_proj_z.scales": "model-00003-of-00004.safetensors", + "language_model.model.layers.22.linear_attn.in_proj_z.weight": "model-00003-of-00004.safetensors", + "language_model.model.layers.22.linear_attn.norm.weight": "model-00003-of-00004.safetensors", + "language_model.model.layers.22.linear_attn.out_proj.biases": "model-00003-of-00004.safetensors", + "language_model.model.layers.22.linear_attn.out_proj.scales": "model-00003-of-00004.safetensors", + "language_model.model.layers.22.linear_attn.out_proj.weight": "model-00003-of-00004.safetensors", + "language_model.model.layers.22.mlp.gate.biases": "model-00003-of-00004.safetensors", + "language_model.model.layers.22.mlp.gate.scales": "model-00003-of-00004.safetensors", + "language_model.model.layers.22.mlp.gate.weight": "model-00003-of-00004.safetensors", + "language_model.model.layers.22.mlp.shared_expert.down_proj.biases": "model-00003-of-00004.safetensors", + "language_model.model.layers.22.mlp.shared_expert.down_proj.scales": "model-00003-of-00004.safetensors", + "language_model.model.layers.22.mlp.shared_expert.down_proj.weight": "model-00003-of-00004.safetensors", + "language_model.model.layers.22.mlp.shared_expert.gate_proj.biases": "model-00003-of-00004.safetensors", + "language_model.model.layers.22.mlp.shared_expert.gate_proj.scales": "model-00003-of-00004.safetensors", + "language_model.model.layers.22.mlp.shared_expert.gate_proj.weight": "model-00003-of-00004.safetensors", + "language_model.model.layers.22.mlp.shared_expert.up_proj.biases": "model-00003-of-00004.safetensors", + "language_model.model.layers.22.mlp.shared_expert.up_proj.scales": "model-00003-of-00004.safetensors", + "language_model.model.layers.22.mlp.shared_expert.up_proj.weight": "model-00003-of-00004.safetensors", + "language_model.model.layers.22.mlp.shared_expert_gate.biases": "model-00003-of-00004.safetensors", + "language_model.model.layers.22.mlp.shared_expert_gate.scales": "model-00003-of-00004.safetensors", + "language_model.model.layers.22.mlp.shared_expert_gate.weight": "model-00003-of-00004.safetensors", + "language_model.model.layers.22.mlp.switch_mlp.down_proj.biases": "model-00003-of-00004.safetensors", + "language_model.model.layers.22.mlp.switch_mlp.down_proj.scales": "model-00003-of-00004.safetensors", + "language_model.model.layers.22.mlp.switch_mlp.down_proj.weight": "model-00003-of-00004.safetensors", + "language_model.model.layers.22.mlp.switch_mlp.gate_proj.biases": "model-00003-of-00004.safetensors", + "language_model.model.layers.22.mlp.switch_mlp.gate_proj.scales": "model-00003-of-00004.safetensors", + "language_model.model.layers.22.mlp.switch_mlp.gate_proj.weight": "model-00003-of-00004.safetensors", + "language_model.model.layers.22.mlp.switch_mlp.up_proj.biases": "model-00003-of-00004.safetensors", + "language_model.model.layers.22.mlp.switch_mlp.up_proj.scales": "model-00003-of-00004.safetensors", + "language_model.model.layers.22.mlp.switch_mlp.up_proj.weight": "model-00003-of-00004.safetensors", + "language_model.model.layers.22.post_attention_layernorm.weight": "model-00003-of-00004.safetensors", + "language_model.model.layers.23.input_layernorm.weight": "model-00003-of-00004.safetensors", + "language_model.model.layers.23.mlp.gate.biases": "model-00003-of-00004.safetensors", + "language_model.model.layers.23.mlp.gate.scales": "model-00003-of-00004.safetensors", + "language_model.model.layers.23.mlp.gate.weight": "model-00003-of-00004.safetensors", + "language_model.model.layers.23.mlp.shared_expert.down_proj.biases": "model-00003-of-00004.safetensors", + "language_model.model.layers.23.mlp.shared_expert.down_proj.scales": "model-00003-of-00004.safetensors", + "language_model.model.layers.23.mlp.shared_expert.down_proj.weight": "model-00003-of-00004.safetensors", + "language_model.model.layers.23.mlp.shared_expert.gate_proj.biases": "model-00003-of-00004.safetensors", + "language_model.model.layers.23.mlp.shared_expert.gate_proj.scales": "model-00003-of-00004.safetensors", + "language_model.model.layers.23.mlp.shared_expert.gate_proj.weight": "model-00003-of-00004.safetensors", + "language_model.model.layers.23.mlp.shared_expert.up_proj.biases": "model-00003-of-00004.safetensors", + "language_model.model.layers.23.mlp.shared_expert.up_proj.scales": "model-00003-of-00004.safetensors", + "language_model.model.layers.23.mlp.shared_expert.up_proj.weight": "model-00003-of-00004.safetensors", + "language_model.model.layers.23.mlp.shared_expert_gate.biases": "model-00003-of-00004.safetensors", + "language_model.model.layers.23.mlp.shared_expert_gate.scales": "model-00003-of-00004.safetensors", + "language_model.model.layers.23.mlp.shared_expert_gate.weight": "model-00003-of-00004.safetensors", + "language_model.model.layers.23.mlp.switch_mlp.down_proj.biases": "model-00003-of-00004.safetensors", + "language_model.model.layers.23.mlp.switch_mlp.down_proj.scales": "model-00003-of-00004.safetensors", + "language_model.model.layers.23.mlp.switch_mlp.down_proj.weight": "model-00003-of-00004.safetensors", + "language_model.model.layers.23.mlp.switch_mlp.gate_proj.biases": "model-00003-of-00004.safetensors", + "language_model.model.layers.23.mlp.switch_mlp.gate_proj.scales": "model-00003-of-00004.safetensors", + "language_model.model.layers.23.mlp.switch_mlp.gate_proj.weight": "model-00003-of-00004.safetensors", + "language_model.model.layers.23.mlp.switch_mlp.up_proj.biases": "model-00003-of-00004.safetensors", + "language_model.model.layers.23.mlp.switch_mlp.up_proj.scales": "model-00003-of-00004.safetensors", + "language_model.model.layers.23.mlp.switch_mlp.up_proj.weight": "model-00003-of-00004.safetensors", + "language_model.model.layers.23.post_attention_layernorm.weight": "model-00003-of-00004.safetensors", + "language_model.model.layers.23.self_attn.k_norm.weight": "model-00003-of-00004.safetensors", + "language_model.model.layers.23.self_attn.k_proj.biases": "model-00003-of-00004.safetensors", + "language_model.model.layers.23.self_attn.k_proj.scales": "model-00003-of-00004.safetensors", + "language_model.model.layers.23.self_attn.k_proj.weight": "model-00003-of-00004.safetensors", + "language_model.model.layers.23.self_attn.o_proj.biases": "model-00003-of-00004.safetensors", + "language_model.model.layers.23.self_attn.o_proj.scales": "model-00003-of-00004.safetensors", + "language_model.model.layers.23.self_attn.o_proj.weight": "model-00003-of-00004.safetensors", + "language_model.model.layers.23.self_attn.q_norm.weight": "model-00003-of-00004.safetensors", + "language_model.model.layers.23.self_attn.q_proj.biases": "model-00003-of-00004.safetensors", + "language_model.model.layers.23.self_attn.q_proj.scales": "model-00003-of-00004.safetensors", + "language_model.model.layers.23.self_attn.q_proj.weight": "model-00003-of-00004.safetensors", + "language_model.model.layers.23.self_attn.v_proj.biases": "model-00003-of-00004.safetensors", + "language_model.model.layers.23.self_attn.v_proj.scales": "model-00003-of-00004.safetensors", + "language_model.model.layers.23.self_attn.v_proj.weight": "model-00003-of-00004.safetensors", + "language_model.model.layers.24.input_layernorm.weight": "model-00003-of-00004.safetensors", + "language_model.model.layers.24.linear_attn.A_log": "model-00003-of-00004.safetensors", + "language_model.model.layers.24.linear_attn.conv1d.weight": "model-00003-of-00004.safetensors", + "language_model.model.layers.24.linear_attn.dt_bias": "model-00003-of-00004.safetensors", + "language_model.model.layers.24.linear_attn.in_proj_a.biases": "model-00003-of-00004.safetensors", + "language_model.model.layers.24.linear_attn.in_proj_a.scales": "model-00003-of-00004.safetensors", + "language_model.model.layers.24.linear_attn.in_proj_a.weight": "model-00003-of-00004.safetensors", + "language_model.model.layers.24.linear_attn.in_proj_b.biases": "model-00003-of-00004.safetensors", + "language_model.model.layers.24.linear_attn.in_proj_b.scales": "model-00003-of-00004.safetensors", + "language_model.model.layers.24.linear_attn.in_proj_b.weight": "model-00003-of-00004.safetensors", + "language_model.model.layers.24.linear_attn.in_proj_qkv.biases": "model-00003-of-00004.safetensors", + "language_model.model.layers.24.linear_attn.in_proj_qkv.scales": "model-00003-of-00004.safetensors", + "language_model.model.layers.24.linear_attn.in_proj_qkv.weight": "model-00003-of-00004.safetensors", + "language_model.model.layers.24.linear_attn.in_proj_z.biases": "model-00003-of-00004.safetensors", + "language_model.model.layers.24.linear_attn.in_proj_z.scales": "model-00003-of-00004.safetensors", + "language_model.model.layers.24.linear_attn.in_proj_z.weight": "model-00003-of-00004.safetensors", + "language_model.model.layers.24.linear_attn.norm.weight": "model-00003-of-00004.safetensors", + "language_model.model.layers.24.linear_attn.out_proj.biases": "model-00003-of-00004.safetensors", + "language_model.model.layers.24.linear_attn.out_proj.scales": "model-00003-of-00004.safetensors", + "language_model.model.layers.24.linear_attn.out_proj.weight": "model-00003-of-00004.safetensors", + "language_model.model.layers.24.mlp.gate.biases": "model-00003-of-00004.safetensors", + "language_model.model.layers.24.mlp.gate.scales": "model-00003-of-00004.safetensors", + "language_model.model.layers.24.mlp.gate.weight": "model-00003-of-00004.safetensors", + "language_model.model.layers.24.mlp.shared_expert.down_proj.biases": "model-00003-of-00004.safetensors", + "language_model.model.layers.24.mlp.shared_expert.down_proj.scales": "model-00003-of-00004.safetensors", + "language_model.model.layers.24.mlp.shared_expert.down_proj.weight": "model-00003-of-00004.safetensors", + "language_model.model.layers.24.mlp.shared_expert.gate_proj.biases": "model-00003-of-00004.safetensors", + "language_model.model.layers.24.mlp.shared_expert.gate_proj.scales": "model-00003-of-00004.safetensors", + "language_model.model.layers.24.mlp.shared_expert.gate_proj.weight": "model-00003-of-00004.safetensors", + "language_model.model.layers.24.mlp.shared_expert.up_proj.biases": "model-00003-of-00004.safetensors", + "language_model.model.layers.24.mlp.shared_expert.up_proj.scales": "model-00003-of-00004.safetensors", + "language_model.model.layers.24.mlp.shared_expert.up_proj.weight": "model-00003-of-00004.safetensors", + "language_model.model.layers.24.mlp.shared_expert_gate.biases": "model-00003-of-00004.safetensors", + "language_model.model.layers.24.mlp.shared_expert_gate.scales": "model-00003-of-00004.safetensors", + "language_model.model.layers.24.mlp.shared_expert_gate.weight": "model-00003-of-00004.safetensors", + "language_model.model.layers.24.mlp.switch_mlp.down_proj.biases": "model-00003-of-00004.safetensors", + "language_model.model.layers.24.mlp.switch_mlp.down_proj.scales": "model-00003-of-00004.safetensors", + "language_model.model.layers.24.mlp.switch_mlp.down_proj.weight": "model-00003-of-00004.safetensors", + "language_model.model.layers.24.mlp.switch_mlp.gate_proj.biases": "model-00003-of-00004.safetensors", + "language_model.model.layers.24.mlp.switch_mlp.gate_proj.scales": "model-00003-of-00004.safetensors", + "language_model.model.layers.24.mlp.switch_mlp.gate_proj.weight": "model-00003-of-00004.safetensors", + "language_model.model.layers.24.mlp.switch_mlp.up_proj.biases": "model-00003-of-00004.safetensors", + "language_model.model.layers.24.mlp.switch_mlp.up_proj.scales": "model-00003-of-00004.safetensors", + "language_model.model.layers.24.mlp.switch_mlp.up_proj.weight": "model-00003-of-00004.safetensors", + "language_model.model.layers.24.post_attention_layernorm.weight": "model-00003-of-00004.safetensors", + "language_model.model.layers.25.input_layernorm.weight": "model-00003-of-00004.safetensors", + "language_model.model.layers.25.linear_attn.A_log": "model-00003-of-00004.safetensors", + "language_model.model.layers.25.linear_attn.conv1d.weight": "model-00003-of-00004.safetensors", + "language_model.model.layers.25.linear_attn.dt_bias": "model-00003-of-00004.safetensors", + "language_model.model.layers.25.linear_attn.in_proj_a.biases": "model-00003-of-00004.safetensors", + "language_model.model.layers.25.linear_attn.in_proj_a.scales": "model-00003-of-00004.safetensors", + "language_model.model.layers.25.linear_attn.in_proj_a.weight": "model-00003-of-00004.safetensors", + "language_model.model.layers.25.linear_attn.in_proj_b.biases": "model-00003-of-00004.safetensors", + "language_model.model.layers.25.linear_attn.in_proj_b.scales": "model-00003-of-00004.safetensors", + "language_model.model.layers.25.linear_attn.in_proj_b.weight": "model-00003-of-00004.safetensors", + "language_model.model.layers.25.linear_attn.in_proj_qkv.biases": "model-00003-of-00004.safetensors", + "language_model.model.layers.25.linear_attn.in_proj_qkv.scales": "model-00003-of-00004.safetensors", + "language_model.model.layers.25.linear_attn.in_proj_qkv.weight": "model-00003-of-00004.safetensors", + "language_model.model.layers.25.linear_attn.in_proj_z.biases": "model-00003-of-00004.safetensors", + "language_model.model.layers.25.linear_attn.in_proj_z.scales": "model-00003-of-00004.safetensors", + "language_model.model.layers.25.linear_attn.in_proj_z.weight": "model-00003-of-00004.safetensors", + "language_model.model.layers.25.linear_attn.norm.weight": "model-00003-of-00004.safetensors", + "language_model.model.layers.25.linear_attn.out_proj.biases": "model-00003-of-00004.safetensors", + "language_model.model.layers.25.linear_attn.out_proj.scales": "model-00003-of-00004.safetensors", + "language_model.model.layers.25.linear_attn.out_proj.weight": "model-00003-of-00004.safetensors", + "language_model.model.layers.25.mlp.gate.biases": "model-00003-of-00004.safetensors", + "language_model.model.layers.25.mlp.gate.scales": "model-00003-of-00004.safetensors", + "language_model.model.layers.25.mlp.gate.weight": "model-00003-of-00004.safetensors", + "language_model.model.layers.25.mlp.shared_expert.down_proj.biases": "model-00003-of-00004.safetensors", + "language_model.model.layers.25.mlp.shared_expert.down_proj.scales": "model-00003-of-00004.safetensors", + "language_model.model.layers.25.mlp.shared_expert.down_proj.weight": "model-00003-of-00004.safetensors", + "language_model.model.layers.25.mlp.shared_expert.gate_proj.biases": "model-00003-of-00004.safetensors", + "language_model.model.layers.25.mlp.shared_expert.gate_proj.scales": "model-00003-of-00004.safetensors", + "language_model.model.layers.25.mlp.shared_expert.gate_proj.weight": "model-00003-of-00004.safetensors", + "language_model.model.layers.25.mlp.shared_expert.up_proj.biases": "model-00003-of-00004.safetensors", + "language_model.model.layers.25.mlp.shared_expert.up_proj.scales": "model-00003-of-00004.safetensors", + "language_model.model.layers.25.mlp.shared_expert.up_proj.weight": "model-00003-of-00004.safetensors", + "language_model.model.layers.25.mlp.shared_expert_gate.biases": "model-00003-of-00004.safetensors", + "language_model.model.layers.25.mlp.shared_expert_gate.scales": "model-00003-of-00004.safetensors", + "language_model.model.layers.25.mlp.shared_expert_gate.weight": "model-00003-of-00004.safetensors", + "language_model.model.layers.25.mlp.switch_mlp.down_proj.biases": "model-00003-of-00004.safetensors", + "language_model.model.layers.25.mlp.switch_mlp.down_proj.scales": "model-00003-of-00004.safetensors", + "language_model.model.layers.25.mlp.switch_mlp.down_proj.weight": "model-00003-of-00004.safetensors", + "language_model.model.layers.25.mlp.switch_mlp.gate_proj.biases": "model-00003-of-00004.safetensors", + "language_model.model.layers.25.mlp.switch_mlp.gate_proj.scales": "model-00003-of-00004.safetensors", + "language_model.model.layers.25.mlp.switch_mlp.gate_proj.weight": "model-00003-of-00004.safetensors", + "language_model.model.layers.25.mlp.switch_mlp.up_proj.biases": "model-00003-of-00004.safetensors", + "language_model.model.layers.25.mlp.switch_mlp.up_proj.scales": "model-00003-of-00004.safetensors", + "language_model.model.layers.25.mlp.switch_mlp.up_proj.weight": "model-00003-of-00004.safetensors", + "language_model.model.layers.25.post_attention_layernorm.weight": "model-00003-of-00004.safetensors", + "language_model.model.layers.26.input_layernorm.weight": "model-00003-of-00004.safetensors", + "language_model.model.layers.26.linear_attn.A_log": "model-00003-of-00004.safetensors", + "language_model.model.layers.26.linear_attn.conv1d.weight": "model-00003-of-00004.safetensors", + "language_model.model.layers.26.linear_attn.dt_bias": "model-00003-of-00004.safetensors", + "language_model.model.layers.26.linear_attn.in_proj_a.biases": "model-00003-of-00004.safetensors", + "language_model.model.layers.26.linear_attn.in_proj_a.scales": "model-00003-of-00004.safetensors", + "language_model.model.layers.26.linear_attn.in_proj_a.weight": "model-00003-of-00004.safetensors", + "language_model.model.layers.26.linear_attn.in_proj_b.biases": "model-00003-of-00004.safetensors", + "language_model.model.layers.26.linear_attn.in_proj_b.scales": "model-00003-of-00004.safetensors", + "language_model.model.layers.26.linear_attn.in_proj_b.weight": "model-00003-of-00004.safetensors", + "language_model.model.layers.26.linear_attn.in_proj_qkv.biases": "model-00003-of-00004.safetensors", + "language_model.model.layers.26.linear_attn.in_proj_qkv.scales": "model-00003-of-00004.safetensors", + "language_model.model.layers.26.linear_attn.in_proj_qkv.weight": "model-00003-of-00004.safetensors", + "language_model.model.layers.26.linear_attn.in_proj_z.biases": "model-00003-of-00004.safetensors", + "language_model.model.layers.26.linear_attn.in_proj_z.scales": "model-00003-of-00004.safetensors", + "language_model.model.layers.26.linear_attn.in_proj_z.weight": "model-00003-of-00004.safetensors", + "language_model.model.layers.26.linear_attn.norm.weight": "model-00003-of-00004.safetensors", + "language_model.model.layers.26.linear_attn.out_proj.biases": "model-00003-of-00004.safetensors", + "language_model.model.layers.26.linear_attn.out_proj.scales": "model-00003-of-00004.safetensors", + "language_model.model.layers.26.linear_attn.out_proj.weight": "model-00003-of-00004.safetensors", + "language_model.model.layers.26.mlp.gate.biases": "model-00003-of-00004.safetensors", + "language_model.model.layers.26.mlp.gate.scales": "model-00003-of-00004.safetensors", + "language_model.model.layers.26.mlp.gate.weight": "model-00003-of-00004.safetensors", + "language_model.model.layers.26.mlp.shared_expert.down_proj.biases": "model-00003-of-00004.safetensors", + "language_model.model.layers.26.mlp.shared_expert.down_proj.scales": "model-00003-of-00004.safetensors", + "language_model.model.layers.26.mlp.shared_expert.down_proj.weight": "model-00003-of-00004.safetensors", + "language_model.model.layers.26.mlp.shared_expert.gate_proj.biases": "model-00003-of-00004.safetensors", + "language_model.model.layers.26.mlp.shared_expert.gate_proj.scales": "model-00003-of-00004.safetensors", + "language_model.model.layers.26.mlp.shared_expert.gate_proj.weight": "model-00003-of-00004.safetensors", + "language_model.model.layers.26.mlp.shared_expert.up_proj.biases": "model-00003-of-00004.safetensors", + "language_model.model.layers.26.mlp.shared_expert.up_proj.scales": "model-00003-of-00004.safetensors", + "language_model.model.layers.26.mlp.shared_expert.up_proj.weight": "model-00003-of-00004.safetensors", + "language_model.model.layers.26.mlp.shared_expert_gate.biases": "model-00003-of-00004.safetensors", + "language_model.model.layers.26.mlp.shared_expert_gate.scales": "model-00003-of-00004.safetensors", + "language_model.model.layers.26.mlp.shared_expert_gate.weight": "model-00003-of-00004.safetensors", + "language_model.model.layers.26.mlp.switch_mlp.down_proj.biases": "model-00003-of-00004.safetensors", + "language_model.model.layers.26.mlp.switch_mlp.down_proj.scales": "model-00003-of-00004.safetensors", + "language_model.model.layers.26.mlp.switch_mlp.down_proj.weight": "model-00003-of-00004.safetensors", + "language_model.model.layers.26.mlp.switch_mlp.gate_proj.biases": "model-00003-of-00004.safetensors", + "language_model.model.layers.26.mlp.switch_mlp.gate_proj.scales": "model-00003-of-00004.safetensors", + "language_model.model.layers.26.mlp.switch_mlp.gate_proj.weight": "model-00003-of-00004.safetensors", + "language_model.model.layers.26.mlp.switch_mlp.up_proj.biases": "model-00003-of-00004.safetensors", + "language_model.model.layers.26.mlp.switch_mlp.up_proj.scales": "model-00003-of-00004.safetensors", + "language_model.model.layers.26.mlp.switch_mlp.up_proj.weight": "model-00003-of-00004.safetensors", + "language_model.model.layers.26.post_attention_layernorm.weight": "model-00003-of-00004.safetensors", + "language_model.model.layers.27.input_layernorm.weight": "model-00003-of-00004.safetensors", + "language_model.model.layers.27.mlp.gate.biases": "model-00003-of-00004.safetensors", + "language_model.model.layers.27.mlp.gate.scales": "model-00003-of-00004.safetensors", + "language_model.model.layers.27.mlp.gate.weight": "model-00003-of-00004.safetensors", + "language_model.model.layers.27.mlp.shared_expert.down_proj.biases": "model-00003-of-00004.safetensors", + "language_model.model.layers.27.mlp.shared_expert.down_proj.scales": "model-00003-of-00004.safetensors", + "language_model.model.layers.27.mlp.shared_expert.down_proj.weight": "model-00003-of-00004.safetensors", + "language_model.model.layers.27.mlp.shared_expert.gate_proj.biases": "model-00003-of-00004.safetensors", + "language_model.model.layers.27.mlp.shared_expert.gate_proj.scales": "model-00003-of-00004.safetensors", + "language_model.model.layers.27.mlp.shared_expert.gate_proj.weight": "model-00003-of-00004.safetensors", + "language_model.model.layers.27.mlp.shared_expert.up_proj.biases": "model-00003-of-00004.safetensors", + "language_model.model.layers.27.mlp.shared_expert.up_proj.scales": "model-00003-of-00004.safetensors", + "language_model.model.layers.27.mlp.shared_expert.up_proj.weight": "model-00003-of-00004.safetensors", + "language_model.model.layers.27.mlp.shared_expert_gate.biases": "model-00003-of-00004.safetensors", + "language_model.model.layers.27.mlp.shared_expert_gate.scales": "model-00003-of-00004.safetensors", + "language_model.model.layers.27.mlp.shared_expert_gate.weight": "model-00003-of-00004.safetensors", + "language_model.model.layers.27.mlp.switch_mlp.down_proj.biases": "model-00003-of-00004.safetensors", + "language_model.model.layers.27.mlp.switch_mlp.down_proj.scales": "model-00003-of-00004.safetensors", + "language_model.model.layers.27.mlp.switch_mlp.down_proj.weight": "model-00003-of-00004.safetensors", + "language_model.model.layers.27.mlp.switch_mlp.gate_proj.biases": "model-00003-of-00004.safetensors", + "language_model.model.layers.27.mlp.switch_mlp.gate_proj.scales": "model-00003-of-00004.safetensors", + "language_model.model.layers.27.mlp.switch_mlp.gate_proj.weight": "model-00003-of-00004.safetensors", + "language_model.model.layers.27.mlp.switch_mlp.up_proj.biases": "model-00003-of-00004.safetensors", + "language_model.model.layers.27.mlp.switch_mlp.up_proj.scales": "model-00003-of-00004.safetensors", + "language_model.model.layers.27.mlp.switch_mlp.up_proj.weight": "model-00003-of-00004.safetensors", + "language_model.model.layers.27.post_attention_layernorm.weight": "model-00003-of-00004.safetensors", + "language_model.model.layers.27.self_attn.k_norm.weight": "model-00003-of-00004.safetensors", + "language_model.model.layers.27.self_attn.k_proj.biases": "model-00003-of-00004.safetensors", + "language_model.model.layers.27.self_attn.k_proj.scales": "model-00003-of-00004.safetensors", + "language_model.model.layers.27.self_attn.k_proj.weight": "model-00003-of-00004.safetensors", + "language_model.model.layers.27.self_attn.o_proj.biases": "model-00003-of-00004.safetensors", + "language_model.model.layers.27.self_attn.o_proj.scales": "model-00003-of-00004.safetensors", + "language_model.model.layers.27.self_attn.o_proj.weight": "model-00003-of-00004.safetensors", + "language_model.model.layers.27.self_attn.q_norm.weight": "model-00003-of-00004.safetensors", + "language_model.model.layers.27.self_attn.q_proj.biases": "model-00003-of-00004.safetensors", + "language_model.model.layers.27.self_attn.q_proj.scales": "model-00003-of-00004.safetensors", + "language_model.model.layers.27.self_attn.q_proj.weight": "model-00003-of-00004.safetensors", + "language_model.model.layers.27.self_attn.v_proj.biases": "model-00003-of-00004.safetensors", + "language_model.model.layers.27.self_attn.v_proj.scales": "model-00003-of-00004.safetensors", + "language_model.model.layers.27.self_attn.v_proj.weight": "model-00003-of-00004.safetensors", + "language_model.model.layers.28.input_layernorm.weight": "model-00003-of-00004.safetensors", + "language_model.model.layers.28.linear_attn.A_log": "model-00003-of-00004.safetensors", + "language_model.model.layers.28.linear_attn.conv1d.weight": "model-00003-of-00004.safetensors", + "language_model.model.layers.28.linear_attn.dt_bias": "model-00003-of-00004.safetensors", + "language_model.model.layers.28.linear_attn.in_proj_a.biases": "model-00003-of-00004.safetensors", + "language_model.model.layers.28.linear_attn.in_proj_a.scales": "model-00003-of-00004.safetensors", + "language_model.model.layers.28.linear_attn.in_proj_a.weight": "model-00003-of-00004.safetensors", + "language_model.model.layers.28.linear_attn.in_proj_b.biases": "model-00003-of-00004.safetensors", + "language_model.model.layers.28.linear_attn.in_proj_b.scales": "model-00003-of-00004.safetensors", + "language_model.model.layers.28.linear_attn.in_proj_b.weight": "model-00003-of-00004.safetensors", + "language_model.model.layers.28.linear_attn.in_proj_qkv.biases": "model-00003-of-00004.safetensors", + "language_model.model.layers.28.linear_attn.in_proj_qkv.scales": "model-00003-of-00004.safetensors", + "language_model.model.layers.28.linear_attn.in_proj_qkv.weight": "model-00003-of-00004.safetensors", + "language_model.model.layers.28.linear_attn.in_proj_z.biases": "model-00003-of-00004.safetensors", + "language_model.model.layers.28.linear_attn.in_proj_z.scales": "model-00003-of-00004.safetensors", + "language_model.model.layers.28.linear_attn.in_proj_z.weight": "model-00003-of-00004.safetensors", + "language_model.model.layers.28.linear_attn.norm.weight": "model-00003-of-00004.safetensors", + "language_model.model.layers.28.linear_attn.out_proj.biases": "model-00003-of-00004.safetensors", + "language_model.model.layers.28.linear_attn.out_proj.scales": "model-00003-of-00004.safetensors", + "language_model.model.layers.28.linear_attn.out_proj.weight": "model-00003-of-00004.safetensors", + "language_model.model.layers.28.mlp.gate.biases": "model-00003-of-00004.safetensors", + "language_model.model.layers.28.mlp.gate.scales": "model-00003-of-00004.safetensors", + "language_model.model.layers.28.mlp.gate.weight": "model-00003-of-00004.safetensors", + "language_model.model.layers.28.mlp.shared_expert.down_proj.biases": "model-00003-of-00004.safetensors", + "language_model.model.layers.28.mlp.shared_expert.down_proj.scales": "model-00003-of-00004.safetensors", + "language_model.model.layers.28.mlp.shared_expert.down_proj.weight": "model-00003-of-00004.safetensors", + "language_model.model.layers.28.mlp.shared_expert.gate_proj.biases": "model-00003-of-00004.safetensors", + "language_model.model.layers.28.mlp.shared_expert.gate_proj.scales": "model-00003-of-00004.safetensors", + "language_model.model.layers.28.mlp.shared_expert.gate_proj.weight": "model-00003-of-00004.safetensors", + "language_model.model.layers.28.mlp.shared_expert.up_proj.biases": "model-00003-of-00004.safetensors", + "language_model.model.layers.28.mlp.shared_expert.up_proj.scales": "model-00003-of-00004.safetensors", + "language_model.model.layers.28.mlp.shared_expert.up_proj.weight": "model-00003-of-00004.safetensors", + "language_model.model.layers.28.mlp.shared_expert_gate.biases": "model-00003-of-00004.safetensors", + "language_model.model.layers.28.mlp.shared_expert_gate.scales": "model-00003-of-00004.safetensors", + "language_model.model.layers.28.mlp.shared_expert_gate.weight": "model-00003-of-00004.safetensors", + "language_model.model.layers.28.mlp.switch_mlp.down_proj.biases": "model-00003-of-00004.safetensors", + "language_model.model.layers.28.mlp.switch_mlp.down_proj.scales": "model-00003-of-00004.safetensors", + "language_model.model.layers.28.mlp.switch_mlp.down_proj.weight": "model-00003-of-00004.safetensors", + "language_model.model.layers.28.mlp.switch_mlp.gate_proj.biases": "model-00003-of-00004.safetensors", + "language_model.model.layers.28.mlp.switch_mlp.gate_proj.scales": "model-00003-of-00004.safetensors", + "language_model.model.layers.28.mlp.switch_mlp.gate_proj.weight": "model-00003-of-00004.safetensors", + "language_model.model.layers.28.mlp.switch_mlp.up_proj.biases": "model-00003-of-00004.safetensors", + "language_model.model.layers.28.mlp.switch_mlp.up_proj.scales": "model-00003-of-00004.safetensors", + "language_model.model.layers.28.mlp.switch_mlp.up_proj.weight": "model-00003-of-00004.safetensors", + "language_model.model.layers.28.post_attention_layernorm.weight": "model-00003-of-00004.safetensors", + "language_model.model.layers.29.input_layernorm.weight": "model-00003-of-00004.safetensors", + "language_model.model.layers.29.linear_attn.A_log": "model-00003-of-00004.safetensors", + "language_model.model.layers.29.linear_attn.conv1d.weight": "model-00003-of-00004.safetensors", + "language_model.model.layers.29.linear_attn.dt_bias": "model-00003-of-00004.safetensors", + "language_model.model.layers.29.linear_attn.in_proj_a.biases": "model-00003-of-00004.safetensors", + "language_model.model.layers.29.linear_attn.in_proj_a.scales": "model-00003-of-00004.safetensors", + "language_model.model.layers.29.linear_attn.in_proj_a.weight": "model-00003-of-00004.safetensors", + "language_model.model.layers.29.linear_attn.in_proj_b.biases": "model-00003-of-00004.safetensors", + "language_model.model.layers.29.linear_attn.in_proj_b.scales": "model-00003-of-00004.safetensors", + "language_model.model.layers.29.linear_attn.in_proj_b.weight": "model-00003-of-00004.safetensors", + "language_model.model.layers.29.linear_attn.in_proj_qkv.biases": "model-00003-of-00004.safetensors", + "language_model.model.layers.29.linear_attn.in_proj_qkv.scales": "model-00003-of-00004.safetensors", + "language_model.model.layers.29.linear_attn.in_proj_qkv.weight": "model-00003-of-00004.safetensors", + "language_model.model.layers.29.linear_attn.in_proj_z.biases": "model-00003-of-00004.safetensors", + "language_model.model.layers.29.linear_attn.in_proj_z.scales": "model-00003-of-00004.safetensors", + "language_model.model.layers.29.linear_attn.in_proj_z.weight": "model-00003-of-00004.safetensors", + "language_model.model.layers.29.linear_attn.norm.weight": "model-00003-of-00004.safetensors", + "language_model.model.layers.29.linear_attn.out_proj.biases": "model-00003-of-00004.safetensors", + "language_model.model.layers.29.linear_attn.out_proj.scales": "model-00003-of-00004.safetensors", + "language_model.model.layers.29.linear_attn.out_proj.weight": "model-00003-of-00004.safetensors", + "language_model.model.layers.29.mlp.gate.biases": "model-00003-of-00004.safetensors", + "language_model.model.layers.29.mlp.gate.scales": "model-00003-of-00004.safetensors", + "language_model.model.layers.29.mlp.gate.weight": "model-00003-of-00004.safetensors", + "language_model.model.layers.29.mlp.shared_expert.down_proj.biases": "model-00003-of-00004.safetensors", + "language_model.model.layers.29.mlp.shared_expert.down_proj.scales": "model-00003-of-00004.safetensors", + "language_model.model.layers.29.mlp.shared_expert.down_proj.weight": "model-00003-of-00004.safetensors", + "language_model.model.layers.29.mlp.shared_expert.gate_proj.biases": "model-00003-of-00004.safetensors", + "language_model.model.layers.29.mlp.shared_expert.gate_proj.scales": "model-00003-of-00004.safetensors", + "language_model.model.layers.29.mlp.shared_expert.gate_proj.weight": "model-00003-of-00004.safetensors", + "language_model.model.layers.29.mlp.shared_expert.up_proj.biases": "model-00003-of-00004.safetensors", + "language_model.model.layers.29.mlp.shared_expert.up_proj.scales": "model-00003-of-00004.safetensors", + "language_model.model.layers.29.mlp.shared_expert.up_proj.weight": "model-00003-of-00004.safetensors", + "language_model.model.layers.29.mlp.shared_expert_gate.biases": "model-00003-of-00004.safetensors", + "language_model.model.layers.29.mlp.shared_expert_gate.scales": "model-00003-of-00004.safetensors", + "language_model.model.layers.29.mlp.shared_expert_gate.weight": "model-00003-of-00004.safetensors", + "language_model.model.layers.29.mlp.switch_mlp.down_proj.biases": "model-00003-of-00004.safetensors", + "language_model.model.layers.29.mlp.switch_mlp.down_proj.scales": "model-00003-of-00004.safetensors", + "language_model.model.layers.29.mlp.switch_mlp.down_proj.weight": "model-00003-of-00004.safetensors", + "language_model.model.layers.29.mlp.switch_mlp.gate_proj.biases": "model-00003-of-00004.safetensors", + "language_model.model.layers.29.mlp.switch_mlp.gate_proj.scales": "model-00003-of-00004.safetensors", + "language_model.model.layers.29.mlp.switch_mlp.gate_proj.weight": "model-00003-of-00004.safetensors", + "language_model.model.layers.29.mlp.switch_mlp.up_proj.biases": "model-00003-of-00004.safetensors", + "language_model.model.layers.29.mlp.switch_mlp.up_proj.scales": "model-00003-of-00004.safetensors", + "language_model.model.layers.29.mlp.switch_mlp.up_proj.weight": "model-00003-of-00004.safetensors", + "language_model.model.layers.29.post_attention_layernorm.weight": "model-00003-of-00004.safetensors", + "language_model.model.layers.3.input_layernorm.weight": "model-00001-of-00004.safetensors", + "language_model.model.layers.3.mlp.gate.biases": "model-00001-of-00004.safetensors", + "language_model.model.layers.3.mlp.gate.scales": "model-00001-of-00004.safetensors", + "language_model.model.layers.3.mlp.gate.weight": "model-00001-of-00004.safetensors", + "language_model.model.layers.3.mlp.shared_expert.down_proj.biases": "model-00001-of-00004.safetensors", + "language_model.model.layers.3.mlp.shared_expert.down_proj.scales": "model-00001-of-00004.safetensors", + "language_model.model.layers.3.mlp.shared_expert.down_proj.weight": "model-00001-of-00004.safetensors", + "language_model.model.layers.3.mlp.shared_expert.gate_proj.biases": "model-00001-of-00004.safetensors", + "language_model.model.layers.3.mlp.shared_expert.gate_proj.scales": "model-00001-of-00004.safetensors", + "language_model.model.layers.3.mlp.shared_expert.gate_proj.weight": "model-00001-of-00004.safetensors", + "language_model.model.layers.3.mlp.shared_expert.up_proj.biases": "model-00001-of-00004.safetensors", + "language_model.model.layers.3.mlp.shared_expert.up_proj.scales": "model-00001-of-00004.safetensors", + "language_model.model.layers.3.mlp.shared_expert.up_proj.weight": "model-00001-of-00004.safetensors", + "language_model.model.layers.3.mlp.shared_expert_gate.biases": "model-00001-of-00004.safetensors", + "language_model.model.layers.3.mlp.shared_expert_gate.scales": "model-00001-of-00004.safetensors", + "language_model.model.layers.3.mlp.shared_expert_gate.weight": "model-00001-of-00004.safetensors", + "language_model.model.layers.3.mlp.switch_mlp.down_proj.biases": "model-00001-of-00004.safetensors", + "language_model.model.layers.3.mlp.switch_mlp.down_proj.scales": "model-00001-of-00004.safetensors", + "language_model.model.layers.3.mlp.switch_mlp.down_proj.weight": "model-00001-of-00004.safetensors", + "language_model.model.layers.3.mlp.switch_mlp.gate_proj.biases": "model-00001-of-00004.safetensors", + "language_model.model.layers.3.mlp.switch_mlp.gate_proj.scales": "model-00001-of-00004.safetensors", + "language_model.model.layers.3.mlp.switch_mlp.gate_proj.weight": "model-00001-of-00004.safetensors", + "language_model.model.layers.3.mlp.switch_mlp.up_proj.biases": "model-00001-of-00004.safetensors", + "language_model.model.layers.3.mlp.switch_mlp.up_proj.scales": "model-00001-of-00004.safetensors", + "language_model.model.layers.3.mlp.switch_mlp.up_proj.weight": "model-00001-of-00004.safetensors", + "language_model.model.layers.3.post_attention_layernorm.weight": "model-00001-of-00004.safetensors", + "language_model.model.layers.3.self_attn.k_norm.weight": "model-00001-of-00004.safetensors", + "language_model.model.layers.3.self_attn.k_proj.biases": "model-00001-of-00004.safetensors", + "language_model.model.layers.3.self_attn.k_proj.scales": "model-00001-of-00004.safetensors", + "language_model.model.layers.3.self_attn.k_proj.weight": "model-00001-of-00004.safetensors", + "language_model.model.layers.3.self_attn.o_proj.biases": "model-00001-of-00004.safetensors", + "language_model.model.layers.3.self_attn.o_proj.scales": "model-00001-of-00004.safetensors", + "language_model.model.layers.3.self_attn.o_proj.weight": "model-00001-of-00004.safetensors", + "language_model.model.layers.3.self_attn.q_norm.weight": "model-00001-of-00004.safetensors", + "language_model.model.layers.3.self_attn.q_proj.biases": "model-00001-of-00004.safetensors", + "language_model.model.layers.3.self_attn.q_proj.scales": "model-00001-of-00004.safetensors", + "language_model.model.layers.3.self_attn.q_proj.weight": "model-00001-of-00004.safetensors", + "language_model.model.layers.3.self_attn.v_proj.biases": "model-00001-of-00004.safetensors", + "language_model.model.layers.3.self_attn.v_proj.scales": "model-00001-of-00004.safetensors", + "language_model.model.layers.3.self_attn.v_proj.weight": "model-00001-of-00004.safetensors", + "language_model.model.layers.30.input_layernorm.weight": "model-00003-of-00004.safetensors", + "language_model.model.layers.30.linear_attn.A_log": "model-00003-of-00004.safetensors", + "language_model.model.layers.30.linear_attn.conv1d.weight": "model-00003-of-00004.safetensors", + "language_model.model.layers.30.linear_attn.dt_bias": "model-00003-of-00004.safetensors", + "language_model.model.layers.30.linear_attn.in_proj_a.biases": "model-00003-of-00004.safetensors", + "language_model.model.layers.30.linear_attn.in_proj_a.scales": "model-00003-of-00004.safetensors", + "language_model.model.layers.30.linear_attn.in_proj_a.weight": "model-00003-of-00004.safetensors", + "language_model.model.layers.30.linear_attn.in_proj_b.biases": "model-00003-of-00004.safetensors", + "language_model.model.layers.30.linear_attn.in_proj_b.scales": "model-00003-of-00004.safetensors", + "language_model.model.layers.30.linear_attn.in_proj_b.weight": "model-00003-of-00004.safetensors", + "language_model.model.layers.30.linear_attn.in_proj_qkv.biases": "model-00003-of-00004.safetensors", + "language_model.model.layers.30.linear_attn.in_proj_qkv.scales": "model-00003-of-00004.safetensors", + "language_model.model.layers.30.linear_attn.in_proj_qkv.weight": "model-00003-of-00004.safetensors", + "language_model.model.layers.30.linear_attn.in_proj_z.biases": "model-00003-of-00004.safetensors", + "language_model.model.layers.30.linear_attn.in_proj_z.scales": "model-00003-of-00004.safetensors", + "language_model.model.layers.30.linear_attn.in_proj_z.weight": "model-00003-of-00004.safetensors", + "language_model.model.layers.30.linear_attn.norm.weight": "model-00003-of-00004.safetensors", + "language_model.model.layers.30.linear_attn.out_proj.biases": "model-00003-of-00004.safetensors", + "language_model.model.layers.30.linear_attn.out_proj.scales": "model-00003-of-00004.safetensors", + "language_model.model.layers.30.linear_attn.out_proj.weight": "model-00003-of-00004.safetensors", + "language_model.model.layers.30.mlp.gate.biases": "model-00003-of-00004.safetensors", + "language_model.model.layers.30.mlp.gate.scales": "model-00003-of-00004.safetensors", + "language_model.model.layers.30.mlp.gate.weight": "model-00003-of-00004.safetensors", + "language_model.model.layers.30.mlp.shared_expert.down_proj.biases": "model-00003-of-00004.safetensors", + "language_model.model.layers.30.mlp.shared_expert.down_proj.scales": "model-00003-of-00004.safetensors", + "language_model.model.layers.30.mlp.shared_expert.down_proj.weight": "model-00003-of-00004.safetensors", + "language_model.model.layers.30.mlp.shared_expert.gate_proj.biases": "model-00003-of-00004.safetensors", + "language_model.model.layers.30.mlp.shared_expert.gate_proj.scales": "model-00003-of-00004.safetensors", + "language_model.model.layers.30.mlp.shared_expert.gate_proj.weight": "model-00003-of-00004.safetensors", + "language_model.model.layers.30.mlp.shared_expert.up_proj.biases": "model-00003-of-00004.safetensors", + "language_model.model.layers.30.mlp.shared_expert.up_proj.scales": "model-00003-of-00004.safetensors", + "language_model.model.layers.30.mlp.shared_expert.up_proj.weight": "model-00003-of-00004.safetensors", + "language_model.model.layers.30.mlp.shared_expert_gate.biases": "model-00003-of-00004.safetensors", + "language_model.model.layers.30.mlp.shared_expert_gate.scales": "model-00003-of-00004.safetensors", + "language_model.model.layers.30.mlp.shared_expert_gate.weight": "model-00003-of-00004.safetensors", + "language_model.model.layers.30.mlp.switch_mlp.down_proj.biases": "model-00003-of-00004.safetensors", + "language_model.model.layers.30.mlp.switch_mlp.down_proj.scales": "model-00003-of-00004.safetensors", + "language_model.model.layers.30.mlp.switch_mlp.down_proj.weight": "model-00003-of-00004.safetensors", + "language_model.model.layers.30.mlp.switch_mlp.gate_proj.biases": "model-00003-of-00004.safetensors", + "language_model.model.layers.30.mlp.switch_mlp.gate_proj.scales": "model-00003-of-00004.safetensors", + "language_model.model.layers.30.mlp.switch_mlp.gate_proj.weight": "model-00003-of-00004.safetensors", + "language_model.model.layers.30.mlp.switch_mlp.up_proj.biases": "model-00003-of-00004.safetensors", + "language_model.model.layers.30.mlp.switch_mlp.up_proj.scales": "model-00003-of-00004.safetensors", + "language_model.model.layers.30.mlp.switch_mlp.up_proj.weight": "model-00003-of-00004.safetensors", + "language_model.model.layers.30.post_attention_layernorm.weight": "model-00003-of-00004.safetensors", + "language_model.model.layers.31.input_layernorm.weight": "model-00003-of-00004.safetensors", + "language_model.model.layers.31.mlp.gate.biases": "model-00003-of-00004.safetensors", + "language_model.model.layers.31.mlp.gate.scales": "model-00003-of-00004.safetensors", + "language_model.model.layers.31.mlp.gate.weight": "model-00003-of-00004.safetensors", + "language_model.model.layers.31.mlp.shared_expert.down_proj.biases": "model-00004-of-00004.safetensors", + "language_model.model.layers.31.mlp.shared_expert.down_proj.scales": "model-00004-of-00004.safetensors", + "language_model.model.layers.31.mlp.shared_expert.down_proj.weight": "model-00004-of-00004.safetensors", + "language_model.model.layers.31.mlp.shared_expert.gate_proj.biases": "model-00004-of-00004.safetensors", + "language_model.model.layers.31.mlp.shared_expert.gate_proj.scales": "model-00004-of-00004.safetensors", + "language_model.model.layers.31.mlp.shared_expert.gate_proj.weight": "model-00004-of-00004.safetensors", + "language_model.model.layers.31.mlp.shared_expert.up_proj.biases": "model-00004-of-00004.safetensors", + "language_model.model.layers.31.mlp.shared_expert.up_proj.scales": "model-00004-of-00004.safetensors", + "language_model.model.layers.31.mlp.shared_expert.up_proj.weight": "model-00004-of-00004.safetensors", + "language_model.model.layers.31.mlp.shared_expert_gate.biases": "model-00004-of-00004.safetensors", + "language_model.model.layers.31.mlp.shared_expert_gate.scales": "model-00004-of-00004.safetensors", + "language_model.model.layers.31.mlp.shared_expert_gate.weight": "model-00004-of-00004.safetensors", + "language_model.model.layers.31.mlp.switch_mlp.down_proj.biases": "model-00004-of-00004.safetensors", + "language_model.model.layers.31.mlp.switch_mlp.down_proj.scales": "model-00004-of-00004.safetensors", + "language_model.model.layers.31.mlp.switch_mlp.down_proj.weight": "model-00004-of-00004.safetensors", + "language_model.model.layers.31.mlp.switch_mlp.gate_proj.biases": "model-00003-of-00004.safetensors", + "language_model.model.layers.31.mlp.switch_mlp.gate_proj.scales": "model-00003-of-00004.safetensors", + "language_model.model.layers.31.mlp.switch_mlp.gate_proj.weight": "model-00003-of-00004.safetensors", + "language_model.model.layers.31.mlp.switch_mlp.up_proj.biases": "model-00004-of-00004.safetensors", + "language_model.model.layers.31.mlp.switch_mlp.up_proj.scales": "model-00004-of-00004.safetensors", + "language_model.model.layers.31.mlp.switch_mlp.up_proj.weight": "model-00004-of-00004.safetensors", + "language_model.model.layers.31.post_attention_layernorm.weight": "model-00003-of-00004.safetensors", + "language_model.model.layers.31.self_attn.k_norm.weight": "model-00003-of-00004.safetensors", + "language_model.model.layers.31.self_attn.k_proj.biases": "model-00003-of-00004.safetensors", + "language_model.model.layers.31.self_attn.k_proj.scales": "model-00003-of-00004.safetensors", + "language_model.model.layers.31.self_attn.k_proj.weight": "model-00003-of-00004.safetensors", + "language_model.model.layers.31.self_attn.o_proj.biases": "model-00003-of-00004.safetensors", + "language_model.model.layers.31.self_attn.o_proj.scales": "model-00003-of-00004.safetensors", + "language_model.model.layers.31.self_attn.o_proj.weight": "model-00003-of-00004.safetensors", + "language_model.model.layers.31.self_attn.q_norm.weight": "model-00003-of-00004.safetensors", + "language_model.model.layers.31.self_attn.q_proj.biases": "model-00003-of-00004.safetensors", + "language_model.model.layers.31.self_attn.q_proj.scales": "model-00003-of-00004.safetensors", + "language_model.model.layers.31.self_attn.q_proj.weight": "model-00003-of-00004.safetensors", + "language_model.model.layers.31.self_attn.v_proj.biases": "model-00003-of-00004.safetensors", + "language_model.model.layers.31.self_attn.v_proj.scales": "model-00003-of-00004.safetensors", + "language_model.model.layers.31.self_attn.v_proj.weight": "model-00003-of-00004.safetensors", + "language_model.model.layers.32.input_layernorm.weight": "model-00004-of-00004.safetensors", + "language_model.model.layers.32.linear_attn.A_log": "model-00004-of-00004.safetensors", + "language_model.model.layers.32.linear_attn.conv1d.weight": "model-00004-of-00004.safetensors", + "language_model.model.layers.32.linear_attn.dt_bias": "model-00004-of-00004.safetensors", + "language_model.model.layers.32.linear_attn.in_proj_a.biases": "model-00004-of-00004.safetensors", + "language_model.model.layers.32.linear_attn.in_proj_a.scales": "model-00004-of-00004.safetensors", + "language_model.model.layers.32.linear_attn.in_proj_a.weight": "model-00004-of-00004.safetensors", + "language_model.model.layers.32.linear_attn.in_proj_b.biases": "model-00004-of-00004.safetensors", + "language_model.model.layers.32.linear_attn.in_proj_b.scales": "model-00004-of-00004.safetensors", + "language_model.model.layers.32.linear_attn.in_proj_b.weight": "model-00004-of-00004.safetensors", + "language_model.model.layers.32.linear_attn.in_proj_qkv.biases": "model-00004-of-00004.safetensors", + "language_model.model.layers.32.linear_attn.in_proj_qkv.scales": "model-00004-of-00004.safetensors", + "language_model.model.layers.32.linear_attn.in_proj_qkv.weight": "model-00004-of-00004.safetensors", + "language_model.model.layers.32.linear_attn.in_proj_z.biases": "model-00004-of-00004.safetensors", + "language_model.model.layers.32.linear_attn.in_proj_z.scales": "model-00004-of-00004.safetensors", + "language_model.model.layers.32.linear_attn.in_proj_z.weight": "model-00004-of-00004.safetensors", + "language_model.model.layers.32.linear_attn.norm.weight": "model-00004-of-00004.safetensors", + "language_model.model.layers.32.linear_attn.out_proj.biases": "model-00004-of-00004.safetensors", + "language_model.model.layers.32.linear_attn.out_proj.scales": "model-00004-of-00004.safetensors", + "language_model.model.layers.32.linear_attn.out_proj.weight": "model-00004-of-00004.safetensors", + "language_model.model.layers.32.mlp.gate.biases": "model-00004-of-00004.safetensors", + "language_model.model.layers.32.mlp.gate.scales": "model-00004-of-00004.safetensors", + "language_model.model.layers.32.mlp.gate.weight": "model-00004-of-00004.safetensors", + "language_model.model.layers.32.mlp.shared_expert.down_proj.biases": "model-00004-of-00004.safetensors", + "language_model.model.layers.32.mlp.shared_expert.down_proj.scales": "model-00004-of-00004.safetensors", + "language_model.model.layers.32.mlp.shared_expert.down_proj.weight": "model-00004-of-00004.safetensors", + "language_model.model.layers.32.mlp.shared_expert.gate_proj.biases": "model-00004-of-00004.safetensors", + "language_model.model.layers.32.mlp.shared_expert.gate_proj.scales": "model-00004-of-00004.safetensors", + "language_model.model.layers.32.mlp.shared_expert.gate_proj.weight": "model-00004-of-00004.safetensors", + "language_model.model.layers.32.mlp.shared_expert.up_proj.biases": "model-00004-of-00004.safetensors", + "language_model.model.layers.32.mlp.shared_expert.up_proj.scales": "model-00004-of-00004.safetensors", + "language_model.model.layers.32.mlp.shared_expert.up_proj.weight": "model-00004-of-00004.safetensors", + "language_model.model.layers.32.mlp.shared_expert_gate.biases": "model-00004-of-00004.safetensors", + "language_model.model.layers.32.mlp.shared_expert_gate.scales": "model-00004-of-00004.safetensors", + "language_model.model.layers.32.mlp.shared_expert_gate.weight": "model-00004-of-00004.safetensors", + "language_model.model.layers.32.mlp.switch_mlp.down_proj.biases": "model-00004-of-00004.safetensors", + "language_model.model.layers.32.mlp.switch_mlp.down_proj.scales": "model-00004-of-00004.safetensors", + "language_model.model.layers.32.mlp.switch_mlp.down_proj.weight": "model-00004-of-00004.safetensors", + "language_model.model.layers.32.mlp.switch_mlp.gate_proj.biases": "model-00004-of-00004.safetensors", + "language_model.model.layers.32.mlp.switch_mlp.gate_proj.scales": "model-00004-of-00004.safetensors", + "language_model.model.layers.32.mlp.switch_mlp.gate_proj.weight": "model-00004-of-00004.safetensors", + "language_model.model.layers.32.mlp.switch_mlp.up_proj.biases": "model-00004-of-00004.safetensors", + "language_model.model.layers.32.mlp.switch_mlp.up_proj.scales": "model-00004-of-00004.safetensors", + "language_model.model.layers.32.mlp.switch_mlp.up_proj.weight": "model-00004-of-00004.safetensors", + "language_model.model.layers.32.post_attention_layernorm.weight": "model-00004-of-00004.safetensors", + "language_model.model.layers.33.input_layernorm.weight": "model-00004-of-00004.safetensors", + "language_model.model.layers.33.linear_attn.A_log": "model-00004-of-00004.safetensors", + "language_model.model.layers.33.linear_attn.conv1d.weight": "model-00004-of-00004.safetensors", + "language_model.model.layers.33.linear_attn.dt_bias": "model-00004-of-00004.safetensors", + "language_model.model.layers.33.linear_attn.in_proj_a.biases": "model-00004-of-00004.safetensors", + "language_model.model.layers.33.linear_attn.in_proj_a.scales": "model-00004-of-00004.safetensors", + "language_model.model.layers.33.linear_attn.in_proj_a.weight": "model-00004-of-00004.safetensors", + "language_model.model.layers.33.linear_attn.in_proj_b.biases": "model-00004-of-00004.safetensors", + "language_model.model.layers.33.linear_attn.in_proj_b.scales": "model-00004-of-00004.safetensors", + "language_model.model.layers.33.linear_attn.in_proj_b.weight": "model-00004-of-00004.safetensors", + "language_model.model.layers.33.linear_attn.in_proj_qkv.biases": "model-00004-of-00004.safetensors", + "language_model.model.layers.33.linear_attn.in_proj_qkv.scales": "model-00004-of-00004.safetensors", + "language_model.model.layers.33.linear_attn.in_proj_qkv.weight": "model-00004-of-00004.safetensors", + "language_model.model.layers.33.linear_attn.in_proj_z.biases": "model-00004-of-00004.safetensors", + "language_model.model.layers.33.linear_attn.in_proj_z.scales": "model-00004-of-00004.safetensors", + "language_model.model.layers.33.linear_attn.in_proj_z.weight": "model-00004-of-00004.safetensors", + "language_model.model.layers.33.linear_attn.norm.weight": "model-00004-of-00004.safetensors", + "language_model.model.layers.33.linear_attn.out_proj.biases": "model-00004-of-00004.safetensors", + "language_model.model.layers.33.linear_attn.out_proj.scales": "model-00004-of-00004.safetensors", + "language_model.model.layers.33.linear_attn.out_proj.weight": "model-00004-of-00004.safetensors", + "language_model.model.layers.33.mlp.gate.biases": "model-00004-of-00004.safetensors", + "language_model.model.layers.33.mlp.gate.scales": "model-00004-of-00004.safetensors", + "language_model.model.layers.33.mlp.gate.weight": "model-00004-of-00004.safetensors", + "language_model.model.layers.33.mlp.shared_expert.down_proj.biases": "model-00004-of-00004.safetensors", + "language_model.model.layers.33.mlp.shared_expert.down_proj.scales": "model-00004-of-00004.safetensors", + "language_model.model.layers.33.mlp.shared_expert.down_proj.weight": "model-00004-of-00004.safetensors", + "language_model.model.layers.33.mlp.shared_expert.gate_proj.biases": "model-00004-of-00004.safetensors", + "language_model.model.layers.33.mlp.shared_expert.gate_proj.scales": "model-00004-of-00004.safetensors", + "language_model.model.layers.33.mlp.shared_expert.gate_proj.weight": "model-00004-of-00004.safetensors", + "language_model.model.layers.33.mlp.shared_expert.up_proj.biases": "model-00004-of-00004.safetensors", + "language_model.model.layers.33.mlp.shared_expert.up_proj.scales": "model-00004-of-00004.safetensors", + "language_model.model.layers.33.mlp.shared_expert.up_proj.weight": "model-00004-of-00004.safetensors", + "language_model.model.layers.33.mlp.shared_expert_gate.biases": "model-00004-of-00004.safetensors", + "language_model.model.layers.33.mlp.shared_expert_gate.scales": "model-00004-of-00004.safetensors", + "language_model.model.layers.33.mlp.shared_expert_gate.weight": "model-00004-of-00004.safetensors", + "language_model.model.layers.33.mlp.switch_mlp.down_proj.biases": "model-00004-of-00004.safetensors", + "language_model.model.layers.33.mlp.switch_mlp.down_proj.scales": "model-00004-of-00004.safetensors", + "language_model.model.layers.33.mlp.switch_mlp.down_proj.weight": "model-00004-of-00004.safetensors", + "language_model.model.layers.33.mlp.switch_mlp.gate_proj.biases": "model-00004-of-00004.safetensors", + "language_model.model.layers.33.mlp.switch_mlp.gate_proj.scales": "model-00004-of-00004.safetensors", + "language_model.model.layers.33.mlp.switch_mlp.gate_proj.weight": "model-00004-of-00004.safetensors", + "language_model.model.layers.33.mlp.switch_mlp.up_proj.biases": "model-00004-of-00004.safetensors", + "language_model.model.layers.33.mlp.switch_mlp.up_proj.scales": "model-00004-of-00004.safetensors", + "language_model.model.layers.33.mlp.switch_mlp.up_proj.weight": "model-00004-of-00004.safetensors", + "language_model.model.layers.33.post_attention_layernorm.weight": "model-00004-of-00004.safetensors", + "language_model.model.layers.34.input_layernorm.weight": "model-00004-of-00004.safetensors", + "language_model.model.layers.34.linear_attn.A_log": "model-00004-of-00004.safetensors", + "language_model.model.layers.34.linear_attn.conv1d.weight": "model-00004-of-00004.safetensors", + "language_model.model.layers.34.linear_attn.dt_bias": "model-00004-of-00004.safetensors", + "language_model.model.layers.34.linear_attn.in_proj_a.biases": "model-00004-of-00004.safetensors", + "language_model.model.layers.34.linear_attn.in_proj_a.scales": "model-00004-of-00004.safetensors", + "language_model.model.layers.34.linear_attn.in_proj_a.weight": "model-00004-of-00004.safetensors", + "language_model.model.layers.34.linear_attn.in_proj_b.biases": "model-00004-of-00004.safetensors", + "language_model.model.layers.34.linear_attn.in_proj_b.scales": "model-00004-of-00004.safetensors", + "language_model.model.layers.34.linear_attn.in_proj_b.weight": "model-00004-of-00004.safetensors", + "language_model.model.layers.34.linear_attn.in_proj_qkv.biases": "model-00004-of-00004.safetensors", + "language_model.model.layers.34.linear_attn.in_proj_qkv.scales": "model-00004-of-00004.safetensors", + "language_model.model.layers.34.linear_attn.in_proj_qkv.weight": "model-00004-of-00004.safetensors", + "language_model.model.layers.34.linear_attn.in_proj_z.biases": "model-00004-of-00004.safetensors", + "language_model.model.layers.34.linear_attn.in_proj_z.scales": "model-00004-of-00004.safetensors", + "language_model.model.layers.34.linear_attn.in_proj_z.weight": "model-00004-of-00004.safetensors", + "language_model.model.layers.34.linear_attn.norm.weight": "model-00004-of-00004.safetensors", + "language_model.model.layers.34.linear_attn.out_proj.biases": "model-00004-of-00004.safetensors", + "language_model.model.layers.34.linear_attn.out_proj.scales": "model-00004-of-00004.safetensors", + "language_model.model.layers.34.linear_attn.out_proj.weight": "model-00004-of-00004.safetensors", + "language_model.model.layers.34.mlp.gate.biases": "model-00004-of-00004.safetensors", + "language_model.model.layers.34.mlp.gate.scales": "model-00004-of-00004.safetensors", + "language_model.model.layers.34.mlp.gate.weight": "model-00004-of-00004.safetensors", + "language_model.model.layers.34.mlp.shared_expert.down_proj.biases": "model-00004-of-00004.safetensors", + "language_model.model.layers.34.mlp.shared_expert.down_proj.scales": "model-00004-of-00004.safetensors", + "language_model.model.layers.34.mlp.shared_expert.down_proj.weight": "model-00004-of-00004.safetensors", + "language_model.model.layers.34.mlp.shared_expert.gate_proj.biases": "model-00004-of-00004.safetensors", + "language_model.model.layers.34.mlp.shared_expert.gate_proj.scales": "model-00004-of-00004.safetensors", + "language_model.model.layers.34.mlp.shared_expert.gate_proj.weight": "model-00004-of-00004.safetensors", + "language_model.model.layers.34.mlp.shared_expert.up_proj.biases": "model-00004-of-00004.safetensors", + "language_model.model.layers.34.mlp.shared_expert.up_proj.scales": "model-00004-of-00004.safetensors", + "language_model.model.layers.34.mlp.shared_expert.up_proj.weight": "model-00004-of-00004.safetensors", + "language_model.model.layers.34.mlp.shared_expert_gate.biases": "model-00004-of-00004.safetensors", + "language_model.model.layers.34.mlp.shared_expert_gate.scales": "model-00004-of-00004.safetensors", + "language_model.model.layers.34.mlp.shared_expert_gate.weight": "model-00004-of-00004.safetensors", + "language_model.model.layers.34.mlp.switch_mlp.down_proj.biases": "model-00004-of-00004.safetensors", + "language_model.model.layers.34.mlp.switch_mlp.down_proj.scales": "model-00004-of-00004.safetensors", + "language_model.model.layers.34.mlp.switch_mlp.down_proj.weight": "model-00004-of-00004.safetensors", + "language_model.model.layers.34.mlp.switch_mlp.gate_proj.biases": "model-00004-of-00004.safetensors", + "language_model.model.layers.34.mlp.switch_mlp.gate_proj.scales": "model-00004-of-00004.safetensors", + "language_model.model.layers.34.mlp.switch_mlp.gate_proj.weight": "model-00004-of-00004.safetensors", + "language_model.model.layers.34.mlp.switch_mlp.up_proj.biases": "model-00004-of-00004.safetensors", + "language_model.model.layers.34.mlp.switch_mlp.up_proj.scales": "model-00004-of-00004.safetensors", + "language_model.model.layers.34.mlp.switch_mlp.up_proj.weight": "model-00004-of-00004.safetensors", + "language_model.model.layers.34.post_attention_layernorm.weight": "model-00004-of-00004.safetensors", + "language_model.model.layers.35.input_layernorm.weight": "model-00004-of-00004.safetensors", + "language_model.model.layers.35.mlp.gate.biases": "model-00004-of-00004.safetensors", + "language_model.model.layers.35.mlp.gate.scales": "model-00004-of-00004.safetensors", + "language_model.model.layers.35.mlp.gate.weight": "model-00004-of-00004.safetensors", + "language_model.model.layers.35.mlp.shared_expert.down_proj.biases": "model-00004-of-00004.safetensors", + "language_model.model.layers.35.mlp.shared_expert.down_proj.scales": "model-00004-of-00004.safetensors", + "language_model.model.layers.35.mlp.shared_expert.down_proj.weight": "model-00004-of-00004.safetensors", + "language_model.model.layers.35.mlp.shared_expert.gate_proj.biases": "model-00004-of-00004.safetensors", + "language_model.model.layers.35.mlp.shared_expert.gate_proj.scales": "model-00004-of-00004.safetensors", + "language_model.model.layers.35.mlp.shared_expert.gate_proj.weight": "model-00004-of-00004.safetensors", + "language_model.model.layers.35.mlp.shared_expert.up_proj.biases": "model-00004-of-00004.safetensors", + "language_model.model.layers.35.mlp.shared_expert.up_proj.scales": "model-00004-of-00004.safetensors", + "language_model.model.layers.35.mlp.shared_expert.up_proj.weight": "model-00004-of-00004.safetensors", + "language_model.model.layers.35.mlp.shared_expert_gate.biases": "model-00004-of-00004.safetensors", + "language_model.model.layers.35.mlp.shared_expert_gate.scales": "model-00004-of-00004.safetensors", + "language_model.model.layers.35.mlp.shared_expert_gate.weight": "model-00004-of-00004.safetensors", + "language_model.model.layers.35.mlp.switch_mlp.down_proj.biases": "model-00004-of-00004.safetensors", + "language_model.model.layers.35.mlp.switch_mlp.down_proj.scales": "model-00004-of-00004.safetensors", + "language_model.model.layers.35.mlp.switch_mlp.down_proj.weight": "model-00004-of-00004.safetensors", + "language_model.model.layers.35.mlp.switch_mlp.gate_proj.biases": "model-00004-of-00004.safetensors", + "language_model.model.layers.35.mlp.switch_mlp.gate_proj.scales": "model-00004-of-00004.safetensors", + "language_model.model.layers.35.mlp.switch_mlp.gate_proj.weight": "model-00004-of-00004.safetensors", + "language_model.model.layers.35.mlp.switch_mlp.up_proj.biases": "model-00004-of-00004.safetensors", + "language_model.model.layers.35.mlp.switch_mlp.up_proj.scales": "model-00004-of-00004.safetensors", + "language_model.model.layers.35.mlp.switch_mlp.up_proj.weight": "model-00004-of-00004.safetensors", + "language_model.model.layers.35.post_attention_layernorm.weight": "model-00004-of-00004.safetensors", + "language_model.model.layers.35.self_attn.k_norm.weight": "model-00004-of-00004.safetensors", + "language_model.model.layers.35.self_attn.k_proj.biases": "model-00004-of-00004.safetensors", + "language_model.model.layers.35.self_attn.k_proj.scales": "model-00004-of-00004.safetensors", + "language_model.model.layers.35.self_attn.k_proj.weight": "model-00004-of-00004.safetensors", + "language_model.model.layers.35.self_attn.o_proj.biases": "model-00004-of-00004.safetensors", + "language_model.model.layers.35.self_attn.o_proj.scales": "model-00004-of-00004.safetensors", + "language_model.model.layers.35.self_attn.o_proj.weight": "model-00004-of-00004.safetensors", + "language_model.model.layers.35.self_attn.q_norm.weight": "model-00004-of-00004.safetensors", + "language_model.model.layers.35.self_attn.q_proj.biases": "model-00004-of-00004.safetensors", + "language_model.model.layers.35.self_attn.q_proj.scales": "model-00004-of-00004.safetensors", + "language_model.model.layers.35.self_attn.q_proj.weight": "model-00004-of-00004.safetensors", + "language_model.model.layers.35.self_attn.v_proj.biases": "model-00004-of-00004.safetensors", + "language_model.model.layers.35.self_attn.v_proj.scales": "model-00004-of-00004.safetensors", + "language_model.model.layers.35.self_attn.v_proj.weight": "model-00004-of-00004.safetensors", + "language_model.model.layers.36.input_layernorm.weight": "model-00004-of-00004.safetensors", + "language_model.model.layers.36.linear_attn.A_log": "model-00004-of-00004.safetensors", + "language_model.model.layers.36.linear_attn.conv1d.weight": "model-00004-of-00004.safetensors", + "language_model.model.layers.36.linear_attn.dt_bias": "model-00004-of-00004.safetensors", + "language_model.model.layers.36.linear_attn.in_proj_a.biases": "model-00004-of-00004.safetensors", + "language_model.model.layers.36.linear_attn.in_proj_a.scales": "model-00004-of-00004.safetensors", + "language_model.model.layers.36.linear_attn.in_proj_a.weight": "model-00004-of-00004.safetensors", + "language_model.model.layers.36.linear_attn.in_proj_b.biases": "model-00004-of-00004.safetensors", + "language_model.model.layers.36.linear_attn.in_proj_b.scales": "model-00004-of-00004.safetensors", + "language_model.model.layers.36.linear_attn.in_proj_b.weight": "model-00004-of-00004.safetensors", + "language_model.model.layers.36.linear_attn.in_proj_qkv.biases": "model-00004-of-00004.safetensors", + "language_model.model.layers.36.linear_attn.in_proj_qkv.scales": "model-00004-of-00004.safetensors", + "language_model.model.layers.36.linear_attn.in_proj_qkv.weight": "model-00004-of-00004.safetensors", + "language_model.model.layers.36.linear_attn.in_proj_z.biases": "model-00004-of-00004.safetensors", + "language_model.model.layers.36.linear_attn.in_proj_z.scales": "model-00004-of-00004.safetensors", + "language_model.model.layers.36.linear_attn.in_proj_z.weight": "model-00004-of-00004.safetensors", + "language_model.model.layers.36.linear_attn.norm.weight": "model-00004-of-00004.safetensors", + "language_model.model.layers.36.linear_attn.out_proj.biases": "model-00004-of-00004.safetensors", + "language_model.model.layers.36.linear_attn.out_proj.scales": "model-00004-of-00004.safetensors", + "language_model.model.layers.36.linear_attn.out_proj.weight": "model-00004-of-00004.safetensors", + "language_model.model.layers.36.mlp.gate.biases": "model-00004-of-00004.safetensors", + "language_model.model.layers.36.mlp.gate.scales": "model-00004-of-00004.safetensors", + "language_model.model.layers.36.mlp.gate.weight": "model-00004-of-00004.safetensors", + "language_model.model.layers.36.mlp.shared_expert.down_proj.biases": "model-00004-of-00004.safetensors", + "language_model.model.layers.36.mlp.shared_expert.down_proj.scales": "model-00004-of-00004.safetensors", + "language_model.model.layers.36.mlp.shared_expert.down_proj.weight": "model-00004-of-00004.safetensors", + "language_model.model.layers.36.mlp.shared_expert.gate_proj.biases": "model-00004-of-00004.safetensors", + "language_model.model.layers.36.mlp.shared_expert.gate_proj.scales": "model-00004-of-00004.safetensors", + "language_model.model.layers.36.mlp.shared_expert.gate_proj.weight": "model-00004-of-00004.safetensors", + "language_model.model.layers.36.mlp.shared_expert.up_proj.biases": "model-00004-of-00004.safetensors", + "language_model.model.layers.36.mlp.shared_expert.up_proj.scales": "model-00004-of-00004.safetensors", + "language_model.model.layers.36.mlp.shared_expert.up_proj.weight": "model-00004-of-00004.safetensors", + "language_model.model.layers.36.mlp.shared_expert_gate.biases": "model-00004-of-00004.safetensors", + "language_model.model.layers.36.mlp.shared_expert_gate.scales": "model-00004-of-00004.safetensors", + "language_model.model.layers.36.mlp.shared_expert_gate.weight": "model-00004-of-00004.safetensors", + "language_model.model.layers.36.mlp.switch_mlp.down_proj.biases": "model-00004-of-00004.safetensors", + "language_model.model.layers.36.mlp.switch_mlp.down_proj.scales": "model-00004-of-00004.safetensors", + "language_model.model.layers.36.mlp.switch_mlp.down_proj.weight": "model-00004-of-00004.safetensors", + "language_model.model.layers.36.mlp.switch_mlp.gate_proj.biases": "model-00004-of-00004.safetensors", + "language_model.model.layers.36.mlp.switch_mlp.gate_proj.scales": "model-00004-of-00004.safetensors", + "language_model.model.layers.36.mlp.switch_mlp.gate_proj.weight": "model-00004-of-00004.safetensors", + "language_model.model.layers.36.mlp.switch_mlp.up_proj.biases": "model-00004-of-00004.safetensors", + "language_model.model.layers.36.mlp.switch_mlp.up_proj.scales": "model-00004-of-00004.safetensors", + "language_model.model.layers.36.mlp.switch_mlp.up_proj.weight": "model-00004-of-00004.safetensors", + "language_model.model.layers.36.post_attention_layernorm.weight": "model-00004-of-00004.safetensors", + "language_model.model.layers.37.input_layernorm.weight": "model-00004-of-00004.safetensors", + "language_model.model.layers.37.linear_attn.A_log": "model-00004-of-00004.safetensors", + "language_model.model.layers.37.linear_attn.conv1d.weight": "model-00004-of-00004.safetensors", + "language_model.model.layers.37.linear_attn.dt_bias": "model-00004-of-00004.safetensors", + "language_model.model.layers.37.linear_attn.in_proj_a.biases": "model-00004-of-00004.safetensors", + "language_model.model.layers.37.linear_attn.in_proj_a.scales": "model-00004-of-00004.safetensors", + "language_model.model.layers.37.linear_attn.in_proj_a.weight": "model-00004-of-00004.safetensors", + "language_model.model.layers.37.linear_attn.in_proj_b.biases": "model-00004-of-00004.safetensors", + "language_model.model.layers.37.linear_attn.in_proj_b.scales": "model-00004-of-00004.safetensors", + "language_model.model.layers.37.linear_attn.in_proj_b.weight": "model-00004-of-00004.safetensors", + "language_model.model.layers.37.linear_attn.in_proj_qkv.biases": "model-00004-of-00004.safetensors", + "language_model.model.layers.37.linear_attn.in_proj_qkv.scales": "model-00004-of-00004.safetensors", + "language_model.model.layers.37.linear_attn.in_proj_qkv.weight": "model-00004-of-00004.safetensors", + "language_model.model.layers.37.linear_attn.in_proj_z.biases": "model-00004-of-00004.safetensors", + "language_model.model.layers.37.linear_attn.in_proj_z.scales": "model-00004-of-00004.safetensors", + "language_model.model.layers.37.linear_attn.in_proj_z.weight": "model-00004-of-00004.safetensors", + "language_model.model.layers.37.linear_attn.norm.weight": "model-00004-of-00004.safetensors", + "language_model.model.layers.37.linear_attn.out_proj.biases": "model-00004-of-00004.safetensors", + "language_model.model.layers.37.linear_attn.out_proj.scales": "model-00004-of-00004.safetensors", + "language_model.model.layers.37.linear_attn.out_proj.weight": "model-00004-of-00004.safetensors", + "language_model.model.layers.37.mlp.gate.biases": "model-00004-of-00004.safetensors", + "language_model.model.layers.37.mlp.gate.scales": "model-00004-of-00004.safetensors", + "language_model.model.layers.37.mlp.gate.weight": "model-00004-of-00004.safetensors", + "language_model.model.layers.37.mlp.shared_expert.down_proj.biases": "model-00004-of-00004.safetensors", + "language_model.model.layers.37.mlp.shared_expert.down_proj.scales": "model-00004-of-00004.safetensors", + "language_model.model.layers.37.mlp.shared_expert.down_proj.weight": "model-00004-of-00004.safetensors", + "language_model.model.layers.37.mlp.shared_expert.gate_proj.biases": "model-00004-of-00004.safetensors", + "language_model.model.layers.37.mlp.shared_expert.gate_proj.scales": "model-00004-of-00004.safetensors", + "language_model.model.layers.37.mlp.shared_expert.gate_proj.weight": "model-00004-of-00004.safetensors", + "language_model.model.layers.37.mlp.shared_expert.up_proj.biases": "model-00004-of-00004.safetensors", + "language_model.model.layers.37.mlp.shared_expert.up_proj.scales": "model-00004-of-00004.safetensors", + "language_model.model.layers.37.mlp.shared_expert.up_proj.weight": "model-00004-of-00004.safetensors", + "language_model.model.layers.37.mlp.shared_expert_gate.biases": "model-00004-of-00004.safetensors", + "language_model.model.layers.37.mlp.shared_expert_gate.scales": "model-00004-of-00004.safetensors", + "language_model.model.layers.37.mlp.shared_expert_gate.weight": "model-00004-of-00004.safetensors", + "language_model.model.layers.37.mlp.switch_mlp.down_proj.biases": "model-00004-of-00004.safetensors", + "language_model.model.layers.37.mlp.switch_mlp.down_proj.scales": "model-00004-of-00004.safetensors", + "language_model.model.layers.37.mlp.switch_mlp.down_proj.weight": "model-00004-of-00004.safetensors", + "language_model.model.layers.37.mlp.switch_mlp.gate_proj.biases": "model-00004-of-00004.safetensors", + "language_model.model.layers.37.mlp.switch_mlp.gate_proj.scales": "model-00004-of-00004.safetensors", + "language_model.model.layers.37.mlp.switch_mlp.gate_proj.weight": "model-00004-of-00004.safetensors", + "language_model.model.layers.37.mlp.switch_mlp.up_proj.biases": "model-00004-of-00004.safetensors", + "language_model.model.layers.37.mlp.switch_mlp.up_proj.scales": "model-00004-of-00004.safetensors", + "language_model.model.layers.37.mlp.switch_mlp.up_proj.weight": "model-00004-of-00004.safetensors", + "language_model.model.layers.37.post_attention_layernorm.weight": "model-00004-of-00004.safetensors", + "language_model.model.layers.38.input_layernorm.weight": "model-00004-of-00004.safetensors", + "language_model.model.layers.38.linear_attn.A_log": "model-00004-of-00004.safetensors", + "language_model.model.layers.38.linear_attn.conv1d.weight": "model-00004-of-00004.safetensors", + "language_model.model.layers.38.linear_attn.dt_bias": "model-00004-of-00004.safetensors", + "language_model.model.layers.38.linear_attn.in_proj_a.biases": "model-00004-of-00004.safetensors", + "language_model.model.layers.38.linear_attn.in_proj_a.scales": "model-00004-of-00004.safetensors", + "language_model.model.layers.38.linear_attn.in_proj_a.weight": "model-00004-of-00004.safetensors", + "language_model.model.layers.38.linear_attn.in_proj_b.biases": "model-00004-of-00004.safetensors", + "language_model.model.layers.38.linear_attn.in_proj_b.scales": "model-00004-of-00004.safetensors", + "language_model.model.layers.38.linear_attn.in_proj_b.weight": "model-00004-of-00004.safetensors", + "language_model.model.layers.38.linear_attn.in_proj_qkv.biases": "model-00004-of-00004.safetensors", + "language_model.model.layers.38.linear_attn.in_proj_qkv.scales": "model-00004-of-00004.safetensors", + "language_model.model.layers.38.linear_attn.in_proj_qkv.weight": "model-00004-of-00004.safetensors", + "language_model.model.layers.38.linear_attn.in_proj_z.biases": "model-00004-of-00004.safetensors", + "language_model.model.layers.38.linear_attn.in_proj_z.scales": "model-00004-of-00004.safetensors", + "language_model.model.layers.38.linear_attn.in_proj_z.weight": "model-00004-of-00004.safetensors", + "language_model.model.layers.38.linear_attn.norm.weight": "model-00004-of-00004.safetensors", + "language_model.model.layers.38.linear_attn.out_proj.biases": "model-00004-of-00004.safetensors", + "language_model.model.layers.38.linear_attn.out_proj.scales": "model-00004-of-00004.safetensors", + "language_model.model.layers.38.linear_attn.out_proj.weight": "model-00004-of-00004.safetensors", + "language_model.model.layers.38.mlp.gate.biases": "model-00004-of-00004.safetensors", + "language_model.model.layers.38.mlp.gate.scales": "model-00004-of-00004.safetensors", + "language_model.model.layers.38.mlp.gate.weight": "model-00004-of-00004.safetensors", + "language_model.model.layers.38.mlp.shared_expert.down_proj.biases": "model-00004-of-00004.safetensors", + "language_model.model.layers.38.mlp.shared_expert.down_proj.scales": "model-00004-of-00004.safetensors", + "language_model.model.layers.38.mlp.shared_expert.down_proj.weight": "model-00004-of-00004.safetensors", + "language_model.model.layers.38.mlp.shared_expert.gate_proj.biases": "model-00004-of-00004.safetensors", + "language_model.model.layers.38.mlp.shared_expert.gate_proj.scales": "model-00004-of-00004.safetensors", + "language_model.model.layers.38.mlp.shared_expert.gate_proj.weight": "model-00004-of-00004.safetensors", + "language_model.model.layers.38.mlp.shared_expert.up_proj.biases": "model-00004-of-00004.safetensors", + "language_model.model.layers.38.mlp.shared_expert.up_proj.scales": "model-00004-of-00004.safetensors", + "language_model.model.layers.38.mlp.shared_expert.up_proj.weight": "model-00004-of-00004.safetensors", + "language_model.model.layers.38.mlp.shared_expert_gate.biases": "model-00004-of-00004.safetensors", + "language_model.model.layers.38.mlp.shared_expert_gate.scales": "model-00004-of-00004.safetensors", + "language_model.model.layers.38.mlp.shared_expert_gate.weight": "model-00004-of-00004.safetensors", + "language_model.model.layers.38.mlp.switch_mlp.down_proj.biases": "model-00004-of-00004.safetensors", + "language_model.model.layers.38.mlp.switch_mlp.down_proj.scales": "model-00004-of-00004.safetensors", + "language_model.model.layers.38.mlp.switch_mlp.down_proj.weight": "model-00004-of-00004.safetensors", + "language_model.model.layers.38.mlp.switch_mlp.gate_proj.biases": "model-00004-of-00004.safetensors", + "language_model.model.layers.38.mlp.switch_mlp.gate_proj.scales": "model-00004-of-00004.safetensors", + "language_model.model.layers.38.mlp.switch_mlp.gate_proj.weight": "model-00004-of-00004.safetensors", + "language_model.model.layers.38.mlp.switch_mlp.up_proj.biases": "model-00004-of-00004.safetensors", + "language_model.model.layers.38.mlp.switch_mlp.up_proj.scales": "model-00004-of-00004.safetensors", + "language_model.model.layers.38.mlp.switch_mlp.up_proj.weight": "model-00004-of-00004.safetensors", + "language_model.model.layers.38.post_attention_layernorm.weight": "model-00004-of-00004.safetensors", + "language_model.model.layers.39.input_layernorm.weight": "model-00004-of-00004.safetensors", + "language_model.model.layers.39.mlp.gate.biases": "model-00004-of-00004.safetensors", + "language_model.model.layers.39.mlp.gate.scales": "model-00004-of-00004.safetensors", + "language_model.model.layers.39.mlp.gate.weight": "model-00004-of-00004.safetensors", + "language_model.model.layers.39.mlp.shared_expert.down_proj.biases": "model-00004-of-00004.safetensors", + "language_model.model.layers.39.mlp.shared_expert.down_proj.scales": "model-00004-of-00004.safetensors", + "language_model.model.layers.39.mlp.shared_expert.down_proj.weight": "model-00004-of-00004.safetensors", + "language_model.model.layers.39.mlp.shared_expert.gate_proj.biases": "model-00004-of-00004.safetensors", + "language_model.model.layers.39.mlp.shared_expert.gate_proj.scales": "model-00004-of-00004.safetensors", + "language_model.model.layers.39.mlp.shared_expert.gate_proj.weight": "model-00004-of-00004.safetensors", + "language_model.model.layers.39.mlp.shared_expert.up_proj.biases": "model-00004-of-00004.safetensors", + "language_model.model.layers.39.mlp.shared_expert.up_proj.scales": "model-00004-of-00004.safetensors", + "language_model.model.layers.39.mlp.shared_expert.up_proj.weight": "model-00004-of-00004.safetensors", + "language_model.model.layers.39.mlp.shared_expert_gate.biases": "model-00004-of-00004.safetensors", + "language_model.model.layers.39.mlp.shared_expert_gate.scales": "model-00004-of-00004.safetensors", + "language_model.model.layers.39.mlp.shared_expert_gate.weight": "model-00004-of-00004.safetensors", + "language_model.model.layers.39.mlp.switch_mlp.down_proj.biases": "model-00004-of-00004.safetensors", + "language_model.model.layers.39.mlp.switch_mlp.down_proj.scales": "model-00004-of-00004.safetensors", + "language_model.model.layers.39.mlp.switch_mlp.down_proj.weight": "model-00004-of-00004.safetensors", + "language_model.model.layers.39.mlp.switch_mlp.gate_proj.biases": "model-00004-of-00004.safetensors", + "language_model.model.layers.39.mlp.switch_mlp.gate_proj.scales": "model-00004-of-00004.safetensors", + "language_model.model.layers.39.mlp.switch_mlp.gate_proj.weight": "model-00004-of-00004.safetensors", + "language_model.model.layers.39.mlp.switch_mlp.up_proj.biases": "model-00004-of-00004.safetensors", + "language_model.model.layers.39.mlp.switch_mlp.up_proj.scales": "model-00004-of-00004.safetensors", + "language_model.model.layers.39.mlp.switch_mlp.up_proj.weight": "model-00004-of-00004.safetensors", + "language_model.model.layers.39.post_attention_layernorm.weight": "model-00004-of-00004.safetensors", + "language_model.model.layers.39.self_attn.k_norm.weight": "model-00004-of-00004.safetensors", + "language_model.model.layers.39.self_attn.k_proj.biases": "model-00004-of-00004.safetensors", + "language_model.model.layers.39.self_attn.k_proj.scales": "model-00004-of-00004.safetensors", + "language_model.model.layers.39.self_attn.k_proj.weight": "model-00004-of-00004.safetensors", + "language_model.model.layers.39.self_attn.o_proj.biases": "model-00004-of-00004.safetensors", + "language_model.model.layers.39.self_attn.o_proj.scales": "model-00004-of-00004.safetensors", + "language_model.model.layers.39.self_attn.o_proj.weight": "model-00004-of-00004.safetensors", + "language_model.model.layers.39.self_attn.q_norm.weight": "model-00004-of-00004.safetensors", + "language_model.model.layers.39.self_attn.q_proj.biases": "model-00004-of-00004.safetensors", + "language_model.model.layers.39.self_attn.q_proj.scales": "model-00004-of-00004.safetensors", + "language_model.model.layers.39.self_attn.q_proj.weight": "model-00004-of-00004.safetensors", + "language_model.model.layers.39.self_attn.v_proj.biases": "model-00004-of-00004.safetensors", + "language_model.model.layers.39.self_attn.v_proj.scales": "model-00004-of-00004.safetensors", + "language_model.model.layers.39.self_attn.v_proj.weight": "model-00004-of-00004.safetensors", + "language_model.model.layers.4.input_layernorm.weight": "model-00001-of-00004.safetensors", + "language_model.model.layers.4.linear_attn.A_log": "model-00001-of-00004.safetensors", + "language_model.model.layers.4.linear_attn.conv1d.weight": "model-00001-of-00004.safetensors", + "language_model.model.layers.4.linear_attn.dt_bias": "model-00001-of-00004.safetensors", + "language_model.model.layers.4.linear_attn.in_proj_a.biases": "model-00001-of-00004.safetensors", + "language_model.model.layers.4.linear_attn.in_proj_a.scales": "model-00001-of-00004.safetensors", + "language_model.model.layers.4.linear_attn.in_proj_a.weight": "model-00001-of-00004.safetensors", + "language_model.model.layers.4.linear_attn.in_proj_b.biases": "model-00001-of-00004.safetensors", + "language_model.model.layers.4.linear_attn.in_proj_b.scales": "model-00001-of-00004.safetensors", + "language_model.model.layers.4.linear_attn.in_proj_b.weight": "model-00001-of-00004.safetensors", + "language_model.model.layers.4.linear_attn.in_proj_qkv.biases": "model-00001-of-00004.safetensors", + "language_model.model.layers.4.linear_attn.in_proj_qkv.scales": "model-00001-of-00004.safetensors", + "language_model.model.layers.4.linear_attn.in_proj_qkv.weight": "model-00001-of-00004.safetensors", + "language_model.model.layers.4.linear_attn.in_proj_z.biases": "model-00001-of-00004.safetensors", + "language_model.model.layers.4.linear_attn.in_proj_z.scales": "model-00001-of-00004.safetensors", + "language_model.model.layers.4.linear_attn.in_proj_z.weight": "model-00001-of-00004.safetensors", + "language_model.model.layers.4.linear_attn.norm.weight": "model-00001-of-00004.safetensors", + "language_model.model.layers.4.linear_attn.out_proj.biases": "model-00001-of-00004.safetensors", + "language_model.model.layers.4.linear_attn.out_proj.scales": "model-00001-of-00004.safetensors", + "language_model.model.layers.4.linear_attn.out_proj.weight": "model-00001-of-00004.safetensors", + "language_model.model.layers.4.mlp.gate.biases": "model-00001-of-00004.safetensors", + "language_model.model.layers.4.mlp.gate.scales": "model-00001-of-00004.safetensors", + "language_model.model.layers.4.mlp.gate.weight": "model-00001-of-00004.safetensors", + "language_model.model.layers.4.mlp.shared_expert.down_proj.biases": "model-00001-of-00004.safetensors", + "language_model.model.layers.4.mlp.shared_expert.down_proj.scales": "model-00001-of-00004.safetensors", + "language_model.model.layers.4.mlp.shared_expert.down_proj.weight": "model-00001-of-00004.safetensors", + "language_model.model.layers.4.mlp.shared_expert.gate_proj.biases": "model-00001-of-00004.safetensors", + "language_model.model.layers.4.mlp.shared_expert.gate_proj.scales": "model-00001-of-00004.safetensors", + "language_model.model.layers.4.mlp.shared_expert.gate_proj.weight": "model-00001-of-00004.safetensors", + "language_model.model.layers.4.mlp.shared_expert.up_proj.biases": "model-00001-of-00004.safetensors", + "language_model.model.layers.4.mlp.shared_expert.up_proj.scales": "model-00001-of-00004.safetensors", + "language_model.model.layers.4.mlp.shared_expert.up_proj.weight": "model-00001-of-00004.safetensors", + "language_model.model.layers.4.mlp.shared_expert_gate.biases": "model-00001-of-00004.safetensors", + "language_model.model.layers.4.mlp.shared_expert_gate.scales": "model-00001-of-00004.safetensors", + "language_model.model.layers.4.mlp.shared_expert_gate.weight": "model-00001-of-00004.safetensors", + "language_model.model.layers.4.mlp.switch_mlp.down_proj.biases": "model-00001-of-00004.safetensors", + "language_model.model.layers.4.mlp.switch_mlp.down_proj.scales": "model-00001-of-00004.safetensors", + "language_model.model.layers.4.mlp.switch_mlp.down_proj.weight": "model-00001-of-00004.safetensors", + "language_model.model.layers.4.mlp.switch_mlp.gate_proj.biases": "model-00001-of-00004.safetensors", + "language_model.model.layers.4.mlp.switch_mlp.gate_proj.scales": "model-00001-of-00004.safetensors", + "language_model.model.layers.4.mlp.switch_mlp.gate_proj.weight": "model-00001-of-00004.safetensors", + "language_model.model.layers.4.mlp.switch_mlp.up_proj.biases": "model-00001-of-00004.safetensors", + "language_model.model.layers.4.mlp.switch_mlp.up_proj.scales": "model-00001-of-00004.safetensors", + "language_model.model.layers.4.mlp.switch_mlp.up_proj.weight": "model-00001-of-00004.safetensors", + "language_model.model.layers.4.post_attention_layernorm.weight": "model-00001-of-00004.safetensors", + "language_model.model.layers.5.input_layernorm.weight": "model-00001-of-00004.safetensors", + "language_model.model.layers.5.linear_attn.A_log": "model-00001-of-00004.safetensors", + "language_model.model.layers.5.linear_attn.conv1d.weight": "model-00001-of-00004.safetensors", + "language_model.model.layers.5.linear_attn.dt_bias": "model-00001-of-00004.safetensors", + "language_model.model.layers.5.linear_attn.in_proj_a.biases": "model-00001-of-00004.safetensors", + "language_model.model.layers.5.linear_attn.in_proj_a.scales": "model-00001-of-00004.safetensors", + "language_model.model.layers.5.linear_attn.in_proj_a.weight": "model-00001-of-00004.safetensors", + "language_model.model.layers.5.linear_attn.in_proj_b.biases": "model-00001-of-00004.safetensors", + "language_model.model.layers.5.linear_attn.in_proj_b.scales": "model-00001-of-00004.safetensors", + "language_model.model.layers.5.linear_attn.in_proj_b.weight": "model-00001-of-00004.safetensors", + "language_model.model.layers.5.linear_attn.in_proj_qkv.biases": "model-00001-of-00004.safetensors", + "language_model.model.layers.5.linear_attn.in_proj_qkv.scales": "model-00001-of-00004.safetensors", + "language_model.model.layers.5.linear_attn.in_proj_qkv.weight": "model-00001-of-00004.safetensors", + "language_model.model.layers.5.linear_attn.in_proj_z.biases": "model-00001-of-00004.safetensors", + "language_model.model.layers.5.linear_attn.in_proj_z.scales": "model-00001-of-00004.safetensors", + "language_model.model.layers.5.linear_attn.in_proj_z.weight": "model-00001-of-00004.safetensors", + "language_model.model.layers.5.linear_attn.norm.weight": "model-00001-of-00004.safetensors", + "language_model.model.layers.5.linear_attn.out_proj.biases": "model-00001-of-00004.safetensors", + "language_model.model.layers.5.linear_attn.out_proj.scales": "model-00001-of-00004.safetensors", + "language_model.model.layers.5.linear_attn.out_proj.weight": "model-00001-of-00004.safetensors", + "language_model.model.layers.5.mlp.gate.biases": "model-00001-of-00004.safetensors", + "language_model.model.layers.5.mlp.gate.scales": "model-00001-of-00004.safetensors", + "language_model.model.layers.5.mlp.gate.weight": "model-00001-of-00004.safetensors", + "language_model.model.layers.5.mlp.shared_expert.down_proj.biases": "model-00001-of-00004.safetensors", + "language_model.model.layers.5.mlp.shared_expert.down_proj.scales": "model-00001-of-00004.safetensors", + "language_model.model.layers.5.mlp.shared_expert.down_proj.weight": "model-00001-of-00004.safetensors", + "language_model.model.layers.5.mlp.shared_expert.gate_proj.biases": "model-00001-of-00004.safetensors", + "language_model.model.layers.5.mlp.shared_expert.gate_proj.scales": "model-00001-of-00004.safetensors", + "language_model.model.layers.5.mlp.shared_expert.gate_proj.weight": "model-00001-of-00004.safetensors", + "language_model.model.layers.5.mlp.shared_expert.up_proj.biases": "model-00001-of-00004.safetensors", + "language_model.model.layers.5.mlp.shared_expert.up_proj.scales": "model-00001-of-00004.safetensors", + "language_model.model.layers.5.mlp.shared_expert.up_proj.weight": "model-00001-of-00004.safetensors", + "language_model.model.layers.5.mlp.shared_expert_gate.biases": "model-00001-of-00004.safetensors", + "language_model.model.layers.5.mlp.shared_expert_gate.scales": "model-00001-of-00004.safetensors", + "language_model.model.layers.5.mlp.shared_expert_gate.weight": "model-00001-of-00004.safetensors", + "language_model.model.layers.5.mlp.switch_mlp.down_proj.biases": "model-00001-of-00004.safetensors", + "language_model.model.layers.5.mlp.switch_mlp.down_proj.scales": "model-00001-of-00004.safetensors", + "language_model.model.layers.5.mlp.switch_mlp.down_proj.weight": "model-00001-of-00004.safetensors", + "language_model.model.layers.5.mlp.switch_mlp.gate_proj.biases": "model-00001-of-00004.safetensors", + "language_model.model.layers.5.mlp.switch_mlp.gate_proj.scales": "model-00001-of-00004.safetensors", + "language_model.model.layers.5.mlp.switch_mlp.gate_proj.weight": "model-00001-of-00004.safetensors", + "language_model.model.layers.5.mlp.switch_mlp.up_proj.biases": "model-00001-of-00004.safetensors", + "language_model.model.layers.5.mlp.switch_mlp.up_proj.scales": "model-00001-of-00004.safetensors", + "language_model.model.layers.5.mlp.switch_mlp.up_proj.weight": "model-00001-of-00004.safetensors", + "language_model.model.layers.5.post_attention_layernorm.weight": "model-00001-of-00004.safetensors", + "language_model.model.layers.6.input_layernorm.weight": "model-00001-of-00004.safetensors", + "language_model.model.layers.6.linear_attn.A_log": "model-00001-of-00004.safetensors", + "language_model.model.layers.6.linear_attn.conv1d.weight": "model-00001-of-00004.safetensors", + "language_model.model.layers.6.linear_attn.dt_bias": "model-00001-of-00004.safetensors", + "language_model.model.layers.6.linear_attn.in_proj_a.biases": "model-00001-of-00004.safetensors", + "language_model.model.layers.6.linear_attn.in_proj_a.scales": "model-00001-of-00004.safetensors", + "language_model.model.layers.6.linear_attn.in_proj_a.weight": "model-00001-of-00004.safetensors", + "language_model.model.layers.6.linear_attn.in_proj_b.biases": "model-00001-of-00004.safetensors", + "language_model.model.layers.6.linear_attn.in_proj_b.scales": "model-00001-of-00004.safetensors", + "language_model.model.layers.6.linear_attn.in_proj_b.weight": "model-00001-of-00004.safetensors", + "language_model.model.layers.6.linear_attn.in_proj_qkv.biases": "model-00001-of-00004.safetensors", + "language_model.model.layers.6.linear_attn.in_proj_qkv.scales": "model-00001-of-00004.safetensors", + "language_model.model.layers.6.linear_attn.in_proj_qkv.weight": "model-00001-of-00004.safetensors", + "language_model.model.layers.6.linear_attn.in_proj_z.biases": "model-00001-of-00004.safetensors", + "language_model.model.layers.6.linear_attn.in_proj_z.scales": "model-00001-of-00004.safetensors", + "language_model.model.layers.6.linear_attn.in_proj_z.weight": "model-00001-of-00004.safetensors", + "language_model.model.layers.6.linear_attn.norm.weight": "model-00001-of-00004.safetensors", + "language_model.model.layers.6.linear_attn.out_proj.biases": "model-00001-of-00004.safetensors", + "language_model.model.layers.6.linear_attn.out_proj.scales": "model-00001-of-00004.safetensors", + "language_model.model.layers.6.linear_attn.out_proj.weight": "model-00001-of-00004.safetensors", + "language_model.model.layers.6.mlp.gate.biases": "model-00001-of-00004.safetensors", + "language_model.model.layers.6.mlp.gate.scales": "model-00001-of-00004.safetensors", + "language_model.model.layers.6.mlp.gate.weight": "model-00001-of-00004.safetensors", + "language_model.model.layers.6.mlp.shared_expert.down_proj.biases": "model-00001-of-00004.safetensors", + "language_model.model.layers.6.mlp.shared_expert.down_proj.scales": "model-00001-of-00004.safetensors", + "language_model.model.layers.6.mlp.shared_expert.down_proj.weight": "model-00001-of-00004.safetensors", + "language_model.model.layers.6.mlp.shared_expert.gate_proj.biases": "model-00001-of-00004.safetensors", + "language_model.model.layers.6.mlp.shared_expert.gate_proj.scales": "model-00001-of-00004.safetensors", + "language_model.model.layers.6.mlp.shared_expert.gate_proj.weight": "model-00001-of-00004.safetensors", + "language_model.model.layers.6.mlp.shared_expert.up_proj.biases": "model-00001-of-00004.safetensors", + "language_model.model.layers.6.mlp.shared_expert.up_proj.scales": "model-00001-of-00004.safetensors", + "language_model.model.layers.6.mlp.shared_expert.up_proj.weight": "model-00001-of-00004.safetensors", + "language_model.model.layers.6.mlp.shared_expert_gate.biases": "model-00001-of-00004.safetensors", + "language_model.model.layers.6.mlp.shared_expert_gate.scales": "model-00001-of-00004.safetensors", + "language_model.model.layers.6.mlp.shared_expert_gate.weight": "model-00001-of-00004.safetensors", + "language_model.model.layers.6.mlp.switch_mlp.down_proj.biases": "model-00001-of-00004.safetensors", + "language_model.model.layers.6.mlp.switch_mlp.down_proj.scales": "model-00001-of-00004.safetensors", + "language_model.model.layers.6.mlp.switch_mlp.down_proj.weight": "model-00001-of-00004.safetensors", + "language_model.model.layers.6.mlp.switch_mlp.gate_proj.biases": "model-00001-of-00004.safetensors", + "language_model.model.layers.6.mlp.switch_mlp.gate_proj.scales": "model-00001-of-00004.safetensors", + "language_model.model.layers.6.mlp.switch_mlp.gate_proj.weight": "model-00001-of-00004.safetensors", + "language_model.model.layers.6.mlp.switch_mlp.up_proj.biases": "model-00001-of-00004.safetensors", + "language_model.model.layers.6.mlp.switch_mlp.up_proj.scales": "model-00001-of-00004.safetensors", + "language_model.model.layers.6.mlp.switch_mlp.up_proj.weight": "model-00001-of-00004.safetensors", + "language_model.model.layers.6.post_attention_layernorm.weight": "model-00001-of-00004.safetensors", + "language_model.model.layers.7.input_layernorm.weight": "model-00001-of-00004.safetensors", + "language_model.model.layers.7.mlp.gate.biases": "model-00001-of-00004.safetensors", + "language_model.model.layers.7.mlp.gate.scales": "model-00001-of-00004.safetensors", + "language_model.model.layers.7.mlp.gate.weight": "model-00001-of-00004.safetensors", + "language_model.model.layers.7.mlp.shared_expert.down_proj.biases": "model-00001-of-00004.safetensors", + "language_model.model.layers.7.mlp.shared_expert.down_proj.scales": "model-00001-of-00004.safetensors", + "language_model.model.layers.7.mlp.shared_expert.down_proj.weight": "model-00001-of-00004.safetensors", + "language_model.model.layers.7.mlp.shared_expert.gate_proj.biases": "model-00001-of-00004.safetensors", + "language_model.model.layers.7.mlp.shared_expert.gate_proj.scales": "model-00001-of-00004.safetensors", + "language_model.model.layers.7.mlp.shared_expert.gate_proj.weight": "model-00001-of-00004.safetensors", + "language_model.model.layers.7.mlp.shared_expert.up_proj.biases": "model-00001-of-00004.safetensors", + "language_model.model.layers.7.mlp.shared_expert.up_proj.scales": "model-00001-of-00004.safetensors", + "language_model.model.layers.7.mlp.shared_expert.up_proj.weight": "model-00001-of-00004.safetensors", + "language_model.model.layers.7.mlp.shared_expert_gate.biases": "model-00001-of-00004.safetensors", + "language_model.model.layers.7.mlp.shared_expert_gate.scales": "model-00001-of-00004.safetensors", + "language_model.model.layers.7.mlp.shared_expert_gate.weight": "model-00001-of-00004.safetensors", + "language_model.model.layers.7.mlp.switch_mlp.down_proj.biases": "model-00001-of-00004.safetensors", + "language_model.model.layers.7.mlp.switch_mlp.down_proj.scales": "model-00001-of-00004.safetensors", + "language_model.model.layers.7.mlp.switch_mlp.down_proj.weight": "model-00001-of-00004.safetensors", + "language_model.model.layers.7.mlp.switch_mlp.gate_proj.biases": "model-00001-of-00004.safetensors", + "language_model.model.layers.7.mlp.switch_mlp.gate_proj.scales": "model-00001-of-00004.safetensors", + "language_model.model.layers.7.mlp.switch_mlp.gate_proj.weight": "model-00001-of-00004.safetensors", + "language_model.model.layers.7.mlp.switch_mlp.up_proj.biases": "model-00001-of-00004.safetensors", + "language_model.model.layers.7.mlp.switch_mlp.up_proj.scales": "model-00001-of-00004.safetensors", + "language_model.model.layers.7.mlp.switch_mlp.up_proj.weight": "model-00001-of-00004.safetensors", + "language_model.model.layers.7.post_attention_layernorm.weight": "model-00001-of-00004.safetensors", + "language_model.model.layers.7.self_attn.k_norm.weight": "model-00001-of-00004.safetensors", + "language_model.model.layers.7.self_attn.k_proj.biases": "model-00001-of-00004.safetensors", + "language_model.model.layers.7.self_attn.k_proj.scales": "model-00001-of-00004.safetensors", + "language_model.model.layers.7.self_attn.k_proj.weight": "model-00001-of-00004.safetensors", + "language_model.model.layers.7.self_attn.o_proj.biases": "model-00001-of-00004.safetensors", + "language_model.model.layers.7.self_attn.o_proj.scales": "model-00001-of-00004.safetensors", + "language_model.model.layers.7.self_attn.o_proj.weight": "model-00001-of-00004.safetensors", + "language_model.model.layers.7.self_attn.q_norm.weight": "model-00001-of-00004.safetensors", + "language_model.model.layers.7.self_attn.q_proj.biases": "model-00001-of-00004.safetensors", + "language_model.model.layers.7.self_attn.q_proj.scales": "model-00001-of-00004.safetensors", + "language_model.model.layers.7.self_attn.q_proj.weight": "model-00001-of-00004.safetensors", + "language_model.model.layers.7.self_attn.v_proj.biases": "model-00001-of-00004.safetensors", + "language_model.model.layers.7.self_attn.v_proj.scales": "model-00001-of-00004.safetensors", + "language_model.model.layers.7.self_attn.v_proj.weight": "model-00001-of-00004.safetensors", + "language_model.model.layers.8.input_layernorm.weight": "model-00001-of-00004.safetensors", + "language_model.model.layers.8.linear_attn.A_log": "model-00001-of-00004.safetensors", + "language_model.model.layers.8.linear_attn.conv1d.weight": "model-00001-of-00004.safetensors", + "language_model.model.layers.8.linear_attn.dt_bias": "model-00001-of-00004.safetensors", + "language_model.model.layers.8.linear_attn.in_proj_a.biases": "model-00001-of-00004.safetensors", + "language_model.model.layers.8.linear_attn.in_proj_a.scales": "model-00001-of-00004.safetensors", + "language_model.model.layers.8.linear_attn.in_proj_a.weight": "model-00001-of-00004.safetensors", + "language_model.model.layers.8.linear_attn.in_proj_b.biases": "model-00001-of-00004.safetensors", + "language_model.model.layers.8.linear_attn.in_proj_b.scales": "model-00001-of-00004.safetensors", + "language_model.model.layers.8.linear_attn.in_proj_b.weight": "model-00001-of-00004.safetensors", + "language_model.model.layers.8.linear_attn.in_proj_qkv.biases": "model-00001-of-00004.safetensors", + "language_model.model.layers.8.linear_attn.in_proj_qkv.scales": "model-00001-of-00004.safetensors", + "language_model.model.layers.8.linear_attn.in_proj_qkv.weight": "model-00001-of-00004.safetensors", + "language_model.model.layers.8.linear_attn.in_proj_z.biases": "model-00001-of-00004.safetensors", + "language_model.model.layers.8.linear_attn.in_proj_z.scales": "model-00001-of-00004.safetensors", + "language_model.model.layers.8.linear_attn.in_proj_z.weight": "model-00001-of-00004.safetensors", + "language_model.model.layers.8.linear_attn.norm.weight": "model-00001-of-00004.safetensors", + "language_model.model.layers.8.linear_attn.out_proj.biases": "model-00001-of-00004.safetensors", + "language_model.model.layers.8.linear_attn.out_proj.scales": "model-00001-of-00004.safetensors", + "language_model.model.layers.8.linear_attn.out_proj.weight": "model-00001-of-00004.safetensors", + "language_model.model.layers.8.mlp.gate.biases": "model-00001-of-00004.safetensors", + "language_model.model.layers.8.mlp.gate.scales": "model-00001-of-00004.safetensors", + "language_model.model.layers.8.mlp.gate.weight": "model-00001-of-00004.safetensors", + "language_model.model.layers.8.mlp.shared_expert.down_proj.biases": "model-00002-of-00004.safetensors", + "language_model.model.layers.8.mlp.shared_expert.down_proj.scales": "model-00002-of-00004.safetensors", + "language_model.model.layers.8.mlp.shared_expert.down_proj.weight": "model-00002-of-00004.safetensors", + "language_model.model.layers.8.mlp.shared_expert.gate_proj.biases": "model-00002-of-00004.safetensors", + "language_model.model.layers.8.mlp.shared_expert.gate_proj.scales": "model-00002-of-00004.safetensors", + "language_model.model.layers.8.mlp.shared_expert.gate_proj.weight": "model-00002-of-00004.safetensors", + "language_model.model.layers.8.mlp.shared_expert.up_proj.biases": "model-00002-of-00004.safetensors", + "language_model.model.layers.8.mlp.shared_expert.up_proj.scales": "model-00002-of-00004.safetensors", + "language_model.model.layers.8.mlp.shared_expert.up_proj.weight": "model-00002-of-00004.safetensors", + "language_model.model.layers.8.mlp.shared_expert_gate.biases": "model-00002-of-00004.safetensors", + "language_model.model.layers.8.mlp.shared_expert_gate.scales": "model-00002-of-00004.safetensors", + "language_model.model.layers.8.mlp.shared_expert_gate.weight": "model-00002-of-00004.safetensors", + "language_model.model.layers.8.mlp.switch_mlp.down_proj.biases": "model-00002-of-00004.safetensors", + "language_model.model.layers.8.mlp.switch_mlp.down_proj.scales": "model-00002-of-00004.safetensors", + "language_model.model.layers.8.mlp.switch_mlp.down_proj.weight": "model-00002-of-00004.safetensors", + "language_model.model.layers.8.mlp.switch_mlp.gate_proj.biases": "model-00001-of-00004.safetensors", + "language_model.model.layers.8.mlp.switch_mlp.gate_proj.scales": "model-00001-of-00004.safetensors", + "language_model.model.layers.8.mlp.switch_mlp.gate_proj.weight": "model-00001-of-00004.safetensors", + "language_model.model.layers.8.mlp.switch_mlp.up_proj.biases": "model-00001-of-00004.safetensors", + "language_model.model.layers.8.mlp.switch_mlp.up_proj.scales": "model-00001-of-00004.safetensors", + "language_model.model.layers.8.mlp.switch_mlp.up_proj.weight": "model-00001-of-00004.safetensors", + "language_model.model.layers.8.post_attention_layernorm.weight": "model-00001-of-00004.safetensors", + "language_model.model.layers.9.input_layernorm.weight": "model-00002-of-00004.safetensors", + "language_model.model.layers.9.linear_attn.A_log": "model-00002-of-00004.safetensors", + "language_model.model.layers.9.linear_attn.conv1d.weight": "model-00002-of-00004.safetensors", + "language_model.model.layers.9.linear_attn.dt_bias": "model-00002-of-00004.safetensors", + "language_model.model.layers.9.linear_attn.in_proj_a.biases": "model-00002-of-00004.safetensors", + "language_model.model.layers.9.linear_attn.in_proj_a.scales": "model-00002-of-00004.safetensors", + "language_model.model.layers.9.linear_attn.in_proj_a.weight": "model-00002-of-00004.safetensors", + "language_model.model.layers.9.linear_attn.in_proj_b.biases": "model-00002-of-00004.safetensors", + "language_model.model.layers.9.linear_attn.in_proj_b.scales": "model-00002-of-00004.safetensors", + "language_model.model.layers.9.linear_attn.in_proj_b.weight": "model-00002-of-00004.safetensors", + "language_model.model.layers.9.linear_attn.in_proj_qkv.biases": "model-00002-of-00004.safetensors", + "language_model.model.layers.9.linear_attn.in_proj_qkv.scales": "model-00002-of-00004.safetensors", + "language_model.model.layers.9.linear_attn.in_proj_qkv.weight": "model-00002-of-00004.safetensors", + "language_model.model.layers.9.linear_attn.in_proj_z.biases": "model-00002-of-00004.safetensors", + "language_model.model.layers.9.linear_attn.in_proj_z.scales": "model-00002-of-00004.safetensors", + "language_model.model.layers.9.linear_attn.in_proj_z.weight": "model-00002-of-00004.safetensors", + "language_model.model.layers.9.linear_attn.norm.weight": "model-00002-of-00004.safetensors", + "language_model.model.layers.9.linear_attn.out_proj.biases": "model-00002-of-00004.safetensors", + "language_model.model.layers.9.linear_attn.out_proj.scales": "model-00002-of-00004.safetensors", + "language_model.model.layers.9.linear_attn.out_proj.weight": "model-00002-of-00004.safetensors", + "language_model.model.layers.9.mlp.gate.biases": "model-00002-of-00004.safetensors", + "language_model.model.layers.9.mlp.gate.scales": "model-00002-of-00004.safetensors", + "language_model.model.layers.9.mlp.gate.weight": "model-00002-of-00004.safetensors", + "language_model.model.layers.9.mlp.shared_expert.down_proj.biases": "model-00002-of-00004.safetensors", + "language_model.model.layers.9.mlp.shared_expert.down_proj.scales": "model-00002-of-00004.safetensors", + "language_model.model.layers.9.mlp.shared_expert.down_proj.weight": "model-00002-of-00004.safetensors", + "language_model.model.layers.9.mlp.shared_expert.gate_proj.biases": "model-00002-of-00004.safetensors", + "language_model.model.layers.9.mlp.shared_expert.gate_proj.scales": "model-00002-of-00004.safetensors", + "language_model.model.layers.9.mlp.shared_expert.gate_proj.weight": "model-00002-of-00004.safetensors", + "language_model.model.layers.9.mlp.shared_expert.up_proj.biases": "model-00002-of-00004.safetensors", + "language_model.model.layers.9.mlp.shared_expert.up_proj.scales": "model-00002-of-00004.safetensors", + "language_model.model.layers.9.mlp.shared_expert.up_proj.weight": "model-00002-of-00004.safetensors", + "language_model.model.layers.9.mlp.shared_expert_gate.biases": "model-00002-of-00004.safetensors", + "language_model.model.layers.9.mlp.shared_expert_gate.scales": "model-00002-of-00004.safetensors", + "language_model.model.layers.9.mlp.shared_expert_gate.weight": "model-00002-of-00004.safetensors", + "language_model.model.layers.9.mlp.switch_mlp.down_proj.biases": "model-00002-of-00004.safetensors", + "language_model.model.layers.9.mlp.switch_mlp.down_proj.scales": "model-00002-of-00004.safetensors", + "language_model.model.layers.9.mlp.switch_mlp.down_proj.weight": "model-00002-of-00004.safetensors", + "language_model.model.layers.9.mlp.switch_mlp.gate_proj.biases": "model-00002-of-00004.safetensors", + "language_model.model.layers.9.mlp.switch_mlp.gate_proj.scales": "model-00002-of-00004.safetensors", + "language_model.model.layers.9.mlp.switch_mlp.gate_proj.weight": "model-00002-of-00004.safetensors", + "language_model.model.layers.9.mlp.switch_mlp.up_proj.biases": "model-00002-of-00004.safetensors", + "language_model.model.layers.9.mlp.switch_mlp.up_proj.scales": "model-00002-of-00004.safetensors", + "language_model.model.layers.9.mlp.switch_mlp.up_proj.weight": "model-00002-of-00004.safetensors", + "language_model.model.layers.9.post_attention_layernorm.weight": "model-00002-of-00004.safetensors", + "language_model.model.norm.weight": "model-00004-of-00004.safetensors", + "vision_tower.blocks.0.attn.proj.bias": "model-00001-of-00004.safetensors", + "vision_tower.blocks.0.attn.proj.weight": "model-00001-of-00004.safetensors", + "vision_tower.blocks.0.attn.qkv.bias": "model-00001-of-00004.safetensors", + "vision_tower.blocks.0.attn.qkv.weight": "model-00001-of-00004.safetensors", + "vision_tower.blocks.0.mlp.linear_fc1.bias": "model-00001-of-00004.safetensors", + "vision_tower.blocks.0.mlp.linear_fc1.weight": "model-00001-of-00004.safetensors", + "vision_tower.blocks.0.mlp.linear_fc2.bias": "model-00001-of-00004.safetensors", + "vision_tower.blocks.0.mlp.linear_fc2.weight": "model-00001-of-00004.safetensors", + "vision_tower.blocks.0.norm1.bias": "model-00001-of-00004.safetensors", + "vision_tower.blocks.0.norm1.weight": "model-00001-of-00004.safetensors", + "vision_tower.blocks.0.norm2.bias": "model-00001-of-00004.safetensors", + "vision_tower.blocks.0.norm2.weight": "model-00001-of-00004.safetensors", + "vision_tower.blocks.1.attn.proj.bias": "model-00001-of-00004.safetensors", + "vision_tower.blocks.1.attn.proj.weight": "model-00001-of-00004.safetensors", + "vision_tower.blocks.1.attn.qkv.bias": "model-00001-of-00004.safetensors", + "vision_tower.blocks.1.attn.qkv.weight": "model-00001-of-00004.safetensors", + "vision_tower.blocks.1.mlp.linear_fc1.bias": "model-00001-of-00004.safetensors", + "vision_tower.blocks.1.mlp.linear_fc1.weight": "model-00001-of-00004.safetensors", + "vision_tower.blocks.1.mlp.linear_fc2.bias": "model-00001-of-00004.safetensors", + "vision_tower.blocks.1.mlp.linear_fc2.weight": "model-00001-of-00004.safetensors", + "vision_tower.blocks.1.norm1.bias": "model-00001-of-00004.safetensors", + "vision_tower.blocks.1.norm1.weight": "model-00001-of-00004.safetensors", + "vision_tower.blocks.1.norm2.bias": "model-00001-of-00004.safetensors", + "vision_tower.blocks.1.norm2.weight": "model-00001-of-00004.safetensors", + "vision_tower.blocks.10.attn.proj.bias": "model-00001-of-00004.safetensors", + "vision_tower.blocks.10.attn.proj.weight": "model-00001-of-00004.safetensors", + "vision_tower.blocks.10.attn.qkv.bias": "model-00001-of-00004.safetensors", + "vision_tower.blocks.10.attn.qkv.weight": "model-00001-of-00004.safetensors", + "vision_tower.blocks.10.mlp.linear_fc1.bias": "model-00001-of-00004.safetensors", + "vision_tower.blocks.10.mlp.linear_fc1.weight": "model-00001-of-00004.safetensors", + "vision_tower.blocks.10.mlp.linear_fc2.bias": "model-00001-of-00004.safetensors", + "vision_tower.blocks.10.mlp.linear_fc2.weight": "model-00001-of-00004.safetensors", + "vision_tower.blocks.10.norm1.bias": "model-00001-of-00004.safetensors", + "vision_tower.blocks.10.norm1.weight": "model-00001-of-00004.safetensors", + "vision_tower.blocks.10.norm2.bias": "model-00001-of-00004.safetensors", + "vision_tower.blocks.10.norm2.weight": "model-00001-of-00004.safetensors", + "vision_tower.blocks.11.attn.proj.bias": "model-00001-of-00004.safetensors", + "vision_tower.blocks.11.attn.proj.weight": "model-00001-of-00004.safetensors", + "vision_tower.blocks.11.attn.qkv.bias": "model-00001-of-00004.safetensors", + "vision_tower.blocks.11.attn.qkv.weight": "model-00001-of-00004.safetensors", + "vision_tower.blocks.11.mlp.linear_fc1.bias": "model-00001-of-00004.safetensors", + "vision_tower.blocks.11.mlp.linear_fc1.weight": "model-00001-of-00004.safetensors", + "vision_tower.blocks.11.mlp.linear_fc2.bias": "model-00001-of-00004.safetensors", + "vision_tower.blocks.11.mlp.linear_fc2.weight": "model-00001-of-00004.safetensors", + "vision_tower.blocks.11.norm1.bias": "model-00001-of-00004.safetensors", + "vision_tower.blocks.11.norm1.weight": "model-00001-of-00004.safetensors", + "vision_tower.blocks.11.norm2.bias": "model-00001-of-00004.safetensors", + "vision_tower.blocks.11.norm2.weight": "model-00001-of-00004.safetensors", + "vision_tower.blocks.12.attn.proj.bias": "model-00001-of-00004.safetensors", + "vision_tower.blocks.12.attn.proj.weight": "model-00001-of-00004.safetensors", + "vision_tower.blocks.12.attn.qkv.bias": "model-00001-of-00004.safetensors", + "vision_tower.blocks.12.attn.qkv.weight": "model-00001-of-00004.safetensors", + "vision_tower.blocks.12.mlp.linear_fc1.bias": "model-00001-of-00004.safetensors", + "vision_tower.blocks.12.mlp.linear_fc1.weight": "model-00001-of-00004.safetensors", + "vision_tower.blocks.12.mlp.linear_fc2.bias": "model-00001-of-00004.safetensors", + "vision_tower.blocks.12.mlp.linear_fc2.weight": "model-00001-of-00004.safetensors", + "vision_tower.blocks.12.norm1.bias": "model-00001-of-00004.safetensors", + "vision_tower.blocks.12.norm1.weight": "model-00001-of-00004.safetensors", + "vision_tower.blocks.12.norm2.bias": "model-00001-of-00004.safetensors", + "vision_tower.blocks.12.norm2.weight": "model-00001-of-00004.safetensors", + "vision_tower.blocks.13.attn.proj.bias": "model-00001-of-00004.safetensors", + "vision_tower.blocks.13.attn.proj.weight": "model-00001-of-00004.safetensors", + "vision_tower.blocks.13.attn.qkv.bias": "model-00001-of-00004.safetensors", + "vision_tower.blocks.13.attn.qkv.weight": "model-00001-of-00004.safetensors", + "vision_tower.blocks.13.mlp.linear_fc1.bias": "model-00001-of-00004.safetensors", + "vision_tower.blocks.13.mlp.linear_fc1.weight": "model-00001-of-00004.safetensors", + "vision_tower.blocks.13.mlp.linear_fc2.bias": "model-00001-of-00004.safetensors", + "vision_tower.blocks.13.mlp.linear_fc2.weight": "model-00001-of-00004.safetensors", + "vision_tower.blocks.13.norm1.bias": "model-00001-of-00004.safetensors", + "vision_tower.blocks.13.norm1.weight": "model-00001-of-00004.safetensors", + "vision_tower.blocks.13.norm2.bias": "model-00001-of-00004.safetensors", + "vision_tower.blocks.13.norm2.weight": "model-00001-of-00004.safetensors", + "vision_tower.blocks.14.attn.proj.bias": "model-00001-of-00004.safetensors", + "vision_tower.blocks.14.attn.proj.weight": "model-00001-of-00004.safetensors", + "vision_tower.blocks.14.attn.qkv.bias": "model-00001-of-00004.safetensors", + "vision_tower.blocks.14.attn.qkv.weight": "model-00001-of-00004.safetensors", + "vision_tower.blocks.14.mlp.linear_fc1.bias": "model-00001-of-00004.safetensors", + "vision_tower.blocks.14.mlp.linear_fc1.weight": "model-00001-of-00004.safetensors", + "vision_tower.blocks.14.mlp.linear_fc2.bias": "model-00001-of-00004.safetensors", + "vision_tower.blocks.14.mlp.linear_fc2.weight": "model-00001-of-00004.safetensors", + "vision_tower.blocks.14.norm1.bias": "model-00001-of-00004.safetensors", + "vision_tower.blocks.14.norm1.weight": "model-00001-of-00004.safetensors", + "vision_tower.blocks.14.norm2.bias": "model-00001-of-00004.safetensors", + "vision_tower.blocks.14.norm2.weight": "model-00001-of-00004.safetensors", + "vision_tower.blocks.15.attn.proj.bias": "model-00001-of-00004.safetensors", + "vision_tower.blocks.15.attn.proj.weight": "model-00001-of-00004.safetensors", + "vision_tower.blocks.15.attn.qkv.bias": "model-00001-of-00004.safetensors", + "vision_tower.blocks.15.attn.qkv.weight": "model-00001-of-00004.safetensors", + "vision_tower.blocks.15.mlp.linear_fc1.bias": "model-00001-of-00004.safetensors", + "vision_tower.blocks.15.mlp.linear_fc1.weight": "model-00001-of-00004.safetensors", + "vision_tower.blocks.15.mlp.linear_fc2.bias": "model-00001-of-00004.safetensors", + "vision_tower.blocks.15.mlp.linear_fc2.weight": "model-00001-of-00004.safetensors", + "vision_tower.blocks.15.norm1.bias": "model-00001-of-00004.safetensors", + "vision_tower.blocks.15.norm1.weight": "model-00001-of-00004.safetensors", + "vision_tower.blocks.15.norm2.bias": "model-00001-of-00004.safetensors", + "vision_tower.blocks.15.norm2.weight": "model-00001-of-00004.safetensors", + "vision_tower.blocks.16.attn.proj.bias": "model-00001-of-00004.safetensors", + "vision_tower.blocks.16.attn.proj.weight": "model-00001-of-00004.safetensors", + "vision_tower.blocks.16.attn.qkv.bias": "model-00001-of-00004.safetensors", + "vision_tower.blocks.16.attn.qkv.weight": "model-00001-of-00004.safetensors", + "vision_tower.blocks.16.mlp.linear_fc1.bias": "model-00001-of-00004.safetensors", + "vision_tower.blocks.16.mlp.linear_fc1.weight": "model-00001-of-00004.safetensors", + "vision_tower.blocks.16.mlp.linear_fc2.bias": "model-00001-of-00004.safetensors", + "vision_tower.blocks.16.mlp.linear_fc2.weight": "model-00001-of-00004.safetensors", + "vision_tower.blocks.16.norm1.bias": "model-00001-of-00004.safetensors", + "vision_tower.blocks.16.norm1.weight": "model-00001-of-00004.safetensors", + "vision_tower.blocks.16.norm2.bias": "model-00001-of-00004.safetensors", + "vision_tower.blocks.16.norm2.weight": "model-00001-of-00004.safetensors", + "vision_tower.blocks.17.attn.proj.bias": "model-00001-of-00004.safetensors", + "vision_tower.blocks.17.attn.proj.weight": "model-00001-of-00004.safetensors", + "vision_tower.blocks.17.attn.qkv.bias": "model-00001-of-00004.safetensors", + "vision_tower.blocks.17.attn.qkv.weight": "model-00001-of-00004.safetensors", + "vision_tower.blocks.17.mlp.linear_fc1.bias": "model-00001-of-00004.safetensors", + "vision_tower.blocks.17.mlp.linear_fc1.weight": "model-00001-of-00004.safetensors", + "vision_tower.blocks.17.mlp.linear_fc2.bias": "model-00001-of-00004.safetensors", + "vision_tower.blocks.17.mlp.linear_fc2.weight": "model-00001-of-00004.safetensors", + "vision_tower.blocks.17.norm1.bias": "model-00001-of-00004.safetensors", + "vision_tower.blocks.17.norm1.weight": "model-00001-of-00004.safetensors", + "vision_tower.blocks.17.norm2.bias": "model-00001-of-00004.safetensors", + "vision_tower.blocks.17.norm2.weight": "model-00001-of-00004.safetensors", + "vision_tower.blocks.18.attn.proj.bias": "model-00001-of-00004.safetensors", + "vision_tower.blocks.18.attn.proj.weight": "model-00001-of-00004.safetensors", + "vision_tower.blocks.18.attn.qkv.bias": "model-00001-of-00004.safetensors", + "vision_tower.blocks.18.attn.qkv.weight": "model-00001-of-00004.safetensors", + "vision_tower.blocks.18.mlp.linear_fc1.bias": "model-00001-of-00004.safetensors", + "vision_tower.blocks.18.mlp.linear_fc1.weight": "model-00001-of-00004.safetensors", + "vision_tower.blocks.18.mlp.linear_fc2.bias": "model-00001-of-00004.safetensors", + "vision_tower.blocks.18.mlp.linear_fc2.weight": "model-00001-of-00004.safetensors", + "vision_tower.blocks.18.norm1.bias": "model-00001-of-00004.safetensors", + "vision_tower.blocks.18.norm1.weight": "model-00001-of-00004.safetensors", + "vision_tower.blocks.18.norm2.bias": "model-00001-of-00004.safetensors", + "vision_tower.blocks.18.norm2.weight": "model-00001-of-00004.safetensors", + "vision_tower.blocks.19.attn.proj.bias": "model-00001-of-00004.safetensors", + "vision_tower.blocks.19.attn.proj.weight": "model-00001-of-00004.safetensors", + "vision_tower.blocks.19.attn.qkv.bias": "model-00001-of-00004.safetensors", + "vision_tower.blocks.19.attn.qkv.weight": "model-00001-of-00004.safetensors", + "vision_tower.blocks.19.mlp.linear_fc1.bias": "model-00001-of-00004.safetensors", + "vision_tower.blocks.19.mlp.linear_fc1.weight": "model-00001-of-00004.safetensors", + "vision_tower.blocks.19.mlp.linear_fc2.bias": "model-00001-of-00004.safetensors", + "vision_tower.blocks.19.mlp.linear_fc2.weight": "model-00001-of-00004.safetensors", + "vision_tower.blocks.19.norm1.bias": "model-00001-of-00004.safetensors", + "vision_tower.blocks.19.norm1.weight": "model-00001-of-00004.safetensors", + "vision_tower.blocks.19.norm2.bias": "model-00001-of-00004.safetensors", + "vision_tower.blocks.19.norm2.weight": "model-00001-of-00004.safetensors", + "vision_tower.blocks.2.attn.proj.bias": "model-00001-of-00004.safetensors", + "vision_tower.blocks.2.attn.proj.weight": "model-00001-of-00004.safetensors", + "vision_tower.blocks.2.attn.qkv.bias": "model-00001-of-00004.safetensors", + "vision_tower.blocks.2.attn.qkv.weight": "model-00001-of-00004.safetensors", + "vision_tower.blocks.2.mlp.linear_fc1.bias": "model-00001-of-00004.safetensors", + "vision_tower.blocks.2.mlp.linear_fc1.weight": "model-00001-of-00004.safetensors", + "vision_tower.blocks.2.mlp.linear_fc2.bias": "model-00001-of-00004.safetensors", + "vision_tower.blocks.2.mlp.linear_fc2.weight": "model-00001-of-00004.safetensors", + "vision_tower.blocks.2.norm1.bias": "model-00001-of-00004.safetensors", + "vision_tower.blocks.2.norm1.weight": "model-00001-of-00004.safetensors", + "vision_tower.blocks.2.norm2.bias": "model-00001-of-00004.safetensors", + "vision_tower.blocks.2.norm2.weight": "model-00001-of-00004.safetensors", + "vision_tower.blocks.20.attn.proj.bias": "model-00001-of-00004.safetensors", + "vision_tower.blocks.20.attn.proj.weight": "model-00001-of-00004.safetensors", + "vision_tower.blocks.20.attn.qkv.bias": "model-00001-of-00004.safetensors", + "vision_tower.blocks.20.attn.qkv.weight": "model-00001-of-00004.safetensors", + "vision_tower.blocks.20.mlp.linear_fc1.bias": "model-00001-of-00004.safetensors", + "vision_tower.blocks.20.mlp.linear_fc1.weight": "model-00001-of-00004.safetensors", + "vision_tower.blocks.20.mlp.linear_fc2.bias": "model-00001-of-00004.safetensors", + "vision_tower.blocks.20.mlp.linear_fc2.weight": "model-00001-of-00004.safetensors", + "vision_tower.blocks.20.norm1.bias": "model-00001-of-00004.safetensors", + "vision_tower.blocks.20.norm1.weight": "model-00001-of-00004.safetensors", + "vision_tower.blocks.20.norm2.bias": "model-00001-of-00004.safetensors", + "vision_tower.blocks.20.norm2.weight": "model-00001-of-00004.safetensors", + "vision_tower.blocks.21.attn.proj.bias": "model-00001-of-00004.safetensors", + "vision_tower.blocks.21.attn.proj.weight": "model-00001-of-00004.safetensors", + "vision_tower.blocks.21.attn.qkv.bias": "model-00001-of-00004.safetensors", + "vision_tower.blocks.21.attn.qkv.weight": "model-00001-of-00004.safetensors", + "vision_tower.blocks.21.mlp.linear_fc1.bias": "model-00001-of-00004.safetensors", + "vision_tower.blocks.21.mlp.linear_fc1.weight": "model-00001-of-00004.safetensors", + "vision_tower.blocks.21.mlp.linear_fc2.bias": "model-00001-of-00004.safetensors", + "vision_tower.blocks.21.mlp.linear_fc2.weight": "model-00001-of-00004.safetensors", + "vision_tower.blocks.21.norm1.bias": "model-00001-of-00004.safetensors", + "vision_tower.blocks.21.norm1.weight": "model-00001-of-00004.safetensors", + "vision_tower.blocks.21.norm2.bias": "model-00001-of-00004.safetensors", + "vision_tower.blocks.21.norm2.weight": "model-00001-of-00004.safetensors", + "vision_tower.blocks.22.attn.proj.bias": "model-00001-of-00004.safetensors", + "vision_tower.blocks.22.attn.proj.weight": "model-00001-of-00004.safetensors", + "vision_tower.blocks.22.attn.qkv.bias": "model-00001-of-00004.safetensors", + "vision_tower.blocks.22.attn.qkv.weight": "model-00001-of-00004.safetensors", + "vision_tower.blocks.22.mlp.linear_fc1.bias": "model-00001-of-00004.safetensors", + "vision_tower.blocks.22.mlp.linear_fc1.weight": "model-00001-of-00004.safetensors", + "vision_tower.blocks.22.mlp.linear_fc2.bias": "model-00001-of-00004.safetensors", + "vision_tower.blocks.22.mlp.linear_fc2.weight": "model-00001-of-00004.safetensors", + "vision_tower.blocks.22.norm1.bias": "model-00001-of-00004.safetensors", + "vision_tower.blocks.22.norm1.weight": "model-00001-of-00004.safetensors", + "vision_tower.blocks.22.norm2.bias": "model-00001-of-00004.safetensors", + "vision_tower.blocks.22.norm2.weight": "model-00001-of-00004.safetensors", + "vision_tower.blocks.23.attn.proj.bias": "model-00001-of-00004.safetensors", + "vision_tower.blocks.23.attn.proj.weight": "model-00001-of-00004.safetensors", + "vision_tower.blocks.23.attn.qkv.bias": "model-00001-of-00004.safetensors", + "vision_tower.blocks.23.attn.qkv.weight": "model-00001-of-00004.safetensors", + "vision_tower.blocks.23.mlp.linear_fc1.bias": "model-00001-of-00004.safetensors", + "vision_tower.blocks.23.mlp.linear_fc1.weight": "model-00001-of-00004.safetensors", + "vision_tower.blocks.23.mlp.linear_fc2.bias": "model-00001-of-00004.safetensors", + "vision_tower.blocks.23.mlp.linear_fc2.weight": "model-00001-of-00004.safetensors", + "vision_tower.blocks.23.norm1.bias": "model-00001-of-00004.safetensors", + "vision_tower.blocks.23.norm1.weight": "model-00001-of-00004.safetensors", + "vision_tower.blocks.23.norm2.bias": "model-00001-of-00004.safetensors", + "vision_tower.blocks.23.norm2.weight": "model-00001-of-00004.safetensors", + "vision_tower.blocks.24.attn.proj.bias": "model-00001-of-00004.safetensors", + "vision_tower.blocks.24.attn.proj.weight": "model-00001-of-00004.safetensors", + "vision_tower.blocks.24.attn.qkv.bias": "model-00001-of-00004.safetensors", + "vision_tower.blocks.24.attn.qkv.weight": "model-00001-of-00004.safetensors", + "vision_tower.blocks.24.mlp.linear_fc1.bias": "model-00001-of-00004.safetensors", + "vision_tower.blocks.24.mlp.linear_fc1.weight": "model-00001-of-00004.safetensors", + "vision_tower.blocks.24.mlp.linear_fc2.bias": "model-00001-of-00004.safetensors", + "vision_tower.blocks.24.mlp.linear_fc2.weight": "model-00001-of-00004.safetensors", + "vision_tower.blocks.24.norm1.bias": "model-00001-of-00004.safetensors", + "vision_tower.blocks.24.norm1.weight": "model-00001-of-00004.safetensors", + "vision_tower.blocks.24.norm2.bias": "model-00001-of-00004.safetensors", + "vision_tower.blocks.24.norm2.weight": "model-00001-of-00004.safetensors", + "vision_tower.blocks.25.attn.proj.bias": "model-00001-of-00004.safetensors", + "vision_tower.blocks.25.attn.proj.weight": "model-00001-of-00004.safetensors", + "vision_tower.blocks.25.attn.qkv.bias": "model-00001-of-00004.safetensors", + "vision_tower.blocks.25.attn.qkv.weight": "model-00001-of-00004.safetensors", + "vision_tower.blocks.25.mlp.linear_fc1.bias": "model-00001-of-00004.safetensors", + "vision_tower.blocks.25.mlp.linear_fc1.weight": "model-00001-of-00004.safetensors", + "vision_tower.blocks.25.mlp.linear_fc2.bias": "model-00001-of-00004.safetensors", + "vision_tower.blocks.25.mlp.linear_fc2.weight": "model-00001-of-00004.safetensors", + "vision_tower.blocks.25.norm1.bias": "model-00001-of-00004.safetensors", + "vision_tower.blocks.25.norm1.weight": "model-00001-of-00004.safetensors", + "vision_tower.blocks.25.norm2.bias": "model-00001-of-00004.safetensors", + "vision_tower.blocks.25.norm2.weight": "model-00001-of-00004.safetensors", + "vision_tower.blocks.26.attn.proj.bias": "model-00001-of-00004.safetensors", + "vision_tower.blocks.26.attn.proj.weight": "model-00001-of-00004.safetensors", + "vision_tower.blocks.26.attn.qkv.bias": "model-00001-of-00004.safetensors", + "vision_tower.blocks.26.attn.qkv.weight": "model-00001-of-00004.safetensors", + "vision_tower.blocks.26.mlp.linear_fc1.bias": "model-00001-of-00004.safetensors", + "vision_tower.blocks.26.mlp.linear_fc1.weight": "model-00001-of-00004.safetensors", + "vision_tower.blocks.26.mlp.linear_fc2.bias": "model-00001-of-00004.safetensors", + "vision_tower.blocks.26.mlp.linear_fc2.weight": "model-00001-of-00004.safetensors", + "vision_tower.blocks.26.norm1.bias": "model-00001-of-00004.safetensors", + "vision_tower.blocks.26.norm1.weight": "model-00001-of-00004.safetensors", + "vision_tower.blocks.26.norm2.bias": "model-00001-of-00004.safetensors", + "vision_tower.blocks.26.norm2.weight": "model-00001-of-00004.safetensors", + "vision_tower.blocks.3.attn.proj.bias": "model-00001-of-00004.safetensors", + "vision_tower.blocks.3.attn.proj.weight": "model-00001-of-00004.safetensors", + "vision_tower.blocks.3.attn.qkv.bias": "model-00001-of-00004.safetensors", + "vision_tower.blocks.3.attn.qkv.weight": "model-00001-of-00004.safetensors", + "vision_tower.blocks.3.mlp.linear_fc1.bias": "model-00001-of-00004.safetensors", + "vision_tower.blocks.3.mlp.linear_fc1.weight": "model-00001-of-00004.safetensors", + "vision_tower.blocks.3.mlp.linear_fc2.bias": "model-00001-of-00004.safetensors", + "vision_tower.blocks.3.mlp.linear_fc2.weight": "model-00001-of-00004.safetensors", + "vision_tower.blocks.3.norm1.bias": "model-00001-of-00004.safetensors", + "vision_tower.blocks.3.norm1.weight": "model-00001-of-00004.safetensors", + "vision_tower.blocks.3.norm2.bias": "model-00001-of-00004.safetensors", + "vision_tower.blocks.3.norm2.weight": "model-00001-of-00004.safetensors", + "vision_tower.blocks.4.attn.proj.bias": "model-00001-of-00004.safetensors", + "vision_tower.blocks.4.attn.proj.weight": "model-00001-of-00004.safetensors", + "vision_tower.blocks.4.attn.qkv.bias": "model-00001-of-00004.safetensors", + "vision_tower.blocks.4.attn.qkv.weight": "model-00001-of-00004.safetensors", + "vision_tower.blocks.4.mlp.linear_fc1.bias": "model-00001-of-00004.safetensors", + "vision_tower.blocks.4.mlp.linear_fc1.weight": "model-00001-of-00004.safetensors", + "vision_tower.blocks.4.mlp.linear_fc2.bias": "model-00001-of-00004.safetensors", + "vision_tower.blocks.4.mlp.linear_fc2.weight": "model-00001-of-00004.safetensors", + "vision_tower.blocks.4.norm1.bias": "model-00001-of-00004.safetensors", + "vision_tower.blocks.4.norm1.weight": "model-00001-of-00004.safetensors", + "vision_tower.blocks.4.norm2.bias": "model-00001-of-00004.safetensors", + "vision_tower.blocks.4.norm2.weight": "model-00001-of-00004.safetensors", + "vision_tower.blocks.5.attn.proj.bias": "model-00001-of-00004.safetensors", + "vision_tower.blocks.5.attn.proj.weight": "model-00001-of-00004.safetensors", + "vision_tower.blocks.5.attn.qkv.bias": "model-00001-of-00004.safetensors", + "vision_tower.blocks.5.attn.qkv.weight": "model-00001-of-00004.safetensors", + "vision_tower.blocks.5.mlp.linear_fc1.bias": "model-00001-of-00004.safetensors", + "vision_tower.blocks.5.mlp.linear_fc1.weight": "model-00001-of-00004.safetensors", + "vision_tower.blocks.5.mlp.linear_fc2.bias": "model-00001-of-00004.safetensors", + "vision_tower.blocks.5.mlp.linear_fc2.weight": "model-00001-of-00004.safetensors", + "vision_tower.blocks.5.norm1.bias": "model-00001-of-00004.safetensors", + "vision_tower.blocks.5.norm1.weight": "model-00001-of-00004.safetensors", + "vision_tower.blocks.5.norm2.bias": "model-00001-of-00004.safetensors", + "vision_tower.blocks.5.norm2.weight": "model-00001-of-00004.safetensors", + "vision_tower.blocks.6.attn.proj.bias": "model-00001-of-00004.safetensors", + "vision_tower.blocks.6.attn.proj.weight": "model-00001-of-00004.safetensors", + "vision_tower.blocks.6.attn.qkv.bias": "model-00001-of-00004.safetensors", + "vision_tower.blocks.6.attn.qkv.weight": "model-00001-of-00004.safetensors", + "vision_tower.blocks.6.mlp.linear_fc1.bias": "model-00001-of-00004.safetensors", + "vision_tower.blocks.6.mlp.linear_fc1.weight": "model-00001-of-00004.safetensors", + "vision_tower.blocks.6.mlp.linear_fc2.bias": "model-00001-of-00004.safetensors", + "vision_tower.blocks.6.mlp.linear_fc2.weight": "model-00001-of-00004.safetensors", + "vision_tower.blocks.6.norm1.bias": "model-00001-of-00004.safetensors", + "vision_tower.blocks.6.norm1.weight": "model-00001-of-00004.safetensors", + "vision_tower.blocks.6.norm2.bias": "model-00001-of-00004.safetensors", + "vision_tower.blocks.6.norm2.weight": "model-00001-of-00004.safetensors", + "vision_tower.blocks.7.attn.proj.bias": "model-00001-of-00004.safetensors", + "vision_tower.blocks.7.attn.proj.weight": "model-00001-of-00004.safetensors", + "vision_tower.blocks.7.attn.qkv.bias": "model-00001-of-00004.safetensors", + "vision_tower.blocks.7.attn.qkv.weight": "model-00001-of-00004.safetensors", + "vision_tower.blocks.7.mlp.linear_fc1.bias": "model-00001-of-00004.safetensors", + "vision_tower.blocks.7.mlp.linear_fc1.weight": "model-00001-of-00004.safetensors", + "vision_tower.blocks.7.mlp.linear_fc2.bias": "model-00001-of-00004.safetensors", + "vision_tower.blocks.7.mlp.linear_fc2.weight": "model-00001-of-00004.safetensors", + "vision_tower.blocks.7.norm1.bias": "model-00001-of-00004.safetensors", + "vision_tower.blocks.7.norm1.weight": "model-00001-of-00004.safetensors", + "vision_tower.blocks.7.norm2.bias": "model-00001-of-00004.safetensors", + "vision_tower.blocks.7.norm2.weight": "model-00001-of-00004.safetensors", + "vision_tower.blocks.8.attn.proj.bias": "model-00001-of-00004.safetensors", + "vision_tower.blocks.8.attn.proj.weight": "model-00001-of-00004.safetensors", + "vision_tower.blocks.8.attn.qkv.bias": "model-00001-of-00004.safetensors", + "vision_tower.blocks.8.attn.qkv.weight": "model-00001-of-00004.safetensors", + "vision_tower.blocks.8.mlp.linear_fc1.bias": "model-00001-of-00004.safetensors", + "vision_tower.blocks.8.mlp.linear_fc1.weight": "model-00001-of-00004.safetensors", + "vision_tower.blocks.8.mlp.linear_fc2.bias": "model-00001-of-00004.safetensors", + "vision_tower.blocks.8.mlp.linear_fc2.weight": "model-00001-of-00004.safetensors", + "vision_tower.blocks.8.norm1.bias": "model-00001-of-00004.safetensors", + "vision_tower.blocks.8.norm1.weight": "model-00001-of-00004.safetensors", + "vision_tower.blocks.8.norm2.bias": "model-00001-of-00004.safetensors", + "vision_tower.blocks.8.norm2.weight": "model-00001-of-00004.safetensors", + "vision_tower.blocks.9.attn.proj.bias": "model-00001-of-00004.safetensors", + "vision_tower.blocks.9.attn.proj.weight": "model-00001-of-00004.safetensors", + "vision_tower.blocks.9.attn.qkv.bias": "model-00001-of-00004.safetensors", + "vision_tower.blocks.9.attn.qkv.weight": "model-00001-of-00004.safetensors", + "vision_tower.blocks.9.mlp.linear_fc1.bias": "model-00001-of-00004.safetensors", + "vision_tower.blocks.9.mlp.linear_fc1.weight": "model-00001-of-00004.safetensors", + "vision_tower.blocks.9.mlp.linear_fc2.bias": "model-00001-of-00004.safetensors", + "vision_tower.blocks.9.mlp.linear_fc2.weight": "model-00001-of-00004.safetensors", + "vision_tower.blocks.9.norm1.bias": "model-00001-of-00004.safetensors", + "vision_tower.blocks.9.norm1.weight": "model-00001-of-00004.safetensors", + "vision_tower.blocks.9.norm2.bias": "model-00001-of-00004.safetensors", + "vision_tower.blocks.9.norm2.weight": "model-00001-of-00004.safetensors", + "vision_tower.merger.linear_fc1.bias": "model-00001-of-00004.safetensors", + "vision_tower.merger.linear_fc1.weight": "model-00001-of-00004.safetensors", + "vision_tower.merger.linear_fc2.bias": "model-00001-of-00004.safetensors", + "vision_tower.merger.linear_fc2.weight": "model-00001-of-00004.safetensors", + "vision_tower.merger.norm.bias": "model-00001-of-00004.safetensors", + "vision_tower.merger.norm.weight": "model-00001-of-00004.safetensors", + "vision_tower.patch_embed.proj.bias": "model-00001-of-00004.safetensors", + "vision_tower.patch_embed.proj.weight": "model-00001-of-00004.safetensors", + "vision_tower.pos_embed.weight": "model-00001-of-00004.safetensors" + } +} \ No newline at end of file diff --git a/chat/mlx/mlx-community/Qwen3.6-35B-A3B-4bit/preprocessor_config.json b/chat/mlx/mlx-community/Qwen3.6-35B-A3B-4bit/preprocessor_config.json new file mode 100644 index 0000000..2ea84a4 --- /dev/null +++ b/chat/mlx/mlx-community/Qwen3.6-35B-A3B-4bit/preprocessor_config.json @@ -0,0 +1,21 @@ +{ + "size": { + "longest_edge": 16777216, + "shortest_edge": 65536 + }, + "patch_size": 16, + "temporal_patch_size": 2, + "merge_size": 2, + "image_mean": [ + 0.5, + 0.5, + 0.5 + ], + "image_std": [ + 0.5, + 0.5, + 0.5 + ], + "processor_class": "Qwen3VLProcessor", + "image_processor_type": "Qwen2VLImageProcessorFast" +} \ No newline at end of file diff --git a/chat/mlx/mlx-community/Qwen3.6-35B-A3B-4bit/processor_config.json b/chat/mlx/mlx-community/Qwen3.6-35B-A3B-4bit/processor_config.json new file mode 100644 index 0000000..a3be3e7 --- /dev/null +++ b/chat/mlx/mlx-community/Qwen3.6-35B-A3B-4bit/processor_config.json @@ -0,0 +1,64 @@ +{ + "image_processor": { + "do_convert_rgb": true, + "do_normalize": true, + "do_rescale": true, + "do_resize": true, + "image_mean": [ + 0.5, + 0.5, + 0.5 + ], + "image_processor_type": "Qwen2VLImageProcessor", + "image_std": [ + 0.5, + 0.5, + 0.5 + ], + "max_pixels": 16777216, + "merge_size": 2, + "min_pixels": 65536, + "patch_size": 16, + "resample": 3, + "rescale_factor": 0.00392156862745098, + "size": { + "longest_edge": 16777216, + "shortest_edge": 65536 + }, + "temporal_patch_size": 2 + }, + "processor_class": "Qwen3VLProcessor", + "video_processor": { + "data_format": "channels_first", + "default_to_square": true, + "do_convert_rgb": true, + "do_normalize": true, + "do_rescale": true, + "do_resize": true, + "do_sample_frames": true, + "fps": 2, + "image_mean": [ + 0.5, + 0.5, + 0.5 + ], + "image_std": [ + 0.5, + 0.5, + 0.5 + ], + "max_frames": 768, + "merge_size": 2, + "min_frames": 4, + "patch_size": 16, + "resample": 3, + "rescale_factor": 0.00392156862745098, + "return_metadata": false, + "size": { + "longest_edge": 25165824, + "shortest_edge": 4096 + }, + "temporal_patch_size": 2, + "video_processor_type": "Qwen3VLVideoProcessor" + } +} diff --git a/chat/mlx/mlx-community/Qwen3.6-35B-A3B-4bit/tokenizer.json b/chat/mlx/mlx-community/Qwen3.6-35B-A3B-4bit/tokenizer.json new file mode 100644 index 0000000..67741b0 --- /dev/null +++ b/chat/mlx/mlx-community/Qwen3.6-35B-A3B-4bit/tokenizer.json @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:87a7830d63fcf43bf241c3c5242e96e62dd3fdc29224ca26fed8ea333db72de4 +size 19989343 diff --git a/chat/mlx/mlx-community/Qwen3.6-35B-A3B-4bit/tokenizer_config.json b/chat/mlx/mlx-community/Qwen3.6-35B-A3B-4bit/tokenizer_config.json new file mode 100644 index 0000000..a068e24 --- /dev/null +++ b/chat/mlx/mlx-community/Qwen3.6-35B-A3B-4bit/tokenizer_config.json @@ -0,0 +1,32 @@ +{ + "add_prefix_space": false, + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "backend": "tokenizers", + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|im_end|>", + "errors": "replace", + "image_token": "<|image_pad|>", + "is_local": true, + "model_max_length": 262144, + "model_specific_special_tokens": { + "audio_bos_token": "<|audio_start|>", + "audio_eos_token": "<|audio_end|>", + "audio_token": "<|audio_pad|>", + "image_token": "<|image_pad|>", + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" + }, + "pad_token": "<|endoftext|>", + "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+", + "processor_class": "Qwen3VLProcessor", + "split_special_tokens": false, + "tokenizer_class": "TokenizersBackend", + "unk_token": null, + "video_token": "<|video_pad|>", + "vision_bos_token": "<|vision_start|>", + "vision_eos_token": "<|vision_end|>" +} diff --git a/chat/mlx/mlx-community/Qwen3.6-35B-A3B-4bit/video_preprocessor_config.json b/chat/mlx/mlx-community/Qwen3.6-35B-A3B-4bit/video_preprocessor_config.json new file mode 100644 index 0000000..3ba673a --- /dev/null +++ b/chat/mlx/mlx-community/Qwen3.6-35B-A3B-4bit/video_preprocessor_config.json @@ -0,0 +1,21 @@ +{ + "size": { + "longest_edge": 25165824, + "shortest_edge": 4096 + }, + "patch_size": 16, + "temporal_patch_size": 2, + "merge_size": 2, + "image_mean": [ + 0.5, + 0.5, + 0.5 + ], + "image_std": [ + 0.5, + 0.5, + 0.5 + ], + "processor_class": "Qwen3VLProcessor", + "video_processor_type": "Qwen3VLVideoProcessor" +} \ No newline at end of file diff --git a/chat/mlx/mlx-community/Qwen3.6-35B-A3B-4bit/vocab.json b/chat/mlx/mlx-community/Qwen3.6-35B-A3B-4bit/vocab.json new file mode 100644 index 0000000..d32f7ed --- /dev/null +++ b/chat/mlx/mlx-community/Qwen3.6-35B-A3B-4bit/vocab.json @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:ce99b4cb2983d118806ce0a8b777a35b093e2000a503ebde25853284c9dfa003 +size 6722759 diff --git a/chat/mlx/mlx-community/gemma-4-12B-it-4bit/.gitattributes b/chat/mlx/mlx-community/gemma-4-12B-it-4bit/.gitattributes new file mode 100644 index 0000000..52373fe --- /dev/null +++ b/chat/mlx/mlx-community/gemma-4-12B-it-4bit/.gitattributes @@ -0,0 +1,36 @@ +*.7z filter=lfs diff=lfs merge=lfs -text +*.arrow filter=lfs diff=lfs merge=lfs -text +*.bin filter=lfs diff=lfs merge=lfs -text +*.bz2 filter=lfs diff=lfs merge=lfs -text +*.ckpt filter=lfs diff=lfs merge=lfs -text +*.ftz filter=lfs diff=lfs merge=lfs -text +*.gz filter=lfs diff=lfs merge=lfs -text +*.h5 filter=lfs diff=lfs merge=lfs -text +*.joblib filter=lfs diff=lfs merge=lfs -text +*.lfs.* filter=lfs diff=lfs merge=lfs -text +*.mlmodel filter=lfs diff=lfs merge=lfs -text +*.model filter=lfs diff=lfs merge=lfs -text +*.msgpack filter=lfs diff=lfs merge=lfs -text +*.npy filter=lfs diff=lfs merge=lfs -text +*.npz filter=lfs diff=lfs merge=lfs -text +*.onnx filter=lfs diff=lfs merge=lfs -text +*.ot filter=lfs diff=lfs merge=lfs -text +*.parquet filter=lfs diff=lfs merge=lfs -text +*.pb filter=lfs diff=lfs merge=lfs -text +*.pickle filter=lfs diff=lfs merge=lfs -text +*.pkl filter=lfs diff=lfs merge=lfs -text +*.pt filter=lfs diff=lfs merge=lfs -text +*.pth filter=lfs diff=lfs merge=lfs -text +*.rar filter=lfs diff=lfs merge=lfs -text +*.safetensors filter=lfs diff=lfs merge=lfs -text +saved_model/**/* filter=lfs diff=lfs merge=lfs -text +*.tar.* filter=lfs diff=lfs merge=lfs -text +*.tar filter=lfs diff=lfs merge=lfs -text +*.tflite filter=lfs diff=lfs merge=lfs -text +*.tgz filter=lfs diff=lfs merge=lfs -text +*.wasm filter=lfs diff=lfs merge=lfs -text +*.xz filter=lfs diff=lfs merge=lfs -text +*.zip filter=lfs diff=lfs merge=lfs -text +*.zst filter=lfs diff=lfs merge=lfs -text +*tfevents* filter=lfs diff=lfs merge=lfs -text +tokenizer.json filter=lfs diff=lfs merge=lfs -text diff --git a/chat/mlx/mlx-community/gemma-4-12B-it-4bit/README.md b/chat/mlx/mlx-community/gemma-4-12B-it-4bit/README.md new file mode 100644 index 0000000..e9f0bd2 --- /dev/null +++ b/chat/mlx/mlx-community/gemma-4-12B-it-4bit/README.md @@ -0,0 +1,7 @@ +--- +language: en +pipeline_tag: image-text-to-text +tags: +- mlx +library_name: mlx +--- diff --git a/chat/mlx/mlx-community/gemma-4-12B-it-4bit/chat_template.jinja b/chat/mlx/mlx-community/gemma-4-12B-it-4bit/chat_template.jinja new file mode 100644 index 0000000..e61bbfe --- /dev/null +++ b/chat/mlx/mlx-community/gemma-4-12B-it-4bit/chat_template.jinja @@ -0,0 +1,363 @@ +{%- macro format_parameters(properties, required, filter_keys=false) -%} + {%- set standard_keys = ['description', 'type', 'properties', 'required', 'nullable'] -%} + {%- set ns = namespace(found_first=false) -%} + {%- for key, value in properties | dictsort -%} + {%- set add_comma = false -%} + {%- if not filter_keys or key not in standard_keys -%} + {%- if ns.found_first %},{% endif -%} + {%- set ns.found_first = true -%} + {{ key }}:{ + {%- if value['description'] -%} + description:<|"|>{{ value['description'] }}<|"|> + {%- set add_comma = true -%} + {%- endif -%} + {%- if value['type'] | upper == 'STRING' -%} + {%- if value['enum'] -%} + {%- if add_comma %},{%- else -%} {%- set add_comma = true -%} {% endif -%} + enum:{{ format_argument(value['enum']) }} + {%- endif -%} + {%- elif value['type'] | upper == 'ARRAY' -%} + {%- if value['items'] is mapping and value['items'] -%} + {%- if add_comma %},{%- else -%} {%- set add_comma = true -%} {% endif -%} + items:{ + {%- set ns_items = namespace(found_first=false) -%} + {%- for item_key, item_value in value['items'] | dictsort -%} + {%- if item_value is not none -%} + {%- if ns_items.found_first %},{% endif -%} + {%- set ns_items.found_first = true -%} + {%- if item_key == 'properties' -%} + properties:{ + {%- if item_value is mapping -%} + {{- format_parameters(item_value, value['items']['required'] | default([])) -}} + {%- endif -%} + } + {%- elif item_key == 'required' -%} + required:[ + {%- for req_item in item_value -%} + <|"|>{{- req_item -}}<|"|> + {%- if not loop.last %},{% endif -%} + {%- endfor -%} + ] + {%- elif item_key == 'type' -%} + {%- if item_value is string -%} + type:{{ format_argument(item_value | upper) }} + {%- else -%} + type:{{ format_argument(item_value | map('upper') | list) }} + {%- endif -%} + {%- else -%} + {{ item_key }}:{{ format_argument(item_value) }} + {%- endif -%} + {%- endif -%} + {%- endfor -%} + } + {%- endif -%} + {%- endif -%} + {%- if value['nullable'] %} + {%- if add_comma %},{%- else -%} {%- set add_comma = true -%} {% endif -%} + nullable:true + {%- endif -%} + {%- if value['type'] | upper == 'OBJECT' -%} + {%- if value['properties'] is defined and value['properties'] is mapping -%} + {%- if add_comma %},{%- else -%} {%- set add_comma = true -%} {% endif -%} + properties:{ + {{- format_parameters(value['properties'], value['required'] | default([])) -}} + } + {%- elif value is mapping -%} + {%- if add_comma %},{%- else -%} {%- set add_comma = true -%} {% endif -%} + properties:{ + {{- format_parameters(value, value['required'] | default([]), filter_keys=true) -}} + } + {%- endif -%} + {%- if value['required'] -%} + {%- if add_comma %},{%- else -%} {%- set add_comma = true -%} {% endif -%} + required:[ + {%- for item in value['required'] | default([]) -%} + <|"|>{{- item -}}<|"|> + {%- if not loop.last %},{% endif -%} + {%- endfor -%} + ] + {%- endif -%} + {%- endif -%} + {%- if add_comma %},{%- else -%} {%- set add_comma = true -%} {% endif -%} + type:<|"|>{{ value['type'] | upper }}<|"|>} + {%- endif -%} + {%- endfor -%} +{%- endmacro -%} +{%- macro format_function_declaration(tool_data) -%} + declaration:{{- tool_data['function']['name'] -}}{description:<|"|>{{- tool_data['function']['description'] -}}<|"|> + {%- set params = tool_data['function']['parameters'] -%} + {%- if params -%} + ,parameters:{ + {%- if params['properties'] -%} + properties:{ {{- format_parameters(params['properties'], params['required']) -}} }, + {%- endif -%} + {%- if params['required'] -%} + required:[ + {%- for item in params['required'] -%} + <|"|>{{- item -}}<|"|> + {{- ',' if not loop.last -}} + {%- endfor -%} + ], + {%- endif -%} + {%- if params['type'] -%} + type:<|"|>{{- params['type'] | upper -}}<|"|>} + {%- endif -%} + {%- endif -%} + {%- if 'response' in tool_data['function'] -%} + {%- set response_declaration = tool_data['function']['response'] -%} + ,response:{ + {%- if response_declaration['description'] -%} + description:<|"|>{{- response_declaration['description'] -}}<|"|>, + {%- endif -%} + {%- if response_declaration['type'] | upper == 'OBJECT' -%} + type:<|"|>{{- response_declaration['type'] | upper -}}<|"|>} + {%- endif -%} + {%- endif -%} + } +{%- endmacro -%} +{%- macro format_argument(argument, escape_keys=True) -%} + {%- if argument is string -%} + {{- '<|"|>' + argument + '<|"|>' -}} + {%- elif argument is boolean -%} + {{- 'true' if argument else 'false' -}} + {%- elif argument is mapping -%} + {{- '{' -}} + {%- set ns = namespace(found_first=false) -%} + {%- for key, value in argument | dictsort -%} + {%- if ns.found_first %},{% endif -%} + {%- set ns.found_first = true -%} + {%- if escape_keys -%} + {{- '<|"|>' + key + '<|"|>' -}} + {%- else -%} + {{- key -}} + {%- endif -%} + :{{- format_argument(value, escape_keys=escape_keys) -}} + {%- endfor -%} + {{- '}' -}} + {%- elif argument is sequence -%} + {{- '[' -}} + {%- for item in argument -%} + {{- format_argument(item, escape_keys=escape_keys) -}} + {%- if not loop.last %},{% endif -%} + {%- endfor -%} + {{- ']' -}} + {%- else -%} + {{- argument -}} + {%- endif -%} +{%- endmacro -%} +{%- macro strip_thinking(text) -%} + {%- set ns = namespace(result='') -%} + {%- for part in text.split('') -%} + {%- if '<|channel>' in part -%} + {%- set ns.result = ns.result + part.split('<|channel>')[0] -%} + {%- else -%} + {%- set ns.result = ns.result + part -%} + {%- endif -%} + {%- endfor -%} + {{- ns.result | trim -}} +{%- endmacro -%} + +{%- macro format_tool_response_block(tool_name, response) -%} + {{- '<|tool_response>' -}} + {%- if response is mapping -%} + {{- 'response:' + tool_name + '{' -}} + {%- for key, value in response | dictsort -%} + {{- key -}}:{{- format_argument(value, escape_keys=False) -}} + {%- if not loop.last %},{% endif -%} + {%- endfor -%} + {{- '}' -}} + {%- else -%} + {{- 'response:' + tool_name + '{value:' + format_argument(response, escape_keys=False) + '}' -}} + {%- endif -%} + {{- '' -}} +{%- endmacro -%} + +{%- set ns = namespace(prev_message_type=None) -%} +{%- set loop_messages = messages -%} +{{- bos_token -}} +{#- Handle System/Tool Definitions Block -#} +{%- if (enable_thinking is defined and enable_thinking) or tools or messages[0]['role'] in ['system', 'developer'] -%} + {{- '<|turn>system\n' -}} + {#- Inject Thinking token at the very top of the FIRST system turn -#} + {%- if enable_thinking is defined and enable_thinking -%} + {{- '<|think|>\n' -}} + {%- set ns.prev_message_type = 'think' -%} + {%- endif -%} + {%- if messages[0]['role'] in ['system', 'developer'] -%} + {%- if messages[0]['content'] is string -%} + {{- messages[0]['content'] | trim -}} + {%- elif messages[0]['content'] is sequence -%} + {%- for item in messages[0]['content'] -%} + {{- item['text'] | trim + ' '-}} + {%- endfor -%} + {%- endif -%} + {%- set loop_messages = messages[1:] -%} + {%- endif -%} + {%- if tools -%} + {%- for tool in tools %} + {{- '<|tool>' -}} + {{- format_function_declaration(tool) | trim -}} + {{- '' -}} + {%- endfor %} + {%- set ns.prev_message_type = 'tool' -%} + {%- endif -%} + {{- '\n' -}} +{%- endif %} + +{#- Pre-scan: find last user message index for reasoning guard -#} +{%- set ns_turn = namespace(last_user_idx=-1) -%} +{%- for i in range(loop_messages | length) -%} + {%- if loop_messages[i]['role'] == 'user' -%} + {%- set ns_turn.last_user_idx = i -%} + {%- endif -%} +{%- endfor -%} + +{#- Loop through messages -#} +{%- for message in loop_messages -%} + {%- if message['role'] != 'tool' -%} + {%- set ns.prev_message_type = None -%} + {%- set role = 'model' if message['role'] == 'assistant' else message['role'] -%} + {#- Detect continuation: suppress duplicate <|turn>model when previous non-tool message was also assistant -#} + {%- set prev_nt = namespace(role=None, found=false) -%} + {%- if loop.index0 > 0 -%} + {%- for j in range(loop.index0 - 1, -1, -1) -%} + {%- if not prev_nt.found -%} + {%- if loop_messages[j]['role'] != 'tool' -%} + {%- set prev_nt.role = loop_messages[j]['role'] -%} + {%- set prev_nt.found = true -%} + {%- endif -%} + {%- endif -%} + {%- endfor -%} + {%- endif -%} + {%- set continue_same_model_turn = (role == 'model' and prev_nt.role == 'assistant') -%} + {%- if not continue_same_model_turn -%} + {{- '<|turn>' + role + '\n' }} + {%- endif -%} + + {#- Render reasoning/reasoning_content as thinking channel -#} + {%- set thinking_text = message.get('reasoning') or message.get('reasoning_content') -%} + {%- if thinking_text and loop.index0 > ns_turn.last_user_idx and message.get('tool_calls') -%} + {{- '<|channel>thought\n' + thinking_text + '\n' -}} + {%- endif -%} + + {%- if message['tool_calls'] -%} + {%- for tool_call in message['tool_calls'] -%} + {%- set function = tool_call['function'] -%} + {{- '<|tool_call>call:' + function['name'] + '{' -}} + {%- if function['arguments'] is mapping -%} + {%- set ns_args = namespace(found_first=false) -%} + {%- for key, value in function['arguments'] | dictsort -%} + {%- if ns_args.found_first %},{% endif -%} + {%- set ns_args.found_first = true -%} + {{- key -}}:{{- format_argument(value, escape_keys=False) -}} + {%- endfor -%} + {%- elif function['arguments'] is string -%} + {{- function['arguments'] -}} + {%- endif -%} + {{- '}' -}} + {%- endfor -%} + {%- set ns.prev_message_type = 'tool_call' -%} + {%- endif -%} + + {%- set ns_tr_out = namespace(flag=false) -%} + {%- if message.get('tool_responses') -%} + {#- Legacy: tool_responses embedded on the assistant message (Google/Gemma native) -#} + {%- for tool_response in message['tool_responses'] -%} + {{- format_tool_response_block(tool_response['name'] | default('unknown'), tool_response['response']) -}} + {%- set ns_tr_out.flag = true -%} + {%- set ns.prev_message_type = 'tool_response' -%} + {%- endfor -%} + {%- elif message.get('tool_calls') -%} + {#- OpenAI Chat Completions: forward-scan consecutive role:tool messages -#} + {%- set ns_tool_scan = namespace(stopped=false) -%} + {%- for k in range(loop.index0 + 1, loop_messages | length) -%} + {%- if ns_tool_scan.stopped -%} + {%- elif loop_messages[k]['role'] != 'tool' -%} + {%- set ns_tool_scan.stopped = true -%} + {%- else -%} + {%- set follow = loop_messages[k] -%} + {#- Resolve tool_call_id to function name -#} + {%- set ns_tname = namespace(name=follow.get('name') | default('unknown')) -%} + {%- for tc in message['tool_calls'] -%} + {%- if tc.get('id') == follow.get('tool_call_id') -%} + {%- set ns_tname.name = tc['function']['name'] -%} + {%- endif -%} + {%- endfor -%} + {#- Handle content as string or content-parts array -#} + {%- set tool_body = follow.get('content') -%} + {%- if tool_body is string -%} + {{- format_tool_response_block(ns_tname.name, tool_body) -}} + {%- elif tool_body is sequence and tool_body is not string -%} + {%- set ns_txt = namespace(s='') -%} + {%- for part in tool_body -%} + {%- if part.get('type') == 'text' -%} + {%- set ns_txt.s = ns_txt.s + (part.get('text') | default('')) -%} + {%- endif -%} + {%- endfor -%} + {{- format_tool_response_block(ns_tname.name, ns_txt.s) -}} + {%- for part in tool_body -%} + {%- if part.get('type') == 'image' -%} + {{- '<|image|>' -}} + {%- elif part.get('type') == 'audio' -%} + {{- '<|audio|>' -}} + {%- elif part.get('type') == 'video' -%} + {{- '<|video|>' -}} + {%- endif -%} + {%- endfor -%} + {%- else -%} + {{- format_tool_response_block(ns_tname.name, tool_body) -}} + {%- endif -%} + {%- set ns_tr_out.flag = true -%} + {%- set ns.prev_message_type = 'tool_response' -%} + {%- endif -%} + {%- endfor -%} + {%- endif -%} + + {%- set captured_content -%} + {%- if message['content'] is string -%} + {%- if role == 'model' -%} + {{- strip_thinking(message['content']) -}} + {%- else -%} + {{- message['content'] | trim -}} + {%- endif -%} + {%- elif message['content'] is sequence -%} + {%- for item in message['content'] -%} + {%- if item['type'] == 'text' -%} + {%- if role == 'model' -%} + {{- strip_thinking(item['text']) -}} + {%- else -%} + {{- item['text'] | trim -}} + {%- endif -%} + {%- elif item['type'] == 'image' -%} + {{- '<|image|>' -}} + {%- set ns.prev_message_type = 'image' -%} + {%- elif item['type'] == 'audio' -%} + {{- '<|audio|>' -}} + {%- set ns.prev_message_type = 'audio' -%} + {%- elif item['type'] == 'video' -%} + {{- '<|video|>' -}} + {%- set ns.prev_message_type = 'video' -%} + {%- endif -%} + {%- endfor -%} + {%- endif -%} + {%- endset -%} + + {{- captured_content -}} + {%- set has_content = captured_content | trim | length > 0 -%} + + {%- if ns.prev_message_type == 'tool_call' and not ns_tr_out.flag -%} + {{- '<|tool_response>' -}} + {%- elif not (ns_tr_out.flag and not has_content) -%} + {{- '\n' -}} + {%- endif -%} + {%- endif -%} +{%- endfor -%} + +{%- if add_generation_prompt -%} + {%- if ns.prev_message_type != 'tool_response' and ns.prev_message_type != 'tool_call' -%} + {{- '<|turn>model\n' -}} + {%- if not enable_thinking | default(false) -%} + {{- '<|channel>thought\n' -}} + {%- endif -%} + {%- endif -%} +{%- endif -%} \ No newline at end of file diff --git a/chat/mlx/mlx-community/gemma-4-12B-it-4bit/config.json b/chat/mlx/mlx-community/gemma-4-12B-it-4bit/config.json new file mode 100644 index 0000000..d70dc39 --- /dev/null +++ b/chat/mlx/mlx-community/gemma-4-12B-it-4bit/config.json @@ -0,0 +1,183 @@ +{ + "architectures": [ + "Gemma4UnifiedForConditionalGeneration" + ], + "audio_config": { + "_name_or_path": "", + "architectures": null, + "audio_embed_dim": 640, + "audio_samples_per_token": 640, + "chunk_size_feed_forward": 0, + "dtype": null, + "hidden_size": 640, + "id2label": { + "0": "LABEL_0", + "1": "LABEL_1" + }, + "initializer_range": 0.02, + "is_encoder_decoder": false, + "label2id": { + "LABEL_0": 0, + "LABEL_1": 1 + }, + "model_type": "gemma4_unified_audio", + "output_attentions": false, + "output_hidden_states": false, + "output_proj_dims": 640, + "problem_type": null, + "return_dict": true, + "rms_norm_eps": 1e-06 + }, + "audio_token_id": 258881, + "boa_token_id": 256000, + "boi_token_id": 255999, + "dtype": "bfloat16", + "eoa_token_index": 258883, + "eoi_token_id": 258882, + "eos_token_id": [ + 1, + 106, + 50 + ], + "image_token_id": 258880, + "initializer_range": 0.02, + "model_type": "gemma4_unified", + "quantization": { + "group_size": 64, + "bits": 4, + "mode": "affine" + }, + "quantization_config": { + "group_size": 64, + "bits": 4, + "mode": "affine" + }, + "text_config": { + "attention_bias": false, + "attention_dropout": 0.0, + "attention_k_eq_v": true, + "bos_token_id": 2, + "enable_moe_block": false, + "eos_token_id": 1, + "final_logit_softcapping": 30.0, + "global_head_dim": 512, + "head_dim": 256, + "hidden_activation": "gelu_pytorch_tanh", + "hidden_size": 3840, + "hidden_size_per_layer_input": 0, + "initializer_range": 0.02, + "intermediate_size": 15360, + "layer_types": [ + "sliding_attention", + "sliding_attention", + "sliding_attention", + "sliding_attention", + "sliding_attention", + "full_attention", + "sliding_attention", + "sliding_attention", + "sliding_attention", + "sliding_attention", + "sliding_attention", + "full_attention", + "sliding_attention", + "sliding_attention", + "sliding_attention", + "sliding_attention", + "sliding_attention", + "full_attention", + "sliding_attention", + "sliding_attention", + "sliding_attention", + "sliding_attention", + "sliding_attention", + "full_attention", + "sliding_attention", + "sliding_attention", + "sliding_attention", + "sliding_attention", + "sliding_attention", + "full_attention", + "sliding_attention", + "sliding_attention", + "sliding_attention", + "sliding_attention", + "sliding_attention", + "full_attention", + "sliding_attention", + "sliding_attention", + "sliding_attention", + "sliding_attention", + "sliding_attention", + "full_attention", + "sliding_attention", + "sliding_attention", + "sliding_attention", + "sliding_attention", + "sliding_attention", + "full_attention" + ], + "max_position_embeddings": 262144, + "model_type": "gemma4_unified_text", + "moe_intermediate_size": null, + "num_attention_heads": 16, + "num_experts": null, + "num_global_key_value_heads": 1, + "num_hidden_layers": 48, + "num_key_value_heads": 8, + "num_kv_shared_layers": 0, + "pad_token_id": 0, + "rms_norm_eps": 1e-06, + "rope_parameters": { + "full_attention": { + "partial_rotary_factor": 0.25, + "rope_theta": 1000000.0, + "rope_type": "proportional" + }, + "sliding_attention": { + "rope_theta": 10000.0, + "rope_type": "default" + } + }, + "sliding_window": 1024, + "tie_word_embeddings": true, + "top_k_experts": null, + "use_bidirectional_attention": "vision", + "use_cache": true, + "use_double_wide_mlp": false, + "vocab_size": 262144, + "vocab_size_per_layer_input": 262144 + }, + "tie_word_embeddings": true, + "transformers_version": "5.10.0.dev0", + "video_token_id": 258884, + "vision_config": { + "_name_or_path": "", + "architectures": null, + "chunk_size_feed_forward": 0, + "dtype": null, + "id2label": { + "0": "LABEL_0", + "1": "LABEL_1" + }, + "initializer_range": 0.02, + "is_encoder_decoder": false, + "label2id": { + "LABEL_0": 0, + "LABEL_1": 1 + }, + "mm_embed_dim": 3840, + "mm_posemb_size": 1120, + "model_patch_size": 48, + "model_type": "gemma4_unified_vision", + "num_soft_tokens": 280, + "output_attentions": false, + "output_hidden_states": false, + "output_proj_dims": 3840, + "patch_size": 16, + "pooling_kernel_size": 3, + "problem_type": null, + "return_dict": true, + "rms_norm_eps": 1e-06 + } +} \ No newline at end of file diff --git a/chat/mlx/mlx-community/gemma-4-12B-it-4bit/generation_config.json b/chat/mlx/mlx-community/gemma-4-12B-it-4bit/generation_config.json new file mode 100644 index 0000000..d09dccf --- /dev/null +++ b/chat/mlx/mlx-community/gemma-4-12B-it-4bit/generation_config.json @@ -0,0 +1,18 @@ +{ + "bos_token_id": 2, + "do_sample": true, + "eos_token_id": [ + 1, + 106, + 50 + ], + "pad_token_id": 0, + "suppress_tokens": [ + 258883, + 258882 + ], + "temperature": 1.0, + "top_k": 64, + "top_p": 0.95, + "transformers_version": "5.10.0.dev0" +} diff --git a/chat/mlx/mlx-community/gemma-4-12B-it-4bit/model-00001-of-00002.safetensors b/chat/mlx/mlx-community/gemma-4-12B-it-4bit/model-00001-of-00002.safetensors new file mode 100644 index 0000000..4ee5d76 --- /dev/null +++ b/chat/mlx/mlx-community/gemma-4-12B-it-4bit/model-00001-of-00002.safetensors @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:0d58feed0c98a69c07317b4481aeae5ab2785f12a496ea96ab24c4842808de78 +size 5351756584 diff --git a/chat/mlx/mlx-community/gemma-4-12B-it-4bit/model-00002-of-00002.safetensors b/chat/mlx/mlx-community/gemma-4-12B-it-4bit/model-00002-of-00002.safetensors new file mode 100644 index 0000000..37b5196 --- /dev/null +++ b/chat/mlx/mlx-community/gemma-4-12B-it-4bit/model-00002-of-00002.safetensors @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:5b00a1bcb596ce6e827b4cdea6ecf2a0f35bb01306eb87c1ea4b3bcde36c7755 +size 1389282927 diff --git a/chat/mlx/mlx-community/gemma-4-12B-it-4bit/model.safetensors.index.json b/chat/mlx/mlx-community/gemma-4-12B-it-4bit/model.safetensors.index.json new file mode 100644 index 0000000..c50946c --- /dev/null +++ b/chat/mlx/mlx-community/gemma-4-12B-it-4bit/model.safetensors.index.json @@ -0,0 +1,1348 @@ +{ + "metadata": { + "total_size": 6740867168 + }, + "weight_map": { + "embed_audio.embedding_projection.biases": "model-00002-of-00002.safetensors", + "embed_audio.embedding_projection.scales": "model-00002-of-00002.safetensors", + "embed_audio.embedding_projection.weight": "model-00002-of-00002.safetensors", + "embed_vision.embedding_projection.biases": "model-00002-of-00002.safetensors", + "embed_vision.embedding_projection.scales": "model-00002-of-00002.safetensors", + "embed_vision.embedding_projection.weight": "model-00002-of-00002.safetensors", + "language_model.model.embed_tokens.biases": "model-00001-of-00002.safetensors", + "language_model.model.embed_tokens.scales": "model-00001-of-00002.safetensors", + "language_model.model.embed_tokens.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.0.input_layernorm.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.0.layer_scalar": "model-00001-of-00002.safetensors", + "language_model.model.layers.0.mlp.down_proj.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.0.mlp.down_proj.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.0.mlp.down_proj.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.0.mlp.gate_proj.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.0.mlp.gate_proj.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.0.mlp.gate_proj.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.0.mlp.up_proj.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.0.mlp.up_proj.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.0.mlp.up_proj.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.0.post_attention_layernorm.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.0.post_feedforward_layernorm.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.0.pre_feedforward_layernorm.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.0.self_attn.k_norm.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.0.self_attn.k_proj.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.0.self_attn.k_proj.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.0.self_attn.k_proj.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.0.self_attn.o_proj.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.0.self_attn.o_proj.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.0.self_attn.o_proj.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.0.self_attn.q_norm.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.0.self_attn.q_proj.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.0.self_attn.q_proj.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.0.self_attn.q_proj.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.0.self_attn.v_proj.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.0.self_attn.v_proj.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.0.self_attn.v_proj.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.1.input_layernorm.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.1.layer_scalar": "model-00001-of-00002.safetensors", + "language_model.model.layers.1.mlp.down_proj.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.1.mlp.down_proj.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.1.mlp.down_proj.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.1.mlp.gate_proj.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.1.mlp.gate_proj.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.1.mlp.gate_proj.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.1.mlp.up_proj.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.1.mlp.up_proj.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.1.mlp.up_proj.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.1.post_attention_layernorm.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.1.post_feedforward_layernorm.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.1.pre_feedforward_layernorm.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.1.self_attn.k_norm.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.1.self_attn.k_proj.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.1.self_attn.k_proj.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.1.self_attn.k_proj.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.1.self_attn.o_proj.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.1.self_attn.o_proj.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.1.self_attn.o_proj.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.1.self_attn.q_norm.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.1.self_attn.q_proj.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.1.self_attn.q_proj.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.1.self_attn.q_proj.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.1.self_attn.v_proj.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.1.self_attn.v_proj.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.1.self_attn.v_proj.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.10.input_layernorm.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.10.layer_scalar": "model-00001-of-00002.safetensors", + "language_model.model.layers.10.mlp.down_proj.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.10.mlp.down_proj.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.10.mlp.down_proj.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.10.mlp.gate_proj.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.10.mlp.gate_proj.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.10.mlp.gate_proj.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.10.mlp.up_proj.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.10.mlp.up_proj.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.10.mlp.up_proj.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.10.post_attention_layernorm.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.10.post_feedforward_layernorm.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.10.pre_feedforward_layernorm.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.10.self_attn.k_norm.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.10.self_attn.k_proj.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.10.self_attn.k_proj.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.10.self_attn.k_proj.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.10.self_attn.o_proj.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.10.self_attn.o_proj.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.10.self_attn.o_proj.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.10.self_attn.q_norm.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.10.self_attn.q_proj.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.10.self_attn.q_proj.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.10.self_attn.q_proj.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.10.self_attn.v_proj.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.10.self_attn.v_proj.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.10.self_attn.v_proj.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.11.input_layernorm.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.11.layer_scalar": "model-00001-of-00002.safetensors", + "language_model.model.layers.11.mlp.down_proj.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.11.mlp.down_proj.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.11.mlp.down_proj.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.11.mlp.gate_proj.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.11.mlp.gate_proj.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.11.mlp.gate_proj.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.11.mlp.up_proj.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.11.mlp.up_proj.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.11.mlp.up_proj.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.11.post_attention_layernorm.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.11.post_feedforward_layernorm.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.11.pre_feedforward_layernorm.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.11.self_attn.k_norm.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.11.self_attn.k_proj.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.11.self_attn.k_proj.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.11.self_attn.k_proj.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.11.self_attn.o_proj.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.11.self_attn.o_proj.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.11.self_attn.o_proj.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.11.self_attn.q_norm.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.11.self_attn.q_proj.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.11.self_attn.q_proj.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.11.self_attn.q_proj.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.12.input_layernorm.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.12.layer_scalar": "model-00001-of-00002.safetensors", + "language_model.model.layers.12.mlp.down_proj.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.12.mlp.down_proj.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.12.mlp.down_proj.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.12.mlp.gate_proj.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.12.mlp.gate_proj.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.12.mlp.gate_proj.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.12.mlp.up_proj.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.12.mlp.up_proj.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.12.mlp.up_proj.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.12.post_attention_layernorm.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.12.post_feedforward_layernorm.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.12.pre_feedforward_layernorm.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.12.self_attn.k_norm.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.12.self_attn.k_proj.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.12.self_attn.k_proj.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.12.self_attn.k_proj.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.12.self_attn.o_proj.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.12.self_attn.o_proj.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.12.self_attn.o_proj.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.12.self_attn.q_norm.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.12.self_attn.q_proj.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.12.self_attn.q_proj.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.12.self_attn.q_proj.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.12.self_attn.v_proj.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.12.self_attn.v_proj.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.12.self_attn.v_proj.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.13.input_layernorm.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.13.layer_scalar": "model-00001-of-00002.safetensors", + "language_model.model.layers.13.mlp.down_proj.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.13.mlp.down_proj.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.13.mlp.down_proj.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.13.mlp.gate_proj.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.13.mlp.gate_proj.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.13.mlp.gate_proj.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.13.mlp.up_proj.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.13.mlp.up_proj.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.13.mlp.up_proj.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.13.post_attention_layernorm.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.13.post_feedforward_layernorm.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.13.pre_feedforward_layernorm.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.13.self_attn.k_norm.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.13.self_attn.k_proj.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.13.self_attn.k_proj.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.13.self_attn.k_proj.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.13.self_attn.o_proj.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.13.self_attn.o_proj.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.13.self_attn.o_proj.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.13.self_attn.q_norm.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.13.self_attn.q_proj.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.13.self_attn.q_proj.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.13.self_attn.q_proj.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.13.self_attn.v_proj.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.13.self_attn.v_proj.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.13.self_attn.v_proj.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.14.input_layernorm.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.14.layer_scalar": "model-00001-of-00002.safetensors", + "language_model.model.layers.14.mlp.down_proj.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.14.mlp.down_proj.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.14.mlp.down_proj.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.14.mlp.gate_proj.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.14.mlp.gate_proj.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.14.mlp.gate_proj.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.14.mlp.up_proj.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.14.mlp.up_proj.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.14.mlp.up_proj.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.14.post_attention_layernorm.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.14.post_feedforward_layernorm.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.14.pre_feedforward_layernorm.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.14.self_attn.k_norm.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.14.self_attn.k_proj.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.14.self_attn.k_proj.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.14.self_attn.k_proj.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.14.self_attn.o_proj.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.14.self_attn.o_proj.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.14.self_attn.o_proj.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.14.self_attn.q_norm.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.14.self_attn.q_proj.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.14.self_attn.q_proj.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.14.self_attn.q_proj.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.14.self_attn.v_proj.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.14.self_attn.v_proj.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.14.self_attn.v_proj.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.15.input_layernorm.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.15.layer_scalar": "model-00001-of-00002.safetensors", + "language_model.model.layers.15.mlp.down_proj.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.15.mlp.down_proj.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.15.mlp.down_proj.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.15.mlp.gate_proj.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.15.mlp.gate_proj.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.15.mlp.gate_proj.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.15.mlp.up_proj.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.15.mlp.up_proj.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.15.mlp.up_proj.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.15.post_attention_layernorm.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.15.post_feedforward_layernorm.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.15.pre_feedforward_layernorm.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.15.self_attn.k_norm.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.15.self_attn.k_proj.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.15.self_attn.k_proj.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.15.self_attn.k_proj.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.15.self_attn.o_proj.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.15.self_attn.o_proj.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.15.self_attn.o_proj.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.15.self_attn.q_norm.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.15.self_attn.q_proj.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.15.self_attn.q_proj.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.15.self_attn.q_proj.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.15.self_attn.v_proj.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.15.self_attn.v_proj.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.15.self_attn.v_proj.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.16.input_layernorm.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.16.layer_scalar": "model-00001-of-00002.safetensors", + "language_model.model.layers.16.mlp.down_proj.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.16.mlp.down_proj.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.16.mlp.down_proj.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.16.mlp.gate_proj.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.16.mlp.gate_proj.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.16.mlp.gate_proj.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.16.mlp.up_proj.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.16.mlp.up_proj.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.16.mlp.up_proj.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.16.post_attention_layernorm.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.16.post_feedforward_layernorm.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.16.pre_feedforward_layernorm.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.16.self_attn.k_norm.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.16.self_attn.k_proj.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.16.self_attn.k_proj.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.16.self_attn.k_proj.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.16.self_attn.o_proj.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.16.self_attn.o_proj.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.16.self_attn.o_proj.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.16.self_attn.q_norm.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.16.self_attn.q_proj.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.16.self_attn.q_proj.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.16.self_attn.q_proj.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.16.self_attn.v_proj.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.16.self_attn.v_proj.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.16.self_attn.v_proj.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.17.input_layernorm.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.17.layer_scalar": "model-00001-of-00002.safetensors", + "language_model.model.layers.17.mlp.down_proj.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.17.mlp.down_proj.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.17.mlp.down_proj.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.17.mlp.gate_proj.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.17.mlp.gate_proj.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.17.mlp.gate_proj.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.17.mlp.up_proj.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.17.mlp.up_proj.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.17.mlp.up_proj.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.17.post_attention_layernorm.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.17.post_feedforward_layernorm.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.17.pre_feedforward_layernorm.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.17.self_attn.k_norm.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.17.self_attn.k_proj.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.17.self_attn.k_proj.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.17.self_attn.k_proj.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.17.self_attn.o_proj.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.17.self_attn.o_proj.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.17.self_attn.o_proj.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.17.self_attn.q_norm.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.17.self_attn.q_proj.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.17.self_attn.q_proj.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.17.self_attn.q_proj.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.18.input_layernorm.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.18.layer_scalar": "model-00001-of-00002.safetensors", + "language_model.model.layers.18.mlp.down_proj.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.18.mlp.down_proj.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.18.mlp.down_proj.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.18.mlp.gate_proj.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.18.mlp.gate_proj.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.18.mlp.gate_proj.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.18.mlp.up_proj.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.18.mlp.up_proj.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.18.mlp.up_proj.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.18.post_attention_layernorm.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.18.post_feedforward_layernorm.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.18.pre_feedforward_layernorm.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.18.self_attn.k_norm.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.18.self_attn.k_proj.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.18.self_attn.k_proj.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.18.self_attn.k_proj.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.18.self_attn.o_proj.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.18.self_attn.o_proj.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.18.self_attn.o_proj.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.18.self_attn.q_norm.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.18.self_attn.q_proj.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.18.self_attn.q_proj.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.18.self_attn.q_proj.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.18.self_attn.v_proj.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.18.self_attn.v_proj.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.18.self_attn.v_proj.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.19.input_layernorm.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.19.layer_scalar": "model-00001-of-00002.safetensors", + "language_model.model.layers.19.mlp.down_proj.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.19.mlp.down_proj.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.19.mlp.down_proj.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.19.mlp.gate_proj.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.19.mlp.gate_proj.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.19.mlp.gate_proj.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.19.mlp.up_proj.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.19.mlp.up_proj.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.19.mlp.up_proj.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.19.post_attention_layernorm.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.19.post_feedforward_layernorm.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.19.pre_feedforward_layernorm.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.19.self_attn.k_norm.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.19.self_attn.k_proj.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.19.self_attn.k_proj.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.19.self_attn.k_proj.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.19.self_attn.o_proj.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.19.self_attn.o_proj.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.19.self_attn.o_proj.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.19.self_attn.q_norm.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.19.self_attn.q_proj.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.19.self_attn.q_proj.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.19.self_attn.q_proj.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.19.self_attn.v_proj.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.19.self_attn.v_proj.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.19.self_attn.v_proj.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.2.input_layernorm.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.2.layer_scalar": "model-00001-of-00002.safetensors", + "language_model.model.layers.2.mlp.down_proj.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.2.mlp.down_proj.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.2.mlp.down_proj.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.2.mlp.gate_proj.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.2.mlp.gate_proj.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.2.mlp.gate_proj.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.2.mlp.up_proj.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.2.mlp.up_proj.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.2.mlp.up_proj.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.2.post_attention_layernorm.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.2.post_feedforward_layernorm.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.2.pre_feedforward_layernorm.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.2.self_attn.k_norm.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.2.self_attn.k_proj.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.2.self_attn.k_proj.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.2.self_attn.k_proj.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.2.self_attn.o_proj.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.2.self_attn.o_proj.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.2.self_attn.o_proj.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.2.self_attn.q_norm.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.2.self_attn.q_proj.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.2.self_attn.q_proj.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.2.self_attn.q_proj.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.2.self_attn.v_proj.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.2.self_attn.v_proj.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.2.self_attn.v_proj.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.20.input_layernorm.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.20.layer_scalar": "model-00001-of-00002.safetensors", + "language_model.model.layers.20.mlp.down_proj.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.20.mlp.down_proj.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.20.mlp.down_proj.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.20.mlp.gate_proj.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.20.mlp.gate_proj.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.20.mlp.gate_proj.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.20.mlp.up_proj.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.20.mlp.up_proj.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.20.mlp.up_proj.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.20.post_attention_layernorm.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.20.post_feedforward_layernorm.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.20.pre_feedforward_layernorm.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.20.self_attn.k_norm.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.20.self_attn.k_proj.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.20.self_attn.k_proj.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.20.self_attn.k_proj.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.20.self_attn.o_proj.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.20.self_attn.o_proj.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.20.self_attn.o_proj.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.20.self_attn.q_norm.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.20.self_attn.q_proj.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.20.self_attn.q_proj.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.20.self_attn.q_proj.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.20.self_attn.v_proj.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.20.self_attn.v_proj.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.20.self_attn.v_proj.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.21.input_layernorm.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.21.layer_scalar": "model-00001-of-00002.safetensors", + "language_model.model.layers.21.mlp.down_proj.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.21.mlp.down_proj.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.21.mlp.down_proj.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.21.mlp.gate_proj.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.21.mlp.gate_proj.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.21.mlp.gate_proj.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.21.mlp.up_proj.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.21.mlp.up_proj.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.21.mlp.up_proj.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.21.post_attention_layernorm.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.21.post_feedforward_layernorm.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.21.pre_feedforward_layernorm.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.21.self_attn.k_norm.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.21.self_attn.k_proj.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.21.self_attn.k_proj.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.21.self_attn.k_proj.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.21.self_attn.o_proj.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.21.self_attn.o_proj.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.21.self_attn.o_proj.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.21.self_attn.q_norm.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.21.self_attn.q_proj.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.21.self_attn.q_proj.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.21.self_attn.q_proj.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.21.self_attn.v_proj.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.21.self_attn.v_proj.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.21.self_attn.v_proj.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.22.input_layernorm.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.22.layer_scalar": "model-00001-of-00002.safetensors", + "language_model.model.layers.22.mlp.down_proj.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.22.mlp.down_proj.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.22.mlp.down_proj.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.22.mlp.gate_proj.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.22.mlp.gate_proj.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.22.mlp.gate_proj.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.22.mlp.up_proj.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.22.mlp.up_proj.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.22.mlp.up_proj.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.22.post_attention_layernorm.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.22.post_feedforward_layernorm.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.22.pre_feedforward_layernorm.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.22.self_attn.k_norm.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.22.self_attn.k_proj.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.22.self_attn.k_proj.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.22.self_attn.k_proj.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.22.self_attn.o_proj.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.22.self_attn.o_proj.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.22.self_attn.o_proj.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.22.self_attn.q_norm.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.22.self_attn.q_proj.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.22.self_attn.q_proj.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.22.self_attn.q_proj.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.22.self_attn.v_proj.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.22.self_attn.v_proj.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.22.self_attn.v_proj.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.23.input_layernorm.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.23.layer_scalar": "model-00001-of-00002.safetensors", + "language_model.model.layers.23.mlp.down_proj.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.23.mlp.down_proj.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.23.mlp.down_proj.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.23.mlp.gate_proj.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.23.mlp.gate_proj.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.23.mlp.gate_proj.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.23.mlp.up_proj.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.23.mlp.up_proj.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.23.mlp.up_proj.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.23.post_attention_layernorm.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.23.post_feedforward_layernorm.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.23.pre_feedforward_layernorm.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.23.self_attn.k_norm.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.23.self_attn.k_proj.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.23.self_attn.k_proj.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.23.self_attn.k_proj.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.23.self_attn.o_proj.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.23.self_attn.o_proj.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.23.self_attn.o_proj.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.23.self_attn.q_norm.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.23.self_attn.q_proj.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.23.self_attn.q_proj.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.23.self_attn.q_proj.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.24.input_layernorm.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.24.layer_scalar": "model-00001-of-00002.safetensors", + "language_model.model.layers.24.mlp.down_proj.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.24.mlp.down_proj.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.24.mlp.down_proj.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.24.mlp.gate_proj.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.24.mlp.gate_proj.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.24.mlp.gate_proj.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.24.mlp.up_proj.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.24.mlp.up_proj.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.24.mlp.up_proj.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.24.post_attention_layernorm.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.24.post_feedforward_layernorm.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.24.pre_feedforward_layernorm.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.24.self_attn.k_norm.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.24.self_attn.k_proj.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.24.self_attn.k_proj.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.24.self_attn.k_proj.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.24.self_attn.o_proj.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.24.self_attn.o_proj.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.24.self_attn.o_proj.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.24.self_attn.q_norm.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.24.self_attn.q_proj.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.24.self_attn.q_proj.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.24.self_attn.q_proj.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.24.self_attn.v_proj.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.24.self_attn.v_proj.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.24.self_attn.v_proj.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.25.input_layernorm.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.25.layer_scalar": "model-00001-of-00002.safetensors", + "language_model.model.layers.25.mlp.down_proj.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.25.mlp.down_proj.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.25.mlp.down_proj.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.25.mlp.gate_proj.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.25.mlp.gate_proj.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.25.mlp.gate_proj.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.25.mlp.up_proj.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.25.mlp.up_proj.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.25.mlp.up_proj.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.25.post_attention_layernorm.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.25.post_feedforward_layernorm.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.25.pre_feedforward_layernorm.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.25.self_attn.k_norm.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.25.self_attn.k_proj.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.25.self_attn.k_proj.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.25.self_attn.k_proj.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.25.self_attn.o_proj.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.25.self_attn.o_proj.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.25.self_attn.o_proj.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.25.self_attn.q_norm.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.25.self_attn.q_proj.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.25.self_attn.q_proj.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.25.self_attn.q_proj.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.25.self_attn.v_proj.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.25.self_attn.v_proj.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.25.self_attn.v_proj.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.26.input_layernorm.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.26.layer_scalar": "model-00001-of-00002.safetensors", + "language_model.model.layers.26.mlp.down_proj.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.26.mlp.down_proj.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.26.mlp.down_proj.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.26.mlp.gate_proj.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.26.mlp.gate_proj.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.26.mlp.gate_proj.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.26.mlp.up_proj.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.26.mlp.up_proj.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.26.mlp.up_proj.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.26.post_attention_layernorm.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.26.post_feedforward_layernorm.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.26.pre_feedforward_layernorm.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.26.self_attn.k_norm.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.26.self_attn.k_proj.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.26.self_attn.k_proj.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.26.self_attn.k_proj.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.26.self_attn.o_proj.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.26.self_attn.o_proj.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.26.self_attn.o_proj.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.26.self_attn.q_norm.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.26.self_attn.q_proj.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.26.self_attn.q_proj.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.26.self_attn.q_proj.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.26.self_attn.v_proj.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.26.self_attn.v_proj.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.26.self_attn.v_proj.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.27.input_layernorm.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.27.layer_scalar": "model-00001-of-00002.safetensors", + "language_model.model.layers.27.mlp.down_proj.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.27.mlp.down_proj.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.27.mlp.down_proj.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.27.mlp.gate_proj.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.27.mlp.gate_proj.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.27.mlp.gate_proj.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.27.mlp.up_proj.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.27.mlp.up_proj.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.27.mlp.up_proj.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.27.post_attention_layernorm.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.27.post_feedforward_layernorm.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.27.pre_feedforward_layernorm.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.27.self_attn.k_norm.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.27.self_attn.k_proj.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.27.self_attn.k_proj.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.27.self_attn.k_proj.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.27.self_attn.o_proj.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.27.self_attn.o_proj.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.27.self_attn.o_proj.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.27.self_attn.q_norm.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.27.self_attn.q_proj.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.27.self_attn.q_proj.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.27.self_attn.q_proj.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.27.self_attn.v_proj.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.27.self_attn.v_proj.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.27.self_attn.v_proj.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.28.input_layernorm.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.28.layer_scalar": "model-00001-of-00002.safetensors", + "language_model.model.layers.28.mlp.down_proj.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.28.mlp.down_proj.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.28.mlp.down_proj.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.28.mlp.gate_proj.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.28.mlp.gate_proj.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.28.mlp.gate_proj.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.28.mlp.up_proj.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.28.mlp.up_proj.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.28.mlp.up_proj.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.28.post_attention_layernorm.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.28.post_feedforward_layernorm.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.28.pre_feedforward_layernorm.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.28.self_attn.k_norm.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.28.self_attn.k_proj.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.28.self_attn.k_proj.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.28.self_attn.k_proj.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.28.self_attn.o_proj.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.28.self_attn.o_proj.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.28.self_attn.o_proj.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.28.self_attn.q_norm.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.28.self_attn.q_proj.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.28.self_attn.q_proj.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.28.self_attn.q_proj.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.28.self_attn.v_proj.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.28.self_attn.v_proj.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.28.self_attn.v_proj.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.29.input_layernorm.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.29.layer_scalar": "model-00001-of-00002.safetensors", + "language_model.model.layers.29.mlp.down_proj.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.29.mlp.down_proj.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.29.mlp.down_proj.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.29.mlp.gate_proj.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.29.mlp.gate_proj.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.29.mlp.gate_proj.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.29.mlp.up_proj.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.29.mlp.up_proj.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.29.mlp.up_proj.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.29.post_attention_layernorm.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.29.post_feedforward_layernorm.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.29.pre_feedforward_layernorm.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.29.self_attn.k_norm.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.29.self_attn.k_proj.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.29.self_attn.k_proj.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.29.self_attn.k_proj.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.29.self_attn.o_proj.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.29.self_attn.o_proj.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.29.self_attn.o_proj.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.29.self_attn.q_norm.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.29.self_attn.q_proj.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.29.self_attn.q_proj.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.29.self_attn.q_proj.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.3.input_layernorm.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.3.layer_scalar": "model-00001-of-00002.safetensors", + "language_model.model.layers.3.mlp.down_proj.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.3.mlp.down_proj.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.3.mlp.down_proj.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.3.mlp.gate_proj.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.3.mlp.gate_proj.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.3.mlp.gate_proj.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.3.mlp.up_proj.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.3.mlp.up_proj.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.3.mlp.up_proj.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.3.post_attention_layernorm.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.3.post_feedforward_layernorm.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.3.pre_feedforward_layernorm.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.3.self_attn.k_norm.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.3.self_attn.k_proj.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.3.self_attn.k_proj.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.3.self_attn.k_proj.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.3.self_attn.o_proj.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.3.self_attn.o_proj.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.3.self_attn.o_proj.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.3.self_attn.q_norm.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.3.self_attn.q_proj.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.3.self_attn.q_proj.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.3.self_attn.q_proj.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.3.self_attn.v_proj.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.3.self_attn.v_proj.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.3.self_attn.v_proj.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.30.input_layernorm.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.30.layer_scalar": "model-00001-of-00002.safetensors", + "language_model.model.layers.30.mlp.down_proj.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.30.mlp.down_proj.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.30.mlp.down_proj.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.30.mlp.gate_proj.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.30.mlp.gate_proj.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.30.mlp.gate_proj.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.30.mlp.up_proj.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.30.mlp.up_proj.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.30.mlp.up_proj.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.30.post_attention_layernorm.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.30.post_feedforward_layernorm.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.30.pre_feedforward_layernorm.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.30.self_attn.k_norm.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.30.self_attn.k_proj.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.30.self_attn.k_proj.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.30.self_attn.k_proj.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.30.self_attn.o_proj.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.30.self_attn.o_proj.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.30.self_attn.o_proj.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.30.self_attn.q_norm.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.30.self_attn.q_proj.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.30.self_attn.q_proj.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.30.self_attn.q_proj.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.30.self_attn.v_proj.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.30.self_attn.v_proj.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.30.self_attn.v_proj.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.31.input_layernorm.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.31.layer_scalar": "model-00001-of-00002.safetensors", + "language_model.model.layers.31.mlp.down_proj.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.31.mlp.down_proj.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.31.mlp.down_proj.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.31.mlp.gate_proj.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.31.mlp.gate_proj.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.31.mlp.gate_proj.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.31.mlp.up_proj.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.31.mlp.up_proj.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.31.mlp.up_proj.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.31.post_attention_layernorm.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.31.post_feedforward_layernorm.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.31.pre_feedforward_layernorm.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.31.self_attn.k_norm.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.31.self_attn.k_proj.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.31.self_attn.k_proj.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.31.self_attn.k_proj.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.31.self_attn.o_proj.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.31.self_attn.o_proj.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.31.self_attn.o_proj.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.31.self_attn.q_norm.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.31.self_attn.q_proj.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.31.self_attn.q_proj.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.31.self_attn.q_proj.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.31.self_attn.v_proj.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.31.self_attn.v_proj.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.31.self_attn.v_proj.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.32.input_layernorm.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.32.layer_scalar": "model-00001-of-00002.safetensors", + "language_model.model.layers.32.mlp.down_proj.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.32.mlp.down_proj.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.32.mlp.down_proj.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.32.mlp.gate_proj.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.32.mlp.gate_proj.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.32.mlp.gate_proj.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.32.mlp.up_proj.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.32.mlp.up_proj.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.32.mlp.up_proj.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.32.post_attention_layernorm.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.32.post_feedforward_layernorm.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.32.pre_feedforward_layernorm.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.32.self_attn.k_norm.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.32.self_attn.k_proj.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.32.self_attn.k_proj.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.32.self_attn.k_proj.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.32.self_attn.o_proj.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.32.self_attn.o_proj.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.32.self_attn.o_proj.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.32.self_attn.q_norm.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.32.self_attn.q_proj.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.32.self_attn.q_proj.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.32.self_attn.q_proj.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.32.self_attn.v_proj.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.32.self_attn.v_proj.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.32.self_attn.v_proj.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.33.input_layernorm.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.33.layer_scalar": "model-00001-of-00002.safetensors", + "language_model.model.layers.33.mlp.down_proj.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.33.mlp.down_proj.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.33.mlp.down_proj.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.33.mlp.gate_proj.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.33.mlp.gate_proj.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.33.mlp.gate_proj.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.33.mlp.up_proj.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.33.mlp.up_proj.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.33.mlp.up_proj.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.33.post_attention_layernorm.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.33.post_feedforward_layernorm.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.33.pre_feedforward_layernorm.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.33.self_attn.k_norm.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.33.self_attn.k_proj.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.33.self_attn.k_proj.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.33.self_attn.k_proj.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.33.self_attn.o_proj.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.33.self_attn.o_proj.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.33.self_attn.o_proj.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.33.self_attn.q_norm.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.33.self_attn.q_proj.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.33.self_attn.q_proj.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.33.self_attn.q_proj.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.33.self_attn.v_proj.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.33.self_attn.v_proj.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.33.self_attn.v_proj.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.34.input_layernorm.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.34.layer_scalar": "model-00001-of-00002.safetensors", + "language_model.model.layers.34.mlp.down_proj.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.34.mlp.down_proj.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.34.mlp.down_proj.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.34.mlp.gate_proj.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.34.mlp.gate_proj.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.34.mlp.gate_proj.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.34.mlp.up_proj.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.34.mlp.up_proj.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.34.mlp.up_proj.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.34.post_attention_layernorm.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.34.post_feedforward_layernorm.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.34.pre_feedforward_layernorm.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.34.self_attn.k_norm.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.34.self_attn.k_proj.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.34.self_attn.k_proj.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.34.self_attn.k_proj.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.34.self_attn.o_proj.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.34.self_attn.o_proj.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.34.self_attn.o_proj.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.34.self_attn.q_norm.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.34.self_attn.q_proj.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.34.self_attn.q_proj.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.34.self_attn.q_proj.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.34.self_attn.v_proj.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.34.self_attn.v_proj.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.34.self_attn.v_proj.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.35.input_layernorm.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.35.layer_scalar": "model-00001-of-00002.safetensors", + "language_model.model.layers.35.mlp.down_proj.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.35.mlp.down_proj.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.35.mlp.down_proj.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.35.mlp.gate_proj.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.35.mlp.gate_proj.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.35.mlp.gate_proj.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.35.mlp.up_proj.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.35.mlp.up_proj.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.35.mlp.up_proj.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.35.post_attention_layernorm.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.35.post_feedforward_layernorm.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.35.pre_feedforward_layernorm.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.35.self_attn.k_norm.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.35.self_attn.k_proj.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.35.self_attn.k_proj.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.35.self_attn.k_proj.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.35.self_attn.o_proj.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.35.self_attn.o_proj.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.35.self_attn.o_proj.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.35.self_attn.q_norm.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.35.self_attn.q_proj.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.35.self_attn.q_proj.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.35.self_attn.q_proj.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.36.input_layernorm.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.36.layer_scalar": "model-00001-of-00002.safetensors", + "language_model.model.layers.36.mlp.down_proj.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.36.mlp.down_proj.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.36.mlp.down_proj.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.36.mlp.gate_proj.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.36.mlp.gate_proj.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.36.mlp.gate_proj.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.36.mlp.up_proj.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.36.mlp.up_proj.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.36.mlp.up_proj.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.36.post_attention_layernorm.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.36.post_feedforward_layernorm.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.36.pre_feedforward_layernorm.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.36.self_attn.k_norm.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.36.self_attn.k_proj.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.36.self_attn.k_proj.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.36.self_attn.k_proj.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.36.self_attn.o_proj.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.36.self_attn.o_proj.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.36.self_attn.o_proj.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.36.self_attn.q_norm.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.36.self_attn.q_proj.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.36.self_attn.q_proj.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.36.self_attn.q_proj.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.36.self_attn.v_proj.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.36.self_attn.v_proj.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.36.self_attn.v_proj.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.37.input_layernorm.weight": "model-00002-of-00002.safetensors", + "language_model.model.layers.37.layer_scalar": "model-00002-of-00002.safetensors", + "language_model.model.layers.37.mlp.down_proj.biases": "model-00002-of-00002.safetensors", + "language_model.model.layers.37.mlp.down_proj.scales": "model-00002-of-00002.safetensors", + "language_model.model.layers.37.mlp.down_proj.weight": "model-00002-of-00002.safetensors", + "language_model.model.layers.37.mlp.gate_proj.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.37.mlp.gate_proj.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.37.mlp.gate_proj.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.37.mlp.up_proj.biases": "model-00002-of-00002.safetensors", + "language_model.model.layers.37.mlp.up_proj.scales": "model-00002-of-00002.safetensors", + "language_model.model.layers.37.mlp.up_proj.weight": "model-00002-of-00002.safetensors", + "language_model.model.layers.37.post_attention_layernorm.weight": "model-00002-of-00002.safetensors", + "language_model.model.layers.37.post_feedforward_layernorm.weight": "model-00002-of-00002.safetensors", + "language_model.model.layers.37.pre_feedforward_layernorm.weight": "model-00002-of-00002.safetensors", + "language_model.model.layers.37.self_attn.k_norm.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.37.self_attn.k_proj.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.37.self_attn.k_proj.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.37.self_attn.k_proj.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.37.self_attn.o_proj.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.37.self_attn.o_proj.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.37.self_attn.o_proj.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.37.self_attn.q_norm.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.37.self_attn.q_proj.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.37.self_attn.q_proj.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.37.self_attn.q_proj.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.37.self_attn.v_proj.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.37.self_attn.v_proj.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.37.self_attn.v_proj.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.38.input_layernorm.weight": "model-00002-of-00002.safetensors", + "language_model.model.layers.38.layer_scalar": "model-00002-of-00002.safetensors", + "language_model.model.layers.38.mlp.down_proj.biases": "model-00002-of-00002.safetensors", + "language_model.model.layers.38.mlp.down_proj.scales": "model-00002-of-00002.safetensors", + "language_model.model.layers.38.mlp.down_proj.weight": "model-00002-of-00002.safetensors", + "language_model.model.layers.38.mlp.gate_proj.biases": "model-00002-of-00002.safetensors", + "language_model.model.layers.38.mlp.gate_proj.scales": "model-00002-of-00002.safetensors", + "language_model.model.layers.38.mlp.gate_proj.weight": "model-00002-of-00002.safetensors", + "language_model.model.layers.38.mlp.up_proj.biases": "model-00002-of-00002.safetensors", + "language_model.model.layers.38.mlp.up_proj.scales": "model-00002-of-00002.safetensors", + "language_model.model.layers.38.mlp.up_proj.weight": "model-00002-of-00002.safetensors", + "language_model.model.layers.38.post_attention_layernorm.weight": "model-00002-of-00002.safetensors", + "language_model.model.layers.38.post_feedforward_layernorm.weight": "model-00002-of-00002.safetensors", + "language_model.model.layers.38.pre_feedforward_layernorm.weight": "model-00002-of-00002.safetensors", + "language_model.model.layers.38.self_attn.k_norm.weight": "model-00002-of-00002.safetensors", + "language_model.model.layers.38.self_attn.k_proj.biases": "model-00002-of-00002.safetensors", + "language_model.model.layers.38.self_attn.k_proj.scales": "model-00002-of-00002.safetensors", + "language_model.model.layers.38.self_attn.k_proj.weight": "model-00002-of-00002.safetensors", + "language_model.model.layers.38.self_attn.o_proj.biases": "model-00002-of-00002.safetensors", + "language_model.model.layers.38.self_attn.o_proj.scales": "model-00002-of-00002.safetensors", + "language_model.model.layers.38.self_attn.o_proj.weight": "model-00002-of-00002.safetensors", + "language_model.model.layers.38.self_attn.q_norm.weight": "model-00002-of-00002.safetensors", + "language_model.model.layers.38.self_attn.q_proj.biases": "model-00002-of-00002.safetensors", + "language_model.model.layers.38.self_attn.q_proj.scales": "model-00002-of-00002.safetensors", + "language_model.model.layers.38.self_attn.q_proj.weight": "model-00002-of-00002.safetensors", + "language_model.model.layers.38.self_attn.v_proj.biases": "model-00002-of-00002.safetensors", + "language_model.model.layers.38.self_attn.v_proj.scales": "model-00002-of-00002.safetensors", + "language_model.model.layers.38.self_attn.v_proj.weight": "model-00002-of-00002.safetensors", + "language_model.model.layers.39.input_layernorm.weight": "model-00002-of-00002.safetensors", + "language_model.model.layers.39.layer_scalar": "model-00002-of-00002.safetensors", + "language_model.model.layers.39.mlp.down_proj.biases": "model-00002-of-00002.safetensors", + "language_model.model.layers.39.mlp.down_proj.scales": "model-00002-of-00002.safetensors", + "language_model.model.layers.39.mlp.down_proj.weight": "model-00002-of-00002.safetensors", + "language_model.model.layers.39.mlp.gate_proj.biases": "model-00002-of-00002.safetensors", + "language_model.model.layers.39.mlp.gate_proj.scales": "model-00002-of-00002.safetensors", + "language_model.model.layers.39.mlp.gate_proj.weight": "model-00002-of-00002.safetensors", + "language_model.model.layers.39.mlp.up_proj.biases": "model-00002-of-00002.safetensors", + "language_model.model.layers.39.mlp.up_proj.scales": "model-00002-of-00002.safetensors", + "language_model.model.layers.39.mlp.up_proj.weight": "model-00002-of-00002.safetensors", + "language_model.model.layers.39.post_attention_layernorm.weight": "model-00002-of-00002.safetensors", + "language_model.model.layers.39.post_feedforward_layernorm.weight": "model-00002-of-00002.safetensors", + "language_model.model.layers.39.pre_feedforward_layernorm.weight": "model-00002-of-00002.safetensors", + "language_model.model.layers.39.self_attn.k_norm.weight": "model-00002-of-00002.safetensors", + "language_model.model.layers.39.self_attn.k_proj.biases": "model-00002-of-00002.safetensors", + "language_model.model.layers.39.self_attn.k_proj.scales": "model-00002-of-00002.safetensors", + "language_model.model.layers.39.self_attn.k_proj.weight": "model-00002-of-00002.safetensors", + "language_model.model.layers.39.self_attn.o_proj.biases": "model-00002-of-00002.safetensors", + "language_model.model.layers.39.self_attn.o_proj.scales": "model-00002-of-00002.safetensors", + "language_model.model.layers.39.self_attn.o_proj.weight": "model-00002-of-00002.safetensors", + "language_model.model.layers.39.self_attn.q_norm.weight": "model-00002-of-00002.safetensors", + "language_model.model.layers.39.self_attn.q_proj.biases": "model-00002-of-00002.safetensors", + "language_model.model.layers.39.self_attn.q_proj.scales": "model-00002-of-00002.safetensors", + "language_model.model.layers.39.self_attn.q_proj.weight": "model-00002-of-00002.safetensors", + "language_model.model.layers.39.self_attn.v_proj.biases": "model-00002-of-00002.safetensors", + "language_model.model.layers.39.self_attn.v_proj.scales": "model-00002-of-00002.safetensors", + "language_model.model.layers.39.self_attn.v_proj.weight": "model-00002-of-00002.safetensors", + "language_model.model.layers.4.input_layernorm.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.4.layer_scalar": "model-00001-of-00002.safetensors", + "language_model.model.layers.4.mlp.down_proj.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.4.mlp.down_proj.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.4.mlp.down_proj.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.4.mlp.gate_proj.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.4.mlp.gate_proj.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.4.mlp.gate_proj.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.4.mlp.up_proj.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.4.mlp.up_proj.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.4.mlp.up_proj.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.4.post_attention_layernorm.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.4.post_feedforward_layernorm.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.4.pre_feedforward_layernorm.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.4.self_attn.k_norm.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.4.self_attn.k_proj.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.4.self_attn.k_proj.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.4.self_attn.k_proj.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.4.self_attn.o_proj.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.4.self_attn.o_proj.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.4.self_attn.o_proj.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.4.self_attn.q_norm.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.4.self_attn.q_proj.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.4.self_attn.q_proj.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.4.self_attn.q_proj.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.4.self_attn.v_proj.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.4.self_attn.v_proj.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.4.self_attn.v_proj.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.40.input_layernorm.weight": "model-00002-of-00002.safetensors", + "language_model.model.layers.40.layer_scalar": "model-00002-of-00002.safetensors", + "language_model.model.layers.40.mlp.down_proj.biases": "model-00002-of-00002.safetensors", + "language_model.model.layers.40.mlp.down_proj.scales": "model-00002-of-00002.safetensors", + "language_model.model.layers.40.mlp.down_proj.weight": "model-00002-of-00002.safetensors", + "language_model.model.layers.40.mlp.gate_proj.biases": "model-00002-of-00002.safetensors", + "language_model.model.layers.40.mlp.gate_proj.scales": "model-00002-of-00002.safetensors", + "language_model.model.layers.40.mlp.gate_proj.weight": "model-00002-of-00002.safetensors", + "language_model.model.layers.40.mlp.up_proj.biases": "model-00002-of-00002.safetensors", + "language_model.model.layers.40.mlp.up_proj.scales": "model-00002-of-00002.safetensors", + "language_model.model.layers.40.mlp.up_proj.weight": "model-00002-of-00002.safetensors", + "language_model.model.layers.40.post_attention_layernorm.weight": "model-00002-of-00002.safetensors", + "language_model.model.layers.40.post_feedforward_layernorm.weight": "model-00002-of-00002.safetensors", + "language_model.model.layers.40.pre_feedforward_layernorm.weight": "model-00002-of-00002.safetensors", + "language_model.model.layers.40.self_attn.k_norm.weight": "model-00002-of-00002.safetensors", + "language_model.model.layers.40.self_attn.k_proj.biases": "model-00002-of-00002.safetensors", + "language_model.model.layers.40.self_attn.k_proj.scales": "model-00002-of-00002.safetensors", + "language_model.model.layers.40.self_attn.k_proj.weight": "model-00002-of-00002.safetensors", + "language_model.model.layers.40.self_attn.o_proj.biases": "model-00002-of-00002.safetensors", + "language_model.model.layers.40.self_attn.o_proj.scales": "model-00002-of-00002.safetensors", + "language_model.model.layers.40.self_attn.o_proj.weight": "model-00002-of-00002.safetensors", + "language_model.model.layers.40.self_attn.q_norm.weight": "model-00002-of-00002.safetensors", + "language_model.model.layers.40.self_attn.q_proj.biases": "model-00002-of-00002.safetensors", + "language_model.model.layers.40.self_attn.q_proj.scales": "model-00002-of-00002.safetensors", + "language_model.model.layers.40.self_attn.q_proj.weight": "model-00002-of-00002.safetensors", + "language_model.model.layers.40.self_attn.v_proj.biases": "model-00002-of-00002.safetensors", + "language_model.model.layers.40.self_attn.v_proj.scales": "model-00002-of-00002.safetensors", + "language_model.model.layers.40.self_attn.v_proj.weight": "model-00002-of-00002.safetensors", + "language_model.model.layers.41.input_layernorm.weight": "model-00002-of-00002.safetensors", + "language_model.model.layers.41.layer_scalar": "model-00002-of-00002.safetensors", + "language_model.model.layers.41.mlp.down_proj.biases": "model-00002-of-00002.safetensors", + "language_model.model.layers.41.mlp.down_proj.scales": "model-00002-of-00002.safetensors", + "language_model.model.layers.41.mlp.down_proj.weight": "model-00002-of-00002.safetensors", + "language_model.model.layers.41.mlp.gate_proj.biases": "model-00002-of-00002.safetensors", + "language_model.model.layers.41.mlp.gate_proj.scales": "model-00002-of-00002.safetensors", + "language_model.model.layers.41.mlp.gate_proj.weight": "model-00002-of-00002.safetensors", + "language_model.model.layers.41.mlp.up_proj.biases": "model-00002-of-00002.safetensors", + "language_model.model.layers.41.mlp.up_proj.scales": "model-00002-of-00002.safetensors", + "language_model.model.layers.41.mlp.up_proj.weight": "model-00002-of-00002.safetensors", + "language_model.model.layers.41.post_attention_layernorm.weight": "model-00002-of-00002.safetensors", + "language_model.model.layers.41.post_feedforward_layernorm.weight": "model-00002-of-00002.safetensors", + "language_model.model.layers.41.pre_feedforward_layernorm.weight": "model-00002-of-00002.safetensors", + "language_model.model.layers.41.self_attn.k_norm.weight": "model-00002-of-00002.safetensors", + "language_model.model.layers.41.self_attn.k_proj.biases": "model-00002-of-00002.safetensors", + "language_model.model.layers.41.self_attn.k_proj.scales": "model-00002-of-00002.safetensors", + "language_model.model.layers.41.self_attn.k_proj.weight": "model-00002-of-00002.safetensors", + "language_model.model.layers.41.self_attn.o_proj.biases": "model-00002-of-00002.safetensors", + "language_model.model.layers.41.self_attn.o_proj.scales": "model-00002-of-00002.safetensors", + "language_model.model.layers.41.self_attn.o_proj.weight": "model-00002-of-00002.safetensors", + "language_model.model.layers.41.self_attn.q_norm.weight": "model-00002-of-00002.safetensors", + "language_model.model.layers.41.self_attn.q_proj.biases": "model-00002-of-00002.safetensors", + "language_model.model.layers.41.self_attn.q_proj.scales": "model-00002-of-00002.safetensors", + "language_model.model.layers.41.self_attn.q_proj.weight": "model-00002-of-00002.safetensors", + "language_model.model.layers.42.input_layernorm.weight": "model-00002-of-00002.safetensors", + "language_model.model.layers.42.layer_scalar": "model-00002-of-00002.safetensors", + "language_model.model.layers.42.mlp.down_proj.biases": "model-00002-of-00002.safetensors", + "language_model.model.layers.42.mlp.down_proj.scales": "model-00002-of-00002.safetensors", + "language_model.model.layers.42.mlp.down_proj.weight": "model-00002-of-00002.safetensors", + "language_model.model.layers.42.mlp.gate_proj.biases": "model-00002-of-00002.safetensors", + "language_model.model.layers.42.mlp.gate_proj.scales": "model-00002-of-00002.safetensors", + "language_model.model.layers.42.mlp.gate_proj.weight": "model-00002-of-00002.safetensors", + "language_model.model.layers.42.mlp.up_proj.biases": "model-00002-of-00002.safetensors", + "language_model.model.layers.42.mlp.up_proj.scales": "model-00002-of-00002.safetensors", + "language_model.model.layers.42.mlp.up_proj.weight": "model-00002-of-00002.safetensors", + "language_model.model.layers.42.post_attention_layernorm.weight": "model-00002-of-00002.safetensors", + "language_model.model.layers.42.post_feedforward_layernorm.weight": "model-00002-of-00002.safetensors", + "language_model.model.layers.42.pre_feedforward_layernorm.weight": "model-00002-of-00002.safetensors", + "language_model.model.layers.42.self_attn.k_norm.weight": "model-00002-of-00002.safetensors", + "language_model.model.layers.42.self_attn.k_proj.biases": "model-00002-of-00002.safetensors", + "language_model.model.layers.42.self_attn.k_proj.scales": "model-00002-of-00002.safetensors", + "language_model.model.layers.42.self_attn.k_proj.weight": "model-00002-of-00002.safetensors", + "language_model.model.layers.42.self_attn.o_proj.biases": "model-00002-of-00002.safetensors", + "language_model.model.layers.42.self_attn.o_proj.scales": "model-00002-of-00002.safetensors", + "language_model.model.layers.42.self_attn.o_proj.weight": "model-00002-of-00002.safetensors", + "language_model.model.layers.42.self_attn.q_norm.weight": "model-00002-of-00002.safetensors", + "language_model.model.layers.42.self_attn.q_proj.biases": "model-00002-of-00002.safetensors", + "language_model.model.layers.42.self_attn.q_proj.scales": "model-00002-of-00002.safetensors", + "language_model.model.layers.42.self_attn.q_proj.weight": "model-00002-of-00002.safetensors", + "language_model.model.layers.42.self_attn.v_proj.biases": "model-00002-of-00002.safetensors", + "language_model.model.layers.42.self_attn.v_proj.scales": "model-00002-of-00002.safetensors", + "language_model.model.layers.42.self_attn.v_proj.weight": "model-00002-of-00002.safetensors", + "language_model.model.layers.43.input_layernorm.weight": "model-00002-of-00002.safetensors", + "language_model.model.layers.43.layer_scalar": "model-00002-of-00002.safetensors", + "language_model.model.layers.43.mlp.down_proj.biases": "model-00002-of-00002.safetensors", + "language_model.model.layers.43.mlp.down_proj.scales": "model-00002-of-00002.safetensors", + "language_model.model.layers.43.mlp.down_proj.weight": "model-00002-of-00002.safetensors", + "language_model.model.layers.43.mlp.gate_proj.biases": "model-00002-of-00002.safetensors", + "language_model.model.layers.43.mlp.gate_proj.scales": "model-00002-of-00002.safetensors", + "language_model.model.layers.43.mlp.gate_proj.weight": "model-00002-of-00002.safetensors", + "language_model.model.layers.43.mlp.up_proj.biases": "model-00002-of-00002.safetensors", + "language_model.model.layers.43.mlp.up_proj.scales": "model-00002-of-00002.safetensors", + "language_model.model.layers.43.mlp.up_proj.weight": "model-00002-of-00002.safetensors", + "language_model.model.layers.43.post_attention_layernorm.weight": "model-00002-of-00002.safetensors", + "language_model.model.layers.43.post_feedforward_layernorm.weight": "model-00002-of-00002.safetensors", + "language_model.model.layers.43.pre_feedforward_layernorm.weight": "model-00002-of-00002.safetensors", + "language_model.model.layers.43.self_attn.k_norm.weight": "model-00002-of-00002.safetensors", + "language_model.model.layers.43.self_attn.k_proj.biases": "model-00002-of-00002.safetensors", + "language_model.model.layers.43.self_attn.k_proj.scales": "model-00002-of-00002.safetensors", + "language_model.model.layers.43.self_attn.k_proj.weight": "model-00002-of-00002.safetensors", + "language_model.model.layers.43.self_attn.o_proj.biases": "model-00002-of-00002.safetensors", + "language_model.model.layers.43.self_attn.o_proj.scales": "model-00002-of-00002.safetensors", + "language_model.model.layers.43.self_attn.o_proj.weight": "model-00002-of-00002.safetensors", + "language_model.model.layers.43.self_attn.q_norm.weight": "model-00002-of-00002.safetensors", + "language_model.model.layers.43.self_attn.q_proj.biases": "model-00002-of-00002.safetensors", + "language_model.model.layers.43.self_attn.q_proj.scales": "model-00002-of-00002.safetensors", + "language_model.model.layers.43.self_attn.q_proj.weight": "model-00002-of-00002.safetensors", + "language_model.model.layers.43.self_attn.v_proj.biases": "model-00002-of-00002.safetensors", + "language_model.model.layers.43.self_attn.v_proj.scales": "model-00002-of-00002.safetensors", + "language_model.model.layers.43.self_attn.v_proj.weight": "model-00002-of-00002.safetensors", + "language_model.model.layers.44.input_layernorm.weight": "model-00002-of-00002.safetensors", + "language_model.model.layers.44.layer_scalar": "model-00002-of-00002.safetensors", + "language_model.model.layers.44.mlp.down_proj.biases": "model-00002-of-00002.safetensors", + "language_model.model.layers.44.mlp.down_proj.scales": "model-00002-of-00002.safetensors", + "language_model.model.layers.44.mlp.down_proj.weight": "model-00002-of-00002.safetensors", + "language_model.model.layers.44.mlp.gate_proj.biases": "model-00002-of-00002.safetensors", + "language_model.model.layers.44.mlp.gate_proj.scales": "model-00002-of-00002.safetensors", + "language_model.model.layers.44.mlp.gate_proj.weight": "model-00002-of-00002.safetensors", + "language_model.model.layers.44.mlp.up_proj.biases": "model-00002-of-00002.safetensors", + "language_model.model.layers.44.mlp.up_proj.scales": "model-00002-of-00002.safetensors", + "language_model.model.layers.44.mlp.up_proj.weight": "model-00002-of-00002.safetensors", + "language_model.model.layers.44.post_attention_layernorm.weight": "model-00002-of-00002.safetensors", + "language_model.model.layers.44.post_feedforward_layernorm.weight": "model-00002-of-00002.safetensors", + "language_model.model.layers.44.pre_feedforward_layernorm.weight": "model-00002-of-00002.safetensors", + "language_model.model.layers.44.self_attn.k_norm.weight": "model-00002-of-00002.safetensors", + "language_model.model.layers.44.self_attn.k_proj.biases": "model-00002-of-00002.safetensors", + "language_model.model.layers.44.self_attn.k_proj.scales": "model-00002-of-00002.safetensors", + "language_model.model.layers.44.self_attn.k_proj.weight": "model-00002-of-00002.safetensors", + "language_model.model.layers.44.self_attn.o_proj.biases": "model-00002-of-00002.safetensors", + "language_model.model.layers.44.self_attn.o_proj.scales": "model-00002-of-00002.safetensors", + "language_model.model.layers.44.self_attn.o_proj.weight": "model-00002-of-00002.safetensors", + "language_model.model.layers.44.self_attn.q_norm.weight": "model-00002-of-00002.safetensors", + "language_model.model.layers.44.self_attn.q_proj.biases": "model-00002-of-00002.safetensors", + "language_model.model.layers.44.self_attn.q_proj.scales": "model-00002-of-00002.safetensors", + "language_model.model.layers.44.self_attn.q_proj.weight": "model-00002-of-00002.safetensors", + "language_model.model.layers.44.self_attn.v_proj.biases": "model-00002-of-00002.safetensors", + "language_model.model.layers.44.self_attn.v_proj.scales": "model-00002-of-00002.safetensors", + "language_model.model.layers.44.self_attn.v_proj.weight": "model-00002-of-00002.safetensors", + "language_model.model.layers.45.input_layernorm.weight": "model-00002-of-00002.safetensors", + "language_model.model.layers.45.layer_scalar": "model-00002-of-00002.safetensors", + "language_model.model.layers.45.mlp.down_proj.biases": "model-00002-of-00002.safetensors", + "language_model.model.layers.45.mlp.down_proj.scales": "model-00002-of-00002.safetensors", + "language_model.model.layers.45.mlp.down_proj.weight": "model-00002-of-00002.safetensors", + "language_model.model.layers.45.mlp.gate_proj.biases": "model-00002-of-00002.safetensors", + "language_model.model.layers.45.mlp.gate_proj.scales": "model-00002-of-00002.safetensors", + "language_model.model.layers.45.mlp.gate_proj.weight": "model-00002-of-00002.safetensors", + "language_model.model.layers.45.mlp.up_proj.biases": "model-00002-of-00002.safetensors", + "language_model.model.layers.45.mlp.up_proj.scales": "model-00002-of-00002.safetensors", + "language_model.model.layers.45.mlp.up_proj.weight": "model-00002-of-00002.safetensors", + "language_model.model.layers.45.post_attention_layernorm.weight": "model-00002-of-00002.safetensors", + "language_model.model.layers.45.post_feedforward_layernorm.weight": "model-00002-of-00002.safetensors", + "language_model.model.layers.45.pre_feedforward_layernorm.weight": "model-00002-of-00002.safetensors", + "language_model.model.layers.45.self_attn.k_norm.weight": "model-00002-of-00002.safetensors", + "language_model.model.layers.45.self_attn.k_proj.biases": "model-00002-of-00002.safetensors", + "language_model.model.layers.45.self_attn.k_proj.scales": "model-00002-of-00002.safetensors", + "language_model.model.layers.45.self_attn.k_proj.weight": "model-00002-of-00002.safetensors", + "language_model.model.layers.45.self_attn.o_proj.biases": "model-00002-of-00002.safetensors", + "language_model.model.layers.45.self_attn.o_proj.scales": "model-00002-of-00002.safetensors", + "language_model.model.layers.45.self_attn.o_proj.weight": "model-00002-of-00002.safetensors", + "language_model.model.layers.45.self_attn.q_norm.weight": "model-00002-of-00002.safetensors", + "language_model.model.layers.45.self_attn.q_proj.biases": "model-00002-of-00002.safetensors", + "language_model.model.layers.45.self_attn.q_proj.scales": "model-00002-of-00002.safetensors", + "language_model.model.layers.45.self_attn.q_proj.weight": "model-00002-of-00002.safetensors", + "language_model.model.layers.45.self_attn.v_proj.biases": "model-00002-of-00002.safetensors", + "language_model.model.layers.45.self_attn.v_proj.scales": "model-00002-of-00002.safetensors", + "language_model.model.layers.45.self_attn.v_proj.weight": "model-00002-of-00002.safetensors", + "language_model.model.layers.46.input_layernorm.weight": "model-00002-of-00002.safetensors", + "language_model.model.layers.46.layer_scalar": "model-00002-of-00002.safetensors", + "language_model.model.layers.46.mlp.down_proj.biases": "model-00002-of-00002.safetensors", + "language_model.model.layers.46.mlp.down_proj.scales": "model-00002-of-00002.safetensors", + "language_model.model.layers.46.mlp.down_proj.weight": "model-00002-of-00002.safetensors", + "language_model.model.layers.46.mlp.gate_proj.biases": "model-00002-of-00002.safetensors", + "language_model.model.layers.46.mlp.gate_proj.scales": "model-00002-of-00002.safetensors", + "language_model.model.layers.46.mlp.gate_proj.weight": "model-00002-of-00002.safetensors", + "language_model.model.layers.46.mlp.up_proj.biases": "model-00002-of-00002.safetensors", + "language_model.model.layers.46.mlp.up_proj.scales": "model-00002-of-00002.safetensors", + "language_model.model.layers.46.mlp.up_proj.weight": "model-00002-of-00002.safetensors", + "language_model.model.layers.46.post_attention_layernorm.weight": "model-00002-of-00002.safetensors", + "language_model.model.layers.46.post_feedforward_layernorm.weight": "model-00002-of-00002.safetensors", + "language_model.model.layers.46.pre_feedforward_layernorm.weight": "model-00002-of-00002.safetensors", + "language_model.model.layers.46.self_attn.k_norm.weight": "model-00002-of-00002.safetensors", + "language_model.model.layers.46.self_attn.k_proj.biases": "model-00002-of-00002.safetensors", + "language_model.model.layers.46.self_attn.k_proj.scales": "model-00002-of-00002.safetensors", + "language_model.model.layers.46.self_attn.k_proj.weight": "model-00002-of-00002.safetensors", + "language_model.model.layers.46.self_attn.o_proj.biases": "model-00002-of-00002.safetensors", + "language_model.model.layers.46.self_attn.o_proj.scales": "model-00002-of-00002.safetensors", + "language_model.model.layers.46.self_attn.o_proj.weight": "model-00002-of-00002.safetensors", + "language_model.model.layers.46.self_attn.q_norm.weight": "model-00002-of-00002.safetensors", + "language_model.model.layers.46.self_attn.q_proj.biases": "model-00002-of-00002.safetensors", + "language_model.model.layers.46.self_attn.q_proj.scales": "model-00002-of-00002.safetensors", + "language_model.model.layers.46.self_attn.q_proj.weight": "model-00002-of-00002.safetensors", + "language_model.model.layers.46.self_attn.v_proj.biases": "model-00002-of-00002.safetensors", + "language_model.model.layers.46.self_attn.v_proj.scales": "model-00002-of-00002.safetensors", + "language_model.model.layers.46.self_attn.v_proj.weight": "model-00002-of-00002.safetensors", + "language_model.model.layers.47.input_layernorm.weight": "model-00002-of-00002.safetensors", + "language_model.model.layers.47.layer_scalar": "model-00002-of-00002.safetensors", + "language_model.model.layers.47.mlp.down_proj.biases": "model-00002-of-00002.safetensors", + "language_model.model.layers.47.mlp.down_proj.scales": "model-00002-of-00002.safetensors", + "language_model.model.layers.47.mlp.down_proj.weight": "model-00002-of-00002.safetensors", + "language_model.model.layers.47.mlp.gate_proj.biases": "model-00002-of-00002.safetensors", + "language_model.model.layers.47.mlp.gate_proj.scales": "model-00002-of-00002.safetensors", + "language_model.model.layers.47.mlp.gate_proj.weight": "model-00002-of-00002.safetensors", + "language_model.model.layers.47.mlp.up_proj.biases": "model-00002-of-00002.safetensors", + "language_model.model.layers.47.mlp.up_proj.scales": "model-00002-of-00002.safetensors", + "language_model.model.layers.47.mlp.up_proj.weight": "model-00002-of-00002.safetensors", + "language_model.model.layers.47.post_attention_layernorm.weight": "model-00002-of-00002.safetensors", + "language_model.model.layers.47.post_feedforward_layernorm.weight": "model-00002-of-00002.safetensors", + "language_model.model.layers.47.pre_feedforward_layernorm.weight": "model-00002-of-00002.safetensors", + "language_model.model.layers.47.self_attn.k_norm.weight": "model-00002-of-00002.safetensors", + "language_model.model.layers.47.self_attn.k_proj.biases": "model-00002-of-00002.safetensors", + "language_model.model.layers.47.self_attn.k_proj.scales": "model-00002-of-00002.safetensors", + "language_model.model.layers.47.self_attn.k_proj.weight": "model-00002-of-00002.safetensors", + "language_model.model.layers.47.self_attn.o_proj.biases": "model-00002-of-00002.safetensors", + "language_model.model.layers.47.self_attn.o_proj.scales": "model-00002-of-00002.safetensors", + "language_model.model.layers.47.self_attn.o_proj.weight": "model-00002-of-00002.safetensors", + "language_model.model.layers.47.self_attn.q_norm.weight": "model-00002-of-00002.safetensors", + "language_model.model.layers.47.self_attn.q_proj.biases": "model-00002-of-00002.safetensors", + "language_model.model.layers.47.self_attn.q_proj.scales": "model-00002-of-00002.safetensors", + "language_model.model.layers.47.self_attn.q_proj.weight": "model-00002-of-00002.safetensors", + "language_model.model.layers.5.input_layernorm.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.5.layer_scalar": "model-00001-of-00002.safetensors", + "language_model.model.layers.5.mlp.down_proj.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.5.mlp.down_proj.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.5.mlp.down_proj.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.5.mlp.gate_proj.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.5.mlp.gate_proj.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.5.mlp.gate_proj.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.5.mlp.up_proj.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.5.mlp.up_proj.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.5.mlp.up_proj.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.5.post_attention_layernorm.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.5.post_feedforward_layernorm.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.5.pre_feedforward_layernorm.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.5.self_attn.k_norm.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.5.self_attn.k_proj.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.5.self_attn.k_proj.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.5.self_attn.k_proj.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.5.self_attn.o_proj.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.5.self_attn.o_proj.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.5.self_attn.o_proj.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.5.self_attn.q_norm.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.5.self_attn.q_proj.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.5.self_attn.q_proj.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.5.self_attn.q_proj.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.6.input_layernorm.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.6.layer_scalar": "model-00001-of-00002.safetensors", + "language_model.model.layers.6.mlp.down_proj.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.6.mlp.down_proj.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.6.mlp.down_proj.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.6.mlp.gate_proj.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.6.mlp.gate_proj.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.6.mlp.gate_proj.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.6.mlp.up_proj.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.6.mlp.up_proj.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.6.mlp.up_proj.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.6.post_attention_layernorm.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.6.post_feedforward_layernorm.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.6.pre_feedforward_layernorm.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.6.self_attn.k_norm.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.6.self_attn.k_proj.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.6.self_attn.k_proj.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.6.self_attn.k_proj.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.6.self_attn.o_proj.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.6.self_attn.o_proj.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.6.self_attn.o_proj.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.6.self_attn.q_norm.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.6.self_attn.q_proj.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.6.self_attn.q_proj.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.6.self_attn.q_proj.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.6.self_attn.v_proj.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.6.self_attn.v_proj.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.6.self_attn.v_proj.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.7.input_layernorm.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.7.layer_scalar": "model-00001-of-00002.safetensors", + "language_model.model.layers.7.mlp.down_proj.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.7.mlp.down_proj.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.7.mlp.down_proj.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.7.mlp.gate_proj.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.7.mlp.gate_proj.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.7.mlp.gate_proj.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.7.mlp.up_proj.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.7.mlp.up_proj.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.7.mlp.up_proj.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.7.post_attention_layernorm.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.7.post_feedforward_layernorm.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.7.pre_feedforward_layernorm.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.7.self_attn.k_norm.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.7.self_attn.k_proj.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.7.self_attn.k_proj.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.7.self_attn.k_proj.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.7.self_attn.o_proj.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.7.self_attn.o_proj.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.7.self_attn.o_proj.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.7.self_attn.q_norm.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.7.self_attn.q_proj.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.7.self_attn.q_proj.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.7.self_attn.q_proj.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.7.self_attn.v_proj.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.7.self_attn.v_proj.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.7.self_attn.v_proj.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.8.input_layernorm.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.8.layer_scalar": "model-00001-of-00002.safetensors", + "language_model.model.layers.8.mlp.down_proj.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.8.mlp.down_proj.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.8.mlp.down_proj.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.8.mlp.gate_proj.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.8.mlp.gate_proj.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.8.mlp.gate_proj.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.8.mlp.up_proj.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.8.mlp.up_proj.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.8.mlp.up_proj.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.8.post_attention_layernorm.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.8.post_feedforward_layernorm.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.8.pre_feedforward_layernorm.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.8.self_attn.k_norm.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.8.self_attn.k_proj.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.8.self_attn.k_proj.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.8.self_attn.k_proj.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.8.self_attn.o_proj.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.8.self_attn.o_proj.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.8.self_attn.o_proj.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.8.self_attn.q_norm.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.8.self_attn.q_proj.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.8.self_attn.q_proj.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.8.self_attn.q_proj.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.8.self_attn.v_proj.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.8.self_attn.v_proj.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.8.self_attn.v_proj.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.9.input_layernorm.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.9.layer_scalar": "model-00001-of-00002.safetensors", + "language_model.model.layers.9.mlp.down_proj.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.9.mlp.down_proj.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.9.mlp.down_proj.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.9.mlp.gate_proj.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.9.mlp.gate_proj.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.9.mlp.gate_proj.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.9.mlp.up_proj.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.9.mlp.up_proj.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.9.mlp.up_proj.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.9.post_attention_layernorm.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.9.post_feedforward_layernorm.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.9.pre_feedforward_layernorm.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.9.self_attn.k_norm.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.9.self_attn.k_proj.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.9.self_attn.k_proj.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.9.self_attn.k_proj.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.9.self_attn.o_proj.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.9.self_attn.o_proj.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.9.self_attn.o_proj.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.9.self_attn.q_norm.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.9.self_attn.q_proj.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.9.self_attn.q_proj.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.9.self_attn.q_proj.weight": "model-00001-of-00002.safetensors", + "language_model.model.layers.9.self_attn.v_proj.biases": "model-00001-of-00002.safetensors", + "language_model.model.layers.9.self_attn.v_proj.scales": "model-00001-of-00002.safetensors", + "language_model.model.layers.9.self_attn.v_proj.weight": "model-00001-of-00002.safetensors", + "language_model.model.norm.weight": "model-00002-of-00002.safetensors", + "vision_embedder.patch_dense.bias": "model-00002-of-00002.safetensors", + "vision_embedder.patch_dense.biases": "model-00002-of-00002.safetensors", + "vision_embedder.patch_dense.scales": "model-00002-of-00002.safetensors", + "vision_embedder.patch_dense.weight": "model-00002-of-00002.safetensors", + "vision_embedder.patch_ln1.bias": "model-00002-of-00002.safetensors", + "vision_embedder.patch_ln1.weight": "model-00002-of-00002.safetensors", + "vision_embedder.patch_ln2.bias": "model-00002-of-00002.safetensors", + "vision_embedder.patch_ln2.weight": "model-00002-of-00002.safetensors", + "vision_embedder.pos_embedding": "model-00002-of-00002.safetensors", + "vision_embedder.pos_norm.bias": "model-00002-of-00002.safetensors", + "vision_embedder.pos_norm.weight": "model-00002-of-00002.safetensors" + } +} \ No newline at end of file diff --git a/chat/mlx/mlx-community/gemma-4-12B-it-4bit/processor_config.json b/chat/mlx/mlx-community/gemma-4-12B-it-4bit/processor_config.json new file mode 100644 index 0000000..62a14d5 --- /dev/null +++ b/chat/mlx/mlx-community/gemma-4-12B-it-4bit/processor_config.json @@ -0,0 +1,40 @@ +{ + "image_processor": { + "do_convert_rgb": true, + "do_normalize": false, + "do_rescale": true, + "do_resize": true, + "image_mean": [ + 0.0, + 0.0, + 0.0 + ], + "image_processor_type": "Gemma4UnifiedImageProcessor", + "image_std": [ + 1.0, + 1.0, + 1.0 + ], + "max_soft_tokens": 280, + "model_patch_size": 48, + "patch_size": 16, + "pooling_kernel_size": 3, + "resample": 3, + "rescale_factor": 0.00392156862745098, + "size": { + "height": 224, + "width": 224 + } + }, + "processor_class": "Gemma4UnifiedProcessor", + "feature_extractor": { + "feature_extractor_type": "Gemma4UnifiedAudioFeatureExtractor", + "sampling_rate": 16000, + "num_mel_filters": 128, + "fft_length": 512, + "hop_length": 160, + "chunk_duration": 8.0, + "overlap_duration": 1.0 + }, + "audio_ms_per_token": 40 +} \ No newline at end of file diff --git a/chat/mlx/mlx-community/gemma-4-12B-it-4bit/tokenizer.json b/chat/mlx/mlx-community/gemma-4-12B-it-4bit/tokenizer.json new file mode 100644 index 0000000..1ff9f3e --- /dev/null +++ b/chat/mlx/mlx-community/gemma-4-12B-it-4bit/tokenizer.json @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:cc8d3a0ce36466ccc1278bf987df5f71db1719b9ca6b4118264f45cb627bfe0f +size 32169626 diff --git a/chat/mlx/mlx-community/gemma-4-12B-it-4bit/tokenizer_config.json b/chat/mlx/mlx-community/gemma-4-12B-it-4bit/tokenizer_config.json new file mode 100644 index 0000000..5c5c5b1 --- /dev/null +++ b/chat/mlx/mlx-community/gemma-4-12B-it-4bit/tokenizer_config.json @@ -0,0 +1,95 @@ +{ + "audio_token": "<|audio|>", + "backend": "tokenizers", + "boa_token": "<|audio>", + "boi_token": "<|image>", + "bos_token": "", + "eoa_token": "", + "eoc_token": "", + "eoi_token": "", + "eos_token": "", + "eot_token": "", + "escape_token": "<|\"|>", + "etc_token": "", + "etd_token": "", + "etr_token": "", + "extra_special_tokens": [ + "<|video|>" + ], + "image_token": "<|image|>", + "is_local": true, + "mask_token": "", + "model_max_length": 1000000000000000019884624838656, + "model_specific_special_tokens": { + "audio_token": "<|audio|>", + "boa_token": "<|audio>", + "boi_token": "<|image>", + "eoa_token": "", + "eoc_token": "", + "eoi_token": "", + "eot_token": "", + "escape_token": "<|\"|>", + "etc_token": "", + "etd_token": "", + "etr_token": "", + "image_token": "<|image|>", + "soc_token": "<|channel>", + "sot_token": "<|turn>", + "stc_token": "<|tool_call>", + "std_token": "<|tool>", + "str_token": "<|tool_response>", + "think_token": "<|think|>" + }, + "pad_token": "", + "padding_side": "left", + "processor_class": "Gemma4UnifiedProcessor", + "response_schema": { + "properties": { + "content": { + "type": "string" + }, + "role": { + "const": "assistant" + }, + "thinking": { + "type": "string" + }, + "tool_calls": { + "items": { + "properties": { + "function": { + "properties": { + "arguments": { + "additionalProperties": {}, + "type": "object", + "x-parser": "gemma4-tool-call" + }, + "name": { + "type": "string" + } + }, + "type": "object", + "x-regex": "call\\:(?P\\w+)(?P\\{.*\\})" + }, + "type": { + "const": "function" + } + }, + "type": "object" + }, + "type": "array", + "x-regex-iterator": "<\\|tool_call>(.*?)" + } + }, + "type": "object", + "x-regex": "(\\<\\|channel\\>thought\\n(?P.*?)\\)?(?P\\<\\|tool_call\\>.*\\)?(?P(?:(?!\\)(?!\\<\\|tool_response\\>).)+)?(?:\\|\\<\\|tool_response\\>)?" + }, + "soc_token": "<|channel>", + "sot_token": "<|turn>", + "stc_token": "<|tool_call>", + "std_token": "<|tool>", + "str_token": "<|tool_response>", + "think_token": "<|think|>", + "tokenizer_class": "GemmaTokenizer", + "unk_token": "" +} diff --git a/chat/mlx/mlx-community/gemma-4-26b-a4b-it-4bit/.gitattributes b/chat/mlx/mlx-community/gemma-4-26b-a4b-it-4bit/.gitattributes new file mode 100644 index 0000000..52373fe --- /dev/null +++ b/chat/mlx/mlx-community/gemma-4-26b-a4b-it-4bit/.gitattributes @@ -0,0 +1,36 @@ +*.7z filter=lfs diff=lfs merge=lfs -text +*.arrow filter=lfs diff=lfs merge=lfs -text +*.bin filter=lfs diff=lfs merge=lfs -text +*.bz2 filter=lfs diff=lfs merge=lfs -text +*.ckpt filter=lfs diff=lfs merge=lfs -text +*.ftz filter=lfs diff=lfs merge=lfs -text +*.gz filter=lfs diff=lfs merge=lfs -text +*.h5 filter=lfs diff=lfs merge=lfs -text +*.joblib filter=lfs diff=lfs merge=lfs -text +*.lfs.* filter=lfs diff=lfs merge=lfs -text +*.mlmodel filter=lfs diff=lfs merge=lfs -text +*.model filter=lfs diff=lfs merge=lfs -text +*.msgpack filter=lfs diff=lfs merge=lfs -text +*.npy filter=lfs diff=lfs merge=lfs -text +*.npz filter=lfs diff=lfs merge=lfs -text +*.onnx filter=lfs diff=lfs merge=lfs -text +*.ot filter=lfs diff=lfs merge=lfs -text +*.parquet filter=lfs diff=lfs merge=lfs -text +*.pb filter=lfs diff=lfs merge=lfs -text +*.pickle filter=lfs diff=lfs merge=lfs -text +*.pkl filter=lfs diff=lfs merge=lfs -text +*.pt filter=lfs diff=lfs merge=lfs -text +*.pth filter=lfs diff=lfs merge=lfs -text +*.rar filter=lfs diff=lfs merge=lfs -text +*.safetensors filter=lfs diff=lfs merge=lfs -text +saved_model/**/* filter=lfs diff=lfs merge=lfs -text +*.tar.* filter=lfs diff=lfs merge=lfs -text +*.tar filter=lfs diff=lfs merge=lfs -text +*.tflite filter=lfs diff=lfs merge=lfs -text +*.tgz filter=lfs diff=lfs merge=lfs -text +*.wasm filter=lfs diff=lfs merge=lfs -text +*.xz filter=lfs diff=lfs merge=lfs -text +*.zip filter=lfs diff=lfs merge=lfs -text +*.zst filter=lfs diff=lfs merge=lfs -text +*tfevents* filter=lfs diff=lfs merge=lfs -text +tokenizer.json filter=lfs diff=lfs merge=lfs -text diff --git a/chat/mlx/mlx-community/gemma-4-26b-a4b-it-4bit/README.md b/chat/mlx/mlx-community/gemma-4-26b-a4b-it-4bit/README.md new file mode 100644 index 0000000..2efe3f6 --- /dev/null +++ b/chat/mlx/mlx-community/gemma-4-26b-a4b-it-4bit/README.md @@ -0,0 +1,25 @@ +--- +library_name: mlx +license: apache-2.0 +license_link: https://ai.google.dev/gemma/docs/gemma_4_license +pipeline_tag: image-text-to-text +base_model: google/gemma-4-26b-a4b-it +tags: +- mlx +--- + +# mlx-community/gemma-4-26b-a4b-it-4bit + +This model was converted to MLX format from [`google/gemma-4-26b-a4b-it`](https://huggingface.co/google/gemma-4-26b-a4b-it) +using mlx-vlm version **0.4.3**. +Refer to the [original model card](https://huggingface.co/google/gemma-4-26b-a4b-it) for more details on the model. + +## Use with mlx + +```bash +pip install -U mlx-vlm +``` + +```bash +python -m mlx_vlm.generate --model mlx-community/gemma-4-26b-a4b-it-4bit --max-tokens 100 --temperature 0.0 --prompt "Describe this image." --image +``` diff --git a/chat/mlx/mlx-community/gemma-4-26b-a4b-it-4bit/chat_template.jinja b/chat/mlx/mlx-community/gemma-4-26b-a4b-it-4bit/chat_template.jinja new file mode 100644 index 0000000..e61bbfe --- /dev/null +++ b/chat/mlx/mlx-community/gemma-4-26b-a4b-it-4bit/chat_template.jinja @@ -0,0 +1,363 @@ +{%- macro format_parameters(properties, required, filter_keys=false) -%} + {%- set standard_keys = ['description', 'type', 'properties', 'required', 'nullable'] -%} + {%- set ns = namespace(found_first=false) -%} + {%- for key, value in properties | dictsort -%} + {%- set add_comma = false -%} + {%- if not filter_keys or key not in standard_keys -%} + {%- if ns.found_first %},{% endif -%} + {%- set ns.found_first = true -%} + {{ key }}:{ + {%- if value['description'] -%} + description:<|"|>{{ value['description'] }}<|"|> + {%- set add_comma = true -%} + {%- endif -%} + {%- if value['type'] | upper == 'STRING' -%} + {%- if value['enum'] -%} + {%- if add_comma %},{%- else -%} {%- set add_comma = true -%} {% endif -%} + enum:{{ format_argument(value['enum']) }} + {%- endif -%} + {%- elif value['type'] | upper == 'ARRAY' -%} + {%- if value['items'] is mapping and value['items'] -%} + {%- if add_comma %},{%- else -%} {%- set add_comma = true -%} {% endif -%} + items:{ + {%- set ns_items = namespace(found_first=false) -%} + {%- for item_key, item_value in value['items'] | dictsort -%} + {%- if item_value is not none -%} + {%- if ns_items.found_first %},{% endif -%} + {%- set ns_items.found_first = true -%} + {%- if item_key == 'properties' -%} + properties:{ + {%- if item_value is mapping -%} + {{- format_parameters(item_value, value['items']['required'] | default([])) -}} + {%- endif -%} + } + {%- elif item_key == 'required' -%} + required:[ + {%- for req_item in item_value -%} + <|"|>{{- req_item -}}<|"|> + {%- if not loop.last %},{% endif -%} + {%- endfor -%} + ] + {%- elif item_key == 'type' -%} + {%- if item_value is string -%} + type:{{ format_argument(item_value | upper) }} + {%- else -%} + type:{{ format_argument(item_value | map('upper') | list) }} + {%- endif -%} + {%- else -%} + {{ item_key }}:{{ format_argument(item_value) }} + {%- endif -%} + {%- endif -%} + {%- endfor -%} + } + {%- endif -%} + {%- endif -%} + {%- if value['nullable'] %} + {%- if add_comma %},{%- else -%} {%- set add_comma = true -%} {% endif -%} + nullable:true + {%- endif -%} + {%- if value['type'] | upper == 'OBJECT' -%} + {%- if value['properties'] is defined and value['properties'] is mapping -%} + {%- if add_comma %},{%- else -%} {%- set add_comma = true -%} {% endif -%} + properties:{ + {{- format_parameters(value['properties'], value['required'] | default([])) -}} + } + {%- elif value is mapping -%} + {%- if add_comma %},{%- else -%} {%- set add_comma = true -%} {% endif -%} + properties:{ + {{- format_parameters(value, value['required'] | default([]), filter_keys=true) -}} + } + {%- endif -%} + {%- if value['required'] -%} + {%- if add_comma %},{%- else -%} {%- set add_comma = true -%} {% endif -%} + required:[ + {%- for item in value['required'] | default([]) -%} + <|"|>{{- item -}}<|"|> + {%- if not loop.last %},{% endif -%} + {%- endfor -%} + ] + {%- endif -%} + {%- endif -%} + {%- if add_comma %},{%- else -%} {%- set add_comma = true -%} {% endif -%} + type:<|"|>{{ value['type'] | upper }}<|"|>} + {%- endif -%} + {%- endfor -%} +{%- endmacro -%} +{%- macro format_function_declaration(tool_data) -%} + declaration:{{- tool_data['function']['name'] -}}{description:<|"|>{{- tool_data['function']['description'] -}}<|"|> + {%- set params = tool_data['function']['parameters'] -%} + {%- if params -%} + ,parameters:{ + {%- if params['properties'] -%} + properties:{ {{- format_parameters(params['properties'], params['required']) -}} }, + {%- endif -%} + {%- if params['required'] -%} + required:[ + {%- for item in params['required'] -%} + <|"|>{{- item -}}<|"|> + {{- ',' if not loop.last -}} + {%- endfor -%} + ], + {%- endif -%} + {%- if params['type'] -%} + type:<|"|>{{- params['type'] | upper -}}<|"|>} + {%- endif -%} + {%- endif -%} + {%- if 'response' in tool_data['function'] -%} + {%- set response_declaration = tool_data['function']['response'] -%} + ,response:{ + {%- if response_declaration['description'] -%} + description:<|"|>{{- response_declaration['description'] -}}<|"|>, + {%- endif -%} + {%- if response_declaration['type'] | upper == 'OBJECT' -%} + type:<|"|>{{- response_declaration['type'] | upper -}}<|"|>} + {%- endif -%} + {%- endif -%} + } +{%- endmacro -%} +{%- macro format_argument(argument, escape_keys=True) -%} + {%- if argument is string -%} + {{- '<|"|>' + argument + '<|"|>' -}} + {%- elif argument is boolean -%} + {{- 'true' if argument else 'false' -}} + {%- elif argument is mapping -%} + {{- '{' -}} + {%- set ns = namespace(found_first=false) -%} + {%- for key, value in argument | dictsort -%} + {%- if ns.found_first %},{% endif -%} + {%- set ns.found_first = true -%} + {%- if escape_keys -%} + {{- '<|"|>' + key + '<|"|>' -}} + {%- else -%} + {{- key -}} + {%- endif -%} + :{{- format_argument(value, escape_keys=escape_keys) -}} + {%- endfor -%} + {{- '}' -}} + {%- elif argument is sequence -%} + {{- '[' -}} + {%- for item in argument -%} + {{- format_argument(item, escape_keys=escape_keys) -}} + {%- if not loop.last %},{% endif -%} + {%- endfor -%} + {{- ']' -}} + {%- else -%} + {{- argument -}} + {%- endif -%} +{%- endmacro -%} +{%- macro strip_thinking(text) -%} + {%- set ns = namespace(result='') -%} + {%- for part in text.split('') -%} + {%- if '<|channel>' in part -%} + {%- set ns.result = ns.result + part.split('<|channel>')[0] -%} + {%- else -%} + {%- set ns.result = ns.result + part -%} + {%- endif -%} + {%- endfor -%} + {{- ns.result | trim -}} +{%- endmacro -%} + +{%- macro format_tool_response_block(tool_name, response) -%} + {{- '<|tool_response>' -}} + {%- if response is mapping -%} + {{- 'response:' + tool_name + '{' -}} + {%- for key, value in response | dictsort -%} + {{- key -}}:{{- format_argument(value, escape_keys=False) -}} + {%- if not loop.last %},{% endif -%} + {%- endfor -%} + {{- '}' -}} + {%- else -%} + {{- 'response:' + tool_name + '{value:' + format_argument(response, escape_keys=False) + '}' -}} + {%- endif -%} + {{- '' -}} +{%- endmacro -%} + +{%- set ns = namespace(prev_message_type=None) -%} +{%- set loop_messages = messages -%} +{{- bos_token -}} +{#- Handle System/Tool Definitions Block -#} +{%- if (enable_thinking is defined and enable_thinking) or tools or messages[0]['role'] in ['system', 'developer'] -%} + {{- '<|turn>system\n' -}} + {#- Inject Thinking token at the very top of the FIRST system turn -#} + {%- if enable_thinking is defined and enable_thinking -%} + {{- '<|think|>\n' -}} + {%- set ns.prev_message_type = 'think' -%} + {%- endif -%} + {%- if messages[0]['role'] in ['system', 'developer'] -%} + {%- if messages[0]['content'] is string -%} + {{- messages[0]['content'] | trim -}} + {%- elif messages[0]['content'] is sequence -%} + {%- for item in messages[0]['content'] -%} + {{- item['text'] | trim + ' '-}} + {%- endfor -%} + {%- endif -%} + {%- set loop_messages = messages[1:] -%} + {%- endif -%} + {%- if tools -%} + {%- for tool in tools %} + {{- '<|tool>' -}} + {{- format_function_declaration(tool) | trim -}} + {{- '' -}} + {%- endfor %} + {%- set ns.prev_message_type = 'tool' -%} + {%- endif -%} + {{- '\n' -}} +{%- endif %} + +{#- Pre-scan: find last user message index for reasoning guard -#} +{%- set ns_turn = namespace(last_user_idx=-1) -%} +{%- for i in range(loop_messages | length) -%} + {%- if loop_messages[i]['role'] == 'user' -%} + {%- set ns_turn.last_user_idx = i -%} + {%- endif -%} +{%- endfor -%} + +{#- Loop through messages -#} +{%- for message in loop_messages -%} + {%- if message['role'] != 'tool' -%} + {%- set ns.prev_message_type = None -%} + {%- set role = 'model' if message['role'] == 'assistant' else message['role'] -%} + {#- Detect continuation: suppress duplicate <|turn>model when previous non-tool message was also assistant -#} + {%- set prev_nt = namespace(role=None, found=false) -%} + {%- if loop.index0 > 0 -%} + {%- for j in range(loop.index0 - 1, -1, -1) -%} + {%- if not prev_nt.found -%} + {%- if loop_messages[j]['role'] != 'tool' -%} + {%- set prev_nt.role = loop_messages[j]['role'] -%} + {%- set prev_nt.found = true -%} + {%- endif -%} + {%- endif -%} + {%- endfor -%} + {%- endif -%} + {%- set continue_same_model_turn = (role == 'model' and prev_nt.role == 'assistant') -%} + {%- if not continue_same_model_turn -%} + {{- '<|turn>' + role + '\n' }} + {%- endif -%} + + {#- Render reasoning/reasoning_content as thinking channel -#} + {%- set thinking_text = message.get('reasoning') or message.get('reasoning_content') -%} + {%- if thinking_text and loop.index0 > ns_turn.last_user_idx and message.get('tool_calls') -%} + {{- '<|channel>thought\n' + thinking_text + '\n' -}} + {%- endif -%} + + {%- if message['tool_calls'] -%} + {%- for tool_call in message['tool_calls'] -%} + {%- set function = tool_call['function'] -%} + {{- '<|tool_call>call:' + function['name'] + '{' -}} + {%- if function['arguments'] is mapping -%} + {%- set ns_args = namespace(found_first=false) -%} + {%- for key, value in function['arguments'] | dictsort -%} + {%- if ns_args.found_first %},{% endif -%} + {%- set ns_args.found_first = true -%} + {{- key -}}:{{- format_argument(value, escape_keys=False) -}} + {%- endfor -%} + {%- elif function['arguments'] is string -%} + {{- function['arguments'] -}} + {%- endif -%} + {{- '}' -}} + {%- endfor -%} + {%- set ns.prev_message_type = 'tool_call' -%} + {%- endif -%} + + {%- set ns_tr_out = namespace(flag=false) -%} + {%- if message.get('tool_responses') -%} + {#- Legacy: tool_responses embedded on the assistant message (Google/Gemma native) -#} + {%- for tool_response in message['tool_responses'] -%} + {{- format_tool_response_block(tool_response['name'] | default('unknown'), tool_response['response']) -}} + {%- set ns_tr_out.flag = true -%} + {%- set ns.prev_message_type = 'tool_response' -%} + {%- endfor -%} + {%- elif message.get('tool_calls') -%} + {#- OpenAI Chat Completions: forward-scan consecutive role:tool messages -#} + {%- set ns_tool_scan = namespace(stopped=false) -%} + {%- for k in range(loop.index0 + 1, loop_messages | length) -%} + {%- if ns_tool_scan.stopped -%} + {%- elif loop_messages[k]['role'] != 'tool' -%} + {%- set ns_tool_scan.stopped = true -%} + {%- else -%} + {%- set follow = loop_messages[k] -%} + {#- Resolve tool_call_id to function name -#} + {%- set ns_tname = namespace(name=follow.get('name') | default('unknown')) -%} + {%- for tc in message['tool_calls'] -%} + {%- if tc.get('id') == follow.get('tool_call_id') -%} + {%- set ns_tname.name = tc['function']['name'] -%} + {%- endif -%} + {%- endfor -%} + {#- Handle content as string or content-parts array -#} + {%- set tool_body = follow.get('content') -%} + {%- if tool_body is string -%} + {{- format_tool_response_block(ns_tname.name, tool_body) -}} + {%- elif tool_body is sequence and tool_body is not string -%} + {%- set ns_txt = namespace(s='') -%} + {%- for part in tool_body -%} + {%- if part.get('type') == 'text' -%} + {%- set ns_txt.s = ns_txt.s + (part.get('text') | default('')) -%} + {%- endif -%} + {%- endfor -%} + {{- format_tool_response_block(ns_tname.name, ns_txt.s) -}} + {%- for part in tool_body -%} + {%- if part.get('type') == 'image' -%} + {{- '<|image|>' -}} + {%- elif part.get('type') == 'audio' -%} + {{- '<|audio|>' -}} + {%- elif part.get('type') == 'video' -%} + {{- '<|video|>' -}} + {%- endif -%} + {%- endfor -%} + {%- else -%} + {{- format_tool_response_block(ns_tname.name, tool_body) -}} + {%- endif -%} + {%- set ns_tr_out.flag = true -%} + {%- set ns.prev_message_type = 'tool_response' -%} + {%- endif -%} + {%- endfor -%} + {%- endif -%} + + {%- set captured_content -%} + {%- if message['content'] is string -%} + {%- if role == 'model' -%} + {{- strip_thinking(message['content']) -}} + {%- else -%} + {{- message['content'] | trim -}} + {%- endif -%} + {%- elif message['content'] is sequence -%} + {%- for item in message['content'] -%} + {%- if item['type'] == 'text' -%} + {%- if role == 'model' -%} + {{- strip_thinking(item['text']) -}} + {%- else -%} + {{- item['text'] | trim -}} + {%- endif -%} + {%- elif item['type'] == 'image' -%} + {{- '<|image|>' -}} + {%- set ns.prev_message_type = 'image' -%} + {%- elif item['type'] == 'audio' -%} + {{- '<|audio|>' -}} + {%- set ns.prev_message_type = 'audio' -%} + {%- elif item['type'] == 'video' -%} + {{- '<|video|>' -}} + {%- set ns.prev_message_type = 'video' -%} + {%- endif -%} + {%- endfor -%} + {%- endif -%} + {%- endset -%} + + {{- captured_content -}} + {%- set has_content = captured_content | trim | length > 0 -%} + + {%- if ns.prev_message_type == 'tool_call' and not ns_tr_out.flag -%} + {{- '<|tool_response>' -}} + {%- elif not (ns_tr_out.flag and not has_content) -%} + {{- '\n' -}} + {%- endif -%} + {%- endif -%} +{%- endfor -%} + +{%- if add_generation_prompt -%} + {%- if ns.prev_message_type != 'tool_response' and ns.prev_message_type != 'tool_call' -%} + {{- '<|turn>model\n' -}} + {%- if not enable_thinking | default(false) -%} + {{- '<|channel>thought\n' -}} + {%- endif -%} + {%- endif -%} +{%- endif -%} \ No newline at end of file diff --git a/chat/mlx/mlx-community/gemma-4-26b-a4b-it-4bit/config.json b/chat/mlx/mlx-community/gemma-4-26b-a4b-it-4bit/config.json new file mode 100644 index 0000000..b9fdfd6 --- /dev/null +++ b/chat/mlx/mlx-community/gemma-4-26b-a4b-it-4bit/config.json @@ -0,0 +1,1117 @@ +{ + "architectures": [ + "Gemma4ForConditionalGeneration" + ], + "audio_config": null, + "audio_token_id": 258881, + "boa_token_id": 256000, + "boi_token_id": 255999, + "dtype": "bfloat16", + "eoa_token_id": 258883, + "eoa_token_index": 258883, + "eoi_token_id": 258882, + "eos_token_id": [ + 1, + 106, + 50 + ], + "image_token_id": 258880, + "initializer_range": 0.02, + "model_type": "gemma4", + "quantization": { + "group_size": 64, + "bits": 4, + "mode": "affine", + "language_model.model.layers.0.mlp.gate_proj": { + "group_size": 64, + "bits": 8 + }, + "language_model.model.layers.0.mlp.down_proj": { + "group_size": 64, + "bits": 8 + }, + "language_model.model.layers.0.mlp.up_proj": { + "group_size": 64, + "bits": 8 + }, + "language_model.model.layers.0.router.proj": { + "group_size": 64, + "bits": 8 + }, + "language_model.model.layers.1.mlp.gate_proj": { + "group_size": 64, + "bits": 8 + }, + "language_model.model.layers.1.mlp.down_proj": { + "group_size": 64, + "bits": 8 + }, + "language_model.model.layers.1.mlp.up_proj": { + "group_size": 64, + "bits": 8 + }, + "language_model.model.layers.1.router.proj": { + "group_size": 64, + "bits": 8 + }, + "language_model.model.layers.2.mlp.gate_proj": { + "group_size": 64, + "bits": 8 + }, + "language_model.model.layers.2.mlp.down_proj": { + "group_size": 64, + "bits": 8 + }, + "language_model.model.layers.2.mlp.up_proj": { + "group_size": 64, + "bits": 8 + }, + "language_model.model.layers.2.router.proj": { + "group_size": 64, + "bits": 8 + }, + "language_model.model.layers.3.mlp.gate_proj": { + "group_size": 64, + "bits": 8 + }, + "language_model.model.layers.3.mlp.down_proj": { + "group_size": 64, + "bits": 8 + }, + "language_model.model.layers.3.mlp.up_proj": { + "group_size": 64, + "bits": 8 + }, + "language_model.model.layers.3.router.proj": { + "group_size": 64, + "bits": 8 + }, + "language_model.model.layers.4.mlp.gate_proj": { + "group_size": 64, + "bits": 8 + }, + "language_model.model.layers.4.mlp.down_proj": { + "group_size": 64, + "bits": 8 + }, + "language_model.model.layers.4.mlp.up_proj": { + "group_size": 64, + "bits": 8 + }, + "language_model.model.layers.4.router.proj": { + "group_size": 64, + "bits": 8 + }, + "language_model.model.layers.5.mlp.gate_proj": { + "group_size": 64, + "bits": 8 + }, + "language_model.model.layers.5.mlp.down_proj": { + "group_size": 64, + "bits": 8 + }, + "language_model.model.layers.5.mlp.up_proj": { + "group_size": 64, + "bits": 8 + }, + "language_model.model.layers.5.router.proj": { + "group_size": 64, + "bits": 8 + }, + "language_model.model.layers.6.mlp.gate_proj": { + "group_size": 64, + "bits": 8 + }, + "language_model.model.layers.6.mlp.down_proj": { + "group_size": 64, + "bits": 8 + }, + "language_model.model.layers.6.mlp.up_proj": { + "group_size": 64, + "bits": 8 + }, + "language_model.model.layers.6.router.proj": { + "group_size": 64, + "bits": 8 + }, + "language_model.model.layers.7.mlp.gate_proj": { + "group_size": 64, + "bits": 8 + }, + "language_model.model.layers.7.mlp.down_proj": { + "group_size": 64, + "bits": 8 + }, + "language_model.model.layers.7.mlp.up_proj": { + "group_size": 64, + "bits": 8 + }, + "language_model.model.layers.7.router.proj": { + "group_size": 64, + "bits": 8 + }, + "language_model.model.layers.8.mlp.gate_proj": { + "group_size": 64, + "bits": 8 + }, + "language_model.model.layers.8.mlp.down_proj": { + "group_size": 64, + "bits": 8 + }, + "language_model.model.layers.8.mlp.up_proj": { + "group_size": 64, + "bits": 8 + }, + "language_model.model.layers.8.router.proj": { + "group_size": 64, + "bits": 8 + }, + "language_model.model.layers.9.mlp.gate_proj": { + "group_size": 64, + "bits": 8 + }, + "language_model.model.layers.9.mlp.down_proj": { + "group_size": 64, + "bits": 8 + }, + "language_model.model.layers.9.mlp.up_proj": { + "group_size": 64, + "bits": 8 + }, + "language_model.model.layers.9.router.proj": { + "group_size": 64, + "bits": 8 + }, + "language_model.model.layers.10.mlp.gate_proj": { + "group_size": 64, + "bits": 8 + }, + "language_model.model.layers.10.mlp.down_proj": { + "group_size": 64, + "bits": 8 + }, + "language_model.model.layers.10.mlp.up_proj": { + "group_size": 64, + "bits": 8 + }, + "language_model.model.layers.10.router.proj": { + "group_size": 64, + "bits": 8 + }, + "language_model.model.layers.11.mlp.gate_proj": { + "group_size": 64, + "bits": 8 + }, + "language_model.model.layers.11.mlp.down_proj": { + "group_size": 64, + "bits": 8 + }, + "language_model.model.layers.11.mlp.up_proj": { + "group_size": 64, + "bits": 8 + }, + "language_model.model.layers.11.router.proj": { + "group_size": 64, + "bits": 8 + }, + "language_model.model.layers.12.mlp.gate_proj": { + "group_size": 64, + "bits": 8 + }, + "language_model.model.layers.12.mlp.down_proj": { + "group_size": 64, + "bits": 8 + }, + "language_model.model.layers.12.mlp.up_proj": { + "group_size": 64, + "bits": 8 + }, + "language_model.model.layers.12.router.proj": { + "group_size": 64, + "bits": 8 + }, + "language_model.model.layers.13.mlp.gate_proj": { + "group_size": 64, + "bits": 8 + }, + "language_model.model.layers.13.mlp.down_proj": { + "group_size": 64, + "bits": 8 + }, + "language_model.model.layers.13.mlp.up_proj": { + "group_size": 64, + "bits": 8 + }, + "language_model.model.layers.13.router.proj": { + "group_size": 64, + "bits": 8 + }, + "language_model.model.layers.14.mlp.gate_proj": { + "group_size": 64, + "bits": 8 + }, + "language_model.model.layers.14.mlp.down_proj": { + "group_size": 64, + "bits": 8 + }, + "language_model.model.layers.14.mlp.up_proj": { + "group_size": 64, + "bits": 8 + }, + "language_model.model.layers.14.router.proj": { + "group_size": 64, + "bits": 8 + }, + "language_model.model.layers.15.mlp.gate_proj": { + "group_size": 64, + "bits": 8 + }, + "language_model.model.layers.15.mlp.down_proj": { + "group_size": 64, + "bits": 8 + }, + "language_model.model.layers.15.mlp.up_proj": { + "group_size": 64, + "bits": 8 + }, + "language_model.model.layers.15.router.proj": { + "group_size": 64, + "bits": 8 + }, + "language_model.model.layers.16.mlp.gate_proj": { + "group_size": 64, + "bits": 8 + }, + "language_model.model.layers.16.mlp.down_proj": { + "group_size": 64, + "bits": 8 + }, + "language_model.model.layers.16.mlp.up_proj": { + "group_size": 64, + "bits": 8 + }, + "language_model.model.layers.16.router.proj": { + "group_size": 64, + "bits": 8 + }, + "language_model.model.layers.17.mlp.gate_proj": { + "group_size": 64, + "bits": 8 + }, + "language_model.model.layers.17.mlp.down_proj": { + "group_size": 64, + "bits": 8 + }, + "language_model.model.layers.17.mlp.up_proj": { + "group_size": 64, + "bits": 8 + }, + "language_model.model.layers.17.router.proj": { + "group_size": 64, + "bits": 8 + }, + "language_model.model.layers.18.mlp.gate_proj": { + "group_size": 64, + "bits": 8 + }, + "language_model.model.layers.18.mlp.down_proj": { + "group_size": 64, + "bits": 8 + }, + "language_model.model.layers.18.mlp.up_proj": { + "group_size": 64, + "bits": 8 + }, + "language_model.model.layers.18.router.proj": { + "group_size": 64, + "bits": 8 + }, + "language_model.model.layers.19.mlp.gate_proj": { + "group_size": 64, + "bits": 8 + }, + "language_model.model.layers.19.mlp.down_proj": { + "group_size": 64, + "bits": 8 + }, + "language_model.model.layers.19.mlp.up_proj": { + "group_size": 64, + "bits": 8 + }, + "language_model.model.layers.19.router.proj": { + "group_size": 64, + "bits": 8 + }, + "language_model.model.layers.20.mlp.gate_proj": { + "group_size": 64, + "bits": 8 + }, + "language_model.model.layers.20.mlp.down_proj": { + "group_size": 64, + "bits": 8 + }, + "language_model.model.layers.20.mlp.up_proj": { + "group_size": 64, + "bits": 8 + }, + "language_model.model.layers.20.router.proj": { + "group_size": 64, + "bits": 8 + }, + "language_model.model.layers.21.mlp.gate_proj": { + "group_size": 64, + "bits": 8 + }, + "language_model.model.layers.21.mlp.down_proj": { + "group_size": 64, + "bits": 8 + }, + "language_model.model.layers.21.mlp.up_proj": { + "group_size": 64, + "bits": 8 + }, + "language_model.model.layers.21.router.proj": { + "group_size": 64, + "bits": 8 + }, + "language_model.model.layers.22.mlp.gate_proj": { + "group_size": 64, + "bits": 8 + }, + "language_model.model.layers.22.mlp.down_proj": { + "group_size": 64, + "bits": 8 + }, + "language_model.model.layers.22.mlp.up_proj": { + "group_size": 64, + "bits": 8 + }, + "language_model.model.layers.22.router.proj": { + "group_size": 64, + "bits": 8 + }, + "language_model.model.layers.23.mlp.gate_proj": { + "group_size": 64, + "bits": 8 + }, + "language_model.model.layers.23.mlp.down_proj": { + "group_size": 64, + "bits": 8 + }, + "language_model.model.layers.23.mlp.up_proj": { + "group_size": 64, + "bits": 8 + }, + "language_model.model.layers.23.router.proj": { + "group_size": 64, + "bits": 8 + }, + "language_model.model.layers.24.mlp.gate_proj": { + "group_size": 64, + "bits": 8 + }, + "language_model.model.layers.24.mlp.down_proj": { + "group_size": 64, + "bits": 8 + }, + "language_model.model.layers.24.mlp.up_proj": { + "group_size": 64, + "bits": 8 + }, + "language_model.model.layers.24.router.proj": { + "group_size": 64, + "bits": 8 + }, + "language_model.model.layers.25.mlp.gate_proj": { + "group_size": 64, + "bits": 8 + }, + "language_model.model.layers.25.mlp.down_proj": { + "group_size": 64, + "bits": 8 + }, + "language_model.model.layers.25.mlp.up_proj": { + "group_size": 64, + "bits": 8 + }, + "language_model.model.layers.25.router.proj": { + "group_size": 64, + "bits": 8 + }, + "language_model.model.layers.26.mlp.gate_proj": { + "group_size": 64, + "bits": 8 + }, + "language_model.model.layers.26.mlp.down_proj": { + "group_size": 64, + "bits": 8 + }, + "language_model.model.layers.26.mlp.up_proj": { + "group_size": 64, + "bits": 8 + }, + "language_model.model.layers.26.router.proj": { + "group_size": 64, + "bits": 8 + }, + "language_model.model.layers.27.mlp.gate_proj": { + "group_size": 64, + "bits": 8 + }, + "language_model.model.layers.27.mlp.down_proj": { + "group_size": 64, + "bits": 8 + }, + "language_model.model.layers.27.mlp.up_proj": { + "group_size": 64, + "bits": 8 + }, + "language_model.model.layers.27.router.proj": { + "group_size": 64, + "bits": 8 + }, + "language_model.model.layers.28.mlp.gate_proj": { + "group_size": 64, + "bits": 8 + }, + "language_model.model.layers.28.mlp.down_proj": { + "group_size": 64, + "bits": 8 + }, + "language_model.model.layers.28.mlp.up_proj": { + "group_size": 64, + "bits": 8 + }, + "language_model.model.layers.28.router.proj": { + "group_size": 64, + "bits": 8 + }, + "language_model.model.layers.29.mlp.gate_proj": { + "group_size": 64, + "bits": 8 + }, + "language_model.model.layers.29.mlp.down_proj": { + "group_size": 64, + "bits": 8 + }, + "language_model.model.layers.29.mlp.up_proj": { + "group_size": 64, + "bits": 8 + }, + "language_model.model.layers.29.router.proj": { + "group_size": 64, + "bits": 8 + } + }, + "quantization_config": { + "group_size": 64, + "bits": 4, + "mode": "affine", + "language_model.model.layers.0.mlp.gate_proj": { + "group_size": 64, + "bits": 8 + }, + "language_model.model.layers.0.mlp.down_proj": { + "group_size": 64, + "bits": 8 + }, + "language_model.model.layers.0.mlp.up_proj": { + "group_size": 64, + "bits": 8 + }, + "language_model.model.layers.0.router.proj": { + "group_size": 64, + "bits": 8 + }, + "language_model.model.layers.1.mlp.gate_proj": { + "group_size": 64, + "bits": 8 + }, + "language_model.model.layers.1.mlp.down_proj": { + "group_size": 64, + "bits": 8 + }, + "language_model.model.layers.1.mlp.up_proj": { + "group_size": 64, + "bits": 8 + }, + "language_model.model.layers.1.router.proj": { + "group_size": 64, + "bits": 8 + }, + "language_model.model.layers.2.mlp.gate_proj": { + "group_size": 64, + "bits": 8 + }, + "language_model.model.layers.2.mlp.down_proj": { + "group_size": 64, + "bits": 8 + }, + "language_model.model.layers.2.mlp.up_proj": { + "group_size": 64, + "bits": 8 + }, + "language_model.model.layers.2.router.proj": { + "group_size": 64, + "bits": 8 + }, + "language_model.model.layers.3.mlp.gate_proj": { + "group_size": 64, + "bits": 8 + }, + "language_model.model.layers.3.mlp.down_proj": { + "group_size": 64, + "bits": 8 + }, + "language_model.model.layers.3.mlp.up_proj": { + "group_size": 64, + "bits": 8 + }, + "language_model.model.layers.3.router.proj": { + "group_size": 64, + "bits": 8 + }, + "language_model.model.layers.4.mlp.gate_proj": { + "group_size": 64, + "bits": 8 + }, + "language_model.model.layers.4.mlp.down_proj": { + "group_size": 64, + "bits": 8 + }, + "language_model.model.layers.4.mlp.up_proj": { + "group_size": 64, + "bits": 8 + }, + "language_model.model.layers.4.router.proj": { + "group_size": 64, + "bits": 8 + }, + "language_model.model.layers.5.mlp.gate_proj": { + "group_size": 64, + "bits": 8 + }, + "language_model.model.layers.5.mlp.down_proj": { + "group_size": 64, + "bits": 8 + }, + "language_model.model.layers.5.mlp.up_proj": { + "group_size": 64, + "bits": 8 + }, + "language_model.model.layers.5.router.proj": { + "group_size": 64, + "bits": 8 + }, + "language_model.model.layers.6.mlp.gate_proj": { + "group_size": 64, + "bits": 8 + }, + "language_model.model.layers.6.mlp.down_proj": { + "group_size": 64, + "bits": 8 + }, + "language_model.model.layers.6.mlp.up_proj": { + "group_size": 64, + "bits": 8 + }, + "language_model.model.layers.6.router.proj": { + "group_size": 64, + "bits": 8 + }, + "language_model.model.layers.7.mlp.gate_proj": { + "group_size": 64, + "bits": 8 + }, + "language_model.model.layers.7.mlp.down_proj": { + "group_size": 64, + "bits": 8 + }, + "language_model.model.layers.7.mlp.up_proj": { + "group_size": 64, + "bits": 8 + }, + "language_model.model.layers.7.router.proj": { + "group_size": 64, + "bits": 8 + }, + "language_model.model.layers.8.mlp.gate_proj": { + "group_size": 64, + "bits": 8 + }, + "language_model.model.layers.8.mlp.down_proj": { + "group_size": 64, + "bits": 8 + }, + "language_model.model.layers.8.mlp.up_proj": { + "group_size": 64, + "bits": 8 + }, + "language_model.model.layers.8.router.proj": { + "group_size": 64, + "bits": 8 + }, + "language_model.model.layers.9.mlp.gate_proj": { + "group_size": 64, + "bits": 8 + }, + "language_model.model.layers.9.mlp.down_proj": { + "group_size": 64, + "bits": 8 + }, + "language_model.model.layers.9.mlp.up_proj": { + "group_size": 64, + "bits": 8 + }, + "language_model.model.layers.9.router.proj": { + "group_size": 64, + "bits": 8 + }, + "language_model.model.layers.10.mlp.gate_proj": { + "group_size": 64, + "bits": 8 + }, + "language_model.model.layers.10.mlp.down_proj": { + "group_size": 64, + "bits": 8 + }, + "language_model.model.layers.10.mlp.up_proj": { + "group_size": 64, + "bits": 8 + }, + "language_model.model.layers.10.router.proj": { + "group_size": 64, + "bits": 8 + }, + "language_model.model.layers.11.mlp.gate_proj": { + "group_size": 64, + "bits": 8 + }, + "language_model.model.layers.11.mlp.down_proj": { + "group_size": 64, + "bits": 8 + }, + "language_model.model.layers.11.mlp.up_proj": { + "group_size": 64, + "bits": 8 + }, + "language_model.model.layers.11.router.proj": { + "group_size": 64, + "bits": 8 + }, + "language_model.model.layers.12.mlp.gate_proj": { + "group_size": 64, + "bits": 8 + }, + "language_model.model.layers.12.mlp.down_proj": { + "group_size": 64, + "bits": 8 + }, + "language_model.model.layers.12.mlp.up_proj": { + "group_size": 64, + "bits": 8 + }, + "language_model.model.layers.12.router.proj": { + "group_size": 64, + "bits": 8 + }, + "language_model.model.layers.13.mlp.gate_proj": { + "group_size": 64, + "bits": 8 + }, + "language_model.model.layers.13.mlp.down_proj": { + "group_size": 64, + "bits": 8 + }, + "language_model.model.layers.13.mlp.up_proj": { + "group_size": 64, + "bits": 8 + }, + "language_model.model.layers.13.router.proj": { + "group_size": 64, + "bits": 8 + }, + "language_model.model.layers.14.mlp.gate_proj": { + "group_size": 64, + "bits": 8 + }, + "language_model.model.layers.14.mlp.down_proj": { + "group_size": 64, + "bits": 8 + }, + "language_model.model.layers.14.mlp.up_proj": { + "group_size": 64, + "bits": 8 + }, + "language_model.model.layers.14.router.proj": { + "group_size": 64, + "bits": 8 + }, + "language_model.model.layers.15.mlp.gate_proj": { + "group_size": 64, + "bits": 8 + }, + "language_model.model.layers.15.mlp.down_proj": { + "group_size": 64, + "bits": 8 + }, + "language_model.model.layers.15.mlp.up_proj": { + "group_size": 64, + "bits": 8 + }, + "language_model.model.layers.15.router.proj": { + "group_size": 64, + "bits": 8 + }, + "language_model.model.layers.16.mlp.gate_proj": { + "group_size": 64, + "bits": 8 + }, + "language_model.model.layers.16.mlp.down_proj": { + "group_size": 64, + "bits": 8 + }, + "language_model.model.layers.16.mlp.up_proj": { + "group_size": 64, + "bits": 8 + }, + "language_model.model.layers.16.router.proj": { + "group_size": 64, + "bits": 8 + }, + "language_model.model.layers.17.mlp.gate_proj": { + "group_size": 64, + "bits": 8 + }, + "language_model.model.layers.17.mlp.down_proj": { + "group_size": 64, + "bits": 8 + }, + "language_model.model.layers.17.mlp.up_proj": { + "group_size": 64, + "bits": 8 + }, + "language_model.model.layers.17.router.proj": { + "group_size": 64, + "bits": 8 + }, + "language_model.model.layers.18.mlp.gate_proj": { + "group_size": 64, + "bits": 8 + }, + "language_model.model.layers.18.mlp.down_proj": { + "group_size": 64, + "bits": 8 + }, + "language_model.model.layers.18.mlp.up_proj": { + "group_size": 64, + "bits": 8 + }, + "language_model.model.layers.18.router.proj": { + "group_size": 64, + "bits": 8 + }, + "language_model.model.layers.19.mlp.gate_proj": { + "group_size": 64, + "bits": 8 + }, + "language_model.model.layers.19.mlp.down_proj": { + "group_size": 64, + "bits": 8 + }, + "language_model.model.layers.19.mlp.up_proj": { + "group_size": 64, + "bits": 8 + }, + "language_model.model.layers.19.router.proj": { + "group_size": 64, + "bits": 8 + }, + "language_model.model.layers.20.mlp.gate_proj": { + "group_size": 64, + "bits": 8 + }, + "language_model.model.layers.20.mlp.down_proj": { + "group_size": 64, + "bits": 8 + }, + "language_model.model.layers.20.mlp.up_proj": { + "group_size": 64, + "bits": 8 + }, + "language_model.model.layers.20.router.proj": { + "group_size": 64, + "bits": 8 + }, + "language_model.model.layers.21.mlp.gate_proj": { + "group_size": 64, + "bits": 8 + }, + "language_model.model.layers.21.mlp.down_proj": { + "group_size": 64, + "bits": 8 + }, + "language_model.model.layers.21.mlp.up_proj": { + "group_size": 64, + "bits": 8 + }, + "language_model.model.layers.21.router.proj": { + "group_size": 64, + "bits": 8 + }, + "language_model.model.layers.22.mlp.gate_proj": { + "group_size": 64, + "bits": 8 + }, + "language_model.model.layers.22.mlp.down_proj": { + "group_size": 64, + "bits": 8 + }, + "language_model.model.layers.22.mlp.up_proj": { + "group_size": 64, + "bits": 8 + }, + "language_model.model.layers.22.router.proj": { + "group_size": 64, + "bits": 8 + }, + "language_model.model.layers.23.mlp.gate_proj": { + "group_size": 64, + "bits": 8 + }, + "language_model.model.layers.23.mlp.down_proj": { + "group_size": 64, + "bits": 8 + }, + "language_model.model.layers.23.mlp.up_proj": { + "group_size": 64, + "bits": 8 + }, + "language_model.model.layers.23.router.proj": { + "group_size": 64, + "bits": 8 + }, + "language_model.model.layers.24.mlp.gate_proj": { + "group_size": 64, + "bits": 8 + }, + "language_model.model.layers.24.mlp.down_proj": { + "group_size": 64, + "bits": 8 + }, + "language_model.model.layers.24.mlp.up_proj": { + "group_size": 64, + "bits": 8 + }, + "language_model.model.layers.24.router.proj": { + "group_size": 64, + "bits": 8 + }, + "language_model.model.layers.25.mlp.gate_proj": { + "group_size": 64, + "bits": 8 + }, + "language_model.model.layers.25.mlp.down_proj": { + "group_size": 64, + "bits": 8 + }, + "language_model.model.layers.25.mlp.up_proj": { + "group_size": 64, + "bits": 8 + }, + "language_model.model.layers.25.router.proj": { + "group_size": 64, + "bits": 8 + }, + "language_model.model.layers.26.mlp.gate_proj": { + "group_size": 64, + "bits": 8 + }, + "language_model.model.layers.26.mlp.down_proj": { + "group_size": 64, + "bits": 8 + }, + "language_model.model.layers.26.mlp.up_proj": { + "group_size": 64, + "bits": 8 + }, + "language_model.model.layers.26.router.proj": { + "group_size": 64, + "bits": 8 + }, + "language_model.model.layers.27.mlp.gate_proj": { + "group_size": 64, + "bits": 8 + }, + "language_model.model.layers.27.mlp.down_proj": { + "group_size": 64, + "bits": 8 + }, + "language_model.model.layers.27.mlp.up_proj": { + "group_size": 64, + "bits": 8 + }, + "language_model.model.layers.27.router.proj": { + "group_size": 64, + "bits": 8 + }, + "language_model.model.layers.28.mlp.gate_proj": { + "group_size": 64, + "bits": 8 + }, + "language_model.model.layers.28.mlp.down_proj": { + "group_size": 64, + "bits": 8 + }, + "language_model.model.layers.28.mlp.up_proj": { + "group_size": 64, + "bits": 8 + }, + "language_model.model.layers.28.router.proj": { + "group_size": 64, + "bits": 8 + }, + "language_model.model.layers.29.mlp.gate_proj": { + "group_size": 64, + "bits": 8 + }, + "language_model.model.layers.29.mlp.down_proj": { + "group_size": 64, + "bits": 8 + }, + "language_model.model.layers.29.mlp.up_proj": { + "group_size": 64, + "bits": 8 + }, + "language_model.model.layers.29.router.proj": { + "group_size": 64, + "bits": 8 + } + }, + "text_config": { + "attention_bias": false, + "attention_dropout": 0.0, + "attention_k_eq_v": true, + "bos_token_id": 2, + "dtype": "bfloat16", + "enable_moe_block": true, + "eos_token_id": 1, + "final_logit_softcapping": 30.0, + "global_head_dim": 512, + "head_dim": 256, + "hidden_activation": "gelu_pytorch_tanh", + "hidden_size": 2816, + "hidden_size_per_layer_input": 0, + "initializer_range": 0.02, + "intermediate_size": 2112, + "layer_types": [ + "sliding_attention", + "sliding_attention", + "sliding_attention", + "sliding_attention", + "sliding_attention", + "full_attention", + "sliding_attention", + "sliding_attention", + "sliding_attention", + "sliding_attention", + "sliding_attention", + "full_attention", + "sliding_attention", + "sliding_attention", + "sliding_attention", + "sliding_attention", + "sliding_attention", + "full_attention", + "sliding_attention", + "sliding_attention", + "sliding_attention", + "sliding_attention", + "sliding_attention", + "full_attention", + "sliding_attention", + "sliding_attention", + "sliding_attention", + "sliding_attention", + "sliding_attention", + "full_attention" + ], + "max_position_embeddings": 262144, + "model_type": "gemma4_text", + "moe_intermediate_size": 704, + "num_attention_heads": 16, + "num_experts": 128, + "num_global_key_value_heads": 2, + "num_hidden_layers": 30, + "num_key_value_heads": 8, + "num_kv_shared_layers": 0, + "pad_token_id": 0, + "rms_norm_eps": 1e-06, + "rope_parameters": { + "full_attention": { + "partial_rotary_factor": 0.25, + "rope_theta": 1000000.0, + "rope_type": "proportional" + }, + "sliding_attention": { + "rope_theta": 10000.0, + "rope_type": "default" + } + }, + "sliding_window": 1024, + "tie_word_embeddings": true, + "top_k_experts": 8, + "use_bidirectional_attention": "vision", + "use_cache": true, + "use_double_wide_mlp": false, + "vocab_size": 262144, + "vocab_size_per_layer_input": 262144 + }, + "tie_word_embeddings": true, + "transformers_version": "5.5.0.dev0", + "video_token_id": 258884, + "vision_config": { + "_name_or_path": "", + "architectures": null, + "attention_bias": false, + "attention_dropout": 0.0, + "chunk_size_feed_forward": 0, + "default_output_length": 280, + "dtype": "bfloat16", + "global_head_dim": 72, + "head_dim": 72, + "hidden_activation": "gelu_pytorch_tanh", + "hidden_size": 1152, + "id2label": { + "0": "LABEL_0", + "1": "LABEL_1" + }, + "initializer_range": 0.02, + "intermediate_size": 4304, + "is_encoder_decoder": false, + "label2id": { + "LABEL_0": 0, + "LABEL_1": 1 + }, + "max_position_embeddings": 131072, + "model_type": "gemma4_vision", + "num_attention_heads": 16, + "num_hidden_layers": 27, + "num_key_value_heads": 16, + "output_attentions": false, + "output_hidden_states": false, + "patch_size": 16, + "pooling_kernel_size": 3, + "position_embedding_size": 10240, + "problem_type": null, + "return_dict": true, + "rms_norm_eps": 1e-06, + "rope_parameters": { + "rope_theta": 100.0, + "rope_type": "default" + }, + "standardize": true, + "use_clipped_linears": false + }, + "vision_soft_tokens_per_image": 280 +} \ No newline at end of file diff --git a/chat/mlx/mlx-community/gemma-4-26b-a4b-it-4bit/generation_config.json b/chat/mlx/mlx-community/gemma-4-26b-a4b-it-4bit/generation_config.json new file mode 100644 index 0000000..e605bb4 --- /dev/null +++ b/chat/mlx/mlx-community/gemma-4-26b-a4b-it-4bit/generation_config.json @@ -0,0 +1,14 @@ +{ + "bos_token_id": 2, + "do_sample": true, + "eos_token_id": [ + 1, + 106, + 50 + ], + "pad_token_id": 0, + "temperature": 1.0, + "top_k": 64, + "top_p": 0.95, + "transformers_version": "5.5.0.dev0" +} diff --git a/chat/mlx/mlx-community/gemma-4-26b-a4b-it-4bit/model-00001-of-00003.safetensors b/chat/mlx/mlx-community/gemma-4-26b-a4b-it-4bit/model-00001-of-00003.safetensors new file mode 100644 index 0000000..8a3ab61 --- /dev/null +++ b/chat/mlx/mlx-community/gemma-4-26b-a4b-it-4bit/model-00001-of-00003.safetensors @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:6a6cba167e5c630a69b527b2b095c0da623507511e43c05a57c5527d9b66fa0d +size 5275612587 diff --git a/chat/mlx/mlx-community/gemma-4-26b-a4b-it-4bit/model-00002-of-00003.safetensors b/chat/mlx/mlx-community/gemma-4-26b-a4b-it-4bit/model-00002-of-00003.safetensors new file mode 100644 index 0000000..df970a5 --- /dev/null +++ b/chat/mlx/mlx-community/gemma-4-26b-a4b-it-4bit/model-00002-of-00003.safetensors @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:922461e4da8c9e3ae2dc5e4f0ccedf5a0259f1e81d3ebda20b3af39e28118f33 +size 5296718232 diff --git a/chat/mlx/mlx-community/gemma-4-26b-a4b-it-4bit/model-00003-of-00003.safetensors b/chat/mlx/mlx-community/gemma-4-26b-a4b-it-4bit/model-00003-of-00003.safetensors new file mode 100644 index 0000000..1812e88 --- /dev/null +++ b/chat/mlx/mlx-community/gemma-4-26b-a4b-it-4bit/model-00003-of-00003.safetensors @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:2e92af87837744c385101b71883b4af898be7a6ce03e5babca475899a8268347 +size 5036507755 diff --git a/chat/mlx/mlx-community/gemma-4-26b-a4b-it-4bit/model.safetensors.index.json b/chat/mlx/mlx-community/gemma-4-26b-a4b-it-4bit/model.safetensors.index.json new file mode 100644 index 0000000..ebc8565 --- /dev/null +++ b/chat/mlx/mlx-community/gemma-4-26b-a4b-it-4bit/model.safetensors.index.json @@ -0,0 +1,1704 @@ +{ + "metadata": { + "total_size": 15608614044 + }, + "weight_map": { + "embed_vision.embedding_projection.biases": "model-00003-of-00003.safetensors", + "embed_vision.embedding_projection.scales": "model-00003-of-00003.safetensors", + "embed_vision.embedding_projection.weight": "model-00003-of-00003.safetensors", + "language_model.model.embed_tokens.biases": "model-00001-of-00003.safetensors", + "language_model.model.embed_tokens.scales": "model-00001-of-00003.safetensors", + "language_model.model.embed_tokens.weight": "model-00001-of-00003.safetensors", + "language_model.model.layers.0.experts.switch_glu.down_proj.biases": "model-00001-of-00003.safetensors", + "language_model.model.layers.0.experts.switch_glu.down_proj.scales": "model-00001-of-00003.safetensors", + "language_model.model.layers.0.experts.switch_glu.down_proj.weight": "model-00001-of-00003.safetensors", + "language_model.model.layers.0.experts.switch_glu.gate_proj.biases": "model-00001-of-00003.safetensors", + "language_model.model.layers.0.experts.switch_glu.gate_proj.scales": "model-00001-of-00003.safetensors", + "language_model.model.layers.0.experts.switch_glu.gate_proj.weight": "model-00001-of-00003.safetensors", + "language_model.model.layers.0.experts.switch_glu.up_proj.biases": "model-00001-of-00003.safetensors", + "language_model.model.layers.0.experts.switch_glu.up_proj.scales": "model-00001-of-00003.safetensors", + "language_model.model.layers.0.experts.switch_glu.up_proj.weight": "model-00001-of-00003.safetensors", + "language_model.model.layers.0.input_layernorm.weight": "model-00001-of-00003.safetensors", + "language_model.model.layers.0.layer_scalar": "model-00001-of-00003.safetensors", + "language_model.model.layers.0.mlp.down_proj.biases": "model-00001-of-00003.safetensors", + "language_model.model.layers.0.mlp.down_proj.scales": "model-00001-of-00003.safetensors", + "language_model.model.layers.0.mlp.down_proj.weight": "model-00001-of-00003.safetensors", + "language_model.model.layers.0.mlp.gate_proj.biases": "model-00001-of-00003.safetensors", + "language_model.model.layers.0.mlp.gate_proj.scales": "model-00001-of-00003.safetensors", + "language_model.model.layers.0.mlp.gate_proj.weight": "model-00001-of-00003.safetensors", + "language_model.model.layers.0.mlp.up_proj.biases": "model-00001-of-00003.safetensors", + "language_model.model.layers.0.mlp.up_proj.scales": "model-00001-of-00003.safetensors", + "language_model.model.layers.0.mlp.up_proj.weight": "model-00001-of-00003.safetensors", + "language_model.model.layers.0.post_attention_layernorm.weight": "model-00001-of-00003.safetensors", + "language_model.model.layers.0.post_feedforward_layernorm.weight": "model-00001-of-00003.safetensors", + "language_model.model.layers.0.post_feedforward_layernorm_1.weight": "model-00001-of-00003.safetensors", + "language_model.model.layers.0.post_feedforward_layernorm_2.weight": "model-00001-of-00003.safetensors", + "language_model.model.layers.0.pre_feedforward_layernorm.weight": "model-00001-of-00003.safetensors", + "language_model.model.layers.0.pre_feedforward_layernorm_2.weight": "model-00001-of-00003.safetensors", + "language_model.model.layers.0.router.per_expert_scale": "model-00001-of-00003.safetensors", + "language_model.model.layers.0.router.proj.biases": "model-00001-of-00003.safetensors", + "language_model.model.layers.0.router.proj.scales": "model-00001-of-00003.safetensors", + "language_model.model.layers.0.router.proj.weight": "model-00001-of-00003.safetensors", + "language_model.model.layers.0.router.scale": "model-00001-of-00003.safetensors", + "language_model.model.layers.0.self_attn.k_norm.weight": "model-00001-of-00003.safetensors", + "language_model.model.layers.0.self_attn.k_proj.biases": "model-00001-of-00003.safetensors", + "language_model.model.layers.0.self_attn.k_proj.scales": "model-00001-of-00003.safetensors", + "language_model.model.layers.0.self_attn.k_proj.weight": "model-00001-of-00003.safetensors", + "language_model.model.layers.0.self_attn.o_proj.biases": "model-00001-of-00003.safetensors", + "language_model.model.layers.0.self_attn.o_proj.scales": "model-00001-of-00003.safetensors", + "language_model.model.layers.0.self_attn.o_proj.weight": "model-00001-of-00003.safetensors", + "language_model.model.layers.0.self_attn.q_norm.weight": "model-00001-of-00003.safetensors", + "language_model.model.layers.0.self_attn.q_proj.biases": "model-00001-of-00003.safetensors", + "language_model.model.layers.0.self_attn.q_proj.scales": "model-00001-of-00003.safetensors", + "language_model.model.layers.0.self_attn.q_proj.weight": "model-00001-of-00003.safetensors", + "language_model.model.layers.0.self_attn.v_proj.biases": "model-00001-of-00003.safetensors", + "language_model.model.layers.0.self_attn.v_proj.scales": "model-00001-of-00003.safetensors", + "language_model.model.layers.0.self_attn.v_proj.weight": "model-00001-of-00003.safetensors", + "language_model.model.layers.1.experts.switch_glu.down_proj.biases": "model-00001-of-00003.safetensors", + "language_model.model.layers.1.experts.switch_glu.down_proj.scales": "model-00001-of-00003.safetensors", + "language_model.model.layers.1.experts.switch_glu.down_proj.weight": "model-00001-of-00003.safetensors", + "language_model.model.layers.1.experts.switch_glu.gate_proj.biases": "model-00001-of-00003.safetensors", + "language_model.model.layers.1.experts.switch_glu.gate_proj.scales": "model-00001-of-00003.safetensors", + "language_model.model.layers.1.experts.switch_glu.gate_proj.weight": "model-00001-of-00003.safetensors", + "language_model.model.layers.1.experts.switch_glu.up_proj.biases": "model-00001-of-00003.safetensors", + "language_model.model.layers.1.experts.switch_glu.up_proj.scales": "model-00001-of-00003.safetensors", + "language_model.model.layers.1.experts.switch_glu.up_proj.weight": "model-00001-of-00003.safetensors", + "language_model.model.layers.1.input_layernorm.weight": "model-00001-of-00003.safetensors", + "language_model.model.layers.1.layer_scalar": "model-00001-of-00003.safetensors", + "language_model.model.layers.1.mlp.down_proj.biases": "model-00001-of-00003.safetensors", + "language_model.model.layers.1.mlp.down_proj.scales": "model-00001-of-00003.safetensors", + "language_model.model.layers.1.mlp.down_proj.weight": "model-00001-of-00003.safetensors", + "language_model.model.layers.1.mlp.gate_proj.biases": "model-00001-of-00003.safetensors", + "language_model.model.layers.1.mlp.gate_proj.scales": "model-00001-of-00003.safetensors", + "language_model.model.layers.1.mlp.gate_proj.weight": "model-00001-of-00003.safetensors", + "language_model.model.layers.1.mlp.up_proj.biases": "model-00001-of-00003.safetensors", + "language_model.model.layers.1.mlp.up_proj.scales": "model-00001-of-00003.safetensors", + "language_model.model.layers.1.mlp.up_proj.weight": "model-00001-of-00003.safetensors", + "language_model.model.layers.1.post_attention_layernorm.weight": "model-00001-of-00003.safetensors", + "language_model.model.layers.1.post_feedforward_layernorm.weight": "model-00001-of-00003.safetensors", + "language_model.model.layers.1.post_feedforward_layernorm_1.weight": "model-00001-of-00003.safetensors", + "language_model.model.layers.1.post_feedforward_layernorm_2.weight": "model-00001-of-00003.safetensors", + "language_model.model.layers.1.pre_feedforward_layernorm.weight": "model-00001-of-00003.safetensors", + "language_model.model.layers.1.pre_feedforward_layernorm_2.weight": "model-00001-of-00003.safetensors", + "language_model.model.layers.1.router.per_expert_scale": "model-00001-of-00003.safetensors", + "language_model.model.layers.1.router.proj.biases": "model-00001-of-00003.safetensors", + "language_model.model.layers.1.router.proj.scales": "model-00001-of-00003.safetensors", + "language_model.model.layers.1.router.proj.weight": "model-00001-of-00003.safetensors", + "language_model.model.layers.1.router.scale": "model-00001-of-00003.safetensors", + "language_model.model.layers.1.self_attn.k_norm.weight": "model-00001-of-00003.safetensors", + "language_model.model.layers.1.self_attn.k_proj.biases": "model-00001-of-00003.safetensors", + "language_model.model.layers.1.self_attn.k_proj.scales": "model-00001-of-00003.safetensors", + "language_model.model.layers.1.self_attn.k_proj.weight": "model-00001-of-00003.safetensors", + "language_model.model.layers.1.self_attn.o_proj.biases": "model-00001-of-00003.safetensors", + "language_model.model.layers.1.self_attn.o_proj.scales": "model-00001-of-00003.safetensors", + "language_model.model.layers.1.self_attn.o_proj.weight": "model-00001-of-00003.safetensors", + "language_model.model.layers.1.self_attn.q_norm.weight": "model-00001-of-00003.safetensors", + "language_model.model.layers.1.self_attn.q_proj.biases": "model-00001-of-00003.safetensors", + "language_model.model.layers.1.self_attn.q_proj.scales": "model-00001-of-00003.safetensors", + "language_model.model.layers.1.self_attn.q_proj.weight": "model-00001-of-00003.safetensors", + "language_model.model.layers.1.self_attn.v_proj.biases": "model-00001-of-00003.safetensors", + "language_model.model.layers.1.self_attn.v_proj.scales": "model-00001-of-00003.safetensors", + "language_model.model.layers.1.self_attn.v_proj.weight": "model-00001-of-00003.safetensors", + "language_model.model.layers.10.experts.switch_glu.down_proj.biases": "model-00002-of-00003.safetensors", + "language_model.model.layers.10.experts.switch_glu.down_proj.scales": "model-00002-of-00003.safetensors", + "language_model.model.layers.10.experts.switch_glu.down_proj.weight": "model-00002-of-00003.safetensors", + "language_model.model.layers.10.experts.switch_glu.gate_proj.biases": "model-00001-of-00003.safetensors", + "language_model.model.layers.10.experts.switch_glu.gate_proj.scales": "model-00001-of-00003.safetensors", + "language_model.model.layers.10.experts.switch_glu.gate_proj.weight": "model-00001-of-00003.safetensors", + "language_model.model.layers.10.experts.switch_glu.up_proj.biases": "model-00002-of-00003.safetensors", + "language_model.model.layers.10.experts.switch_glu.up_proj.scales": "model-00002-of-00003.safetensors", + "language_model.model.layers.10.experts.switch_glu.up_proj.weight": "model-00002-of-00003.safetensors", + "language_model.model.layers.10.input_layernorm.weight": "model-00001-of-00003.safetensors", + "language_model.model.layers.10.layer_scalar": "model-00002-of-00003.safetensors", + "language_model.model.layers.10.mlp.down_proj.biases": "model-00001-of-00003.safetensors", + "language_model.model.layers.10.mlp.down_proj.scales": "model-00001-of-00003.safetensors", + "language_model.model.layers.10.mlp.down_proj.weight": "model-00001-of-00003.safetensors", + "language_model.model.layers.10.mlp.gate_proj.biases": "model-00001-of-00003.safetensors", + "language_model.model.layers.10.mlp.gate_proj.scales": "model-00001-of-00003.safetensors", + "language_model.model.layers.10.mlp.gate_proj.weight": "model-00001-of-00003.safetensors", + "language_model.model.layers.10.mlp.up_proj.biases": "model-00001-of-00003.safetensors", + "language_model.model.layers.10.mlp.up_proj.scales": "model-00001-of-00003.safetensors", + "language_model.model.layers.10.mlp.up_proj.weight": "model-00001-of-00003.safetensors", + "language_model.model.layers.10.post_attention_layernorm.weight": "model-00001-of-00003.safetensors", + "language_model.model.layers.10.post_feedforward_layernorm.weight": "model-00001-of-00003.safetensors", + "language_model.model.layers.10.post_feedforward_layernorm_1.weight": "model-00002-of-00003.safetensors", + "language_model.model.layers.10.post_feedforward_layernorm_2.weight": "model-00002-of-00003.safetensors", + "language_model.model.layers.10.pre_feedforward_layernorm.weight": "model-00001-of-00003.safetensors", + "language_model.model.layers.10.pre_feedforward_layernorm_2.weight": "model-00002-of-00003.safetensors", + "language_model.model.layers.10.router.per_expert_scale": "model-00001-of-00003.safetensors", + "language_model.model.layers.10.router.proj.biases": "model-00001-of-00003.safetensors", + "language_model.model.layers.10.router.proj.scales": "model-00001-of-00003.safetensors", + "language_model.model.layers.10.router.proj.weight": "model-00001-of-00003.safetensors", + "language_model.model.layers.10.router.scale": "model-00001-of-00003.safetensors", + "language_model.model.layers.10.self_attn.k_norm.weight": "model-00001-of-00003.safetensors", + "language_model.model.layers.10.self_attn.k_proj.biases": "model-00001-of-00003.safetensors", + "language_model.model.layers.10.self_attn.k_proj.scales": "model-00001-of-00003.safetensors", + "language_model.model.layers.10.self_attn.k_proj.weight": "model-00001-of-00003.safetensors", + "language_model.model.layers.10.self_attn.o_proj.biases": "model-00001-of-00003.safetensors", + "language_model.model.layers.10.self_attn.o_proj.scales": "model-00001-of-00003.safetensors", + "language_model.model.layers.10.self_attn.o_proj.weight": "model-00001-of-00003.safetensors", + "language_model.model.layers.10.self_attn.q_norm.weight": "model-00001-of-00003.safetensors", + "language_model.model.layers.10.self_attn.q_proj.biases": "model-00001-of-00003.safetensors", + "language_model.model.layers.10.self_attn.q_proj.scales": "model-00001-of-00003.safetensors", + "language_model.model.layers.10.self_attn.q_proj.weight": "model-00001-of-00003.safetensors", + "language_model.model.layers.10.self_attn.v_proj.biases": "model-00001-of-00003.safetensors", + "language_model.model.layers.10.self_attn.v_proj.scales": "model-00001-of-00003.safetensors", + "language_model.model.layers.10.self_attn.v_proj.weight": "model-00001-of-00003.safetensors", + "language_model.model.layers.11.experts.switch_glu.down_proj.biases": "model-00002-of-00003.safetensors", + "language_model.model.layers.11.experts.switch_glu.down_proj.scales": "model-00002-of-00003.safetensors", + "language_model.model.layers.11.experts.switch_glu.down_proj.weight": "model-00002-of-00003.safetensors", + "language_model.model.layers.11.experts.switch_glu.gate_proj.biases": "model-00002-of-00003.safetensors", + "language_model.model.layers.11.experts.switch_glu.gate_proj.scales": "model-00002-of-00003.safetensors", + "language_model.model.layers.11.experts.switch_glu.gate_proj.weight": "model-00002-of-00003.safetensors", + "language_model.model.layers.11.experts.switch_glu.up_proj.biases": "model-00002-of-00003.safetensors", + "language_model.model.layers.11.experts.switch_glu.up_proj.scales": "model-00002-of-00003.safetensors", + "language_model.model.layers.11.experts.switch_glu.up_proj.weight": "model-00002-of-00003.safetensors", + "language_model.model.layers.11.input_layernorm.weight": "model-00002-of-00003.safetensors", + "language_model.model.layers.11.layer_scalar": "model-00002-of-00003.safetensors", + "language_model.model.layers.11.mlp.down_proj.biases": "model-00002-of-00003.safetensors", + "language_model.model.layers.11.mlp.down_proj.scales": "model-00002-of-00003.safetensors", + "language_model.model.layers.11.mlp.down_proj.weight": "model-00002-of-00003.safetensors", + "language_model.model.layers.11.mlp.gate_proj.biases": "model-00002-of-00003.safetensors", + "language_model.model.layers.11.mlp.gate_proj.scales": "model-00002-of-00003.safetensors", + "language_model.model.layers.11.mlp.gate_proj.weight": "model-00002-of-00003.safetensors", + "language_model.model.layers.11.mlp.up_proj.biases": "model-00002-of-00003.safetensors", + "language_model.model.layers.11.mlp.up_proj.scales": "model-00002-of-00003.safetensors", + "language_model.model.layers.11.mlp.up_proj.weight": "model-00002-of-00003.safetensors", + "language_model.model.layers.11.post_attention_layernorm.weight": "model-00002-of-00003.safetensors", + "language_model.model.layers.11.post_feedforward_layernorm.weight": "model-00002-of-00003.safetensors", + "language_model.model.layers.11.post_feedforward_layernorm_1.weight": "model-00002-of-00003.safetensors", + "language_model.model.layers.11.post_feedforward_layernorm_2.weight": "model-00002-of-00003.safetensors", + "language_model.model.layers.11.pre_feedforward_layernorm.weight": "model-00002-of-00003.safetensors", + "language_model.model.layers.11.pre_feedforward_layernorm_2.weight": "model-00002-of-00003.safetensors", + "language_model.model.layers.11.router.per_expert_scale": "model-00002-of-00003.safetensors", + "language_model.model.layers.11.router.proj.biases": "model-00002-of-00003.safetensors", + "language_model.model.layers.11.router.proj.scales": "model-00002-of-00003.safetensors", + "language_model.model.layers.11.router.proj.weight": "model-00002-of-00003.safetensors", + "language_model.model.layers.11.router.scale": "model-00002-of-00003.safetensors", + "language_model.model.layers.11.self_attn.k_norm.weight": "model-00002-of-00003.safetensors", + "language_model.model.layers.11.self_attn.k_proj.biases": "model-00002-of-00003.safetensors", + "language_model.model.layers.11.self_attn.k_proj.scales": "model-00002-of-00003.safetensors", + "language_model.model.layers.11.self_attn.k_proj.weight": "model-00002-of-00003.safetensors", + "language_model.model.layers.11.self_attn.o_proj.biases": "model-00002-of-00003.safetensors", + "language_model.model.layers.11.self_attn.o_proj.scales": "model-00002-of-00003.safetensors", + "language_model.model.layers.11.self_attn.o_proj.weight": "model-00002-of-00003.safetensors", + "language_model.model.layers.11.self_attn.q_norm.weight": "model-00002-of-00003.safetensors", + "language_model.model.layers.11.self_attn.q_proj.biases": "model-00002-of-00003.safetensors", + "language_model.model.layers.11.self_attn.q_proj.scales": "model-00002-of-00003.safetensors", + "language_model.model.layers.11.self_attn.q_proj.weight": "model-00002-of-00003.safetensors", + "language_model.model.layers.12.experts.switch_glu.down_proj.biases": "model-00002-of-00003.safetensors", + "language_model.model.layers.12.experts.switch_glu.down_proj.scales": "model-00002-of-00003.safetensors", + "language_model.model.layers.12.experts.switch_glu.down_proj.weight": "model-00002-of-00003.safetensors", + "language_model.model.layers.12.experts.switch_glu.gate_proj.biases": "model-00002-of-00003.safetensors", + "language_model.model.layers.12.experts.switch_glu.gate_proj.scales": "model-00002-of-00003.safetensors", + "language_model.model.layers.12.experts.switch_glu.gate_proj.weight": "model-00002-of-00003.safetensors", + "language_model.model.layers.12.experts.switch_glu.up_proj.biases": "model-00002-of-00003.safetensors", + "language_model.model.layers.12.experts.switch_glu.up_proj.scales": "model-00002-of-00003.safetensors", + "language_model.model.layers.12.experts.switch_glu.up_proj.weight": "model-00002-of-00003.safetensors", + "language_model.model.layers.12.input_layernorm.weight": "model-00002-of-00003.safetensors", + "language_model.model.layers.12.layer_scalar": "model-00002-of-00003.safetensors", + "language_model.model.layers.12.mlp.down_proj.biases": "model-00002-of-00003.safetensors", + "language_model.model.layers.12.mlp.down_proj.scales": "model-00002-of-00003.safetensors", + "language_model.model.layers.12.mlp.down_proj.weight": "model-00002-of-00003.safetensors", + "language_model.model.layers.12.mlp.gate_proj.biases": "model-00002-of-00003.safetensors", + "language_model.model.layers.12.mlp.gate_proj.scales": "model-00002-of-00003.safetensors", + "language_model.model.layers.12.mlp.gate_proj.weight": "model-00002-of-00003.safetensors", + "language_model.model.layers.12.mlp.up_proj.biases": "model-00002-of-00003.safetensors", + "language_model.model.layers.12.mlp.up_proj.scales": "model-00002-of-00003.safetensors", + "language_model.model.layers.12.mlp.up_proj.weight": "model-00002-of-00003.safetensors", + "language_model.model.layers.12.post_attention_layernorm.weight": "model-00002-of-00003.safetensors", + "language_model.model.layers.12.post_feedforward_layernorm.weight": "model-00002-of-00003.safetensors", + "language_model.model.layers.12.post_feedforward_layernorm_1.weight": "model-00002-of-00003.safetensors", + "language_model.model.layers.12.post_feedforward_layernorm_2.weight": "model-00002-of-00003.safetensors", + "language_model.model.layers.12.pre_feedforward_layernorm.weight": "model-00002-of-00003.safetensors", + "language_model.model.layers.12.pre_feedforward_layernorm_2.weight": "model-00002-of-00003.safetensors", + "language_model.model.layers.12.router.per_expert_scale": "model-00002-of-00003.safetensors", + "language_model.model.layers.12.router.proj.biases": "model-00002-of-00003.safetensors", + "language_model.model.layers.12.router.proj.scales": "model-00002-of-00003.safetensors", + "language_model.model.layers.12.router.proj.weight": "model-00002-of-00003.safetensors", + "language_model.model.layers.12.router.scale": "model-00002-of-00003.safetensors", + "language_model.model.layers.12.self_attn.k_norm.weight": "model-00002-of-00003.safetensors", + "language_model.model.layers.12.self_attn.k_proj.biases": "model-00002-of-00003.safetensors", + "language_model.model.layers.12.self_attn.k_proj.scales": "model-00002-of-00003.safetensors", + "language_model.model.layers.12.self_attn.k_proj.weight": "model-00002-of-00003.safetensors", + "language_model.model.layers.12.self_attn.o_proj.biases": "model-00002-of-00003.safetensors", + "language_model.model.layers.12.self_attn.o_proj.scales": "model-00002-of-00003.safetensors", + "language_model.model.layers.12.self_attn.o_proj.weight": "model-00002-of-00003.safetensors", + "language_model.model.layers.12.self_attn.q_norm.weight": "model-00002-of-00003.safetensors", + "language_model.model.layers.12.self_attn.q_proj.biases": "model-00002-of-00003.safetensors", + "language_model.model.layers.12.self_attn.q_proj.scales": "model-00002-of-00003.safetensors", + "language_model.model.layers.12.self_attn.q_proj.weight": "model-00002-of-00003.safetensors", + "language_model.model.layers.12.self_attn.v_proj.biases": "model-00002-of-00003.safetensors", + "language_model.model.layers.12.self_attn.v_proj.scales": "model-00002-of-00003.safetensors", + "language_model.model.layers.12.self_attn.v_proj.weight": "model-00002-of-00003.safetensors", + "language_model.model.layers.13.experts.switch_glu.down_proj.biases": "model-00002-of-00003.safetensors", + "language_model.model.layers.13.experts.switch_glu.down_proj.scales": "model-00002-of-00003.safetensors", + "language_model.model.layers.13.experts.switch_glu.down_proj.weight": "model-00002-of-00003.safetensors", + "language_model.model.layers.13.experts.switch_glu.gate_proj.biases": "model-00002-of-00003.safetensors", + "language_model.model.layers.13.experts.switch_glu.gate_proj.scales": "model-00002-of-00003.safetensors", + "language_model.model.layers.13.experts.switch_glu.gate_proj.weight": "model-00002-of-00003.safetensors", + "language_model.model.layers.13.experts.switch_glu.up_proj.biases": "model-00002-of-00003.safetensors", + "language_model.model.layers.13.experts.switch_glu.up_proj.scales": "model-00002-of-00003.safetensors", + "language_model.model.layers.13.experts.switch_glu.up_proj.weight": "model-00002-of-00003.safetensors", + "language_model.model.layers.13.input_layernorm.weight": "model-00002-of-00003.safetensors", + "language_model.model.layers.13.layer_scalar": "model-00002-of-00003.safetensors", + "language_model.model.layers.13.mlp.down_proj.biases": "model-00002-of-00003.safetensors", + "language_model.model.layers.13.mlp.down_proj.scales": "model-00002-of-00003.safetensors", + "language_model.model.layers.13.mlp.down_proj.weight": "model-00002-of-00003.safetensors", + "language_model.model.layers.13.mlp.gate_proj.biases": "model-00002-of-00003.safetensors", + "language_model.model.layers.13.mlp.gate_proj.scales": "model-00002-of-00003.safetensors", + "language_model.model.layers.13.mlp.gate_proj.weight": "model-00002-of-00003.safetensors", + "language_model.model.layers.13.mlp.up_proj.biases": "model-00002-of-00003.safetensors", + "language_model.model.layers.13.mlp.up_proj.scales": "model-00002-of-00003.safetensors", + "language_model.model.layers.13.mlp.up_proj.weight": "model-00002-of-00003.safetensors", + "language_model.model.layers.13.post_attention_layernorm.weight": "model-00002-of-00003.safetensors", + "language_model.model.layers.13.post_feedforward_layernorm.weight": "model-00002-of-00003.safetensors", + "language_model.model.layers.13.post_feedforward_layernorm_1.weight": "model-00002-of-00003.safetensors", + "language_model.model.layers.13.post_feedforward_layernorm_2.weight": "model-00002-of-00003.safetensors", + "language_model.model.layers.13.pre_feedforward_layernorm.weight": "model-00002-of-00003.safetensors", + "language_model.model.layers.13.pre_feedforward_layernorm_2.weight": "model-00002-of-00003.safetensors", + "language_model.model.layers.13.router.per_expert_scale": "model-00002-of-00003.safetensors", + "language_model.model.layers.13.router.proj.biases": "model-00002-of-00003.safetensors", + "language_model.model.layers.13.router.proj.scales": "model-00002-of-00003.safetensors", + "language_model.model.layers.13.router.proj.weight": "model-00002-of-00003.safetensors", + "language_model.model.layers.13.router.scale": "model-00002-of-00003.safetensors", + "language_model.model.layers.13.self_attn.k_norm.weight": "model-00002-of-00003.safetensors", + "language_model.model.layers.13.self_attn.k_proj.biases": "model-00002-of-00003.safetensors", + "language_model.model.layers.13.self_attn.k_proj.scales": "model-00002-of-00003.safetensors", + "language_model.model.layers.13.self_attn.k_proj.weight": "model-00002-of-00003.safetensors", + "language_model.model.layers.13.self_attn.o_proj.biases": "model-00002-of-00003.safetensors", + "language_model.model.layers.13.self_attn.o_proj.scales": "model-00002-of-00003.safetensors", + "language_model.model.layers.13.self_attn.o_proj.weight": "model-00002-of-00003.safetensors", + "language_model.model.layers.13.self_attn.q_norm.weight": "model-00002-of-00003.safetensors", + "language_model.model.layers.13.self_attn.q_proj.biases": "model-00002-of-00003.safetensors", + "language_model.model.layers.13.self_attn.q_proj.scales": "model-00002-of-00003.safetensors", + "language_model.model.layers.13.self_attn.q_proj.weight": "model-00002-of-00003.safetensors", + "language_model.model.layers.13.self_attn.v_proj.biases": "model-00002-of-00003.safetensors", + "language_model.model.layers.13.self_attn.v_proj.scales": "model-00002-of-00003.safetensors", + "language_model.model.layers.13.self_attn.v_proj.weight": "model-00002-of-00003.safetensors", + "language_model.model.layers.14.experts.switch_glu.down_proj.biases": "model-00002-of-00003.safetensors", + "language_model.model.layers.14.experts.switch_glu.down_proj.scales": "model-00002-of-00003.safetensors", + "language_model.model.layers.14.experts.switch_glu.down_proj.weight": "model-00002-of-00003.safetensors", + "language_model.model.layers.14.experts.switch_glu.gate_proj.biases": "model-00002-of-00003.safetensors", + "language_model.model.layers.14.experts.switch_glu.gate_proj.scales": "model-00002-of-00003.safetensors", + "language_model.model.layers.14.experts.switch_glu.gate_proj.weight": "model-00002-of-00003.safetensors", + "language_model.model.layers.14.experts.switch_glu.up_proj.biases": "model-00002-of-00003.safetensors", + "language_model.model.layers.14.experts.switch_glu.up_proj.scales": "model-00002-of-00003.safetensors", + "language_model.model.layers.14.experts.switch_glu.up_proj.weight": "model-00002-of-00003.safetensors", + "language_model.model.layers.14.input_layernorm.weight": "model-00002-of-00003.safetensors", + "language_model.model.layers.14.layer_scalar": "model-00002-of-00003.safetensors", + "language_model.model.layers.14.mlp.down_proj.biases": "model-00002-of-00003.safetensors", + "language_model.model.layers.14.mlp.down_proj.scales": "model-00002-of-00003.safetensors", + "language_model.model.layers.14.mlp.down_proj.weight": "model-00002-of-00003.safetensors", + "language_model.model.layers.14.mlp.gate_proj.biases": "model-00002-of-00003.safetensors", + "language_model.model.layers.14.mlp.gate_proj.scales": "model-00002-of-00003.safetensors", + "language_model.model.layers.14.mlp.gate_proj.weight": "model-00002-of-00003.safetensors", + "language_model.model.layers.14.mlp.up_proj.biases": "model-00002-of-00003.safetensors", + "language_model.model.layers.14.mlp.up_proj.scales": "model-00002-of-00003.safetensors", + "language_model.model.layers.14.mlp.up_proj.weight": "model-00002-of-00003.safetensors", + "language_model.model.layers.14.post_attention_layernorm.weight": "model-00002-of-00003.safetensors", + "language_model.model.layers.14.post_feedforward_layernorm.weight": "model-00002-of-00003.safetensors", + "language_model.model.layers.14.post_feedforward_layernorm_1.weight": "model-00002-of-00003.safetensors", + "language_model.model.layers.14.post_feedforward_layernorm_2.weight": "model-00002-of-00003.safetensors", + "language_model.model.layers.14.pre_feedforward_layernorm.weight": "model-00002-of-00003.safetensors", + "language_model.model.layers.14.pre_feedforward_layernorm_2.weight": "model-00002-of-00003.safetensors", + "language_model.model.layers.14.router.per_expert_scale": "model-00002-of-00003.safetensors", + "language_model.model.layers.14.router.proj.biases": "model-00002-of-00003.safetensors", + "language_model.model.layers.14.router.proj.scales": "model-00002-of-00003.safetensors", + "language_model.model.layers.14.router.proj.weight": "model-00002-of-00003.safetensors", + "language_model.model.layers.14.router.scale": "model-00002-of-00003.safetensors", + "language_model.model.layers.14.self_attn.k_norm.weight": "model-00002-of-00003.safetensors", + "language_model.model.layers.14.self_attn.k_proj.biases": "model-00002-of-00003.safetensors", + "language_model.model.layers.14.self_attn.k_proj.scales": "model-00002-of-00003.safetensors", + "language_model.model.layers.14.self_attn.k_proj.weight": "model-00002-of-00003.safetensors", + "language_model.model.layers.14.self_attn.o_proj.biases": "model-00002-of-00003.safetensors", + "language_model.model.layers.14.self_attn.o_proj.scales": "model-00002-of-00003.safetensors", + "language_model.model.layers.14.self_attn.o_proj.weight": "model-00002-of-00003.safetensors", + "language_model.model.layers.14.self_attn.q_norm.weight": "model-00002-of-00003.safetensors", + "language_model.model.layers.14.self_attn.q_proj.biases": "model-00002-of-00003.safetensors", + "language_model.model.layers.14.self_attn.q_proj.scales": "model-00002-of-00003.safetensors", + "language_model.model.layers.14.self_attn.q_proj.weight": "model-00002-of-00003.safetensors", + "language_model.model.layers.14.self_attn.v_proj.biases": "model-00002-of-00003.safetensors", + "language_model.model.layers.14.self_attn.v_proj.scales": "model-00002-of-00003.safetensors", + "language_model.model.layers.14.self_attn.v_proj.weight": "model-00002-of-00003.safetensors", + "language_model.model.layers.15.experts.switch_glu.down_proj.biases": "model-00002-of-00003.safetensors", + "language_model.model.layers.15.experts.switch_glu.down_proj.scales": "model-00002-of-00003.safetensors", + "language_model.model.layers.15.experts.switch_glu.down_proj.weight": "model-00002-of-00003.safetensors", + "language_model.model.layers.15.experts.switch_glu.gate_proj.biases": "model-00002-of-00003.safetensors", + "language_model.model.layers.15.experts.switch_glu.gate_proj.scales": "model-00002-of-00003.safetensors", + "language_model.model.layers.15.experts.switch_glu.gate_proj.weight": "model-00002-of-00003.safetensors", + "language_model.model.layers.15.experts.switch_glu.up_proj.biases": "model-00002-of-00003.safetensors", + "language_model.model.layers.15.experts.switch_glu.up_proj.scales": "model-00002-of-00003.safetensors", + "language_model.model.layers.15.experts.switch_glu.up_proj.weight": "model-00002-of-00003.safetensors", + "language_model.model.layers.15.input_layernorm.weight": "model-00002-of-00003.safetensors", + "language_model.model.layers.15.layer_scalar": "model-00002-of-00003.safetensors", + "language_model.model.layers.15.mlp.down_proj.biases": "model-00002-of-00003.safetensors", + "language_model.model.layers.15.mlp.down_proj.scales": "model-00002-of-00003.safetensors", + "language_model.model.layers.15.mlp.down_proj.weight": "model-00002-of-00003.safetensors", + "language_model.model.layers.15.mlp.gate_proj.biases": "model-00002-of-00003.safetensors", + "language_model.model.layers.15.mlp.gate_proj.scales": "model-00002-of-00003.safetensors", + "language_model.model.layers.15.mlp.gate_proj.weight": "model-00002-of-00003.safetensors", + "language_model.model.layers.15.mlp.up_proj.biases": "model-00002-of-00003.safetensors", + "language_model.model.layers.15.mlp.up_proj.scales": "model-00002-of-00003.safetensors", + "language_model.model.layers.15.mlp.up_proj.weight": "model-00002-of-00003.safetensors", + "language_model.model.layers.15.post_attention_layernorm.weight": "model-00002-of-00003.safetensors", + "language_model.model.layers.15.post_feedforward_layernorm.weight": "model-00002-of-00003.safetensors", + "language_model.model.layers.15.post_feedforward_layernorm_1.weight": "model-00002-of-00003.safetensors", + "language_model.model.layers.15.post_feedforward_layernorm_2.weight": "model-00002-of-00003.safetensors", + "language_model.model.layers.15.pre_feedforward_layernorm.weight": "model-00002-of-00003.safetensors", + "language_model.model.layers.15.pre_feedforward_layernorm_2.weight": "model-00002-of-00003.safetensors", + "language_model.model.layers.15.router.per_expert_scale": "model-00002-of-00003.safetensors", + "language_model.model.layers.15.router.proj.biases": "model-00002-of-00003.safetensors", + "language_model.model.layers.15.router.proj.scales": "model-00002-of-00003.safetensors", + "language_model.model.layers.15.router.proj.weight": "model-00002-of-00003.safetensors", + "language_model.model.layers.15.router.scale": "model-00002-of-00003.safetensors", + "language_model.model.layers.15.self_attn.k_norm.weight": "model-00002-of-00003.safetensors", + "language_model.model.layers.15.self_attn.k_proj.biases": "model-00002-of-00003.safetensors", + "language_model.model.layers.15.self_attn.k_proj.scales": "model-00002-of-00003.safetensors", + "language_model.model.layers.15.self_attn.k_proj.weight": "model-00002-of-00003.safetensors", + "language_model.model.layers.15.self_attn.o_proj.biases": "model-00002-of-00003.safetensors", + "language_model.model.layers.15.self_attn.o_proj.scales": "model-00002-of-00003.safetensors", + "language_model.model.layers.15.self_attn.o_proj.weight": "model-00002-of-00003.safetensors", + "language_model.model.layers.15.self_attn.q_norm.weight": "model-00002-of-00003.safetensors", + "language_model.model.layers.15.self_attn.q_proj.biases": "model-00002-of-00003.safetensors", + "language_model.model.layers.15.self_attn.q_proj.scales": "model-00002-of-00003.safetensors", + "language_model.model.layers.15.self_attn.q_proj.weight": "model-00002-of-00003.safetensors", + "language_model.model.layers.15.self_attn.v_proj.biases": "model-00002-of-00003.safetensors", + "language_model.model.layers.15.self_attn.v_proj.scales": "model-00002-of-00003.safetensors", + "language_model.model.layers.15.self_attn.v_proj.weight": "model-00002-of-00003.safetensors", + "language_model.model.layers.16.experts.switch_glu.down_proj.biases": "model-00002-of-00003.safetensors", + "language_model.model.layers.16.experts.switch_glu.down_proj.scales": "model-00002-of-00003.safetensors", + "language_model.model.layers.16.experts.switch_glu.down_proj.weight": "model-00002-of-00003.safetensors", + "language_model.model.layers.16.experts.switch_glu.gate_proj.biases": "model-00002-of-00003.safetensors", + "language_model.model.layers.16.experts.switch_glu.gate_proj.scales": "model-00002-of-00003.safetensors", + "language_model.model.layers.16.experts.switch_glu.gate_proj.weight": "model-00002-of-00003.safetensors", + "language_model.model.layers.16.experts.switch_glu.up_proj.biases": "model-00002-of-00003.safetensors", + "language_model.model.layers.16.experts.switch_glu.up_proj.scales": "model-00002-of-00003.safetensors", + "language_model.model.layers.16.experts.switch_glu.up_proj.weight": "model-00002-of-00003.safetensors", + "language_model.model.layers.16.input_layernorm.weight": "model-00002-of-00003.safetensors", + "language_model.model.layers.16.layer_scalar": "model-00002-of-00003.safetensors", + "language_model.model.layers.16.mlp.down_proj.biases": "model-00002-of-00003.safetensors", + "language_model.model.layers.16.mlp.down_proj.scales": "model-00002-of-00003.safetensors", + "language_model.model.layers.16.mlp.down_proj.weight": "model-00002-of-00003.safetensors", + "language_model.model.layers.16.mlp.gate_proj.biases": "model-00002-of-00003.safetensors", + "language_model.model.layers.16.mlp.gate_proj.scales": "model-00002-of-00003.safetensors", + "language_model.model.layers.16.mlp.gate_proj.weight": "model-00002-of-00003.safetensors", + "language_model.model.layers.16.mlp.up_proj.biases": "model-00002-of-00003.safetensors", + "language_model.model.layers.16.mlp.up_proj.scales": "model-00002-of-00003.safetensors", + "language_model.model.layers.16.mlp.up_proj.weight": "model-00002-of-00003.safetensors", + "language_model.model.layers.16.post_attention_layernorm.weight": "model-00002-of-00003.safetensors", + "language_model.model.layers.16.post_feedforward_layernorm.weight": "model-00002-of-00003.safetensors", + "language_model.model.layers.16.post_feedforward_layernorm_1.weight": "model-00002-of-00003.safetensors", + "language_model.model.layers.16.post_feedforward_layernorm_2.weight": "model-00002-of-00003.safetensors", + "language_model.model.layers.16.pre_feedforward_layernorm.weight": "model-00002-of-00003.safetensors", + "language_model.model.layers.16.pre_feedforward_layernorm_2.weight": "model-00002-of-00003.safetensors", + "language_model.model.layers.16.router.per_expert_scale": "model-00002-of-00003.safetensors", + "language_model.model.layers.16.router.proj.biases": "model-00002-of-00003.safetensors", + "language_model.model.layers.16.router.proj.scales": "model-00002-of-00003.safetensors", + "language_model.model.layers.16.router.proj.weight": "model-00002-of-00003.safetensors", + "language_model.model.layers.16.router.scale": "model-00002-of-00003.safetensors", + "language_model.model.layers.16.self_attn.k_norm.weight": "model-00002-of-00003.safetensors", + "language_model.model.layers.16.self_attn.k_proj.biases": "model-00002-of-00003.safetensors", + "language_model.model.layers.16.self_attn.k_proj.scales": "model-00002-of-00003.safetensors", + "language_model.model.layers.16.self_attn.k_proj.weight": "model-00002-of-00003.safetensors", + "language_model.model.layers.16.self_attn.o_proj.biases": "model-00002-of-00003.safetensors", + "language_model.model.layers.16.self_attn.o_proj.scales": "model-00002-of-00003.safetensors", + "language_model.model.layers.16.self_attn.o_proj.weight": "model-00002-of-00003.safetensors", + "language_model.model.layers.16.self_attn.q_norm.weight": "model-00002-of-00003.safetensors", + "language_model.model.layers.16.self_attn.q_proj.biases": "model-00002-of-00003.safetensors", + "language_model.model.layers.16.self_attn.q_proj.scales": "model-00002-of-00003.safetensors", + "language_model.model.layers.16.self_attn.q_proj.weight": "model-00002-of-00003.safetensors", + "language_model.model.layers.16.self_attn.v_proj.biases": "model-00002-of-00003.safetensors", + "language_model.model.layers.16.self_attn.v_proj.scales": "model-00002-of-00003.safetensors", + "language_model.model.layers.16.self_attn.v_proj.weight": "model-00002-of-00003.safetensors", + "language_model.model.layers.17.experts.switch_glu.down_proj.biases": "model-00002-of-00003.safetensors", + "language_model.model.layers.17.experts.switch_glu.down_proj.scales": "model-00002-of-00003.safetensors", + "language_model.model.layers.17.experts.switch_glu.down_proj.weight": "model-00002-of-00003.safetensors", + "language_model.model.layers.17.experts.switch_glu.gate_proj.biases": "model-00002-of-00003.safetensors", + "language_model.model.layers.17.experts.switch_glu.gate_proj.scales": "model-00002-of-00003.safetensors", + "language_model.model.layers.17.experts.switch_glu.gate_proj.weight": "model-00002-of-00003.safetensors", + "language_model.model.layers.17.experts.switch_glu.up_proj.biases": "model-00002-of-00003.safetensors", + "language_model.model.layers.17.experts.switch_glu.up_proj.scales": "model-00002-of-00003.safetensors", + "language_model.model.layers.17.experts.switch_glu.up_proj.weight": "model-00002-of-00003.safetensors", + "language_model.model.layers.17.input_layernorm.weight": "model-00002-of-00003.safetensors", + "language_model.model.layers.17.layer_scalar": "model-00002-of-00003.safetensors", + "language_model.model.layers.17.mlp.down_proj.biases": "model-00002-of-00003.safetensors", + "language_model.model.layers.17.mlp.down_proj.scales": "model-00002-of-00003.safetensors", + "language_model.model.layers.17.mlp.down_proj.weight": "model-00002-of-00003.safetensors", + "language_model.model.layers.17.mlp.gate_proj.biases": "model-00002-of-00003.safetensors", + "language_model.model.layers.17.mlp.gate_proj.scales": "model-00002-of-00003.safetensors", + "language_model.model.layers.17.mlp.gate_proj.weight": "model-00002-of-00003.safetensors", + "language_model.model.layers.17.mlp.up_proj.biases": "model-00002-of-00003.safetensors", + "language_model.model.layers.17.mlp.up_proj.scales": "model-00002-of-00003.safetensors", + "language_model.model.layers.17.mlp.up_proj.weight": "model-00002-of-00003.safetensors", + "language_model.model.layers.17.post_attention_layernorm.weight": "model-00002-of-00003.safetensors", + "language_model.model.layers.17.post_feedforward_layernorm.weight": "model-00002-of-00003.safetensors", + "language_model.model.layers.17.post_feedforward_layernorm_1.weight": "model-00002-of-00003.safetensors", + "language_model.model.layers.17.post_feedforward_layernorm_2.weight": "model-00002-of-00003.safetensors", + "language_model.model.layers.17.pre_feedforward_layernorm.weight": "model-00002-of-00003.safetensors", + "language_model.model.layers.17.pre_feedforward_layernorm_2.weight": "model-00002-of-00003.safetensors", + "language_model.model.layers.17.router.per_expert_scale": "model-00002-of-00003.safetensors", + "language_model.model.layers.17.router.proj.biases": "model-00002-of-00003.safetensors", + "language_model.model.layers.17.router.proj.scales": "model-00002-of-00003.safetensors", + "language_model.model.layers.17.router.proj.weight": "model-00002-of-00003.safetensors", + "language_model.model.layers.17.router.scale": "model-00002-of-00003.safetensors", + "language_model.model.layers.17.self_attn.k_norm.weight": "model-00002-of-00003.safetensors", + "language_model.model.layers.17.self_attn.k_proj.biases": "model-00002-of-00003.safetensors", + "language_model.model.layers.17.self_attn.k_proj.scales": "model-00002-of-00003.safetensors", + "language_model.model.layers.17.self_attn.k_proj.weight": "model-00002-of-00003.safetensors", + "language_model.model.layers.17.self_attn.o_proj.biases": "model-00002-of-00003.safetensors", + "language_model.model.layers.17.self_attn.o_proj.scales": "model-00002-of-00003.safetensors", + "language_model.model.layers.17.self_attn.o_proj.weight": "model-00002-of-00003.safetensors", + "language_model.model.layers.17.self_attn.q_norm.weight": "model-00002-of-00003.safetensors", + "language_model.model.layers.17.self_attn.q_proj.biases": "model-00002-of-00003.safetensors", + "language_model.model.layers.17.self_attn.q_proj.scales": "model-00002-of-00003.safetensors", + "language_model.model.layers.17.self_attn.q_proj.weight": "model-00002-of-00003.safetensors", + "language_model.model.layers.18.experts.switch_glu.down_proj.biases": "model-00002-of-00003.safetensors", + "language_model.model.layers.18.experts.switch_glu.down_proj.scales": "model-00002-of-00003.safetensors", + "language_model.model.layers.18.experts.switch_glu.down_proj.weight": "model-00002-of-00003.safetensors", + "language_model.model.layers.18.experts.switch_glu.gate_proj.biases": "model-00002-of-00003.safetensors", + "language_model.model.layers.18.experts.switch_glu.gate_proj.scales": "model-00002-of-00003.safetensors", + "language_model.model.layers.18.experts.switch_glu.gate_proj.weight": "model-00002-of-00003.safetensors", + "language_model.model.layers.18.experts.switch_glu.up_proj.biases": "model-00002-of-00003.safetensors", + "language_model.model.layers.18.experts.switch_glu.up_proj.scales": "model-00002-of-00003.safetensors", + "language_model.model.layers.18.experts.switch_glu.up_proj.weight": "model-00002-of-00003.safetensors", + "language_model.model.layers.18.input_layernorm.weight": "model-00002-of-00003.safetensors", + "language_model.model.layers.18.layer_scalar": "model-00002-of-00003.safetensors", + "language_model.model.layers.18.mlp.down_proj.biases": "model-00002-of-00003.safetensors", + "language_model.model.layers.18.mlp.down_proj.scales": "model-00002-of-00003.safetensors", + "language_model.model.layers.18.mlp.down_proj.weight": "model-00002-of-00003.safetensors", + "language_model.model.layers.18.mlp.gate_proj.biases": "model-00002-of-00003.safetensors", + "language_model.model.layers.18.mlp.gate_proj.scales": "model-00002-of-00003.safetensors", + "language_model.model.layers.18.mlp.gate_proj.weight": "model-00002-of-00003.safetensors", + "language_model.model.layers.18.mlp.up_proj.biases": "model-00002-of-00003.safetensors", + "language_model.model.layers.18.mlp.up_proj.scales": "model-00002-of-00003.safetensors", + "language_model.model.layers.18.mlp.up_proj.weight": "model-00002-of-00003.safetensors", + "language_model.model.layers.18.post_attention_layernorm.weight": "model-00002-of-00003.safetensors", + "language_model.model.layers.18.post_feedforward_layernorm.weight": "model-00002-of-00003.safetensors", + "language_model.model.layers.18.post_feedforward_layernorm_1.weight": "model-00002-of-00003.safetensors", + "language_model.model.layers.18.post_feedforward_layernorm_2.weight": "model-00002-of-00003.safetensors", + "language_model.model.layers.18.pre_feedforward_layernorm.weight": "model-00002-of-00003.safetensors", + "language_model.model.layers.18.pre_feedforward_layernorm_2.weight": "model-00002-of-00003.safetensors", + "language_model.model.layers.18.router.per_expert_scale": "model-00002-of-00003.safetensors", + "language_model.model.layers.18.router.proj.biases": "model-00002-of-00003.safetensors", + "language_model.model.layers.18.router.proj.scales": "model-00002-of-00003.safetensors", + "language_model.model.layers.18.router.proj.weight": "model-00002-of-00003.safetensors", + "language_model.model.layers.18.router.scale": "model-00002-of-00003.safetensors", + "language_model.model.layers.18.self_attn.k_norm.weight": "model-00002-of-00003.safetensors", + "language_model.model.layers.18.self_attn.k_proj.biases": "model-00002-of-00003.safetensors", + "language_model.model.layers.18.self_attn.k_proj.scales": "model-00002-of-00003.safetensors", + "language_model.model.layers.18.self_attn.k_proj.weight": "model-00002-of-00003.safetensors", + "language_model.model.layers.18.self_attn.o_proj.biases": "model-00002-of-00003.safetensors", + "language_model.model.layers.18.self_attn.o_proj.scales": "model-00002-of-00003.safetensors", + "language_model.model.layers.18.self_attn.o_proj.weight": "model-00002-of-00003.safetensors", + "language_model.model.layers.18.self_attn.q_norm.weight": "model-00002-of-00003.safetensors", + "language_model.model.layers.18.self_attn.q_proj.biases": "model-00002-of-00003.safetensors", + "language_model.model.layers.18.self_attn.q_proj.scales": "model-00002-of-00003.safetensors", + "language_model.model.layers.18.self_attn.q_proj.weight": "model-00002-of-00003.safetensors", + "language_model.model.layers.18.self_attn.v_proj.biases": "model-00002-of-00003.safetensors", + "language_model.model.layers.18.self_attn.v_proj.scales": "model-00002-of-00003.safetensors", + "language_model.model.layers.18.self_attn.v_proj.weight": "model-00002-of-00003.safetensors", + "language_model.model.layers.19.experts.switch_glu.down_proj.biases": "model-00002-of-00003.safetensors", + "language_model.model.layers.19.experts.switch_glu.down_proj.scales": "model-00002-of-00003.safetensors", + "language_model.model.layers.19.experts.switch_glu.down_proj.weight": "model-00002-of-00003.safetensors", + "language_model.model.layers.19.experts.switch_glu.gate_proj.biases": "model-00002-of-00003.safetensors", + "language_model.model.layers.19.experts.switch_glu.gate_proj.scales": "model-00002-of-00003.safetensors", + "language_model.model.layers.19.experts.switch_glu.gate_proj.weight": "model-00002-of-00003.safetensors", + "language_model.model.layers.19.experts.switch_glu.up_proj.biases": "model-00002-of-00003.safetensors", + "language_model.model.layers.19.experts.switch_glu.up_proj.scales": "model-00002-of-00003.safetensors", + "language_model.model.layers.19.experts.switch_glu.up_proj.weight": "model-00002-of-00003.safetensors", + "language_model.model.layers.19.input_layernorm.weight": "model-00002-of-00003.safetensors", + "language_model.model.layers.19.layer_scalar": "model-00002-of-00003.safetensors", + "language_model.model.layers.19.mlp.down_proj.biases": "model-00002-of-00003.safetensors", + "language_model.model.layers.19.mlp.down_proj.scales": "model-00002-of-00003.safetensors", + "language_model.model.layers.19.mlp.down_proj.weight": "model-00002-of-00003.safetensors", + "language_model.model.layers.19.mlp.gate_proj.biases": "model-00002-of-00003.safetensors", + "language_model.model.layers.19.mlp.gate_proj.scales": "model-00002-of-00003.safetensors", + "language_model.model.layers.19.mlp.gate_proj.weight": "model-00002-of-00003.safetensors", + "language_model.model.layers.19.mlp.up_proj.biases": "model-00002-of-00003.safetensors", + "language_model.model.layers.19.mlp.up_proj.scales": "model-00002-of-00003.safetensors", + "language_model.model.layers.19.mlp.up_proj.weight": "model-00002-of-00003.safetensors", + "language_model.model.layers.19.post_attention_layernorm.weight": "model-00002-of-00003.safetensors", + "language_model.model.layers.19.post_feedforward_layernorm.weight": "model-00002-of-00003.safetensors", + "language_model.model.layers.19.post_feedforward_layernorm_1.weight": "model-00002-of-00003.safetensors", + "language_model.model.layers.19.post_feedforward_layernorm_2.weight": "model-00002-of-00003.safetensors", + "language_model.model.layers.19.pre_feedforward_layernorm.weight": "model-00002-of-00003.safetensors", + "language_model.model.layers.19.pre_feedforward_layernorm_2.weight": "model-00002-of-00003.safetensors", + "language_model.model.layers.19.router.per_expert_scale": "model-00002-of-00003.safetensors", + "language_model.model.layers.19.router.proj.biases": "model-00002-of-00003.safetensors", + "language_model.model.layers.19.router.proj.scales": "model-00002-of-00003.safetensors", + "language_model.model.layers.19.router.proj.weight": "model-00002-of-00003.safetensors", + "language_model.model.layers.19.router.scale": "model-00002-of-00003.safetensors", + "language_model.model.layers.19.self_attn.k_norm.weight": "model-00002-of-00003.safetensors", + "language_model.model.layers.19.self_attn.k_proj.biases": "model-00002-of-00003.safetensors", + "language_model.model.layers.19.self_attn.k_proj.scales": "model-00002-of-00003.safetensors", + "language_model.model.layers.19.self_attn.k_proj.weight": "model-00002-of-00003.safetensors", + "language_model.model.layers.19.self_attn.o_proj.biases": "model-00002-of-00003.safetensors", + "language_model.model.layers.19.self_attn.o_proj.scales": "model-00002-of-00003.safetensors", + "language_model.model.layers.19.self_attn.o_proj.weight": "model-00002-of-00003.safetensors", + "language_model.model.layers.19.self_attn.q_norm.weight": "model-00002-of-00003.safetensors", + "language_model.model.layers.19.self_attn.q_proj.biases": "model-00002-of-00003.safetensors", + "language_model.model.layers.19.self_attn.q_proj.scales": "model-00002-of-00003.safetensors", + "language_model.model.layers.19.self_attn.q_proj.weight": "model-00002-of-00003.safetensors", + "language_model.model.layers.19.self_attn.v_proj.biases": "model-00002-of-00003.safetensors", + "language_model.model.layers.19.self_attn.v_proj.scales": "model-00002-of-00003.safetensors", + "language_model.model.layers.19.self_attn.v_proj.weight": "model-00002-of-00003.safetensors", + "language_model.model.layers.2.experts.switch_glu.down_proj.biases": "model-00001-of-00003.safetensors", + "language_model.model.layers.2.experts.switch_glu.down_proj.scales": "model-00001-of-00003.safetensors", + "language_model.model.layers.2.experts.switch_glu.down_proj.weight": "model-00001-of-00003.safetensors", + "language_model.model.layers.2.experts.switch_glu.gate_proj.biases": "model-00001-of-00003.safetensors", + "language_model.model.layers.2.experts.switch_glu.gate_proj.scales": "model-00001-of-00003.safetensors", + "language_model.model.layers.2.experts.switch_glu.gate_proj.weight": "model-00001-of-00003.safetensors", + "language_model.model.layers.2.experts.switch_glu.up_proj.biases": "model-00001-of-00003.safetensors", + "language_model.model.layers.2.experts.switch_glu.up_proj.scales": "model-00001-of-00003.safetensors", + "language_model.model.layers.2.experts.switch_glu.up_proj.weight": "model-00001-of-00003.safetensors", + "language_model.model.layers.2.input_layernorm.weight": "model-00001-of-00003.safetensors", + "language_model.model.layers.2.layer_scalar": "model-00001-of-00003.safetensors", + "language_model.model.layers.2.mlp.down_proj.biases": "model-00001-of-00003.safetensors", + "language_model.model.layers.2.mlp.down_proj.scales": "model-00001-of-00003.safetensors", + "language_model.model.layers.2.mlp.down_proj.weight": "model-00001-of-00003.safetensors", + "language_model.model.layers.2.mlp.gate_proj.biases": "model-00001-of-00003.safetensors", + "language_model.model.layers.2.mlp.gate_proj.scales": "model-00001-of-00003.safetensors", + "language_model.model.layers.2.mlp.gate_proj.weight": "model-00001-of-00003.safetensors", + "language_model.model.layers.2.mlp.up_proj.biases": "model-00001-of-00003.safetensors", + "language_model.model.layers.2.mlp.up_proj.scales": "model-00001-of-00003.safetensors", + "language_model.model.layers.2.mlp.up_proj.weight": "model-00001-of-00003.safetensors", + "language_model.model.layers.2.post_attention_layernorm.weight": "model-00001-of-00003.safetensors", + "language_model.model.layers.2.post_feedforward_layernorm.weight": "model-00001-of-00003.safetensors", + "language_model.model.layers.2.post_feedforward_layernorm_1.weight": "model-00001-of-00003.safetensors", + "language_model.model.layers.2.post_feedforward_layernorm_2.weight": "model-00001-of-00003.safetensors", + "language_model.model.layers.2.pre_feedforward_layernorm.weight": "model-00001-of-00003.safetensors", + "language_model.model.layers.2.pre_feedforward_layernorm_2.weight": "model-00001-of-00003.safetensors", + "language_model.model.layers.2.router.per_expert_scale": "model-00001-of-00003.safetensors", + "language_model.model.layers.2.router.proj.biases": "model-00001-of-00003.safetensors", + "language_model.model.layers.2.router.proj.scales": "model-00001-of-00003.safetensors", + "language_model.model.layers.2.router.proj.weight": "model-00001-of-00003.safetensors", + "language_model.model.layers.2.router.scale": "model-00001-of-00003.safetensors", + "language_model.model.layers.2.self_attn.k_norm.weight": "model-00001-of-00003.safetensors", + "language_model.model.layers.2.self_attn.k_proj.biases": "model-00001-of-00003.safetensors", + "language_model.model.layers.2.self_attn.k_proj.scales": "model-00001-of-00003.safetensors", + "language_model.model.layers.2.self_attn.k_proj.weight": "model-00001-of-00003.safetensors", + "language_model.model.layers.2.self_attn.o_proj.biases": "model-00001-of-00003.safetensors", + "language_model.model.layers.2.self_attn.o_proj.scales": "model-00001-of-00003.safetensors", + "language_model.model.layers.2.self_attn.o_proj.weight": "model-00001-of-00003.safetensors", + "language_model.model.layers.2.self_attn.q_norm.weight": "model-00001-of-00003.safetensors", + "language_model.model.layers.2.self_attn.q_proj.biases": "model-00001-of-00003.safetensors", + "language_model.model.layers.2.self_attn.q_proj.scales": "model-00001-of-00003.safetensors", + "language_model.model.layers.2.self_attn.q_proj.weight": "model-00001-of-00003.safetensors", + "language_model.model.layers.2.self_attn.v_proj.biases": "model-00001-of-00003.safetensors", + "language_model.model.layers.2.self_attn.v_proj.scales": "model-00001-of-00003.safetensors", + "language_model.model.layers.2.self_attn.v_proj.weight": "model-00001-of-00003.safetensors", + "language_model.model.layers.20.experts.switch_glu.down_proj.biases": "model-00002-of-00003.safetensors", + "language_model.model.layers.20.experts.switch_glu.down_proj.scales": "model-00002-of-00003.safetensors", + "language_model.model.layers.20.experts.switch_glu.down_proj.weight": "model-00002-of-00003.safetensors", + "language_model.model.layers.20.experts.switch_glu.gate_proj.biases": "model-00002-of-00003.safetensors", + "language_model.model.layers.20.experts.switch_glu.gate_proj.scales": "model-00002-of-00003.safetensors", + "language_model.model.layers.20.experts.switch_glu.gate_proj.weight": "model-00002-of-00003.safetensors", + "language_model.model.layers.20.experts.switch_glu.up_proj.biases": "model-00002-of-00003.safetensors", + "language_model.model.layers.20.experts.switch_glu.up_proj.scales": "model-00002-of-00003.safetensors", + "language_model.model.layers.20.experts.switch_glu.up_proj.weight": "model-00002-of-00003.safetensors", + "language_model.model.layers.20.input_layernorm.weight": "model-00002-of-00003.safetensors", + "language_model.model.layers.20.layer_scalar": "model-00002-of-00003.safetensors", + "language_model.model.layers.20.mlp.down_proj.biases": "model-00002-of-00003.safetensors", + "language_model.model.layers.20.mlp.down_proj.scales": "model-00002-of-00003.safetensors", + "language_model.model.layers.20.mlp.down_proj.weight": "model-00002-of-00003.safetensors", + "language_model.model.layers.20.mlp.gate_proj.biases": "model-00002-of-00003.safetensors", + "language_model.model.layers.20.mlp.gate_proj.scales": "model-00002-of-00003.safetensors", + "language_model.model.layers.20.mlp.gate_proj.weight": "model-00002-of-00003.safetensors", + "language_model.model.layers.20.mlp.up_proj.biases": "model-00002-of-00003.safetensors", + "language_model.model.layers.20.mlp.up_proj.scales": "model-00002-of-00003.safetensors", + "language_model.model.layers.20.mlp.up_proj.weight": "model-00002-of-00003.safetensors", + "language_model.model.layers.20.post_attention_layernorm.weight": "model-00002-of-00003.safetensors", + "language_model.model.layers.20.post_feedforward_layernorm.weight": "model-00002-of-00003.safetensors", + "language_model.model.layers.20.post_feedforward_layernorm_1.weight": "model-00002-of-00003.safetensors", + "language_model.model.layers.20.post_feedforward_layernorm_2.weight": "model-00002-of-00003.safetensors", + "language_model.model.layers.20.pre_feedforward_layernorm.weight": "model-00002-of-00003.safetensors", + "language_model.model.layers.20.pre_feedforward_layernorm_2.weight": "model-00002-of-00003.safetensors", + "language_model.model.layers.20.router.per_expert_scale": "model-00002-of-00003.safetensors", + "language_model.model.layers.20.router.proj.biases": "model-00002-of-00003.safetensors", + "language_model.model.layers.20.router.proj.scales": "model-00002-of-00003.safetensors", + "language_model.model.layers.20.router.proj.weight": "model-00002-of-00003.safetensors", + "language_model.model.layers.20.router.scale": "model-00002-of-00003.safetensors", + "language_model.model.layers.20.self_attn.k_norm.weight": "model-00002-of-00003.safetensors", + "language_model.model.layers.20.self_attn.k_proj.biases": "model-00002-of-00003.safetensors", + "language_model.model.layers.20.self_attn.k_proj.scales": "model-00002-of-00003.safetensors", + "language_model.model.layers.20.self_attn.k_proj.weight": "model-00002-of-00003.safetensors", + "language_model.model.layers.20.self_attn.o_proj.biases": "model-00002-of-00003.safetensors", + "language_model.model.layers.20.self_attn.o_proj.scales": "model-00002-of-00003.safetensors", + "language_model.model.layers.20.self_attn.o_proj.weight": "model-00002-of-00003.safetensors", + "language_model.model.layers.20.self_attn.q_norm.weight": "model-00002-of-00003.safetensors", + "language_model.model.layers.20.self_attn.q_proj.biases": "model-00002-of-00003.safetensors", + "language_model.model.layers.20.self_attn.q_proj.scales": "model-00002-of-00003.safetensors", + "language_model.model.layers.20.self_attn.q_proj.weight": "model-00002-of-00003.safetensors", + "language_model.model.layers.20.self_attn.v_proj.biases": "model-00002-of-00003.safetensors", + "language_model.model.layers.20.self_attn.v_proj.scales": "model-00002-of-00003.safetensors", + "language_model.model.layers.20.self_attn.v_proj.weight": "model-00002-of-00003.safetensors", + "language_model.model.layers.21.experts.switch_glu.down_proj.biases": "model-00003-of-00003.safetensors", + "language_model.model.layers.21.experts.switch_glu.down_proj.scales": "model-00003-of-00003.safetensors", + "language_model.model.layers.21.experts.switch_glu.down_proj.weight": "model-00003-of-00003.safetensors", + "language_model.model.layers.21.experts.switch_glu.gate_proj.biases": "model-00002-of-00003.safetensors", + "language_model.model.layers.21.experts.switch_glu.gate_proj.scales": "model-00002-of-00003.safetensors", + "language_model.model.layers.21.experts.switch_glu.gate_proj.weight": "model-00002-of-00003.safetensors", + "language_model.model.layers.21.experts.switch_glu.up_proj.biases": "model-00002-of-00003.safetensors", + "language_model.model.layers.21.experts.switch_glu.up_proj.scales": "model-00002-of-00003.safetensors", + "language_model.model.layers.21.experts.switch_glu.up_proj.weight": "model-00002-of-00003.safetensors", + "language_model.model.layers.21.input_layernorm.weight": "model-00002-of-00003.safetensors", + "language_model.model.layers.21.layer_scalar": "model-00003-of-00003.safetensors", + "language_model.model.layers.21.mlp.down_proj.biases": "model-00002-of-00003.safetensors", + "language_model.model.layers.21.mlp.down_proj.scales": "model-00002-of-00003.safetensors", + "language_model.model.layers.21.mlp.down_proj.weight": "model-00002-of-00003.safetensors", + "language_model.model.layers.21.mlp.gate_proj.biases": "model-00002-of-00003.safetensors", + "language_model.model.layers.21.mlp.gate_proj.scales": "model-00002-of-00003.safetensors", + "language_model.model.layers.21.mlp.gate_proj.weight": "model-00002-of-00003.safetensors", + "language_model.model.layers.21.mlp.up_proj.biases": "model-00002-of-00003.safetensors", + "language_model.model.layers.21.mlp.up_proj.scales": "model-00002-of-00003.safetensors", + "language_model.model.layers.21.mlp.up_proj.weight": "model-00002-of-00003.safetensors", + "language_model.model.layers.21.post_attention_layernorm.weight": "model-00002-of-00003.safetensors", + "language_model.model.layers.21.post_feedforward_layernorm.weight": "model-00002-of-00003.safetensors", + "language_model.model.layers.21.post_feedforward_layernorm_1.weight": "model-00003-of-00003.safetensors", + "language_model.model.layers.21.post_feedforward_layernorm_2.weight": "model-00003-of-00003.safetensors", + "language_model.model.layers.21.pre_feedforward_layernorm.weight": "model-00002-of-00003.safetensors", + "language_model.model.layers.21.pre_feedforward_layernorm_2.weight": "model-00003-of-00003.safetensors", + "language_model.model.layers.21.router.per_expert_scale": "model-00002-of-00003.safetensors", + "language_model.model.layers.21.router.proj.biases": "model-00002-of-00003.safetensors", + "language_model.model.layers.21.router.proj.scales": "model-00002-of-00003.safetensors", + "language_model.model.layers.21.router.proj.weight": "model-00002-of-00003.safetensors", + "language_model.model.layers.21.router.scale": "model-00002-of-00003.safetensors", + "language_model.model.layers.21.self_attn.k_norm.weight": "model-00002-of-00003.safetensors", + "language_model.model.layers.21.self_attn.k_proj.biases": "model-00002-of-00003.safetensors", + "language_model.model.layers.21.self_attn.k_proj.scales": "model-00002-of-00003.safetensors", + "language_model.model.layers.21.self_attn.k_proj.weight": "model-00002-of-00003.safetensors", + "language_model.model.layers.21.self_attn.o_proj.biases": "model-00002-of-00003.safetensors", + "language_model.model.layers.21.self_attn.o_proj.scales": "model-00002-of-00003.safetensors", + "language_model.model.layers.21.self_attn.o_proj.weight": "model-00002-of-00003.safetensors", + "language_model.model.layers.21.self_attn.q_norm.weight": "model-00002-of-00003.safetensors", + "language_model.model.layers.21.self_attn.q_proj.biases": "model-00002-of-00003.safetensors", + "language_model.model.layers.21.self_attn.q_proj.scales": "model-00002-of-00003.safetensors", + "language_model.model.layers.21.self_attn.q_proj.weight": "model-00002-of-00003.safetensors", + "language_model.model.layers.21.self_attn.v_proj.biases": "model-00002-of-00003.safetensors", + "language_model.model.layers.21.self_attn.v_proj.scales": "model-00002-of-00003.safetensors", + "language_model.model.layers.21.self_attn.v_proj.weight": "model-00002-of-00003.safetensors", + "language_model.model.layers.22.experts.switch_glu.down_proj.biases": "model-00003-of-00003.safetensors", + "language_model.model.layers.22.experts.switch_glu.down_proj.scales": "model-00003-of-00003.safetensors", + "language_model.model.layers.22.experts.switch_glu.down_proj.weight": "model-00003-of-00003.safetensors", + "language_model.model.layers.22.experts.switch_glu.gate_proj.biases": "model-00003-of-00003.safetensors", + "language_model.model.layers.22.experts.switch_glu.gate_proj.scales": "model-00003-of-00003.safetensors", + "language_model.model.layers.22.experts.switch_glu.gate_proj.weight": "model-00003-of-00003.safetensors", + "language_model.model.layers.22.experts.switch_glu.up_proj.biases": "model-00003-of-00003.safetensors", + "language_model.model.layers.22.experts.switch_glu.up_proj.scales": "model-00003-of-00003.safetensors", + "language_model.model.layers.22.experts.switch_glu.up_proj.weight": "model-00003-of-00003.safetensors", + "language_model.model.layers.22.input_layernorm.weight": "model-00003-of-00003.safetensors", + "language_model.model.layers.22.layer_scalar": "model-00003-of-00003.safetensors", + "language_model.model.layers.22.mlp.down_proj.biases": "model-00003-of-00003.safetensors", + "language_model.model.layers.22.mlp.down_proj.scales": "model-00003-of-00003.safetensors", + "language_model.model.layers.22.mlp.down_proj.weight": "model-00003-of-00003.safetensors", + "language_model.model.layers.22.mlp.gate_proj.biases": "model-00003-of-00003.safetensors", + "language_model.model.layers.22.mlp.gate_proj.scales": "model-00003-of-00003.safetensors", + "language_model.model.layers.22.mlp.gate_proj.weight": "model-00003-of-00003.safetensors", + "language_model.model.layers.22.mlp.up_proj.biases": "model-00003-of-00003.safetensors", + "language_model.model.layers.22.mlp.up_proj.scales": "model-00003-of-00003.safetensors", + "language_model.model.layers.22.mlp.up_proj.weight": "model-00003-of-00003.safetensors", + "language_model.model.layers.22.post_attention_layernorm.weight": "model-00003-of-00003.safetensors", + "language_model.model.layers.22.post_feedforward_layernorm.weight": "model-00003-of-00003.safetensors", + "language_model.model.layers.22.post_feedforward_layernorm_1.weight": "model-00003-of-00003.safetensors", + "language_model.model.layers.22.post_feedforward_layernorm_2.weight": "model-00003-of-00003.safetensors", + "language_model.model.layers.22.pre_feedforward_layernorm.weight": "model-00003-of-00003.safetensors", + "language_model.model.layers.22.pre_feedforward_layernorm_2.weight": "model-00003-of-00003.safetensors", + "language_model.model.layers.22.router.per_expert_scale": "model-00003-of-00003.safetensors", + "language_model.model.layers.22.router.proj.biases": "model-00003-of-00003.safetensors", + "language_model.model.layers.22.router.proj.scales": "model-00003-of-00003.safetensors", + "language_model.model.layers.22.router.proj.weight": "model-00003-of-00003.safetensors", + "language_model.model.layers.22.router.scale": "model-00003-of-00003.safetensors", + "language_model.model.layers.22.self_attn.k_norm.weight": "model-00003-of-00003.safetensors", + "language_model.model.layers.22.self_attn.k_proj.biases": "model-00003-of-00003.safetensors", + "language_model.model.layers.22.self_attn.k_proj.scales": "model-00003-of-00003.safetensors", + "language_model.model.layers.22.self_attn.k_proj.weight": "model-00003-of-00003.safetensors", + "language_model.model.layers.22.self_attn.o_proj.biases": "model-00003-of-00003.safetensors", + "language_model.model.layers.22.self_attn.o_proj.scales": "model-00003-of-00003.safetensors", + "language_model.model.layers.22.self_attn.o_proj.weight": "model-00003-of-00003.safetensors", + "language_model.model.layers.22.self_attn.q_norm.weight": "model-00003-of-00003.safetensors", + "language_model.model.layers.22.self_attn.q_proj.biases": "model-00003-of-00003.safetensors", + "language_model.model.layers.22.self_attn.q_proj.scales": "model-00003-of-00003.safetensors", + "language_model.model.layers.22.self_attn.q_proj.weight": "model-00003-of-00003.safetensors", + "language_model.model.layers.22.self_attn.v_proj.biases": "model-00003-of-00003.safetensors", + "language_model.model.layers.22.self_attn.v_proj.scales": "model-00003-of-00003.safetensors", + "language_model.model.layers.22.self_attn.v_proj.weight": "model-00003-of-00003.safetensors", + "language_model.model.layers.23.experts.switch_glu.down_proj.biases": "model-00003-of-00003.safetensors", + "language_model.model.layers.23.experts.switch_glu.down_proj.scales": "model-00003-of-00003.safetensors", + "language_model.model.layers.23.experts.switch_glu.down_proj.weight": "model-00003-of-00003.safetensors", + "language_model.model.layers.23.experts.switch_glu.gate_proj.biases": "model-00003-of-00003.safetensors", + "language_model.model.layers.23.experts.switch_glu.gate_proj.scales": "model-00003-of-00003.safetensors", + "language_model.model.layers.23.experts.switch_glu.gate_proj.weight": "model-00003-of-00003.safetensors", + "language_model.model.layers.23.experts.switch_glu.up_proj.biases": "model-00003-of-00003.safetensors", + "language_model.model.layers.23.experts.switch_glu.up_proj.scales": "model-00003-of-00003.safetensors", + "language_model.model.layers.23.experts.switch_glu.up_proj.weight": "model-00003-of-00003.safetensors", + "language_model.model.layers.23.input_layernorm.weight": "model-00003-of-00003.safetensors", + "language_model.model.layers.23.layer_scalar": "model-00003-of-00003.safetensors", + "language_model.model.layers.23.mlp.down_proj.biases": "model-00003-of-00003.safetensors", + "language_model.model.layers.23.mlp.down_proj.scales": "model-00003-of-00003.safetensors", + "language_model.model.layers.23.mlp.down_proj.weight": "model-00003-of-00003.safetensors", + "language_model.model.layers.23.mlp.gate_proj.biases": "model-00003-of-00003.safetensors", + "language_model.model.layers.23.mlp.gate_proj.scales": "model-00003-of-00003.safetensors", + "language_model.model.layers.23.mlp.gate_proj.weight": "model-00003-of-00003.safetensors", + "language_model.model.layers.23.mlp.up_proj.biases": "model-00003-of-00003.safetensors", + "language_model.model.layers.23.mlp.up_proj.scales": "model-00003-of-00003.safetensors", + "language_model.model.layers.23.mlp.up_proj.weight": "model-00003-of-00003.safetensors", + "language_model.model.layers.23.post_attention_layernorm.weight": "model-00003-of-00003.safetensors", + "language_model.model.layers.23.post_feedforward_layernorm.weight": "model-00003-of-00003.safetensors", + "language_model.model.layers.23.post_feedforward_layernorm_1.weight": "model-00003-of-00003.safetensors", + "language_model.model.layers.23.post_feedforward_layernorm_2.weight": "model-00003-of-00003.safetensors", + "language_model.model.layers.23.pre_feedforward_layernorm.weight": "model-00003-of-00003.safetensors", + "language_model.model.layers.23.pre_feedforward_layernorm_2.weight": "model-00003-of-00003.safetensors", + "language_model.model.layers.23.router.per_expert_scale": "model-00003-of-00003.safetensors", + "language_model.model.layers.23.router.proj.biases": "model-00003-of-00003.safetensors", + "language_model.model.layers.23.router.proj.scales": "model-00003-of-00003.safetensors", + "language_model.model.layers.23.router.proj.weight": "model-00003-of-00003.safetensors", + "language_model.model.layers.23.router.scale": "model-00003-of-00003.safetensors", + "language_model.model.layers.23.self_attn.k_norm.weight": "model-00003-of-00003.safetensors", + "language_model.model.layers.23.self_attn.k_proj.biases": "model-00003-of-00003.safetensors", + "language_model.model.layers.23.self_attn.k_proj.scales": "model-00003-of-00003.safetensors", + "language_model.model.layers.23.self_attn.k_proj.weight": "model-00003-of-00003.safetensors", + "language_model.model.layers.23.self_attn.o_proj.biases": "model-00003-of-00003.safetensors", + "language_model.model.layers.23.self_attn.o_proj.scales": "model-00003-of-00003.safetensors", + "language_model.model.layers.23.self_attn.o_proj.weight": "model-00003-of-00003.safetensors", + "language_model.model.layers.23.self_attn.q_norm.weight": "model-00003-of-00003.safetensors", + "language_model.model.layers.23.self_attn.q_proj.biases": "model-00003-of-00003.safetensors", + "language_model.model.layers.23.self_attn.q_proj.scales": "model-00003-of-00003.safetensors", + "language_model.model.layers.23.self_attn.q_proj.weight": "model-00003-of-00003.safetensors", + "language_model.model.layers.24.experts.switch_glu.down_proj.biases": "model-00003-of-00003.safetensors", + "language_model.model.layers.24.experts.switch_glu.down_proj.scales": "model-00003-of-00003.safetensors", + "language_model.model.layers.24.experts.switch_glu.down_proj.weight": "model-00003-of-00003.safetensors", + "language_model.model.layers.24.experts.switch_glu.gate_proj.biases": "model-00003-of-00003.safetensors", + "language_model.model.layers.24.experts.switch_glu.gate_proj.scales": "model-00003-of-00003.safetensors", + "language_model.model.layers.24.experts.switch_glu.gate_proj.weight": "model-00003-of-00003.safetensors", + "language_model.model.layers.24.experts.switch_glu.up_proj.biases": "model-00003-of-00003.safetensors", + "language_model.model.layers.24.experts.switch_glu.up_proj.scales": "model-00003-of-00003.safetensors", + "language_model.model.layers.24.experts.switch_glu.up_proj.weight": "model-00003-of-00003.safetensors", + "language_model.model.layers.24.input_layernorm.weight": "model-00003-of-00003.safetensors", + "language_model.model.layers.24.layer_scalar": "model-00003-of-00003.safetensors", + "language_model.model.layers.24.mlp.down_proj.biases": "model-00003-of-00003.safetensors", + "language_model.model.layers.24.mlp.down_proj.scales": "model-00003-of-00003.safetensors", + "language_model.model.layers.24.mlp.down_proj.weight": "model-00003-of-00003.safetensors", + "language_model.model.layers.24.mlp.gate_proj.biases": "model-00003-of-00003.safetensors", + "language_model.model.layers.24.mlp.gate_proj.scales": "model-00003-of-00003.safetensors", + "language_model.model.layers.24.mlp.gate_proj.weight": "model-00003-of-00003.safetensors", + "language_model.model.layers.24.mlp.up_proj.biases": "model-00003-of-00003.safetensors", + "language_model.model.layers.24.mlp.up_proj.scales": "model-00003-of-00003.safetensors", + "language_model.model.layers.24.mlp.up_proj.weight": "model-00003-of-00003.safetensors", + "language_model.model.layers.24.post_attention_layernorm.weight": "model-00003-of-00003.safetensors", + "language_model.model.layers.24.post_feedforward_layernorm.weight": "model-00003-of-00003.safetensors", + "language_model.model.layers.24.post_feedforward_layernorm_1.weight": "model-00003-of-00003.safetensors", + "language_model.model.layers.24.post_feedforward_layernorm_2.weight": "model-00003-of-00003.safetensors", + "language_model.model.layers.24.pre_feedforward_layernorm.weight": "model-00003-of-00003.safetensors", + "language_model.model.layers.24.pre_feedforward_layernorm_2.weight": "model-00003-of-00003.safetensors", + "language_model.model.layers.24.router.per_expert_scale": "model-00003-of-00003.safetensors", + "language_model.model.layers.24.router.proj.biases": "model-00003-of-00003.safetensors", + "language_model.model.layers.24.router.proj.scales": "model-00003-of-00003.safetensors", + "language_model.model.layers.24.router.proj.weight": "model-00003-of-00003.safetensors", + "language_model.model.layers.24.router.scale": "model-00003-of-00003.safetensors", + "language_model.model.layers.24.self_attn.k_norm.weight": "model-00003-of-00003.safetensors", + "language_model.model.layers.24.self_attn.k_proj.biases": "model-00003-of-00003.safetensors", + "language_model.model.layers.24.self_attn.k_proj.scales": "model-00003-of-00003.safetensors", + "language_model.model.layers.24.self_attn.k_proj.weight": "model-00003-of-00003.safetensors", + "language_model.model.layers.24.self_attn.o_proj.biases": "model-00003-of-00003.safetensors", + "language_model.model.layers.24.self_attn.o_proj.scales": "model-00003-of-00003.safetensors", + "language_model.model.layers.24.self_attn.o_proj.weight": "model-00003-of-00003.safetensors", + "language_model.model.layers.24.self_attn.q_norm.weight": "model-00003-of-00003.safetensors", + "language_model.model.layers.24.self_attn.q_proj.biases": "model-00003-of-00003.safetensors", + "language_model.model.layers.24.self_attn.q_proj.scales": "model-00003-of-00003.safetensors", + "language_model.model.layers.24.self_attn.q_proj.weight": "model-00003-of-00003.safetensors", + "language_model.model.layers.24.self_attn.v_proj.biases": "model-00003-of-00003.safetensors", + "language_model.model.layers.24.self_attn.v_proj.scales": "model-00003-of-00003.safetensors", + "language_model.model.layers.24.self_attn.v_proj.weight": "model-00003-of-00003.safetensors", + "language_model.model.layers.25.experts.switch_glu.down_proj.biases": "model-00003-of-00003.safetensors", + "language_model.model.layers.25.experts.switch_glu.down_proj.scales": "model-00003-of-00003.safetensors", + "language_model.model.layers.25.experts.switch_glu.down_proj.weight": "model-00003-of-00003.safetensors", + "language_model.model.layers.25.experts.switch_glu.gate_proj.biases": "model-00003-of-00003.safetensors", + "language_model.model.layers.25.experts.switch_glu.gate_proj.scales": "model-00003-of-00003.safetensors", + "language_model.model.layers.25.experts.switch_glu.gate_proj.weight": "model-00003-of-00003.safetensors", + "language_model.model.layers.25.experts.switch_glu.up_proj.biases": "model-00003-of-00003.safetensors", + "language_model.model.layers.25.experts.switch_glu.up_proj.scales": "model-00003-of-00003.safetensors", + "language_model.model.layers.25.experts.switch_glu.up_proj.weight": "model-00003-of-00003.safetensors", + "language_model.model.layers.25.input_layernorm.weight": "model-00003-of-00003.safetensors", + "language_model.model.layers.25.layer_scalar": "model-00003-of-00003.safetensors", + "language_model.model.layers.25.mlp.down_proj.biases": "model-00003-of-00003.safetensors", + "language_model.model.layers.25.mlp.down_proj.scales": "model-00003-of-00003.safetensors", + "language_model.model.layers.25.mlp.down_proj.weight": "model-00003-of-00003.safetensors", + "language_model.model.layers.25.mlp.gate_proj.biases": "model-00003-of-00003.safetensors", + "language_model.model.layers.25.mlp.gate_proj.scales": "model-00003-of-00003.safetensors", + "language_model.model.layers.25.mlp.gate_proj.weight": "model-00003-of-00003.safetensors", + "language_model.model.layers.25.mlp.up_proj.biases": "model-00003-of-00003.safetensors", + "language_model.model.layers.25.mlp.up_proj.scales": "model-00003-of-00003.safetensors", + "language_model.model.layers.25.mlp.up_proj.weight": "model-00003-of-00003.safetensors", + "language_model.model.layers.25.post_attention_layernorm.weight": "model-00003-of-00003.safetensors", + "language_model.model.layers.25.post_feedforward_layernorm.weight": "model-00003-of-00003.safetensors", + "language_model.model.layers.25.post_feedforward_layernorm_1.weight": "model-00003-of-00003.safetensors", + "language_model.model.layers.25.post_feedforward_layernorm_2.weight": "model-00003-of-00003.safetensors", + "language_model.model.layers.25.pre_feedforward_layernorm.weight": "model-00003-of-00003.safetensors", + "language_model.model.layers.25.pre_feedforward_layernorm_2.weight": "model-00003-of-00003.safetensors", + "language_model.model.layers.25.router.per_expert_scale": "model-00003-of-00003.safetensors", + "language_model.model.layers.25.router.proj.biases": "model-00003-of-00003.safetensors", + "language_model.model.layers.25.router.proj.scales": "model-00003-of-00003.safetensors", + "language_model.model.layers.25.router.proj.weight": "model-00003-of-00003.safetensors", + "language_model.model.layers.25.router.scale": "model-00003-of-00003.safetensors", + "language_model.model.layers.25.self_attn.k_norm.weight": "model-00003-of-00003.safetensors", + "language_model.model.layers.25.self_attn.k_proj.biases": "model-00003-of-00003.safetensors", + "language_model.model.layers.25.self_attn.k_proj.scales": "model-00003-of-00003.safetensors", + "language_model.model.layers.25.self_attn.k_proj.weight": "model-00003-of-00003.safetensors", + "language_model.model.layers.25.self_attn.o_proj.biases": "model-00003-of-00003.safetensors", + "language_model.model.layers.25.self_attn.o_proj.scales": "model-00003-of-00003.safetensors", + "language_model.model.layers.25.self_attn.o_proj.weight": "model-00003-of-00003.safetensors", + "language_model.model.layers.25.self_attn.q_norm.weight": "model-00003-of-00003.safetensors", + "language_model.model.layers.25.self_attn.q_proj.biases": "model-00003-of-00003.safetensors", + "language_model.model.layers.25.self_attn.q_proj.scales": "model-00003-of-00003.safetensors", + "language_model.model.layers.25.self_attn.q_proj.weight": "model-00003-of-00003.safetensors", + "language_model.model.layers.25.self_attn.v_proj.biases": "model-00003-of-00003.safetensors", + "language_model.model.layers.25.self_attn.v_proj.scales": "model-00003-of-00003.safetensors", + "language_model.model.layers.25.self_attn.v_proj.weight": "model-00003-of-00003.safetensors", + "language_model.model.layers.26.experts.switch_glu.down_proj.biases": "model-00003-of-00003.safetensors", + "language_model.model.layers.26.experts.switch_glu.down_proj.scales": "model-00003-of-00003.safetensors", + "language_model.model.layers.26.experts.switch_glu.down_proj.weight": "model-00003-of-00003.safetensors", + "language_model.model.layers.26.experts.switch_glu.gate_proj.biases": "model-00003-of-00003.safetensors", + "language_model.model.layers.26.experts.switch_glu.gate_proj.scales": "model-00003-of-00003.safetensors", + "language_model.model.layers.26.experts.switch_glu.gate_proj.weight": "model-00003-of-00003.safetensors", + "language_model.model.layers.26.experts.switch_glu.up_proj.biases": "model-00003-of-00003.safetensors", + "language_model.model.layers.26.experts.switch_glu.up_proj.scales": "model-00003-of-00003.safetensors", + "language_model.model.layers.26.experts.switch_glu.up_proj.weight": "model-00003-of-00003.safetensors", + "language_model.model.layers.26.input_layernorm.weight": "model-00003-of-00003.safetensors", + "language_model.model.layers.26.layer_scalar": "model-00003-of-00003.safetensors", + "language_model.model.layers.26.mlp.down_proj.biases": "model-00003-of-00003.safetensors", + "language_model.model.layers.26.mlp.down_proj.scales": "model-00003-of-00003.safetensors", + "language_model.model.layers.26.mlp.down_proj.weight": "model-00003-of-00003.safetensors", + "language_model.model.layers.26.mlp.gate_proj.biases": "model-00003-of-00003.safetensors", + "language_model.model.layers.26.mlp.gate_proj.scales": "model-00003-of-00003.safetensors", + "language_model.model.layers.26.mlp.gate_proj.weight": "model-00003-of-00003.safetensors", + "language_model.model.layers.26.mlp.up_proj.biases": "model-00003-of-00003.safetensors", + "language_model.model.layers.26.mlp.up_proj.scales": "model-00003-of-00003.safetensors", + "language_model.model.layers.26.mlp.up_proj.weight": "model-00003-of-00003.safetensors", + "language_model.model.layers.26.post_attention_layernorm.weight": "model-00003-of-00003.safetensors", + "language_model.model.layers.26.post_feedforward_layernorm.weight": "model-00003-of-00003.safetensors", + "language_model.model.layers.26.post_feedforward_layernorm_1.weight": "model-00003-of-00003.safetensors", + "language_model.model.layers.26.post_feedforward_layernorm_2.weight": "model-00003-of-00003.safetensors", + "language_model.model.layers.26.pre_feedforward_layernorm.weight": "model-00003-of-00003.safetensors", + "language_model.model.layers.26.pre_feedforward_layernorm_2.weight": "model-00003-of-00003.safetensors", + "language_model.model.layers.26.router.per_expert_scale": "model-00003-of-00003.safetensors", + "language_model.model.layers.26.router.proj.biases": "model-00003-of-00003.safetensors", + "language_model.model.layers.26.router.proj.scales": "model-00003-of-00003.safetensors", + "language_model.model.layers.26.router.proj.weight": "model-00003-of-00003.safetensors", + "language_model.model.layers.26.router.scale": "model-00003-of-00003.safetensors", + "language_model.model.layers.26.self_attn.k_norm.weight": "model-00003-of-00003.safetensors", + "language_model.model.layers.26.self_attn.k_proj.biases": "model-00003-of-00003.safetensors", + "language_model.model.layers.26.self_attn.k_proj.scales": "model-00003-of-00003.safetensors", + "language_model.model.layers.26.self_attn.k_proj.weight": "model-00003-of-00003.safetensors", + "language_model.model.layers.26.self_attn.o_proj.biases": "model-00003-of-00003.safetensors", + "language_model.model.layers.26.self_attn.o_proj.scales": "model-00003-of-00003.safetensors", + "language_model.model.layers.26.self_attn.o_proj.weight": "model-00003-of-00003.safetensors", + "language_model.model.layers.26.self_attn.q_norm.weight": "model-00003-of-00003.safetensors", + "language_model.model.layers.26.self_attn.q_proj.biases": "model-00003-of-00003.safetensors", + "language_model.model.layers.26.self_attn.q_proj.scales": "model-00003-of-00003.safetensors", + "language_model.model.layers.26.self_attn.q_proj.weight": "model-00003-of-00003.safetensors", + "language_model.model.layers.26.self_attn.v_proj.biases": "model-00003-of-00003.safetensors", + "language_model.model.layers.26.self_attn.v_proj.scales": "model-00003-of-00003.safetensors", + "language_model.model.layers.26.self_attn.v_proj.weight": "model-00003-of-00003.safetensors", + "language_model.model.layers.27.experts.switch_glu.down_proj.biases": "model-00003-of-00003.safetensors", + "language_model.model.layers.27.experts.switch_glu.down_proj.scales": "model-00003-of-00003.safetensors", + "language_model.model.layers.27.experts.switch_glu.down_proj.weight": "model-00003-of-00003.safetensors", + "language_model.model.layers.27.experts.switch_glu.gate_proj.biases": "model-00003-of-00003.safetensors", + "language_model.model.layers.27.experts.switch_glu.gate_proj.scales": "model-00003-of-00003.safetensors", + "language_model.model.layers.27.experts.switch_glu.gate_proj.weight": "model-00003-of-00003.safetensors", + "language_model.model.layers.27.experts.switch_glu.up_proj.biases": "model-00003-of-00003.safetensors", + "language_model.model.layers.27.experts.switch_glu.up_proj.scales": "model-00003-of-00003.safetensors", + "language_model.model.layers.27.experts.switch_glu.up_proj.weight": "model-00003-of-00003.safetensors", + "language_model.model.layers.27.input_layernorm.weight": "model-00003-of-00003.safetensors", + "language_model.model.layers.27.layer_scalar": "model-00003-of-00003.safetensors", + "language_model.model.layers.27.mlp.down_proj.biases": "model-00003-of-00003.safetensors", + "language_model.model.layers.27.mlp.down_proj.scales": "model-00003-of-00003.safetensors", + "language_model.model.layers.27.mlp.down_proj.weight": "model-00003-of-00003.safetensors", + "language_model.model.layers.27.mlp.gate_proj.biases": "model-00003-of-00003.safetensors", + "language_model.model.layers.27.mlp.gate_proj.scales": "model-00003-of-00003.safetensors", + "language_model.model.layers.27.mlp.gate_proj.weight": "model-00003-of-00003.safetensors", + "language_model.model.layers.27.mlp.up_proj.biases": "model-00003-of-00003.safetensors", + "language_model.model.layers.27.mlp.up_proj.scales": "model-00003-of-00003.safetensors", + "language_model.model.layers.27.mlp.up_proj.weight": "model-00003-of-00003.safetensors", + "language_model.model.layers.27.post_attention_layernorm.weight": "model-00003-of-00003.safetensors", + "language_model.model.layers.27.post_feedforward_layernorm.weight": "model-00003-of-00003.safetensors", + "language_model.model.layers.27.post_feedforward_layernorm_1.weight": "model-00003-of-00003.safetensors", + "language_model.model.layers.27.post_feedforward_layernorm_2.weight": "model-00003-of-00003.safetensors", + "language_model.model.layers.27.pre_feedforward_layernorm.weight": "model-00003-of-00003.safetensors", + "language_model.model.layers.27.pre_feedforward_layernorm_2.weight": "model-00003-of-00003.safetensors", + "language_model.model.layers.27.router.per_expert_scale": "model-00003-of-00003.safetensors", + "language_model.model.layers.27.router.proj.biases": "model-00003-of-00003.safetensors", + "language_model.model.layers.27.router.proj.scales": "model-00003-of-00003.safetensors", + "language_model.model.layers.27.router.proj.weight": "model-00003-of-00003.safetensors", + "language_model.model.layers.27.router.scale": "model-00003-of-00003.safetensors", + "language_model.model.layers.27.self_attn.k_norm.weight": "model-00003-of-00003.safetensors", + "language_model.model.layers.27.self_attn.k_proj.biases": "model-00003-of-00003.safetensors", + "language_model.model.layers.27.self_attn.k_proj.scales": "model-00003-of-00003.safetensors", + "language_model.model.layers.27.self_attn.k_proj.weight": "model-00003-of-00003.safetensors", + "language_model.model.layers.27.self_attn.o_proj.biases": "model-00003-of-00003.safetensors", + "language_model.model.layers.27.self_attn.o_proj.scales": "model-00003-of-00003.safetensors", + "language_model.model.layers.27.self_attn.o_proj.weight": "model-00003-of-00003.safetensors", + "language_model.model.layers.27.self_attn.q_norm.weight": "model-00003-of-00003.safetensors", + "language_model.model.layers.27.self_attn.q_proj.biases": "model-00003-of-00003.safetensors", + "language_model.model.layers.27.self_attn.q_proj.scales": "model-00003-of-00003.safetensors", + "language_model.model.layers.27.self_attn.q_proj.weight": "model-00003-of-00003.safetensors", + "language_model.model.layers.27.self_attn.v_proj.biases": "model-00003-of-00003.safetensors", + "language_model.model.layers.27.self_attn.v_proj.scales": "model-00003-of-00003.safetensors", + "language_model.model.layers.27.self_attn.v_proj.weight": "model-00003-of-00003.safetensors", + "language_model.model.layers.28.experts.switch_glu.down_proj.biases": "model-00003-of-00003.safetensors", + "language_model.model.layers.28.experts.switch_glu.down_proj.scales": "model-00003-of-00003.safetensors", + "language_model.model.layers.28.experts.switch_glu.down_proj.weight": "model-00003-of-00003.safetensors", + "language_model.model.layers.28.experts.switch_glu.gate_proj.biases": "model-00003-of-00003.safetensors", + "language_model.model.layers.28.experts.switch_glu.gate_proj.scales": "model-00003-of-00003.safetensors", + "language_model.model.layers.28.experts.switch_glu.gate_proj.weight": "model-00003-of-00003.safetensors", + "language_model.model.layers.28.experts.switch_glu.up_proj.biases": "model-00003-of-00003.safetensors", + "language_model.model.layers.28.experts.switch_glu.up_proj.scales": "model-00003-of-00003.safetensors", + "language_model.model.layers.28.experts.switch_glu.up_proj.weight": "model-00003-of-00003.safetensors", + "language_model.model.layers.28.input_layernorm.weight": "model-00003-of-00003.safetensors", + "language_model.model.layers.28.layer_scalar": "model-00003-of-00003.safetensors", + "language_model.model.layers.28.mlp.down_proj.biases": "model-00003-of-00003.safetensors", + "language_model.model.layers.28.mlp.down_proj.scales": "model-00003-of-00003.safetensors", + "language_model.model.layers.28.mlp.down_proj.weight": "model-00003-of-00003.safetensors", + "language_model.model.layers.28.mlp.gate_proj.biases": "model-00003-of-00003.safetensors", + "language_model.model.layers.28.mlp.gate_proj.scales": "model-00003-of-00003.safetensors", + "language_model.model.layers.28.mlp.gate_proj.weight": "model-00003-of-00003.safetensors", + "language_model.model.layers.28.mlp.up_proj.biases": "model-00003-of-00003.safetensors", + "language_model.model.layers.28.mlp.up_proj.scales": "model-00003-of-00003.safetensors", + "language_model.model.layers.28.mlp.up_proj.weight": "model-00003-of-00003.safetensors", + "language_model.model.layers.28.post_attention_layernorm.weight": "model-00003-of-00003.safetensors", + "language_model.model.layers.28.post_feedforward_layernorm.weight": "model-00003-of-00003.safetensors", + "language_model.model.layers.28.post_feedforward_layernorm_1.weight": "model-00003-of-00003.safetensors", + "language_model.model.layers.28.post_feedforward_layernorm_2.weight": "model-00003-of-00003.safetensors", + "language_model.model.layers.28.pre_feedforward_layernorm.weight": "model-00003-of-00003.safetensors", + "language_model.model.layers.28.pre_feedforward_layernorm_2.weight": "model-00003-of-00003.safetensors", + "language_model.model.layers.28.router.per_expert_scale": "model-00003-of-00003.safetensors", + "language_model.model.layers.28.router.proj.biases": "model-00003-of-00003.safetensors", + "language_model.model.layers.28.router.proj.scales": "model-00003-of-00003.safetensors", + "language_model.model.layers.28.router.proj.weight": "model-00003-of-00003.safetensors", + "language_model.model.layers.28.router.scale": "model-00003-of-00003.safetensors", + "language_model.model.layers.28.self_attn.k_norm.weight": "model-00003-of-00003.safetensors", + "language_model.model.layers.28.self_attn.k_proj.biases": "model-00003-of-00003.safetensors", + "language_model.model.layers.28.self_attn.k_proj.scales": "model-00003-of-00003.safetensors", + "language_model.model.layers.28.self_attn.k_proj.weight": "model-00003-of-00003.safetensors", + "language_model.model.layers.28.self_attn.o_proj.biases": "model-00003-of-00003.safetensors", + "language_model.model.layers.28.self_attn.o_proj.scales": "model-00003-of-00003.safetensors", + "language_model.model.layers.28.self_attn.o_proj.weight": "model-00003-of-00003.safetensors", + "language_model.model.layers.28.self_attn.q_norm.weight": "model-00003-of-00003.safetensors", + "language_model.model.layers.28.self_attn.q_proj.biases": "model-00003-of-00003.safetensors", + "language_model.model.layers.28.self_attn.q_proj.scales": "model-00003-of-00003.safetensors", + "language_model.model.layers.28.self_attn.q_proj.weight": "model-00003-of-00003.safetensors", + "language_model.model.layers.28.self_attn.v_proj.biases": "model-00003-of-00003.safetensors", + "language_model.model.layers.28.self_attn.v_proj.scales": "model-00003-of-00003.safetensors", + "language_model.model.layers.28.self_attn.v_proj.weight": "model-00003-of-00003.safetensors", + "language_model.model.layers.29.experts.switch_glu.down_proj.biases": "model-00003-of-00003.safetensors", + "language_model.model.layers.29.experts.switch_glu.down_proj.scales": "model-00003-of-00003.safetensors", + "language_model.model.layers.29.experts.switch_glu.down_proj.weight": "model-00003-of-00003.safetensors", + "language_model.model.layers.29.experts.switch_glu.gate_proj.biases": "model-00003-of-00003.safetensors", + "language_model.model.layers.29.experts.switch_glu.gate_proj.scales": "model-00003-of-00003.safetensors", + "language_model.model.layers.29.experts.switch_glu.gate_proj.weight": "model-00003-of-00003.safetensors", + "language_model.model.layers.29.experts.switch_glu.up_proj.biases": "model-00003-of-00003.safetensors", + "language_model.model.layers.29.experts.switch_glu.up_proj.scales": "model-00003-of-00003.safetensors", + "language_model.model.layers.29.experts.switch_glu.up_proj.weight": "model-00003-of-00003.safetensors", + "language_model.model.layers.29.input_layernorm.weight": "model-00003-of-00003.safetensors", + "language_model.model.layers.29.layer_scalar": "model-00003-of-00003.safetensors", + "language_model.model.layers.29.mlp.down_proj.biases": "model-00003-of-00003.safetensors", + "language_model.model.layers.29.mlp.down_proj.scales": "model-00003-of-00003.safetensors", + "language_model.model.layers.29.mlp.down_proj.weight": "model-00003-of-00003.safetensors", + "language_model.model.layers.29.mlp.gate_proj.biases": "model-00003-of-00003.safetensors", + "language_model.model.layers.29.mlp.gate_proj.scales": "model-00003-of-00003.safetensors", + "language_model.model.layers.29.mlp.gate_proj.weight": "model-00003-of-00003.safetensors", + "language_model.model.layers.29.mlp.up_proj.biases": "model-00003-of-00003.safetensors", + "language_model.model.layers.29.mlp.up_proj.scales": "model-00003-of-00003.safetensors", + "language_model.model.layers.29.mlp.up_proj.weight": "model-00003-of-00003.safetensors", + "language_model.model.layers.29.post_attention_layernorm.weight": "model-00003-of-00003.safetensors", + "language_model.model.layers.29.post_feedforward_layernorm.weight": "model-00003-of-00003.safetensors", + "language_model.model.layers.29.post_feedforward_layernorm_1.weight": "model-00003-of-00003.safetensors", + "language_model.model.layers.29.post_feedforward_layernorm_2.weight": "model-00003-of-00003.safetensors", + "language_model.model.layers.29.pre_feedforward_layernorm.weight": "model-00003-of-00003.safetensors", + "language_model.model.layers.29.pre_feedforward_layernorm_2.weight": "model-00003-of-00003.safetensors", + "language_model.model.layers.29.router.per_expert_scale": "model-00003-of-00003.safetensors", + "language_model.model.layers.29.router.proj.biases": "model-00003-of-00003.safetensors", + "language_model.model.layers.29.router.proj.scales": "model-00003-of-00003.safetensors", + "language_model.model.layers.29.router.proj.weight": "model-00003-of-00003.safetensors", + "language_model.model.layers.29.router.scale": "model-00003-of-00003.safetensors", + "language_model.model.layers.29.self_attn.k_norm.weight": "model-00003-of-00003.safetensors", + "language_model.model.layers.29.self_attn.k_proj.biases": "model-00003-of-00003.safetensors", + "language_model.model.layers.29.self_attn.k_proj.scales": "model-00003-of-00003.safetensors", + "language_model.model.layers.29.self_attn.k_proj.weight": "model-00003-of-00003.safetensors", + "language_model.model.layers.29.self_attn.o_proj.biases": "model-00003-of-00003.safetensors", + "language_model.model.layers.29.self_attn.o_proj.scales": "model-00003-of-00003.safetensors", + "language_model.model.layers.29.self_attn.o_proj.weight": "model-00003-of-00003.safetensors", + "language_model.model.layers.29.self_attn.q_norm.weight": "model-00003-of-00003.safetensors", + "language_model.model.layers.29.self_attn.q_proj.biases": "model-00003-of-00003.safetensors", + "language_model.model.layers.29.self_attn.q_proj.scales": "model-00003-of-00003.safetensors", + "language_model.model.layers.29.self_attn.q_proj.weight": "model-00003-of-00003.safetensors", + "language_model.model.layers.3.experts.switch_glu.down_proj.biases": "model-00001-of-00003.safetensors", + "language_model.model.layers.3.experts.switch_glu.down_proj.scales": "model-00001-of-00003.safetensors", + "language_model.model.layers.3.experts.switch_glu.down_proj.weight": "model-00001-of-00003.safetensors", + "language_model.model.layers.3.experts.switch_glu.gate_proj.biases": "model-00001-of-00003.safetensors", + "language_model.model.layers.3.experts.switch_glu.gate_proj.scales": "model-00001-of-00003.safetensors", + "language_model.model.layers.3.experts.switch_glu.gate_proj.weight": "model-00001-of-00003.safetensors", + "language_model.model.layers.3.experts.switch_glu.up_proj.biases": "model-00001-of-00003.safetensors", + "language_model.model.layers.3.experts.switch_glu.up_proj.scales": "model-00001-of-00003.safetensors", + "language_model.model.layers.3.experts.switch_glu.up_proj.weight": "model-00001-of-00003.safetensors", + "language_model.model.layers.3.input_layernorm.weight": "model-00001-of-00003.safetensors", + "language_model.model.layers.3.layer_scalar": "model-00001-of-00003.safetensors", + "language_model.model.layers.3.mlp.down_proj.biases": "model-00001-of-00003.safetensors", + "language_model.model.layers.3.mlp.down_proj.scales": "model-00001-of-00003.safetensors", + "language_model.model.layers.3.mlp.down_proj.weight": "model-00001-of-00003.safetensors", + "language_model.model.layers.3.mlp.gate_proj.biases": "model-00001-of-00003.safetensors", + "language_model.model.layers.3.mlp.gate_proj.scales": "model-00001-of-00003.safetensors", + "language_model.model.layers.3.mlp.gate_proj.weight": "model-00001-of-00003.safetensors", + "language_model.model.layers.3.mlp.up_proj.biases": "model-00001-of-00003.safetensors", + "language_model.model.layers.3.mlp.up_proj.scales": "model-00001-of-00003.safetensors", + "language_model.model.layers.3.mlp.up_proj.weight": "model-00001-of-00003.safetensors", + "language_model.model.layers.3.post_attention_layernorm.weight": "model-00001-of-00003.safetensors", + "language_model.model.layers.3.post_feedforward_layernorm.weight": "model-00001-of-00003.safetensors", + "language_model.model.layers.3.post_feedforward_layernorm_1.weight": "model-00001-of-00003.safetensors", + "language_model.model.layers.3.post_feedforward_layernorm_2.weight": "model-00001-of-00003.safetensors", + "language_model.model.layers.3.pre_feedforward_layernorm.weight": "model-00001-of-00003.safetensors", + "language_model.model.layers.3.pre_feedforward_layernorm_2.weight": "model-00001-of-00003.safetensors", + "language_model.model.layers.3.router.per_expert_scale": "model-00001-of-00003.safetensors", + "language_model.model.layers.3.router.proj.biases": "model-00001-of-00003.safetensors", + "language_model.model.layers.3.router.proj.scales": "model-00001-of-00003.safetensors", + "language_model.model.layers.3.router.proj.weight": "model-00001-of-00003.safetensors", + "language_model.model.layers.3.router.scale": "model-00001-of-00003.safetensors", + "language_model.model.layers.3.self_attn.k_norm.weight": "model-00001-of-00003.safetensors", + "language_model.model.layers.3.self_attn.k_proj.biases": "model-00001-of-00003.safetensors", + "language_model.model.layers.3.self_attn.k_proj.scales": "model-00001-of-00003.safetensors", + "language_model.model.layers.3.self_attn.k_proj.weight": "model-00001-of-00003.safetensors", + "language_model.model.layers.3.self_attn.o_proj.biases": "model-00001-of-00003.safetensors", + "language_model.model.layers.3.self_attn.o_proj.scales": "model-00001-of-00003.safetensors", + "language_model.model.layers.3.self_attn.o_proj.weight": "model-00001-of-00003.safetensors", + "language_model.model.layers.3.self_attn.q_norm.weight": "model-00001-of-00003.safetensors", + "language_model.model.layers.3.self_attn.q_proj.biases": "model-00001-of-00003.safetensors", + "language_model.model.layers.3.self_attn.q_proj.scales": "model-00001-of-00003.safetensors", + "language_model.model.layers.3.self_attn.q_proj.weight": "model-00001-of-00003.safetensors", + "language_model.model.layers.3.self_attn.v_proj.biases": "model-00001-of-00003.safetensors", + "language_model.model.layers.3.self_attn.v_proj.scales": "model-00001-of-00003.safetensors", + "language_model.model.layers.3.self_attn.v_proj.weight": "model-00001-of-00003.safetensors", + "language_model.model.layers.4.experts.switch_glu.down_proj.biases": "model-00001-of-00003.safetensors", + "language_model.model.layers.4.experts.switch_glu.down_proj.scales": "model-00001-of-00003.safetensors", + "language_model.model.layers.4.experts.switch_glu.down_proj.weight": "model-00001-of-00003.safetensors", + "language_model.model.layers.4.experts.switch_glu.gate_proj.biases": "model-00001-of-00003.safetensors", + "language_model.model.layers.4.experts.switch_glu.gate_proj.scales": "model-00001-of-00003.safetensors", + "language_model.model.layers.4.experts.switch_glu.gate_proj.weight": "model-00001-of-00003.safetensors", + "language_model.model.layers.4.experts.switch_glu.up_proj.biases": "model-00001-of-00003.safetensors", + "language_model.model.layers.4.experts.switch_glu.up_proj.scales": "model-00001-of-00003.safetensors", + "language_model.model.layers.4.experts.switch_glu.up_proj.weight": "model-00001-of-00003.safetensors", + "language_model.model.layers.4.input_layernorm.weight": "model-00001-of-00003.safetensors", + "language_model.model.layers.4.layer_scalar": "model-00001-of-00003.safetensors", + "language_model.model.layers.4.mlp.down_proj.biases": "model-00001-of-00003.safetensors", + "language_model.model.layers.4.mlp.down_proj.scales": "model-00001-of-00003.safetensors", + "language_model.model.layers.4.mlp.down_proj.weight": "model-00001-of-00003.safetensors", + "language_model.model.layers.4.mlp.gate_proj.biases": "model-00001-of-00003.safetensors", + "language_model.model.layers.4.mlp.gate_proj.scales": "model-00001-of-00003.safetensors", + "language_model.model.layers.4.mlp.gate_proj.weight": "model-00001-of-00003.safetensors", + "language_model.model.layers.4.mlp.up_proj.biases": "model-00001-of-00003.safetensors", + "language_model.model.layers.4.mlp.up_proj.scales": "model-00001-of-00003.safetensors", + "language_model.model.layers.4.mlp.up_proj.weight": "model-00001-of-00003.safetensors", + "language_model.model.layers.4.post_attention_layernorm.weight": "model-00001-of-00003.safetensors", + "language_model.model.layers.4.post_feedforward_layernorm.weight": "model-00001-of-00003.safetensors", + "language_model.model.layers.4.post_feedforward_layernorm_1.weight": "model-00001-of-00003.safetensors", + "language_model.model.layers.4.post_feedforward_layernorm_2.weight": "model-00001-of-00003.safetensors", + "language_model.model.layers.4.pre_feedforward_layernorm.weight": "model-00001-of-00003.safetensors", + "language_model.model.layers.4.pre_feedforward_layernorm_2.weight": "model-00001-of-00003.safetensors", + "language_model.model.layers.4.router.per_expert_scale": "model-00001-of-00003.safetensors", + "language_model.model.layers.4.router.proj.biases": "model-00001-of-00003.safetensors", + "language_model.model.layers.4.router.proj.scales": "model-00001-of-00003.safetensors", + "language_model.model.layers.4.router.proj.weight": "model-00001-of-00003.safetensors", + "language_model.model.layers.4.router.scale": "model-00001-of-00003.safetensors", + "language_model.model.layers.4.self_attn.k_norm.weight": "model-00001-of-00003.safetensors", + "language_model.model.layers.4.self_attn.k_proj.biases": "model-00001-of-00003.safetensors", + "language_model.model.layers.4.self_attn.k_proj.scales": "model-00001-of-00003.safetensors", + "language_model.model.layers.4.self_attn.k_proj.weight": "model-00001-of-00003.safetensors", + "language_model.model.layers.4.self_attn.o_proj.biases": "model-00001-of-00003.safetensors", + "language_model.model.layers.4.self_attn.o_proj.scales": "model-00001-of-00003.safetensors", + "language_model.model.layers.4.self_attn.o_proj.weight": "model-00001-of-00003.safetensors", + "language_model.model.layers.4.self_attn.q_norm.weight": "model-00001-of-00003.safetensors", + "language_model.model.layers.4.self_attn.q_proj.biases": "model-00001-of-00003.safetensors", + "language_model.model.layers.4.self_attn.q_proj.scales": "model-00001-of-00003.safetensors", + "language_model.model.layers.4.self_attn.q_proj.weight": "model-00001-of-00003.safetensors", + "language_model.model.layers.4.self_attn.v_proj.biases": "model-00001-of-00003.safetensors", + "language_model.model.layers.4.self_attn.v_proj.scales": "model-00001-of-00003.safetensors", + "language_model.model.layers.4.self_attn.v_proj.weight": "model-00001-of-00003.safetensors", + "language_model.model.layers.5.experts.switch_glu.down_proj.biases": "model-00001-of-00003.safetensors", + "language_model.model.layers.5.experts.switch_glu.down_proj.scales": "model-00001-of-00003.safetensors", + "language_model.model.layers.5.experts.switch_glu.down_proj.weight": "model-00001-of-00003.safetensors", + "language_model.model.layers.5.experts.switch_glu.gate_proj.biases": "model-00001-of-00003.safetensors", + "language_model.model.layers.5.experts.switch_glu.gate_proj.scales": "model-00001-of-00003.safetensors", + "language_model.model.layers.5.experts.switch_glu.gate_proj.weight": "model-00001-of-00003.safetensors", + "language_model.model.layers.5.experts.switch_glu.up_proj.biases": "model-00001-of-00003.safetensors", + "language_model.model.layers.5.experts.switch_glu.up_proj.scales": "model-00001-of-00003.safetensors", + "language_model.model.layers.5.experts.switch_glu.up_proj.weight": "model-00001-of-00003.safetensors", + "language_model.model.layers.5.input_layernorm.weight": "model-00001-of-00003.safetensors", + "language_model.model.layers.5.layer_scalar": "model-00001-of-00003.safetensors", + "language_model.model.layers.5.mlp.down_proj.biases": "model-00001-of-00003.safetensors", + "language_model.model.layers.5.mlp.down_proj.scales": "model-00001-of-00003.safetensors", + "language_model.model.layers.5.mlp.down_proj.weight": "model-00001-of-00003.safetensors", + "language_model.model.layers.5.mlp.gate_proj.biases": "model-00001-of-00003.safetensors", + "language_model.model.layers.5.mlp.gate_proj.scales": "model-00001-of-00003.safetensors", + "language_model.model.layers.5.mlp.gate_proj.weight": "model-00001-of-00003.safetensors", + "language_model.model.layers.5.mlp.up_proj.biases": "model-00001-of-00003.safetensors", + "language_model.model.layers.5.mlp.up_proj.scales": "model-00001-of-00003.safetensors", + "language_model.model.layers.5.mlp.up_proj.weight": "model-00001-of-00003.safetensors", + "language_model.model.layers.5.post_attention_layernorm.weight": "model-00001-of-00003.safetensors", + "language_model.model.layers.5.post_feedforward_layernorm.weight": "model-00001-of-00003.safetensors", + "language_model.model.layers.5.post_feedforward_layernorm_1.weight": "model-00001-of-00003.safetensors", + "language_model.model.layers.5.post_feedforward_layernorm_2.weight": "model-00001-of-00003.safetensors", + "language_model.model.layers.5.pre_feedforward_layernorm.weight": "model-00001-of-00003.safetensors", + "language_model.model.layers.5.pre_feedforward_layernorm_2.weight": "model-00001-of-00003.safetensors", + "language_model.model.layers.5.router.per_expert_scale": "model-00001-of-00003.safetensors", + "language_model.model.layers.5.router.proj.biases": "model-00001-of-00003.safetensors", + "language_model.model.layers.5.router.proj.scales": "model-00001-of-00003.safetensors", + "language_model.model.layers.5.router.proj.weight": "model-00001-of-00003.safetensors", + "language_model.model.layers.5.router.scale": "model-00001-of-00003.safetensors", + "language_model.model.layers.5.self_attn.k_norm.weight": "model-00001-of-00003.safetensors", + "language_model.model.layers.5.self_attn.k_proj.biases": "model-00001-of-00003.safetensors", + "language_model.model.layers.5.self_attn.k_proj.scales": "model-00001-of-00003.safetensors", + "language_model.model.layers.5.self_attn.k_proj.weight": "model-00001-of-00003.safetensors", + "language_model.model.layers.5.self_attn.o_proj.biases": "model-00001-of-00003.safetensors", + "language_model.model.layers.5.self_attn.o_proj.scales": "model-00001-of-00003.safetensors", + "language_model.model.layers.5.self_attn.o_proj.weight": "model-00001-of-00003.safetensors", + "language_model.model.layers.5.self_attn.q_norm.weight": "model-00001-of-00003.safetensors", + "language_model.model.layers.5.self_attn.q_proj.biases": "model-00001-of-00003.safetensors", + "language_model.model.layers.5.self_attn.q_proj.scales": "model-00001-of-00003.safetensors", + "language_model.model.layers.5.self_attn.q_proj.weight": "model-00001-of-00003.safetensors", + "language_model.model.layers.6.experts.switch_glu.down_proj.biases": "model-00001-of-00003.safetensors", + "language_model.model.layers.6.experts.switch_glu.down_proj.scales": "model-00001-of-00003.safetensors", + "language_model.model.layers.6.experts.switch_glu.down_proj.weight": "model-00001-of-00003.safetensors", + "language_model.model.layers.6.experts.switch_glu.gate_proj.biases": "model-00001-of-00003.safetensors", + "language_model.model.layers.6.experts.switch_glu.gate_proj.scales": "model-00001-of-00003.safetensors", + "language_model.model.layers.6.experts.switch_glu.gate_proj.weight": "model-00001-of-00003.safetensors", + "language_model.model.layers.6.experts.switch_glu.up_proj.biases": "model-00001-of-00003.safetensors", + "language_model.model.layers.6.experts.switch_glu.up_proj.scales": "model-00001-of-00003.safetensors", + "language_model.model.layers.6.experts.switch_glu.up_proj.weight": "model-00001-of-00003.safetensors", + "language_model.model.layers.6.input_layernorm.weight": "model-00001-of-00003.safetensors", + "language_model.model.layers.6.layer_scalar": "model-00001-of-00003.safetensors", + "language_model.model.layers.6.mlp.down_proj.biases": "model-00001-of-00003.safetensors", + "language_model.model.layers.6.mlp.down_proj.scales": "model-00001-of-00003.safetensors", + "language_model.model.layers.6.mlp.down_proj.weight": "model-00001-of-00003.safetensors", + "language_model.model.layers.6.mlp.gate_proj.biases": "model-00001-of-00003.safetensors", + "language_model.model.layers.6.mlp.gate_proj.scales": "model-00001-of-00003.safetensors", + "language_model.model.layers.6.mlp.gate_proj.weight": "model-00001-of-00003.safetensors", + "language_model.model.layers.6.mlp.up_proj.biases": "model-00001-of-00003.safetensors", + "language_model.model.layers.6.mlp.up_proj.scales": "model-00001-of-00003.safetensors", + "language_model.model.layers.6.mlp.up_proj.weight": "model-00001-of-00003.safetensors", + "language_model.model.layers.6.post_attention_layernorm.weight": "model-00001-of-00003.safetensors", + "language_model.model.layers.6.post_feedforward_layernorm.weight": "model-00001-of-00003.safetensors", + "language_model.model.layers.6.post_feedforward_layernorm_1.weight": "model-00001-of-00003.safetensors", + "language_model.model.layers.6.post_feedforward_layernorm_2.weight": "model-00001-of-00003.safetensors", + "language_model.model.layers.6.pre_feedforward_layernorm.weight": "model-00001-of-00003.safetensors", + "language_model.model.layers.6.pre_feedforward_layernorm_2.weight": "model-00001-of-00003.safetensors", + "language_model.model.layers.6.router.per_expert_scale": "model-00001-of-00003.safetensors", + "language_model.model.layers.6.router.proj.biases": "model-00001-of-00003.safetensors", + "language_model.model.layers.6.router.proj.scales": "model-00001-of-00003.safetensors", + "language_model.model.layers.6.router.proj.weight": "model-00001-of-00003.safetensors", + "language_model.model.layers.6.router.scale": "model-00001-of-00003.safetensors", + "language_model.model.layers.6.self_attn.k_norm.weight": "model-00001-of-00003.safetensors", + "language_model.model.layers.6.self_attn.k_proj.biases": "model-00001-of-00003.safetensors", + "language_model.model.layers.6.self_attn.k_proj.scales": "model-00001-of-00003.safetensors", + "language_model.model.layers.6.self_attn.k_proj.weight": "model-00001-of-00003.safetensors", + "language_model.model.layers.6.self_attn.o_proj.biases": "model-00001-of-00003.safetensors", + "language_model.model.layers.6.self_attn.o_proj.scales": "model-00001-of-00003.safetensors", + "language_model.model.layers.6.self_attn.o_proj.weight": "model-00001-of-00003.safetensors", + "language_model.model.layers.6.self_attn.q_norm.weight": "model-00001-of-00003.safetensors", + "language_model.model.layers.6.self_attn.q_proj.biases": "model-00001-of-00003.safetensors", + "language_model.model.layers.6.self_attn.q_proj.scales": "model-00001-of-00003.safetensors", + "language_model.model.layers.6.self_attn.q_proj.weight": "model-00001-of-00003.safetensors", + "language_model.model.layers.6.self_attn.v_proj.biases": "model-00001-of-00003.safetensors", + "language_model.model.layers.6.self_attn.v_proj.scales": "model-00001-of-00003.safetensors", + "language_model.model.layers.6.self_attn.v_proj.weight": "model-00001-of-00003.safetensors", + "language_model.model.layers.7.experts.switch_glu.down_proj.biases": "model-00001-of-00003.safetensors", + "language_model.model.layers.7.experts.switch_glu.down_proj.scales": "model-00001-of-00003.safetensors", + "language_model.model.layers.7.experts.switch_glu.down_proj.weight": "model-00001-of-00003.safetensors", + "language_model.model.layers.7.experts.switch_glu.gate_proj.biases": "model-00001-of-00003.safetensors", + "language_model.model.layers.7.experts.switch_glu.gate_proj.scales": "model-00001-of-00003.safetensors", + "language_model.model.layers.7.experts.switch_glu.gate_proj.weight": "model-00001-of-00003.safetensors", + "language_model.model.layers.7.experts.switch_glu.up_proj.biases": "model-00001-of-00003.safetensors", + "language_model.model.layers.7.experts.switch_glu.up_proj.scales": "model-00001-of-00003.safetensors", + "language_model.model.layers.7.experts.switch_glu.up_proj.weight": "model-00001-of-00003.safetensors", + "language_model.model.layers.7.input_layernorm.weight": "model-00001-of-00003.safetensors", + "language_model.model.layers.7.layer_scalar": "model-00001-of-00003.safetensors", + "language_model.model.layers.7.mlp.down_proj.biases": "model-00001-of-00003.safetensors", + "language_model.model.layers.7.mlp.down_proj.scales": "model-00001-of-00003.safetensors", + "language_model.model.layers.7.mlp.down_proj.weight": "model-00001-of-00003.safetensors", + "language_model.model.layers.7.mlp.gate_proj.biases": "model-00001-of-00003.safetensors", + "language_model.model.layers.7.mlp.gate_proj.scales": "model-00001-of-00003.safetensors", + "language_model.model.layers.7.mlp.gate_proj.weight": "model-00001-of-00003.safetensors", + "language_model.model.layers.7.mlp.up_proj.biases": "model-00001-of-00003.safetensors", + "language_model.model.layers.7.mlp.up_proj.scales": "model-00001-of-00003.safetensors", + "language_model.model.layers.7.mlp.up_proj.weight": "model-00001-of-00003.safetensors", + "language_model.model.layers.7.post_attention_layernorm.weight": "model-00001-of-00003.safetensors", + "language_model.model.layers.7.post_feedforward_layernorm.weight": "model-00001-of-00003.safetensors", + "language_model.model.layers.7.post_feedforward_layernorm_1.weight": "model-00001-of-00003.safetensors", + "language_model.model.layers.7.post_feedforward_layernorm_2.weight": "model-00001-of-00003.safetensors", + "language_model.model.layers.7.pre_feedforward_layernorm.weight": "model-00001-of-00003.safetensors", + "language_model.model.layers.7.pre_feedforward_layernorm_2.weight": "model-00001-of-00003.safetensors", + "language_model.model.layers.7.router.per_expert_scale": "model-00001-of-00003.safetensors", + "language_model.model.layers.7.router.proj.biases": "model-00001-of-00003.safetensors", + "language_model.model.layers.7.router.proj.scales": "model-00001-of-00003.safetensors", + "language_model.model.layers.7.router.proj.weight": "model-00001-of-00003.safetensors", + "language_model.model.layers.7.router.scale": "model-00001-of-00003.safetensors", + "language_model.model.layers.7.self_attn.k_norm.weight": "model-00001-of-00003.safetensors", + "language_model.model.layers.7.self_attn.k_proj.biases": "model-00001-of-00003.safetensors", + "language_model.model.layers.7.self_attn.k_proj.scales": "model-00001-of-00003.safetensors", + "language_model.model.layers.7.self_attn.k_proj.weight": "model-00001-of-00003.safetensors", + "language_model.model.layers.7.self_attn.o_proj.biases": "model-00001-of-00003.safetensors", + "language_model.model.layers.7.self_attn.o_proj.scales": "model-00001-of-00003.safetensors", + "language_model.model.layers.7.self_attn.o_proj.weight": "model-00001-of-00003.safetensors", + "language_model.model.layers.7.self_attn.q_norm.weight": "model-00001-of-00003.safetensors", + "language_model.model.layers.7.self_attn.q_proj.biases": "model-00001-of-00003.safetensors", + "language_model.model.layers.7.self_attn.q_proj.scales": "model-00001-of-00003.safetensors", + "language_model.model.layers.7.self_attn.q_proj.weight": "model-00001-of-00003.safetensors", + "language_model.model.layers.7.self_attn.v_proj.biases": "model-00001-of-00003.safetensors", + "language_model.model.layers.7.self_attn.v_proj.scales": "model-00001-of-00003.safetensors", + "language_model.model.layers.7.self_attn.v_proj.weight": "model-00001-of-00003.safetensors", + "language_model.model.layers.8.experts.switch_glu.down_proj.biases": "model-00001-of-00003.safetensors", + "language_model.model.layers.8.experts.switch_glu.down_proj.scales": "model-00001-of-00003.safetensors", + "language_model.model.layers.8.experts.switch_glu.down_proj.weight": "model-00001-of-00003.safetensors", + "language_model.model.layers.8.experts.switch_glu.gate_proj.biases": "model-00001-of-00003.safetensors", + "language_model.model.layers.8.experts.switch_glu.gate_proj.scales": "model-00001-of-00003.safetensors", + "language_model.model.layers.8.experts.switch_glu.gate_proj.weight": "model-00001-of-00003.safetensors", + "language_model.model.layers.8.experts.switch_glu.up_proj.biases": "model-00001-of-00003.safetensors", + "language_model.model.layers.8.experts.switch_glu.up_proj.scales": "model-00001-of-00003.safetensors", + "language_model.model.layers.8.experts.switch_glu.up_proj.weight": "model-00001-of-00003.safetensors", + "language_model.model.layers.8.input_layernorm.weight": "model-00001-of-00003.safetensors", + "language_model.model.layers.8.layer_scalar": "model-00001-of-00003.safetensors", + "language_model.model.layers.8.mlp.down_proj.biases": "model-00001-of-00003.safetensors", + "language_model.model.layers.8.mlp.down_proj.scales": "model-00001-of-00003.safetensors", + "language_model.model.layers.8.mlp.down_proj.weight": "model-00001-of-00003.safetensors", + "language_model.model.layers.8.mlp.gate_proj.biases": "model-00001-of-00003.safetensors", + "language_model.model.layers.8.mlp.gate_proj.scales": "model-00001-of-00003.safetensors", + "language_model.model.layers.8.mlp.gate_proj.weight": "model-00001-of-00003.safetensors", + "language_model.model.layers.8.mlp.up_proj.biases": "model-00001-of-00003.safetensors", + "language_model.model.layers.8.mlp.up_proj.scales": "model-00001-of-00003.safetensors", + "language_model.model.layers.8.mlp.up_proj.weight": "model-00001-of-00003.safetensors", + "language_model.model.layers.8.post_attention_layernorm.weight": "model-00001-of-00003.safetensors", + "language_model.model.layers.8.post_feedforward_layernorm.weight": "model-00001-of-00003.safetensors", + "language_model.model.layers.8.post_feedforward_layernorm_1.weight": "model-00001-of-00003.safetensors", + "language_model.model.layers.8.post_feedforward_layernorm_2.weight": "model-00001-of-00003.safetensors", + "language_model.model.layers.8.pre_feedforward_layernorm.weight": "model-00001-of-00003.safetensors", + "language_model.model.layers.8.pre_feedforward_layernorm_2.weight": "model-00001-of-00003.safetensors", + "language_model.model.layers.8.router.per_expert_scale": "model-00001-of-00003.safetensors", + "language_model.model.layers.8.router.proj.biases": "model-00001-of-00003.safetensors", + "language_model.model.layers.8.router.proj.scales": "model-00001-of-00003.safetensors", + "language_model.model.layers.8.router.proj.weight": "model-00001-of-00003.safetensors", + "language_model.model.layers.8.router.scale": "model-00001-of-00003.safetensors", + "language_model.model.layers.8.self_attn.k_norm.weight": "model-00001-of-00003.safetensors", + "language_model.model.layers.8.self_attn.k_proj.biases": "model-00001-of-00003.safetensors", + "language_model.model.layers.8.self_attn.k_proj.scales": "model-00001-of-00003.safetensors", + "language_model.model.layers.8.self_attn.k_proj.weight": "model-00001-of-00003.safetensors", + "language_model.model.layers.8.self_attn.o_proj.biases": "model-00001-of-00003.safetensors", + "language_model.model.layers.8.self_attn.o_proj.scales": "model-00001-of-00003.safetensors", + "language_model.model.layers.8.self_attn.o_proj.weight": "model-00001-of-00003.safetensors", + "language_model.model.layers.8.self_attn.q_norm.weight": "model-00001-of-00003.safetensors", + "language_model.model.layers.8.self_attn.q_proj.biases": "model-00001-of-00003.safetensors", + "language_model.model.layers.8.self_attn.q_proj.scales": "model-00001-of-00003.safetensors", + "language_model.model.layers.8.self_attn.q_proj.weight": "model-00001-of-00003.safetensors", + "language_model.model.layers.8.self_attn.v_proj.biases": "model-00001-of-00003.safetensors", + "language_model.model.layers.8.self_attn.v_proj.scales": "model-00001-of-00003.safetensors", + "language_model.model.layers.8.self_attn.v_proj.weight": "model-00001-of-00003.safetensors", + "language_model.model.layers.9.experts.switch_glu.down_proj.biases": "model-00001-of-00003.safetensors", + "language_model.model.layers.9.experts.switch_glu.down_proj.scales": "model-00001-of-00003.safetensors", + "language_model.model.layers.9.experts.switch_glu.down_proj.weight": "model-00001-of-00003.safetensors", + "language_model.model.layers.9.experts.switch_glu.gate_proj.biases": "model-00001-of-00003.safetensors", + "language_model.model.layers.9.experts.switch_glu.gate_proj.scales": "model-00001-of-00003.safetensors", + "language_model.model.layers.9.experts.switch_glu.gate_proj.weight": "model-00001-of-00003.safetensors", + "language_model.model.layers.9.experts.switch_glu.up_proj.biases": "model-00001-of-00003.safetensors", + "language_model.model.layers.9.experts.switch_glu.up_proj.scales": "model-00001-of-00003.safetensors", + "language_model.model.layers.9.experts.switch_glu.up_proj.weight": "model-00001-of-00003.safetensors", + "language_model.model.layers.9.input_layernorm.weight": "model-00001-of-00003.safetensors", + "language_model.model.layers.9.layer_scalar": "model-00001-of-00003.safetensors", + "language_model.model.layers.9.mlp.down_proj.biases": "model-00001-of-00003.safetensors", + "language_model.model.layers.9.mlp.down_proj.scales": "model-00001-of-00003.safetensors", + "language_model.model.layers.9.mlp.down_proj.weight": "model-00001-of-00003.safetensors", + "language_model.model.layers.9.mlp.gate_proj.biases": "model-00001-of-00003.safetensors", + "language_model.model.layers.9.mlp.gate_proj.scales": "model-00001-of-00003.safetensors", + "language_model.model.layers.9.mlp.gate_proj.weight": "model-00001-of-00003.safetensors", + "language_model.model.layers.9.mlp.up_proj.biases": "model-00001-of-00003.safetensors", + "language_model.model.layers.9.mlp.up_proj.scales": "model-00001-of-00003.safetensors", + "language_model.model.layers.9.mlp.up_proj.weight": "model-00001-of-00003.safetensors", + "language_model.model.layers.9.post_attention_layernorm.weight": "model-00001-of-00003.safetensors", + "language_model.model.layers.9.post_feedforward_layernorm.weight": "model-00001-of-00003.safetensors", + "language_model.model.layers.9.post_feedforward_layernorm_1.weight": "model-00001-of-00003.safetensors", + "language_model.model.layers.9.post_feedforward_layernorm_2.weight": "model-00001-of-00003.safetensors", + "language_model.model.layers.9.pre_feedforward_layernorm.weight": "model-00001-of-00003.safetensors", + "language_model.model.layers.9.pre_feedforward_layernorm_2.weight": "model-00001-of-00003.safetensors", + "language_model.model.layers.9.router.per_expert_scale": "model-00001-of-00003.safetensors", + "language_model.model.layers.9.router.proj.biases": "model-00001-of-00003.safetensors", + "language_model.model.layers.9.router.proj.scales": "model-00001-of-00003.safetensors", + "language_model.model.layers.9.router.proj.weight": "model-00001-of-00003.safetensors", + "language_model.model.layers.9.router.scale": "model-00001-of-00003.safetensors", + "language_model.model.layers.9.self_attn.k_norm.weight": "model-00001-of-00003.safetensors", + "language_model.model.layers.9.self_attn.k_proj.biases": "model-00001-of-00003.safetensors", + "language_model.model.layers.9.self_attn.k_proj.scales": "model-00001-of-00003.safetensors", + "language_model.model.layers.9.self_attn.k_proj.weight": "model-00001-of-00003.safetensors", + "language_model.model.layers.9.self_attn.o_proj.biases": "model-00001-of-00003.safetensors", + "language_model.model.layers.9.self_attn.o_proj.scales": "model-00001-of-00003.safetensors", + "language_model.model.layers.9.self_attn.o_proj.weight": "model-00001-of-00003.safetensors", + "language_model.model.layers.9.self_attn.q_norm.weight": "model-00001-of-00003.safetensors", + "language_model.model.layers.9.self_attn.q_proj.biases": "model-00001-of-00003.safetensors", + "language_model.model.layers.9.self_attn.q_proj.scales": "model-00001-of-00003.safetensors", + "language_model.model.layers.9.self_attn.q_proj.weight": "model-00001-of-00003.safetensors", + "language_model.model.layers.9.self_attn.v_proj.biases": "model-00001-of-00003.safetensors", + "language_model.model.layers.9.self_attn.v_proj.scales": "model-00001-of-00003.safetensors", + "language_model.model.layers.9.self_attn.v_proj.weight": "model-00001-of-00003.safetensors", + "language_model.model.norm.weight": "model-00003-of-00003.safetensors", + "vision_tower.encoder.layers.0.input_layernorm.weight": "model-00003-of-00003.safetensors", + "vision_tower.encoder.layers.0.mlp.down_proj.linear.weight": "model-00003-of-00003.safetensors", + "vision_tower.encoder.layers.0.mlp.gate_proj.linear.weight": "model-00003-of-00003.safetensors", + "vision_tower.encoder.layers.0.mlp.up_proj.linear.weight": "model-00003-of-00003.safetensors", + "vision_tower.encoder.layers.0.post_attention_layernorm.weight": "model-00003-of-00003.safetensors", + "vision_tower.encoder.layers.0.post_feedforward_layernorm.weight": "model-00003-of-00003.safetensors", + "vision_tower.encoder.layers.0.pre_feedforward_layernorm.weight": "model-00003-of-00003.safetensors", + "vision_tower.encoder.layers.0.self_attn.k_norm.weight": "model-00003-of-00003.safetensors", + "vision_tower.encoder.layers.0.self_attn.k_proj.linear.weight": "model-00003-of-00003.safetensors", + "vision_tower.encoder.layers.0.self_attn.o_proj.linear.weight": "model-00003-of-00003.safetensors", + "vision_tower.encoder.layers.0.self_attn.q_norm.weight": "model-00003-of-00003.safetensors", + "vision_tower.encoder.layers.0.self_attn.q_proj.linear.weight": "model-00003-of-00003.safetensors", + "vision_tower.encoder.layers.0.self_attn.v_proj.linear.weight": "model-00003-of-00003.safetensors", + "vision_tower.encoder.layers.1.input_layernorm.weight": "model-00003-of-00003.safetensors", + "vision_tower.encoder.layers.1.mlp.down_proj.linear.weight": "model-00003-of-00003.safetensors", + "vision_tower.encoder.layers.1.mlp.gate_proj.linear.weight": "model-00003-of-00003.safetensors", + "vision_tower.encoder.layers.1.mlp.up_proj.linear.weight": "model-00003-of-00003.safetensors", + "vision_tower.encoder.layers.1.post_attention_layernorm.weight": "model-00003-of-00003.safetensors", + "vision_tower.encoder.layers.1.post_feedforward_layernorm.weight": "model-00003-of-00003.safetensors", + "vision_tower.encoder.layers.1.pre_feedforward_layernorm.weight": "model-00003-of-00003.safetensors", + "vision_tower.encoder.layers.1.self_attn.k_norm.weight": "model-00003-of-00003.safetensors", + "vision_tower.encoder.layers.1.self_attn.k_proj.linear.weight": "model-00003-of-00003.safetensors", + "vision_tower.encoder.layers.1.self_attn.o_proj.linear.weight": "model-00003-of-00003.safetensors", + "vision_tower.encoder.layers.1.self_attn.q_norm.weight": "model-00003-of-00003.safetensors", + "vision_tower.encoder.layers.1.self_attn.q_proj.linear.weight": "model-00003-of-00003.safetensors", + "vision_tower.encoder.layers.1.self_attn.v_proj.linear.weight": "model-00003-of-00003.safetensors", + "vision_tower.encoder.layers.10.input_layernorm.weight": "model-00003-of-00003.safetensors", + "vision_tower.encoder.layers.10.mlp.down_proj.linear.weight": "model-00003-of-00003.safetensors", + "vision_tower.encoder.layers.10.mlp.gate_proj.linear.weight": "model-00003-of-00003.safetensors", + "vision_tower.encoder.layers.10.mlp.up_proj.linear.weight": "model-00003-of-00003.safetensors", + "vision_tower.encoder.layers.10.post_attention_layernorm.weight": "model-00003-of-00003.safetensors", + "vision_tower.encoder.layers.10.post_feedforward_layernorm.weight": "model-00003-of-00003.safetensors", + "vision_tower.encoder.layers.10.pre_feedforward_layernorm.weight": "model-00003-of-00003.safetensors", + "vision_tower.encoder.layers.10.self_attn.k_norm.weight": "model-00003-of-00003.safetensors", + "vision_tower.encoder.layers.10.self_attn.k_proj.linear.weight": "model-00003-of-00003.safetensors", + "vision_tower.encoder.layers.10.self_attn.o_proj.linear.weight": "model-00003-of-00003.safetensors", + "vision_tower.encoder.layers.10.self_attn.q_norm.weight": "model-00003-of-00003.safetensors", + "vision_tower.encoder.layers.10.self_attn.q_proj.linear.weight": "model-00003-of-00003.safetensors", + "vision_tower.encoder.layers.10.self_attn.v_proj.linear.weight": "model-00003-of-00003.safetensors", + "vision_tower.encoder.layers.11.input_layernorm.weight": "model-00003-of-00003.safetensors", + "vision_tower.encoder.layers.11.mlp.down_proj.linear.weight": "model-00003-of-00003.safetensors", + "vision_tower.encoder.layers.11.mlp.gate_proj.linear.weight": "model-00003-of-00003.safetensors", + "vision_tower.encoder.layers.11.mlp.up_proj.linear.weight": "model-00003-of-00003.safetensors", + "vision_tower.encoder.layers.11.post_attention_layernorm.weight": "model-00003-of-00003.safetensors", + "vision_tower.encoder.layers.11.post_feedforward_layernorm.weight": "model-00003-of-00003.safetensors", + "vision_tower.encoder.layers.11.pre_feedforward_layernorm.weight": "model-00003-of-00003.safetensors", + "vision_tower.encoder.layers.11.self_attn.k_norm.weight": "model-00003-of-00003.safetensors", + "vision_tower.encoder.layers.11.self_attn.k_proj.linear.weight": "model-00003-of-00003.safetensors", + "vision_tower.encoder.layers.11.self_attn.o_proj.linear.weight": "model-00003-of-00003.safetensors", + "vision_tower.encoder.layers.11.self_attn.q_norm.weight": "model-00003-of-00003.safetensors", + "vision_tower.encoder.layers.11.self_attn.q_proj.linear.weight": "model-00003-of-00003.safetensors", + "vision_tower.encoder.layers.11.self_attn.v_proj.linear.weight": "model-00003-of-00003.safetensors", + "vision_tower.encoder.layers.12.input_layernorm.weight": "model-00003-of-00003.safetensors", + "vision_tower.encoder.layers.12.mlp.down_proj.linear.weight": "model-00003-of-00003.safetensors", + "vision_tower.encoder.layers.12.mlp.gate_proj.linear.weight": "model-00003-of-00003.safetensors", + "vision_tower.encoder.layers.12.mlp.up_proj.linear.weight": "model-00003-of-00003.safetensors", + "vision_tower.encoder.layers.12.post_attention_layernorm.weight": "model-00003-of-00003.safetensors", + "vision_tower.encoder.layers.12.post_feedforward_layernorm.weight": "model-00003-of-00003.safetensors", + "vision_tower.encoder.layers.12.pre_feedforward_layernorm.weight": "model-00003-of-00003.safetensors", + "vision_tower.encoder.layers.12.self_attn.k_norm.weight": "model-00003-of-00003.safetensors", + "vision_tower.encoder.layers.12.self_attn.k_proj.linear.weight": "model-00003-of-00003.safetensors", + "vision_tower.encoder.layers.12.self_attn.o_proj.linear.weight": "model-00003-of-00003.safetensors", + "vision_tower.encoder.layers.12.self_attn.q_norm.weight": "model-00003-of-00003.safetensors", + "vision_tower.encoder.layers.12.self_attn.q_proj.linear.weight": "model-00003-of-00003.safetensors", + "vision_tower.encoder.layers.12.self_attn.v_proj.linear.weight": "model-00003-of-00003.safetensors", + "vision_tower.encoder.layers.13.input_layernorm.weight": "model-00003-of-00003.safetensors", + "vision_tower.encoder.layers.13.mlp.down_proj.linear.weight": "model-00003-of-00003.safetensors", + "vision_tower.encoder.layers.13.mlp.gate_proj.linear.weight": "model-00003-of-00003.safetensors", + "vision_tower.encoder.layers.13.mlp.up_proj.linear.weight": "model-00003-of-00003.safetensors", + "vision_tower.encoder.layers.13.post_attention_layernorm.weight": "model-00003-of-00003.safetensors", + "vision_tower.encoder.layers.13.post_feedforward_layernorm.weight": "model-00003-of-00003.safetensors", + "vision_tower.encoder.layers.13.pre_feedforward_layernorm.weight": "model-00003-of-00003.safetensors", + "vision_tower.encoder.layers.13.self_attn.k_norm.weight": "model-00003-of-00003.safetensors", + "vision_tower.encoder.layers.13.self_attn.k_proj.linear.weight": "model-00003-of-00003.safetensors", + "vision_tower.encoder.layers.13.self_attn.o_proj.linear.weight": "model-00003-of-00003.safetensors", + "vision_tower.encoder.layers.13.self_attn.q_norm.weight": "model-00003-of-00003.safetensors", + "vision_tower.encoder.layers.13.self_attn.q_proj.linear.weight": "model-00003-of-00003.safetensors", + "vision_tower.encoder.layers.13.self_attn.v_proj.linear.weight": "model-00003-of-00003.safetensors", + "vision_tower.encoder.layers.14.input_layernorm.weight": "model-00003-of-00003.safetensors", + "vision_tower.encoder.layers.14.mlp.down_proj.linear.weight": "model-00003-of-00003.safetensors", + "vision_tower.encoder.layers.14.mlp.gate_proj.linear.weight": "model-00003-of-00003.safetensors", + "vision_tower.encoder.layers.14.mlp.up_proj.linear.weight": "model-00003-of-00003.safetensors", + "vision_tower.encoder.layers.14.post_attention_layernorm.weight": "model-00003-of-00003.safetensors", + "vision_tower.encoder.layers.14.post_feedforward_layernorm.weight": "model-00003-of-00003.safetensors", + "vision_tower.encoder.layers.14.pre_feedforward_layernorm.weight": "model-00003-of-00003.safetensors", + "vision_tower.encoder.layers.14.self_attn.k_norm.weight": "model-00003-of-00003.safetensors", + "vision_tower.encoder.layers.14.self_attn.k_proj.linear.weight": "model-00003-of-00003.safetensors", + "vision_tower.encoder.layers.14.self_attn.o_proj.linear.weight": "model-00003-of-00003.safetensors", + "vision_tower.encoder.layers.14.self_attn.q_norm.weight": "model-00003-of-00003.safetensors", + "vision_tower.encoder.layers.14.self_attn.q_proj.linear.weight": "model-00003-of-00003.safetensors", + "vision_tower.encoder.layers.14.self_attn.v_proj.linear.weight": "model-00003-of-00003.safetensors", + "vision_tower.encoder.layers.15.input_layernorm.weight": "model-00003-of-00003.safetensors", + "vision_tower.encoder.layers.15.mlp.down_proj.linear.weight": "model-00003-of-00003.safetensors", + "vision_tower.encoder.layers.15.mlp.gate_proj.linear.weight": "model-00003-of-00003.safetensors", + "vision_tower.encoder.layers.15.mlp.up_proj.linear.weight": "model-00003-of-00003.safetensors", + "vision_tower.encoder.layers.15.post_attention_layernorm.weight": "model-00003-of-00003.safetensors", + "vision_tower.encoder.layers.15.post_feedforward_layernorm.weight": "model-00003-of-00003.safetensors", + "vision_tower.encoder.layers.15.pre_feedforward_layernorm.weight": "model-00003-of-00003.safetensors", + "vision_tower.encoder.layers.15.self_attn.k_norm.weight": "model-00003-of-00003.safetensors", + "vision_tower.encoder.layers.15.self_attn.k_proj.linear.weight": "model-00003-of-00003.safetensors", + "vision_tower.encoder.layers.15.self_attn.o_proj.linear.weight": "model-00003-of-00003.safetensors", + "vision_tower.encoder.layers.15.self_attn.q_norm.weight": "model-00003-of-00003.safetensors", + "vision_tower.encoder.layers.15.self_attn.q_proj.linear.weight": "model-00003-of-00003.safetensors", + "vision_tower.encoder.layers.15.self_attn.v_proj.linear.weight": "model-00003-of-00003.safetensors", + "vision_tower.encoder.layers.16.input_layernorm.weight": "model-00003-of-00003.safetensors", + "vision_tower.encoder.layers.16.mlp.down_proj.linear.weight": "model-00003-of-00003.safetensors", + "vision_tower.encoder.layers.16.mlp.gate_proj.linear.weight": "model-00003-of-00003.safetensors", + "vision_tower.encoder.layers.16.mlp.up_proj.linear.weight": "model-00003-of-00003.safetensors", + "vision_tower.encoder.layers.16.post_attention_layernorm.weight": "model-00003-of-00003.safetensors", + "vision_tower.encoder.layers.16.post_feedforward_layernorm.weight": "model-00003-of-00003.safetensors", + "vision_tower.encoder.layers.16.pre_feedforward_layernorm.weight": "model-00003-of-00003.safetensors", + "vision_tower.encoder.layers.16.self_attn.k_norm.weight": "model-00003-of-00003.safetensors", + "vision_tower.encoder.layers.16.self_attn.k_proj.linear.weight": "model-00003-of-00003.safetensors", + "vision_tower.encoder.layers.16.self_attn.o_proj.linear.weight": "model-00003-of-00003.safetensors", + "vision_tower.encoder.layers.16.self_attn.q_norm.weight": "model-00003-of-00003.safetensors", + "vision_tower.encoder.layers.16.self_attn.q_proj.linear.weight": "model-00003-of-00003.safetensors", + "vision_tower.encoder.layers.16.self_attn.v_proj.linear.weight": "model-00003-of-00003.safetensors", + "vision_tower.encoder.layers.17.input_layernorm.weight": "model-00003-of-00003.safetensors", + "vision_tower.encoder.layers.17.mlp.down_proj.linear.weight": "model-00003-of-00003.safetensors", + "vision_tower.encoder.layers.17.mlp.gate_proj.linear.weight": "model-00003-of-00003.safetensors", + "vision_tower.encoder.layers.17.mlp.up_proj.linear.weight": "model-00003-of-00003.safetensors", + "vision_tower.encoder.layers.17.post_attention_layernorm.weight": "model-00003-of-00003.safetensors", + "vision_tower.encoder.layers.17.post_feedforward_layernorm.weight": "model-00003-of-00003.safetensors", + "vision_tower.encoder.layers.17.pre_feedforward_layernorm.weight": "model-00003-of-00003.safetensors", + "vision_tower.encoder.layers.17.self_attn.k_norm.weight": "model-00003-of-00003.safetensors", + "vision_tower.encoder.layers.17.self_attn.k_proj.linear.weight": "model-00003-of-00003.safetensors", + "vision_tower.encoder.layers.17.self_attn.o_proj.linear.weight": "model-00003-of-00003.safetensors", + "vision_tower.encoder.layers.17.self_attn.q_norm.weight": "model-00003-of-00003.safetensors", + "vision_tower.encoder.layers.17.self_attn.q_proj.linear.weight": "model-00003-of-00003.safetensors", + "vision_tower.encoder.layers.17.self_attn.v_proj.linear.weight": "model-00003-of-00003.safetensors", + "vision_tower.encoder.layers.18.input_layernorm.weight": "model-00003-of-00003.safetensors", + "vision_tower.encoder.layers.18.mlp.down_proj.linear.weight": "model-00003-of-00003.safetensors", + "vision_tower.encoder.layers.18.mlp.gate_proj.linear.weight": "model-00003-of-00003.safetensors", + "vision_tower.encoder.layers.18.mlp.up_proj.linear.weight": "model-00003-of-00003.safetensors", + "vision_tower.encoder.layers.18.post_attention_layernorm.weight": "model-00003-of-00003.safetensors", + "vision_tower.encoder.layers.18.post_feedforward_layernorm.weight": "model-00003-of-00003.safetensors", + "vision_tower.encoder.layers.18.pre_feedforward_layernorm.weight": "model-00003-of-00003.safetensors", + "vision_tower.encoder.layers.18.self_attn.k_norm.weight": "model-00003-of-00003.safetensors", + "vision_tower.encoder.layers.18.self_attn.k_proj.linear.weight": "model-00003-of-00003.safetensors", + "vision_tower.encoder.layers.18.self_attn.o_proj.linear.weight": "model-00003-of-00003.safetensors", + "vision_tower.encoder.layers.18.self_attn.q_norm.weight": "model-00003-of-00003.safetensors", + "vision_tower.encoder.layers.18.self_attn.q_proj.linear.weight": "model-00003-of-00003.safetensors", + "vision_tower.encoder.layers.18.self_attn.v_proj.linear.weight": "model-00003-of-00003.safetensors", + "vision_tower.encoder.layers.19.input_layernorm.weight": "model-00003-of-00003.safetensors", + "vision_tower.encoder.layers.19.mlp.down_proj.linear.weight": "model-00003-of-00003.safetensors", + "vision_tower.encoder.layers.19.mlp.gate_proj.linear.weight": "model-00003-of-00003.safetensors", + "vision_tower.encoder.layers.19.mlp.up_proj.linear.weight": "model-00003-of-00003.safetensors", + "vision_tower.encoder.layers.19.post_attention_layernorm.weight": "model-00003-of-00003.safetensors", + "vision_tower.encoder.layers.19.post_feedforward_layernorm.weight": "model-00003-of-00003.safetensors", + "vision_tower.encoder.layers.19.pre_feedforward_layernorm.weight": "model-00003-of-00003.safetensors", + "vision_tower.encoder.layers.19.self_attn.k_norm.weight": "model-00003-of-00003.safetensors", + "vision_tower.encoder.layers.19.self_attn.k_proj.linear.weight": "model-00003-of-00003.safetensors", + "vision_tower.encoder.layers.19.self_attn.o_proj.linear.weight": "model-00003-of-00003.safetensors", + "vision_tower.encoder.layers.19.self_attn.q_norm.weight": "model-00003-of-00003.safetensors", + "vision_tower.encoder.layers.19.self_attn.q_proj.linear.weight": "model-00003-of-00003.safetensors", + "vision_tower.encoder.layers.19.self_attn.v_proj.linear.weight": "model-00003-of-00003.safetensors", + "vision_tower.encoder.layers.2.input_layernorm.weight": "model-00003-of-00003.safetensors", + "vision_tower.encoder.layers.2.mlp.down_proj.linear.weight": "model-00003-of-00003.safetensors", + "vision_tower.encoder.layers.2.mlp.gate_proj.linear.weight": "model-00003-of-00003.safetensors", + "vision_tower.encoder.layers.2.mlp.up_proj.linear.weight": "model-00003-of-00003.safetensors", + "vision_tower.encoder.layers.2.post_attention_layernorm.weight": "model-00003-of-00003.safetensors", + "vision_tower.encoder.layers.2.post_feedforward_layernorm.weight": "model-00003-of-00003.safetensors", + "vision_tower.encoder.layers.2.pre_feedforward_layernorm.weight": "model-00003-of-00003.safetensors", + "vision_tower.encoder.layers.2.self_attn.k_norm.weight": "model-00003-of-00003.safetensors", + "vision_tower.encoder.layers.2.self_attn.k_proj.linear.weight": "model-00003-of-00003.safetensors", + "vision_tower.encoder.layers.2.self_attn.o_proj.linear.weight": "model-00003-of-00003.safetensors", + "vision_tower.encoder.layers.2.self_attn.q_norm.weight": "model-00003-of-00003.safetensors", + "vision_tower.encoder.layers.2.self_attn.q_proj.linear.weight": "model-00003-of-00003.safetensors", + "vision_tower.encoder.layers.2.self_attn.v_proj.linear.weight": "model-00003-of-00003.safetensors", + "vision_tower.encoder.layers.20.input_layernorm.weight": "model-00003-of-00003.safetensors", + "vision_tower.encoder.layers.20.mlp.down_proj.linear.weight": "model-00003-of-00003.safetensors", + "vision_tower.encoder.layers.20.mlp.gate_proj.linear.weight": "model-00003-of-00003.safetensors", + "vision_tower.encoder.layers.20.mlp.up_proj.linear.weight": "model-00003-of-00003.safetensors", + "vision_tower.encoder.layers.20.post_attention_layernorm.weight": "model-00003-of-00003.safetensors", + "vision_tower.encoder.layers.20.post_feedforward_layernorm.weight": "model-00003-of-00003.safetensors", + "vision_tower.encoder.layers.20.pre_feedforward_layernorm.weight": "model-00003-of-00003.safetensors", + "vision_tower.encoder.layers.20.self_attn.k_norm.weight": "model-00003-of-00003.safetensors", + "vision_tower.encoder.layers.20.self_attn.k_proj.linear.weight": "model-00003-of-00003.safetensors", + "vision_tower.encoder.layers.20.self_attn.o_proj.linear.weight": "model-00003-of-00003.safetensors", + "vision_tower.encoder.layers.20.self_attn.q_norm.weight": "model-00003-of-00003.safetensors", + "vision_tower.encoder.layers.20.self_attn.q_proj.linear.weight": "model-00003-of-00003.safetensors", + "vision_tower.encoder.layers.20.self_attn.v_proj.linear.weight": "model-00003-of-00003.safetensors", + "vision_tower.encoder.layers.21.input_layernorm.weight": "model-00003-of-00003.safetensors", + "vision_tower.encoder.layers.21.mlp.down_proj.linear.weight": "model-00003-of-00003.safetensors", + "vision_tower.encoder.layers.21.mlp.gate_proj.linear.weight": "model-00003-of-00003.safetensors", + "vision_tower.encoder.layers.21.mlp.up_proj.linear.weight": "model-00003-of-00003.safetensors", + "vision_tower.encoder.layers.21.post_attention_layernorm.weight": "model-00003-of-00003.safetensors", + "vision_tower.encoder.layers.21.post_feedforward_layernorm.weight": "model-00003-of-00003.safetensors", + "vision_tower.encoder.layers.21.pre_feedforward_layernorm.weight": "model-00003-of-00003.safetensors", + "vision_tower.encoder.layers.21.self_attn.k_norm.weight": "model-00003-of-00003.safetensors", + "vision_tower.encoder.layers.21.self_attn.k_proj.linear.weight": "model-00003-of-00003.safetensors", + "vision_tower.encoder.layers.21.self_attn.o_proj.linear.weight": "model-00003-of-00003.safetensors", + "vision_tower.encoder.layers.21.self_attn.q_norm.weight": "model-00003-of-00003.safetensors", + "vision_tower.encoder.layers.21.self_attn.q_proj.linear.weight": "model-00003-of-00003.safetensors", + "vision_tower.encoder.layers.21.self_attn.v_proj.linear.weight": "model-00003-of-00003.safetensors", + "vision_tower.encoder.layers.22.input_layernorm.weight": "model-00003-of-00003.safetensors", + "vision_tower.encoder.layers.22.mlp.down_proj.linear.weight": "model-00003-of-00003.safetensors", + "vision_tower.encoder.layers.22.mlp.gate_proj.linear.weight": "model-00003-of-00003.safetensors", + "vision_tower.encoder.layers.22.mlp.up_proj.linear.weight": "model-00003-of-00003.safetensors", + "vision_tower.encoder.layers.22.post_attention_layernorm.weight": "model-00003-of-00003.safetensors", + "vision_tower.encoder.layers.22.post_feedforward_layernorm.weight": "model-00003-of-00003.safetensors", + "vision_tower.encoder.layers.22.pre_feedforward_layernorm.weight": "model-00003-of-00003.safetensors", + "vision_tower.encoder.layers.22.self_attn.k_norm.weight": "model-00003-of-00003.safetensors", + "vision_tower.encoder.layers.22.self_attn.k_proj.linear.weight": "model-00003-of-00003.safetensors", + "vision_tower.encoder.layers.22.self_attn.o_proj.linear.weight": "model-00003-of-00003.safetensors", + "vision_tower.encoder.layers.22.self_attn.q_norm.weight": "model-00003-of-00003.safetensors", + "vision_tower.encoder.layers.22.self_attn.q_proj.linear.weight": "model-00003-of-00003.safetensors", + "vision_tower.encoder.layers.22.self_attn.v_proj.linear.weight": "model-00003-of-00003.safetensors", + "vision_tower.encoder.layers.23.input_layernorm.weight": "model-00003-of-00003.safetensors", + "vision_tower.encoder.layers.23.mlp.down_proj.linear.weight": "model-00003-of-00003.safetensors", + "vision_tower.encoder.layers.23.mlp.gate_proj.linear.weight": "model-00003-of-00003.safetensors", + "vision_tower.encoder.layers.23.mlp.up_proj.linear.weight": "model-00003-of-00003.safetensors", + "vision_tower.encoder.layers.23.post_attention_layernorm.weight": "model-00003-of-00003.safetensors", + "vision_tower.encoder.layers.23.post_feedforward_layernorm.weight": "model-00003-of-00003.safetensors", + "vision_tower.encoder.layers.23.pre_feedforward_layernorm.weight": "model-00003-of-00003.safetensors", + "vision_tower.encoder.layers.23.self_attn.k_norm.weight": "model-00003-of-00003.safetensors", + "vision_tower.encoder.layers.23.self_attn.k_proj.linear.weight": "model-00003-of-00003.safetensors", + "vision_tower.encoder.layers.23.self_attn.o_proj.linear.weight": "model-00003-of-00003.safetensors", + "vision_tower.encoder.layers.23.self_attn.q_norm.weight": "model-00003-of-00003.safetensors", + "vision_tower.encoder.layers.23.self_attn.q_proj.linear.weight": "model-00003-of-00003.safetensors", + "vision_tower.encoder.layers.23.self_attn.v_proj.linear.weight": "model-00003-of-00003.safetensors", + "vision_tower.encoder.layers.24.input_layernorm.weight": "model-00003-of-00003.safetensors", + "vision_tower.encoder.layers.24.mlp.down_proj.linear.weight": "model-00003-of-00003.safetensors", + "vision_tower.encoder.layers.24.mlp.gate_proj.linear.weight": "model-00003-of-00003.safetensors", + "vision_tower.encoder.layers.24.mlp.up_proj.linear.weight": "model-00003-of-00003.safetensors", + "vision_tower.encoder.layers.24.post_attention_layernorm.weight": "model-00003-of-00003.safetensors", + "vision_tower.encoder.layers.24.post_feedforward_layernorm.weight": "model-00003-of-00003.safetensors", + "vision_tower.encoder.layers.24.pre_feedforward_layernorm.weight": "model-00003-of-00003.safetensors", + "vision_tower.encoder.layers.24.self_attn.k_norm.weight": "model-00003-of-00003.safetensors", + "vision_tower.encoder.layers.24.self_attn.k_proj.linear.weight": "model-00003-of-00003.safetensors", + "vision_tower.encoder.layers.24.self_attn.o_proj.linear.weight": "model-00003-of-00003.safetensors", + "vision_tower.encoder.layers.24.self_attn.q_norm.weight": "model-00003-of-00003.safetensors", + "vision_tower.encoder.layers.24.self_attn.q_proj.linear.weight": "model-00003-of-00003.safetensors", + "vision_tower.encoder.layers.24.self_attn.v_proj.linear.weight": "model-00003-of-00003.safetensors", + "vision_tower.encoder.layers.25.input_layernorm.weight": "model-00003-of-00003.safetensors", + "vision_tower.encoder.layers.25.mlp.down_proj.linear.weight": "model-00003-of-00003.safetensors", + "vision_tower.encoder.layers.25.mlp.gate_proj.linear.weight": "model-00003-of-00003.safetensors", + "vision_tower.encoder.layers.25.mlp.up_proj.linear.weight": "model-00003-of-00003.safetensors", + "vision_tower.encoder.layers.25.post_attention_layernorm.weight": "model-00003-of-00003.safetensors", + "vision_tower.encoder.layers.25.post_feedforward_layernorm.weight": "model-00003-of-00003.safetensors", + "vision_tower.encoder.layers.25.pre_feedforward_layernorm.weight": "model-00003-of-00003.safetensors", + "vision_tower.encoder.layers.25.self_attn.k_norm.weight": "model-00003-of-00003.safetensors", + "vision_tower.encoder.layers.25.self_attn.k_proj.linear.weight": "model-00003-of-00003.safetensors", + "vision_tower.encoder.layers.25.self_attn.o_proj.linear.weight": "model-00003-of-00003.safetensors", + "vision_tower.encoder.layers.25.self_attn.q_norm.weight": "model-00003-of-00003.safetensors", + "vision_tower.encoder.layers.25.self_attn.q_proj.linear.weight": "model-00003-of-00003.safetensors", + "vision_tower.encoder.layers.25.self_attn.v_proj.linear.weight": "model-00003-of-00003.safetensors", + "vision_tower.encoder.layers.26.input_layernorm.weight": "model-00003-of-00003.safetensors", + "vision_tower.encoder.layers.26.mlp.down_proj.linear.weight": "model-00003-of-00003.safetensors", + "vision_tower.encoder.layers.26.mlp.gate_proj.linear.weight": "model-00003-of-00003.safetensors", + "vision_tower.encoder.layers.26.mlp.up_proj.linear.weight": "model-00003-of-00003.safetensors", + "vision_tower.encoder.layers.26.post_attention_layernorm.weight": "model-00003-of-00003.safetensors", + "vision_tower.encoder.layers.26.post_feedforward_layernorm.weight": "model-00003-of-00003.safetensors", + "vision_tower.encoder.layers.26.pre_feedforward_layernorm.weight": "model-00003-of-00003.safetensors", + "vision_tower.encoder.layers.26.self_attn.k_norm.weight": "model-00003-of-00003.safetensors", + "vision_tower.encoder.layers.26.self_attn.k_proj.linear.weight": "model-00003-of-00003.safetensors", + "vision_tower.encoder.layers.26.self_attn.o_proj.linear.weight": "model-00003-of-00003.safetensors", + "vision_tower.encoder.layers.26.self_attn.q_norm.weight": "model-00003-of-00003.safetensors", + "vision_tower.encoder.layers.26.self_attn.q_proj.linear.weight": "model-00003-of-00003.safetensors", + "vision_tower.encoder.layers.26.self_attn.v_proj.linear.weight": "model-00003-of-00003.safetensors", + "vision_tower.encoder.layers.3.input_layernorm.weight": "model-00003-of-00003.safetensors", + "vision_tower.encoder.layers.3.mlp.down_proj.linear.weight": "model-00003-of-00003.safetensors", + "vision_tower.encoder.layers.3.mlp.gate_proj.linear.weight": "model-00003-of-00003.safetensors", + "vision_tower.encoder.layers.3.mlp.up_proj.linear.weight": "model-00003-of-00003.safetensors", + "vision_tower.encoder.layers.3.post_attention_layernorm.weight": "model-00003-of-00003.safetensors", + "vision_tower.encoder.layers.3.post_feedforward_layernorm.weight": "model-00003-of-00003.safetensors", + "vision_tower.encoder.layers.3.pre_feedforward_layernorm.weight": "model-00003-of-00003.safetensors", + "vision_tower.encoder.layers.3.self_attn.k_norm.weight": "model-00003-of-00003.safetensors", + "vision_tower.encoder.layers.3.self_attn.k_proj.linear.weight": "model-00003-of-00003.safetensors", + "vision_tower.encoder.layers.3.self_attn.o_proj.linear.weight": "model-00003-of-00003.safetensors", + "vision_tower.encoder.layers.3.self_attn.q_norm.weight": "model-00003-of-00003.safetensors", + "vision_tower.encoder.layers.3.self_attn.q_proj.linear.weight": "model-00003-of-00003.safetensors", + "vision_tower.encoder.layers.3.self_attn.v_proj.linear.weight": "model-00003-of-00003.safetensors", + "vision_tower.encoder.layers.4.input_layernorm.weight": "model-00003-of-00003.safetensors", + "vision_tower.encoder.layers.4.mlp.down_proj.linear.weight": "model-00003-of-00003.safetensors", + "vision_tower.encoder.layers.4.mlp.gate_proj.linear.weight": "model-00003-of-00003.safetensors", + "vision_tower.encoder.layers.4.mlp.up_proj.linear.weight": "model-00003-of-00003.safetensors", + "vision_tower.encoder.layers.4.post_attention_layernorm.weight": "model-00003-of-00003.safetensors", + "vision_tower.encoder.layers.4.post_feedforward_layernorm.weight": "model-00003-of-00003.safetensors", + "vision_tower.encoder.layers.4.pre_feedforward_layernorm.weight": "model-00003-of-00003.safetensors", + "vision_tower.encoder.layers.4.self_attn.k_norm.weight": "model-00003-of-00003.safetensors", + "vision_tower.encoder.layers.4.self_attn.k_proj.linear.weight": "model-00003-of-00003.safetensors", + "vision_tower.encoder.layers.4.self_attn.o_proj.linear.weight": "model-00003-of-00003.safetensors", + "vision_tower.encoder.layers.4.self_attn.q_norm.weight": "model-00003-of-00003.safetensors", + "vision_tower.encoder.layers.4.self_attn.q_proj.linear.weight": "model-00003-of-00003.safetensors", + "vision_tower.encoder.layers.4.self_attn.v_proj.linear.weight": "model-00003-of-00003.safetensors", + "vision_tower.encoder.layers.5.input_layernorm.weight": "model-00003-of-00003.safetensors", + "vision_tower.encoder.layers.5.mlp.down_proj.linear.weight": "model-00003-of-00003.safetensors", + "vision_tower.encoder.layers.5.mlp.gate_proj.linear.weight": "model-00003-of-00003.safetensors", + "vision_tower.encoder.layers.5.mlp.up_proj.linear.weight": "model-00003-of-00003.safetensors", + "vision_tower.encoder.layers.5.post_attention_layernorm.weight": "model-00003-of-00003.safetensors", + "vision_tower.encoder.layers.5.post_feedforward_layernorm.weight": "model-00003-of-00003.safetensors", + "vision_tower.encoder.layers.5.pre_feedforward_layernorm.weight": "model-00003-of-00003.safetensors", + "vision_tower.encoder.layers.5.self_attn.k_norm.weight": "model-00003-of-00003.safetensors", + "vision_tower.encoder.layers.5.self_attn.k_proj.linear.weight": "model-00003-of-00003.safetensors", + "vision_tower.encoder.layers.5.self_attn.o_proj.linear.weight": "model-00003-of-00003.safetensors", + "vision_tower.encoder.layers.5.self_attn.q_norm.weight": "model-00003-of-00003.safetensors", + "vision_tower.encoder.layers.5.self_attn.q_proj.linear.weight": "model-00003-of-00003.safetensors", + "vision_tower.encoder.layers.5.self_attn.v_proj.linear.weight": "model-00003-of-00003.safetensors", + "vision_tower.encoder.layers.6.input_layernorm.weight": "model-00003-of-00003.safetensors", + "vision_tower.encoder.layers.6.mlp.down_proj.linear.weight": "model-00003-of-00003.safetensors", + "vision_tower.encoder.layers.6.mlp.gate_proj.linear.weight": "model-00003-of-00003.safetensors", + "vision_tower.encoder.layers.6.mlp.up_proj.linear.weight": "model-00003-of-00003.safetensors", + "vision_tower.encoder.layers.6.post_attention_layernorm.weight": "model-00003-of-00003.safetensors", + "vision_tower.encoder.layers.6.post_feedforward_layernorm.weight": "model-00003-of-00003.safetensors", + "vision_tower.encoder.layers.6.pre_feedforward_layernorm.weight": "model-00003-of-00003.safetensors", + "vision_tower.encoder.layers.6.self_attn.k_norm.weight": "model-00003-of-00003.safetensors", + "vision_tower.encoder.layers.6.self_attn.k_proj.linear.weight": "model-00003-of-00003.safetensors", + "vision_tower.encoder.layers.6.self_attn.o_proj.linear.weight": "model-00003-of-00003.safetensors", + "vision_tower.encoder.layers.6.self_attn.q_norm.weight": "model-00003-of-00003.safetensors", + "vision_tower.encoder.layers.6.self_attn.q_proj.linear.weight": "model-00003-of-00003.safetensors", + "vision_tower.encoder.layers.6.self_attn.v_proj.linear.weight": "model-00003-of-00003.safetensors", + "vision_tower.encoder.layers.7.input_layernorm.weight": "model-00003-of-00003.safetensors", + "vision_tower.encoder.layers.7.mlp.down_proj.linear.weight": "model-00003-of-00003.safetensors", + "vision_tower.encoder.layers.7.mlp.gate_proj.linear.weight": "model-00003-of-00003.safetensors", + "vision_tower.encoder.layers.7.mlp.up_proj.linear.weight": "model-00003-of-00003.safetensors", + "vision_tower.encoder.layers.7.post_attention_layernorm.weight": "model-00003-of-00003.safetensors", + "vision_tower.encoder.layers.7.post_feedforward_layernorm.weight": "model-00003-of-00003.safetensors", + "vision_tower.encoder.layers.7.pre_feedforward_layernorm.weight": "model-00003-of-00003.safetensors", + "vision_tower.encoder.layers.7.self_attn.k_norm.weight": "model-00003-of-00003.safetensors", + "vision_tower.encoder.layers.7.self_attn.k_proj.linear.weight": "model-00003-of-00003.safetensors", + "vision_tower.encoder.layers.7.self_attn.o_proj.linear.weight": "model-00003-of-00003.safetensors", + "vision_tower.encoder.layers.7.self_attn.q_norm.weight": "model-00003-of-00003.safetensors", + "vision_tower.encoder.layers.7.self_attn.q_proj.linear.weight": "model-00003-of-00003.safetensors", + "vision_tower.encoder.layers.7.self_attn.v_proj.linear.weight": "model-00003-of-00003.safetensors", + "vision_tower.encoder.layers.8.input_layernorm.weight": "model-00003-of-00003.safetensors", + "vision_tower.encoder.layers.8.mlp.down_proj.linear.weight": "model-00003-of-00003.safetensors", + "vision_tower.encoder.layers.8.mlp.gate_proj.linear.weight": "model-00003-of-00003.safetensors", + "vision_tower.encoder.layers.8.mlp.up_proj.linear.weight": "model-00003-of-00003.safetensors", + "vision_tower.encoder.layers.8.post_attention_layernorm.weight": "model-00003-of-00003.safetensors", + "vision_tower.encoder.layers.8.post_feedforward_layernorm.weight": "model-00003-of-00003.safetensors", + "vision_tower.encoder.layers.8.pre_feedforward_layernorm.weight": "model-00003-of-00003.safetensors", + "vision_tower.encoder.layers.8.self_attn.k_norm.weight": "model-00003-of-00003.safetensors", + "vision_tower.encoder.layers.8.self_attn.k_proj.linear.weight": "model-00003-of-00003.safetensors", + "vision_tower.encoder.layers.8.self_attn.o_proj.linear.weight": "model-00003-of-00003.safetensors", + "vision_tower.encoder.layers.8.self_attn.q_norm.weight": "model-00003-of-00003.safetensors", + "vision_tower.encoder.layers.8.self_attn.q_proj.linear.weight": "model-00003-of-00003.safetensors", + "vision_tower.encoder.layers.8.self_attn.v_proj.linear.weight": "model-00003-of-00003.safetensors", + "vision_tower.encoder.layers.9.input_layernorm.weight": "model-00003-of-00003.safetensors", + "vision_tower.encoder.layers.9.mlp.down_proj.linear.weight": "model-00003-of-00003.safetensors", + "vision_tower.encoder.layers.9.mlp.gate_proj.linear.weight": "model-00003-of-00003.safetensors", + "vision_tower.encoder.layers.9.mlp.up_proj.linear.weight": "model-00003-of-00003.safetensors", + "vision_tower.encoder.layers.9.post_attention_layernorm.weight": "model-00003-of-00003.safetensors", + "vision_tower.encoder.layers.9.post_feedforward_layernorm.weight": "model-00003-of-00003.safetensors", + "vision_tower.encoder.layers.9.pre_feedforward_layernorm.weight": "model-00003-of-00003.safetensors", + "vision_tower.encoder.layers.9.self_attn.k_norm.weight": "model-00003-of-00003.safetensors", + "vision_tower.encoder.layers.9.self_attn.k_proj.linear.weight": "model-00003-of-00003.safetensors", + "vision_tower.encoder.layers.9.self_attn.o_proj.linear.weight": "model-00003-of-00003.safetensors", + "vision_tower.encoder.layers.9.self_attn.q_norm.weight": "model-00003-of-00003.safetensors", + "vision_tower.encoder.layers.9.self_attn.q_proj.linear.weight": "model-00003-of-00003.safetensors", + "vision_tower.encoder.layers.9.self_attn.v_proj.linear.weight": "model-00003-of-00003.safetensors", + "vision_tower.patch_embedder.input_proj.weight": "model-00003-of-00003.safetensors", + "vision_tower.patch_embedder.position_embedding_table": "model-00003-of-00003.safetensors", + "vision_tower.std_bias": "model-00003-of-00003.safetensors", + "vision_tower.std_scale": "model-00003-of-00003.safetensors" + } +} \ No newline at end of file diff --git a/chat/mlx/mlx-community/gemma-4-26b-a4b-it-4bit/processor_config.json b/chat/mlx/mlx-community/gemma-4-26b-a4b-it-4bit/processor_config.json new file mode 100644 index 0000000..09dfe23 --- /dev/null +++ b/chat/mlx/mlx-community/gemma-4-26b-a4b-it-4bit/processor_config.json @@ -0,0 +1,32 @@ +{ + "audio_seq_length": 750, + "image_processor": { + "do_convert_rgb": true, + "do_normalize": false, + "do_rescale": true, + "do_resize": true, + "image_mean": [ + 0.0, + 0.0, + 0.0 + ], + "image_processor_type": "Gemma4ImageProcessor", + "image_seq_length": 280, + "image_std": [ + 1.0, + 1.0, + 1.0 + ], + "max_soft_tokens": 280, + "patch_size": 16, + "pooling_kernel_size": 3, + "resample": 3, + "rescale_factor": 0.00392156862745098, + "size": { + "height": 224, + "width": 224 + } + }, + "image_seq_length": 280, + "processor_class": "Gemma4Processor" +} diff --git a/chat/mlx/mlx-community/gemma-4-26b-a4b-it-4bit/tokenizer.json b/chat/mlx/mlx-community/gemma-4-26b-a4b-it-4bit/tokenizer.json new file mode 100644 index 0000000..1ff9f3e --- /dev/null +++ b/chat/mlx/mlx-community/gemma-4-26b-a4b-it-4bit/tokenizer.json @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:cc8d3a0ce36466ccc1278bf987df5f71db1719b9ca6b4118264f45cb627bfe0f +size 32169626 diff --git a/chat/mlx/mlx-community/gemma-4-26b-a4b-it-4bit/tokenizer_config.json b/chat/mlx/mlx-community/gemma-4-26b-a4b-it-4bit/tokenizer_config.json new file mode 100644 index 0000000..375b25d --- /dev/null +++ b/chat/mlx/mlx-community/gemma-4-26b-a4b-it-4bit/tokenizer_config.json @@ -0,0 +1,74 @@ +{ + "audio_token": "<|audio|>", + "backend": "tokenizers", + "boa_token": "<|audio>", + "boi_token": "<|image>", + "bos_token": "", + "eoa_token": "", + "eoc_token": "", + "eoi_token": "", + "eos_token": "", + "eot_token": "", + "escape_token": "<|\"|>", + "etc_token": "", + "etd_token": "", + "etr_token": "", + "extra_special_tokens": [ + "<|video|>" + ], + "image_token": "<|image|>", + "mask_token": "", + "model_max_length": 1000000000000000019884624838656, + "pad_token": "", + "padding_side": "left", + "processor_class": "Gemma4Processor", + "response_schema": { + "type": "object", + "properties": { + "role": { + "const": "assistant" + }, + "thinking": { + "type": "string" + }, + "content": { + "type": "string" + }, + "tool_calls": { + "x-regex-iterator": "<\\|tool_call>(.*?)", + "type": "array", + "items": { + "type": "object", + "properties": { + "type": { + "const": "function" + }, + "function": { + "type": "object", + "x-regex": "call\\:(?P\\w+)(?P\\{.*\\})", + "properties": { + "name": { + "type": "string" + }, + "arguments": { + "type": "object", + "x-parser": "gemma4-tool-call", + "additionalProperties": {} + } + } + } + } + } + } + }, + "x-regex": "(\\<\\|channel\\>thought\\n(?P.*?)\\)?(?P\\<\\|tool_call\\>.*\\)?(?P(?:(?!\\)(?!\\<\\|tool_response\\>).)+)?(?:\\|\\<\\|tool_response\\>)?" + }, + "soc_token": "<|channel>", + "sot_token": "<|turn>", + "stc_token": "<|tool_call>", + "std_token": "<|tool>", + "str_token": "<|tool_response>", + "think_token": "<|think|>", + "tokenizer_class": "GemmaTokenizer", + "unk_token": "" +} diff --git a/chat/mlx/mlx-community/gemma-4-e2b-it-4bit/.gitattributes b/chat/mlx/mlx-community/gemma-4-e2b-it-4bit/.gitattributes new file mode 100644 index 0000000..52373fe --- /dev/null +++ b/chat/mlx/mlx-community/gemma-4-e2b-it-4bit/.gitattributes @@ -0,0 +1,36 @@ +*.7z filter=lfs diff=lfs merge=lfs -text +*.arrow filter=lfs diff=lfs merge=lfs -text +*.bin filter=lfs diff=lfs merge=lfs -text +*.bz2 filter=lfs diff=lfs merge=lfs -text +*.ckpt filter=lfs diff=lfs merge=lfs -text +*.ftz filter=lfs diff=lfs merge=lfs -text +*.gz filter=lfs diff=lfs merge=lfs -text +*.h5 filter=lfs diff=lfs merge=lfs -text +*.joblib filter=lfs diff=lfs merge=lfs -text +*.lfs.* filter=lfs diff=lfs merge=lfs -text +*.mlmodel filter=lfs diff=lfs merge=lfs -text +*.model filter=lfs diff=lfs merge=lfs -text +*.msgpack filter=lfs diff=lfs merge=lfs -text +*.npy filter=lfs diff=lfs merge=lfs -text +*.npz filter=lfs diff=lfs merge=lfs -text +*.onnx filter=lfs diff=lfs merge=lfs -text +*.ot filter=lfs diff=lfs merge=lfs -text +*.parquet filter=lfs diff=lfs merge=lfs -text +*.pb filter=lfs diff=lfs merge=lfs -text +*.pickle filter=lfs diff=lfs merge=lfs -text +*.pkl filter=lfs diff=lfs merge=lfs -text +*.pt filter=lfs diff=lfs merge=lfs -text +*.pth filter=lfs diff=lfs merge=lfs -text +*.rar filter=lfs diff=lfs merge=lfs -text +*.safetensors filter=lfs diff=lfs merge=lfs -text +saved_model/**/* filter=lfs diff=lfs merge=lfs -text +*.tar.* filter=lfs diff=lfs merge=lfs -text +*.tar filter=lfs diff=lfs merge=lfs -text +*.tflite filter=lfs diff=lfs merge=lfs -text +*.tgz filter=lfs diff=lfs merge=lfs -text +*.wasm filter=lfs diff=lfs merge=lfs -text +*.xz filter=lfs diff=lfs merge=lfs -text +*.zip filter=lfs diff=lfs merge=lfs -text +*.zst filter=lfs diff=lfs merge=lfs -text +*tfevents* filter=lfs diff=lfs merge=lfs -text +tokenizer.json filter=lfs diff=lfs merge=lfs -text diff --git a/chat/mlx/mlx-community/gemma-4-e2b-it-4bit/README.md b/chat/mlx/mlx-community/gemma-4-e2b-it-4bit/README.md new file mode 100644 index 0000000..b30b13e --- /dev/null +++ b/chat/mlx/mlx-community/gemma-4-e2b-it-4bit/README.md @@ -0,0 +1,25 @@ +--- +library_name: mlx +license: apache-2.0 +license_link: https://ai.google.dev/gemma/docs/gemma_4_license +pipeline_tag: any-to-any +tags: +- mlx +base_model: google/gemma-4-e2b-it +--- + +# mlx-community/gemma-4-e2b-it-4bit + +This model was converted to MLX format from [`google/gemma-4-e2b-it`](https://huggingface.co/google/gemma-4-e2b-it) +using mlx-vlm version **0.4.3**. +Refer to the [original model card](https://huggingface.co/google/gemma-4-e2b-it) for more details on the model. + +## Use with mlx + +```bash +pip install -U mlx-vlm +``` + +```bash +python -m mlx_vlm.generate --model mlx-community/gemma-4-e2b-it-4bit --max-tokens 100 --temperature 0.0 --prompt "Describe this image." --image +``` diff --git a/chat/mlx/mlx-community/gemma-4-e2b-it-4bit/chat_template.jinja b/chat/mlx/mlx-community/gemma-4-e2b-it-4bit/chat_template.jinja new file mode 100644 index 0000000..c19999a --- /dev/null +++ b/chat/mlx/mlx-community/gemma-4-e2b-it-4bit/chat_template.jinja @@ -0,0 +1,360 @@ +{%- macro format_parameters(properties, required, filter_keys=false) -%} + {%- set standard_keys = ['description', 'type', 'properties', 'required', 'nullable'] -%} + {%- set ns = namespace(found_first=false) -%} + {%- for key, value in properties | dictsort -%} + {%- set add_comma = false -%} + {%- if not filter_keys or key not in standard_keys -%} + {%- if ns.found_first %},{% endif -%} + {%- set ns.found_first = true -%} + {{ key }}:{ + {%- if value['description'] -%} + description:<|"|>{{ value['description'] }}<|"|> + {%- set add_comma = true -%} + {%- endif -%} + {%- if value['type'] | upper == 'STRING' -%} + {%- if value['enum'] -%} + {%- if add_comma %},{%- else -%} {%- set add_comma = true -%} {% endif -%} + enum:{{ format_argument(value['enum']) }} + {%- endif -%} + {%- elif value['type'] | upper == 'ARRAY' -%} + {%- if value['items'] is mapping and value['items'] -%} + {%- if add_comma %},{%- else -%} {%- set add_comma = true -%} {% endif -%} + items:{ + {%- set ns_items = namespace(found_first=false) -%} + {%- for item_key, item_value in value['items'] | dictsort -%} + {%- if item_value is not none -%} + {%- if ns_items.found_first %},{% endif -%} + {%- set ns_items.found_first = true -%} + {%- if item_key == 'properties' -%} + properties:{ + {%- if item_value is mapping -%} + {{- format_parameters(item_value, value['items']['required'] | default([])) -}} + {%- endif -%} + } + {%- elif item_key == 'required' -%} + required:[ + {%- for req_item in item_value -%} + <|"|>{{- req_item -}}<|"|> + {%- if not loop.last %},{% endif -%} + {%- endfor -%} + ] + {%- elif item_key == 'type' -%} + {%- if item_value is string -%} + type:{{ format_argument(item_value | upper) }} + {%- else -%} + type:{{ format_argument(item_value | map('upper') | list) }} + {%- endif -%} + {%- else -%} + {{ item_key }}:{{ format_argument(item_value) }} + {%- endif -%} + {%- endif -%} + {%- endfor -%} + } + {%- endif -%} + {%- endif -%} + {%- if value['nullable'] %} + {%- if add_comma %},{%- else -%} {%- set add_comma = true -%} {% endif -%} + nullable:true + {%- endif -%} + {%- if value['type'] | upper == 'OBJECT' -%} + {%- if value['properties'] is defined and value['properties'] is mapping -%} + {%- if add_comma %},{%- else -%} {%- set add_comma = true -%} {% endif -%} + properties:{ + {{- format_parameters(value['properties'], value['required'] | default([])) -}} + } + {%- elif value is mapping -%} + {%- if add_comma %},{%- else -%} {%- set add_comma = true -%} {% endif -%} + properties:{ + {{- format_parameters(value, value['required'] | default([]), filter_keys=true) -}} + } + {%- endif -%} + {%- if value['required'] -%} + {%- if add_comma %},{%- else -%} {%- set add_comma = true -%} {% endif -%} + required:[ + {%- for item in value['required'] | default([]) -%} + <|"|>{{- item -}}<|"|> + {%- if not loop.last %},{% endif -%} + {%- endfor -%} + ] + {%- endif -%} + {%- endif -%} + {%- if add_comma %},{%- else -%} {%- set add_comma = true -%} {% endif -%} + type:<|"|>{{ value['type'] | upper }}<|"|>} + {%- endif -%} + {%- endfor -%} +{%- endmacro -%} +{%- macro format_function_declaration(tool_data) -%} + declaration:{{- tool_data['function']['name'] -}}{description:<|"|>{{- tool_data['function']['description'] -}}<|"|> + {%- set params = tool_data['function']['parameters'] -%} + {%- if params -%} + ,parameters:{ + {%- if params['properties'] -%} + properties:{ {{- format_parameters(params['properties'], params['required']) -}} }, + {%- endif -%} + {%- if params['required'] -%} + required:[ + {%- for item in params['required'] -%} + <|"|>{{- item -}}<|"|> + {{- ',' if not loop.last -}} + {%- endfor -%} + ], + {%- endif -%} + {%- if params['type'] -%} + type:<|"|>{{- params['type'] | upper -}}<|"|>} + {%- endif -%} + {%- endif -%} + {%- if 'response' in tool_data['function'] -%} + {%- set response_declaration = tool_data['function']['response'] -%} + ,response:{ + {%- if response_declaration['description'] -%} + description:<|"|>{{- response_declaration['description'] -}}<|"|>, + {%- endif -%} + {%- if response_declaration['type'] | upper == 'OBJECT' -%} + type:<|"|>{{- response_declaration['type'] | upper -}}<|"|>} + {%- endif -%} + {%- endif -%} + } +{%- endmacro -%} +{%- macro format_argument(argument, escape_keys=True) -%} + {%- if argument is string -%} + {{- '<|"|>' + argument + '<|"|>' -}} + {%- elif argument is boolean -%} + {{- 'true' if argument else 'false' -}} + {%- elif argument is mapping -%} + {{- '{' -}} + {%- set ns = namespace(found_first=false) -%} + {%- for key, value in argument | dictsort -%} + {%- if ns.found_first %},{% endif -%} + {%- set ns.found_first = true -%} + {%- if escape_keys -%} + {{- '<|"|>' + key + '<|"|>' -}} + {%- else -%} + {{- key -}} + {%- endif -%} + :{{- format_argument(value, escape_keys=escape_keys) -}} + {%- endfor -%} + {{- '}' -}} + {%- elif argument is sequence -%} + {{- '[' -}} + {%- for item in argument -%} + {{- format_argument(item, escape_keys=escape_keys) -}} + {%- if not loop.last %},{% endif -%} + {%- endfor -%} + {{- ']' -}} + {%- else -%} + {{- argument -}} + {%- endif -%} +{%- endmacro -%} +{%- macro strip_thinking(text) -%} + {%- set ns = namespace(result='') -%} + {%- for part in text.split('') -%} + {%- if '<|channel>' in part -%} + {%- set ns.result = ns.result + part.split('<|channel>')[0] -%} + {%- else -%} + {%- set ns.result = ns.result + part -%} + {%- endif -%} + {%- endfor -%} + {{- ns.result | trim -}} +{%- endmacro -%} + +{%- macro format_tool_response_block(tool_name, response) -%} + {{- '<|tool_response>' -}} + {%- if response is mapping -%} + {{- 'response:' + tool_name + '{' -}} + {%- for key, value in response | dictsort -%} + {{- key -}}:{{- format_argument(value, escape_keys=False) -}} + {%- if not loop.last %},{% endif -%} + {%- endfor -%} + {{- '}' -}} + {%- else -%} + {{- 'response:' + tool_name + '{value:' + format_argument(response, escape_keys=False) + '}' -}} + {%- endif -%} + {{- '' -}} +{%- endmacro -%} + +{%- set ns = namespace(prev_message_type=None) -%} +{%- set loop_messages = messages -%} +{{- bos_token -}} +{#- Handle System/Tool Definitions Block -#} +{%- if (enable_thinking is defined and enable_thinking) or tools or messages[0]['role'] in ['system', 'developer'] -%} + {{- '<|turn>system\n' -}} + {#- Inject Thinking token at the very top of the FIRST system turn -#} + {%- if enable_thinking is defined and enable_thinking -%} + {{- '<|think|>\n' -}} + {%- set ns.prev_message_type = 'think' -%} + {%- endif -%} + {%- if messages[0]['role'] in ['system', 'developer'] -%} + {%- if messages[0]['content'] is string -%} + {{- messages[0]['content'] | trim -}} + {%- elif messages[0]['content'] is sequence -%} + {%- for item in messages[0]['content'] -%} + {{- item['text'] | trim + ' '-}} + {%- endfor -%} + {%- endif -%} + {%- set loop_messages = messages[1:] -%} + {%- endif -%} + {%- if tools -%} + {%- for tool in tools %} + {{- '<|tool>' -}} + {{- format_function_declaration(tool) | trim -}} + {{- '' -}} + {%- endfor %} + {%- set ns.prev_message_type = 'tool' -%} + {%- endif -%} + {{- '\n' -}} +{%- endif %} + +{#- Pre-scan: find last user message index for reasoning guard -#} +{%- set ns_turn = namespace(last_user_idx=-1) -%} +{%- for i in range(loop_messages | length) -%} + {%- if loop_messages[i]['role'] == 'user' -%} + {%- set ns_turn.last_user_idx = i -%} + {%- endif -%} +{%- endfor -%} + +{#- Loop through messages -#} +{%- for message in loop_messages -%} + {%- if message['role'] != 'tool' -%} + {%- set ns.prev_message_type = None -%} + {%- set role = 'model' if message['role'] == 'assistant' else message['role'] -%} + {#- Detect continuation: suppress duplicate <|turn>model when previous non-tool message was also assistant -#} + {%- set prev_nt = namespace(role=None, found=false) -%} + {%- if loop.index0 > 0 -%} + {%- for j in range(loop.index0 - 1, -1, -1) -%} + {%- if not prev_nt.found -%} + {%- if loop_messages[j]['role'] != 'tool' -%} + {%- set prev_nt.role = loop_messages[j]['role'] -%} + {%- set prev_nt.found = true -%} + {%- endif -%} + {%- endif -%} + {%- endfor -%} + {%- endif -%} + {%- set continue_same_model_turn = (role == 'model' and prev_nt.role == 'assistant') -%} + {%- if not continue_same_model_turn -%} + {{- '<|turn>' + role + '\n' }} + {%- endif -%} + + {#- Render reasoning/reasoning_content as thinking channel -#} + {%- set thinking_text = message.get('reasoning') or message.get('reasoning_content') -%} + {%- if thinking_text and loop.index0 > ns_turn.last_user_idx and message.get('tool_calls') -%} + {{- '<|channel>thought\n' + thinking_text + '\n' -}} + {%- endif -%} + + {%- if message['tool_calls'] -%} + {%- for tool_call in message['tool_calls'] -%} + {%- set function = tool_call['function'] -%} + {{- '<|tool_call>call:' + function['name'] + '{' -}} + {%- if function['arguments'] is mapping -%} + {%- set ns_args = namespace(found_first=false) -%} + {%- for key, value in function['arguments'] | dictsort -%} + {%- if ns_args.found_first %},{% endif -%} + {%- set ns_args.found_first = true -%} + {{- key -}}:{{- format_argument(value, escape_keys=False) -}} + {%- endfor -%} + {%- elif function['arguments'] is string -%} + {{- function['arguments'] -}} + {%- endif -%} + {{- '}' -}} + {%- endfor -%} + {%- set ns.prev_message_type = 'tool_call' -%} + {%- endif -%} + + {%- set ns_tr_out = namespace(flag=false) -%} + {%- if message.get('tool_responses') -%} + {#- Legacy: tool_responses embedded on the assistant message (Google/Gemma native) -#} + {%- for tool_response in message['tool_responses'] -%} + {{- format_tool_response_block(tool_response['name'] | default('unknown'), tool_response['response']) -}} + {%- set ns_tr_out.flag = true -%} + {%- set ns.prev_message_type = 'tool_response' -%} + {%- endfor -%} + {%- elif message.get('tool_calls') -%} + {#- OpenAI Chat Completions: forward-scan consecutive role:tool messages -#} + {%- set ns_tool_scan = namespace(stopped=false) -%} + {%- for k in range(loop.index0 + 1, loop_messages | length) -%} + {%- if ns_tool_scan.stopped -%} + {%- elif loop_messages[k]['role'] != 'tool' -%} + {%- set ns_tool_scan.stopped = true -%} + {%- else -%} + {%- set follow = loop_messages[k] -%} + {#- Resolve tool_call_id to function name -#} + {%- set ns_tname = namespace(name=follow.get('name') | default('unknown')) -%} + {%- for tc in message['tool_calls'] -%} + {%- if tc.get('id') == follow.get('tool_call_id') -%} + {%- set ns_tname.name = tc['function']['name'] -%} + {%- endif -%} + {%- endfor -%} + {#- Handle content as string or content-parts array -#} + {%- set tool_body = follow.get('content') -%} + {%- if tool_body is string -%} + {{- format_tool_response_block(ns_tname.name, tool_body) -}} + {%- elif tool_body is sequence and tool_body is not string -%} + {%- set ns_txt = namespace(s='') -%} + {%- for part in tool_body -%} + {%- if part.get('type') == 'text' -%} + {%- set ns_txt.s = ns_txt.s + (part.get('text') | default('')) -%} + {%- endif -%} + {%- endfor -%} + {{- format_tool_response_block(ns_tname.name, ns_txt.s) -}} + {%- for part in tool_body -%} + {%- if part.get('type') == 'image' -%} + {{- '<|image|>' -}} + {%- elif part.get('type') == 'audio' -%} + {{- '<|audio|>' -}} + {%- elif part.get('type') == 'video' -%} + {{- '<|video|>' -}} + {%- endif -%} + {%- endfor -%} + {%- else -%} + {{- format_tool_response_block(ns_tname.name, tool_body) -}} + {%- endif -%} + {%- set ns_tr_out.flag = true -%} + {%- set ns.prev_message_type = 'tool_response' -%} + {%- endif -%} + {%- endfor -%} + {%- endif -%} + + {%- set captured_content -%} + {%- if message['content'] is string -%} + {%- if role == 'model' -%} + {{- strip_thinking(message['content']) -}} + {%- else -%} + {{- message['content'] | trim -}} + {%- endif -%} + {%- elif message['content'] is sequence -%} + {%- for item in message['content'] -%} + {%- if item['type'] == 'text' -%} + {%- if role == 'model' -%} + {{- strip_thinking(item['text']) -}} + {%- else -%} + {{- item['text'] | trim -}} + {%- endif -%} + {%- elif item['type'] == 'image' -%} + {{- '<|image|>' -}} + {%- set ns.prev_message_type = 'image' -%} + {%- elif item['type'] == 'audio' -%} + {{- '<|audio|>' -}} + {%- set ns.prev_message_type = 'audio' -%} + {%- elif item['type'] == 'video' -%} + {{- '<|video|>' -}} + {%- set ns.prev_message_type = 'video' -%} + {%- endif -%} + {%- endfor -%} + {%- endif -%} + {%- endset -%} + + {{- captured_content -}} + {%- set has_content = captured_content | trim | length > 0 -%} + + {%- if ns.prev_message_type == 'tool_call' and not ns_tr_out.flag -%} + {{- '<|tool_response>' -}} + {%- elif not (ns_tr_out.flag and not has_content) -%} + {{- '\n' -}} + {%- endif -%} + {%- endif -%} +{%- endfor -%} + +{%- if add_generation_prompt -%} + {%- if ns.prev_message_type != 'tool_response' and ns.prev_message_type != 'tool_call' -%} + {{- '<|turn>model\n' -}} + {%- endif -%} +{%- endif -%} \ No newline at end of file diff --git a/chat/mlx/mlx-community/gemma-4-e2b-it-4bit/config.json b/chat/mlx/mlx-community/gemma-4-e2b-it-4bit/config.json new file mode 100644 index 0000000..e4f9de9 --- /dev/null +++ b/chat/mlx/mlx-community/gemma-4-e2b-it-4bit/config.json @@ -0,0 +1,201 @@ +{ + "architectures": [ + "Gemma4ForConditionalGeneration" + ], + "audio_config": { + "_name_or_path": "", + "architectures": null, + "attention_chunk_size": 12, + "attention_context_left": 13, + "attention_context_right": 0, + "attention_invalid_logits_value": -1000000000.0, + "attention_logit_cap": 50.0, + "chunk_size_feed_forward": 0, + "conv_kernel_size": 5, + "dtype": "bfloat16", + "gradient_clipping": 10000000000.0, + "hidden_act": "silu", + "hidden_size": 1024, + "id2label": { + "0": "LABEL_0", + "1": "LABEL_1" + }, + "initializer_range": 0.02, + "is_encoder_decoder": false, + "label2id": { + "LABEL_0": 0, + "LABEL_1": 1 + }, + "model_type": "gemma4_audio", + "num_attention_heads": 8, + "num_hidden_layers": 12, + "output_attentions": false, + "output_hidden_states": false, + "output_proj_dims": 1536, + "problem_type": null, + "residual_weight": 0.5, + "return_dict": true, + "rms_norm_eps": 1e-06, + "subsampling_conv_channels": [ + 128, + 32 + ], + "use_clipped_linears": true + }, + "audio_token_id": 258881, + "boa_token_id": 256000, + "boi_token_id": 255999, + "dtype": "bfloat16", + "eoa_token_id": 258883, + "eoa_token_index": 258883, + "eoi_token_id": 258882, + "eos_token_id": [ + 1, + 106, + 50 + ], + "image_token_id": 258880, + "initializer_range": 0.02, + "model_type": "gemma4", + "quantization": { + "group_size": 64, + "bits": 4, + "mode": "affine" + }, + "quantization_config": { + "group_size": 64, + "bits": 4, + "mode": "affine" + }, + "text_config": { + "attention_bias": false, + "attention_dropout": 0.0, + "attention_k_eq_v": false, + "bos_token_id": 2, + "dtype": "bfloat16", + "enable_moe_block": false, + "eos_token_id": 1, + "expert_intermediate_size": null, + "final_logit_softcapping": 30.0, + "global_head_dim": 512, + "head_dim": 256, + "hidden_activation": "gelu_pytorch_tanh", + "hidden_size": 1536, + "hidden_size_per_layer_input": 256, + "initializer_range": 0.02, + "intermediate_size": 6144, + "layer_types": [ + "sliding_attention", + "sliding_attention", + "sliding_attention", + "sliding_attention", + "full_attention", + "sliding_attention", + "sliding_attention", + "sliding_attention", + "sliding_attention", + "full_attention", + "sliding_attention", + "sliding_attention", + "sliding_attention", + "sliding_attention", + "full_attention", + "sliding_attention", + "sliding_attention", + "sliding_attention", + "sliding_attention", + "full_attention", + "sliding_attention", + "sliding_attention", + "sliding_attention", + "sliding_attention", + "full_attention", + "sliding_attention", + "sliding_attention", + "sliding_attention", + "sliding_attention", + "full_attention", + "sliding_attention", + "sliding_attention", + "sliding_attention", + "sliding_attention", + "full_attention" + ], + "max_position_embeddings": 131072, + "model_type": "gemma4_text", + "num_attention_heads": 8, + "num_experts": null, + "num_global_key_value_heads": null, + "num_hidden_layers": 35, + "num_key_value_heads": 1, + "num_kv_shared_layers": 20, + "pad_token_id": 0, + "rms_norm_eps": 1e-06, + "rope_parameters": { + "full_attention": { + "partial_rotary_factor": 0.25, + "rope_theta": 1000000.0, + "rope_type": "proportional" + }, + "sliding_attention": { + "rope_theta": 10000.0, + "rope_type": "default" + } + }, + "sliding_window": 512, + "tie_word_embeddings": true, + "top_k_experts": null, + "use_bidirectional_attention": null, + "use_cache": true, + "use_double_wide_mlp": true, + "vocab_size": 262144, + "vocab_size_per_layer_input": 262144 + }, + "tie_word_embeddings": true, + "transformers_version": "5.5.0.dev0", + "video_token_id": 258884, + "vision_config": { + "_name_or_path": "", + "architectures": null, + "attention_bias": false, + "attention_dropout": 0.0, + "chunk_size_feed_forward": 0, + "default_output_length": 280, + "dtype": "bfloat16", + "global_head_dim": 64, + "head_dim": 64, + "hidden_activation": "gelu_pytorch_tanh", + "hidden_size": 768, + "id2label": { + "0": "LABEL_0", + "1": "LABEL_1" + }, + "initializer_range": 0.02, + "intermediate_size": 3072, + "is_encoder_decoder": false, + "label2id": { + "LABEL_0": 0, + "LABEL_1": 1 + }, + "max_position_embeddings": 131072, + "model_type": "gemma4_vision", + "num_attention_heads": 12, + "num_hidden_layers": 16, + "num_key_value_heads": 12, + "output_attentions": false, + "output_hidden_states": false, + "patch_size": 16, + "pooling_kernel_size": 3, + "position_embedding_size": 10240, + "problem_type": null, + "return_dict": true, + "rms_norm_eps": 1e-06, + "rope_parameters": { + "rope_theta": 100.0, + "rope_type": "default" + }, + "standardize": false, + "use_clipped_linears": true + }, + "vision_soft_tokens_per_image": 280 +} \ No newline at end of file diff --git a/chat/mlx/mlx-community/gemma-4-e2b-it-4bit/generation_config.json b/chat/mlx/mlx-community/gemma-4-e2b-it-4bit/generation_config.json new file mode 100644 index 0000000..e605bb4 --- /dev/null +++ b/chat/mlx/mlx-community/gemma-4-e2b-it-4bit/generation_config.json @@ -0,0 +1,14 @@ +{ + "bos_token_id": 2, + "do_sample": true, + "eos_token_id": [ + 1, + 106, + 50 + ], + "pad_token_id": 0, + "temperature": 1.0, + "top_k": 64, + "top_p": 0.95, + "transformers_version": "5.5.0.dev0" +} diff --git a/chat/mlx/mlx-community/gemma-4-e2b-it-4bit/model.safetensors b/chat/mlx/mlx-community/gemma-4-e2b-it-4bit/model.safetensors new file mode 100644 index 0000000..3f82c0a --- /dev/null +++ b/chat/mlx/mlx-community/gemma-4-e2b-it-4bit/model.safetensors @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:e9bea0584546fafb5ff83a1132a6c4662a8498cc6a5bcda52fc6ca562b7bafab +size 3581101896 diff --git a/chat/mlx/mlx-community/gemma-4-e2b-it-4bit/model.safetensors.index.json b/chat/mlx/mlx-community/gemma-4-e2b-it-4bit/model.safetensors.index.json new file mode 100644 index 0000000..cbba8cc --- /dev/null +++ b/chat/mlx/mlx-community/gemma-4-e2b-it-4bit/model.safetensors.index.json @@ -0,0 +1,2656 @@ +{ + "metadata": { + "total_size": 3580765126 + }, + "weight_map": { + "audio_tower.layers.0.feed_forward1.ffw_layer_1.input_max": "model.safetensors", + "audio_tower.layers.0.feed_forward1.ffw_layer_1.input_min": "model.safetensors", + "audio_tower.layers.0.feed_forward1.ffw_layer_1.linear.weight": "model.safetensors", + "audio_tower.layers.0.feed_forward1.ffw_layer_1.output_max": "model.safetensors", + "audio_tower.layers.0.feed_forward1.ffw_layer_1.output_min": "model.safetensors", + "audio_tower.layers.0.feed_forward1.ffw_layer_2.input_max": "model.safetensors", + "audio_tower.layers.0.feed_forward1.ffw_layer_2.input_min": "model.safetensors", + "audio_tower.layers.0.feed_forward1.ffw_layer_2.linear.weight": "model.safetensors", + "audio_tower.layers.0.feed_forward1.ffw_layer_2.output_max": "model.safetensors", + "audio_tower.layers.0.feed_forward1.ffw_layer_2.output_min": "model.safetensors", + "audio_tower.layers.0.feed_forward1.post_layer_norm.weight": "model.safetensors", + "audio_tower.layers.0.feed_forward1.pre_layer_norm.weight": "model.safetensors", + "audio_tower.layers.0.feed_forward2.ffw_layer_1.input_max": "model.safetensors", + "audio_tower.layers.0.feed_forward2.ffw_layer_1.input_min": "model.safetensors", + "audio_tower.layers.0.feed_forward2.ffw_layer_1.linear.weight": "model.safetensors", + "audio_tower.layers.0.feed_forward2.ffw_layer_1.output_max": "model.safetensors", + "audio_tower.layers.0.feed_forward2.ffw_layer_1.output_min": "model.safetensors", + "audio_tower.layers.0.feed_forward2.ffw_layer_2.input_max": "model.safetensors", + "audio_tower.layers.0.feed_forward2.ffw_layer_2.input_min": "model.safetensors", + "audio_tower.layers.0.feed_forward2.ffw_layer_2.linear.weight": "model.safetensors", + "audio_tower.layers.0.feed_forward2.ffw_layer_2.output_max": "model.safetensors", + "audio_tower.layers.0.feed_forward2.ffw_layer_2.output_min": "model.safetensors", + "audio_tower.layers.0.feed_forward2.post_layer_norm.weight": "model.safetensors", + "audio_tower.layers.0.feed_forward2.pre_layer_norm.weight": "model.safetensors", + "audio_tower.layers.0.lconv1d.conv_norm.weight": "model.safetensors", + "audio_tower.layers.0.lconv1d.depthwise_conv1d.weight": "model.safetensors", + "audio_tower.layers.0.lconv1d.linear_end.input_max": "model.safetensors", + "audio_tower.layers.0.lconv1d.linear_end.input_min": "model.safetensors", + "audio_tower.layers.0.lconv1d.linear_end.linear.weight": "model.safetensors", + "audio_tower.layers.0.lconv1d.linear_end.output_max": "model.safetensors", + "audio_tower.layers.0.lconv1d.linear_end.output_min": "model.safetensors", + "audio_tower.layers.0.lconv1d.linear_start.input_max": "model.safetensors", + "audio_tower.layers.0.lconv1d.linear_start.input_min": "model.safetensors", + "audio_tower.layers.0.lconv1d.linear_start.linear.weight": "model.safetensors", + "audio_tower.layers.0.lconv1d.linear_start.output_max": "model.safetensors", + "audio_tower.layers.0.lconv1d.linear_start.output_min": "model.safetensors", + "audio_tower.layers.0.lconv1d.pre_layer_norm.weight": "model.safetensors", + "audio_tower.layers.0.norm_out.weight": "model.safetensors", + "audio_tower.layers.0.norm_post_attn.weight": "model.safetensors", + "audio_tower.layers.0.norm_pre_attn.weight": "model.safetensors", + "audio_tower.layers.0.self_attn.k_proj.input_max": "model.safetensors", + "audio_tower.layers.0.self_attn.k_proj.input_min": "model.safetensors", + "audio_tower.layers.0.self_attn.k_proj.linear.weight": "model.safetensors", + "audio_tower.layers.0.self_attn.k_proj.output_max": "model.safetensors", + "audio_tower.layers.0.self_attn.k_proj.output_min": "model.safetensors", + "audio_tower.layers.0.self_attn.per_dim_scale": "model.safetensors", + "audio_tower.layers.0.self_attn.post.input_max": "model.safetensors", + "audio_tower.layers.0.self_attn.post.input_min": "model.safetensors", + "audio_tower.layers.0.self_attn.post.linear.weight": "model.safetensors", + "audio_tower.layers.0.self_attn.post.output_max": "model.safetensors", + "audio_tower.layers.0.self_attn.post.output_min": "model.safetensors", + "audio_tower.layers.0.self_attn.q_proj.input_max": "model.safetensors", + "audio_tower.layers.0.self_attn.q_proj.input_min": "model.safetensors", + "audio_tower.layers.0.self_attn.q_proj.linear.weight": "model.safetensors", + "audio_tower.layers.0.self_attn.q_proj.output_max": "model.safetensors", + "audio_tower.layers.0.self_attn.q_proj.output_min": "model.safetensors", + "audio_tower.layers.0.self_attn.relative_k_proj.weight": "model.safetensors", + "audio_tower.layers.0.self_attn.v_proj.input_max": "model.safetensors", + "audio_tower.layers.0.self_attn.v_proj.input_min": "model.safetensors", + "audio_tower.layers.0.self_attn.v_proj.linear.weight": "model.safetensors", + "audio_tower.layers.0.self_attn.v_proj.output_max": "model.safetensors", + "audio_tower.layers.0.self_attn.v_proj.output_min": "model.safetensors", + "audio_tower.layers.1.feed_forward1.ffw_layer_1.input_max": "model.safetensors", + "audio_tower.layers.1.feed_forward1.ffw_layer_1.input_min": "model.safetensors", + "audio_tower.layers.1.feed_forward1.ffw_layer_1.linear.weight": "model.safetensors", + "audio_tower.layers.1.feed_forward1.ffw_layer_1.output_max": "model.safetensors", + "audio_tower.layers.1.feed_forward1.ffw_layer_1.output_min": "model.safetensors", + "audio_tower.layers.1.feed_forward1.ffw_layer_2.input_max": "model.safetensors", + "audio_tower.layers.1.feed_forward1.ffw_layer_2.input_min": "model.safetensors", + "audio_tower.layers.1.feed_forward1.ffw_layer_2.linear.weight": "model.safetensors", + "audio_tower.layers.1.feed_forward1.ffw_layer_2.output_max": "model.safetensors", + "audio_tower.layers.1.feed_forward1.ffw_layer_2.output_min": "model.safetensors", + "audio_tower.layers.1.feed_forward1.post_layer_norm.weight": "model.safetensors", + "audio_tower.layers.1.feed_forward1.pre_layer_norm.weight": "model.safetensors", + "audio_tower.layers.1.feed_forward2.ffw_layer_1.input_max": "model.safetensors", + "audio_tower.layers.1.feed_forward2.ffw_layer_1.input_min": "model.safetensors", + "audio_tower.layers.1.feed_forward2.ffw_layer_1.linear.weight": "model.safetensors", + "audio_tower.layers.1.feed_forward2.ffw_layer_1.output_max": "model.safetensors", + "audio_tower.layers.1.feed_forward2.ffw_layer_1.output_min": "model.safetensors", + "audio_tower.layers.1.feed_forward2.ffw_layer_2.input_max": "model.safetensors", + "audio_tower.layers.1.feed_forward2.ffw_layer_2.input_min": "model.safetensors", + "audio_tower.layers.1.feed_forward2.ffw_layer_2.linear.weight": "model.safetensors", + "audio_tower.layers.1.feed_forward2.ffw_layer_2.output_max": "model.safetensors", + "audio_tower.layers.1.feed_forward2.ffw_layer_2.output_min": "model.safetensors", + "audio_tower.layers.1.feed_forward2.post_layer_norm.weight": "model.safetensors", + "audio_tower.layers.1.feed_forward2.pre_layer_norm.weight": "model.safetensors", + "audio_tower.layers.1.lconv1d.conv_norm.weight": "model.safetensors", + "audio_tower.layers.1.lconv1d.depthwise_conv1d.weight": "model.safetensors", + "audio_tower.layers.1.lconv1d.linear_end.input_max": "model.safetensors", + "audio_tower.layers.1.lconv1d.linear_end.input_min": "model.safetensors", + "audio_tower.layers.1.lconv1d.linear_end.linear.weight": "model.safetensors", + "audio_tower.layers.1.lconv1d.linear_end.output_max": "model.safetensors", + "audio_tower.layers.1.lconv1d.linear_end.output_min": "model.safetensors", + "audio_tower.layers.1.lconv1d.linear_start.input_max": "model.safetensors", + "audio_tower.layers.1.lconv1d.linear_start.input_min": "model.safetensors", + "audio_tower.layers.1.lconv1d.linear_start.linear.weight": "model.safetensors", + "audio_tower.layers.1.lconv1d.linear_start.output_max": "model.safetensors", + "audio_tower.layers.1.lconv1d.linear_start.output_min": "model.safetensors", + "audio_tower.layers.1.lconv1d.pre_layer_norm.weight": "model.safetensors", + "audio_tower.layers.1.norm_out.weight": "model.safetensors", + "audio_tower.layers.1.norm_post_attn.weight": "model.safetensors", + "audio_tower.layers.1.norm_pre_attn.weight": "model.safetensors", + "audio_tower.layers.1.self_attn.k_proj.input_max": "model.safetensors", + "audio_tower.layers.1.self_attn.k_proj.input_min": "model.safetensors", + "audio_tower.layers.1.self_attn.k_proj.linear.weight": "model.safetensors", + "audio_tower.layers.1.self_attn.k_proj.output_max": "model.safetensors", + "audio_tower.layers.1.self_attn.k_proj.output_min": "model.safetensors", + "audio_tower.layers.1.self_attn.per_dim_scale": "model.safetensors", + "audio_tower.layers.1.self_attn.post.input_max": "model.safetensors", + "audio_tower.layers.1.self_attn.post.input_min": "model.safetensors", + "audio_tower.layers.1.self_attn.post.linear.weight": "model.safetensors", + "audio_tower.layers.1.self_attn.post.output_max": "model.safetensors", + "audio_tower.layers.1.self_attn.post.output_min": "model.safetensors", + "audio_tower.layers.1.self_attn.q_proj.input_max": "model.safetensors", + "audio_tower.layers.1.self_attn.q_proj.input_min": "model.safetensors", + "audio_tower.layers.1.self_attn.q_proj.linear.weight": "model.safetensors", + "audio_tower.layers.1.self_attn.q_proj.output_max": "model.safetensors", + "audio_tower.layers.1.self_attn.q_proj.output_min": "model.safetensors", + "audio_tower.layers.1.self_attn.relative_k_proj.weight": "model.safetensors", + "audio_tower.layers.1.self_attn.v_proj.input_max": "model.safetensors", + "audio_tower.layers.1.self_attn.v_proj.input_min": "model.safetensors", + "audio_tower.layers.1.self_attn.v_proj.linear.weight": "model.safetensors", + "audio_tower.layers.1.self_attn.v_proj.output_max": "model.safetensors", + "audio_tower.layers.1.self_attn.v_proj.output_min": "model.safetensors", + "audio_tower.layers.10.feed_forward1.ffw_layer_1.input_max": "model.safetensors", + "audio_tower.layers.10.feed_forward1.ffw_layer_1.input_min": "model.safetensors", + "audio_tower.layers.10.feed_forward1.ffw_layer_1.linear.weight": "model.safetensors", + "audio_tower.layers.10.feed_forward1.ffw_layer_1.output_max": "model.safetensors", + "audio_tower.layers.10.feed_forward1.ffw_layer_1.output_min": "model.safetensors", + "audio_tower.layers.10.feed_forward1.ffw_layer_2.input_max": "model.safetensors", + "audio_tower.layers.10.feed_forward1.ffw_layer_2.input_min": "model.safetensors", + "audio_tower.layers.10.feed_forward1.ffw_layer_2.linear.weight": "model.safetensors", + "audio_tower.layers.10.feed_forward1.ffw_layer_2.output_max": "model.safetensors", + "audio_tower.layers.10.feed_forward1.ffw_layer_2.output_min": "model.safetensors", + "audio_tower.layers.10.feed_forward1.post_layer_norm.weight": "model.safetensors", + "audio_tower.layers.10.feed_forward1.pre_layer_norm.weight": "model.safetensors", + "audio_tower.layers.10.feed_forward2.ffw_layer_1.input_max": "model.safetensors", + "audio_tower.layers.10.feed_forward2.ffw_layer_1.input_min": "model.safetensors", + "audio_tower.layers.10.feed_forward2.ffw_layer_1.linear.weight": "model.safetensors", + "audio_tower.layers.10.feed_forward2.ffw_layer_1.output_max": "model.safetensors", + "audio_tower.layers.10.feed_forward2.ffw_layer_1.output_min": "model.safetensors", + "audio_tower.layers.10.feed_forward2.ffw_layer_2.input_max": "model.safetensors", + "audio_tower.layers.10.feed_forward2.ffw_layer_2.input_min": "model.safetensors", + "audio_tower.layers.10.feed_forward2.ffw_layer_2.linear.weight": "model.safetensors", + "audio_tower.layers.10.feed_forward2.ffw_layer_2.output_max": "model.safetensors", + "audio_tower.layers.10.feed_forward2.ffw_layer_2.output_min": "model.safetensors", + "audio_tower.layers.10.feed_forward2.post_layer_norm.weight": "model.safetensors", + "audio_tower.layers.10.feed_forward2.pre_layer_norm.weight": "model.safetensors", + "audio_tower.layers.10.lconv1d.conv_norm.weight": "model.safetensors", + "audio_tower.layers.10.lconv1d.depthwise_conv1d.weight": "model.safetensors", + "audio_tower.layers.10.lconv1d.linear_end.input_max": "model.safetensors", + "audio_tower.layers.10.lconv1d.linear_end.input_min": "model.safetensors", + "audio_tower.layers.10.lconv1d.linear_end.linear.weight": "model.safetensors", + "audio_tower.layers.10.lconv1d.linear_end.output_max": "model.safetensors", + "audio_tower.layers.10.lconv1d.linear_end.output_min": "model.safetensors", + "audio_tower.layers.10.lconv1d.linear_start.input_max": "model.safetensors", + "audio_tower.layers.10.lconv1d.linear_start.input_min": "model.safetensors", + "audio_tower.layers.10.lconv1d.linear_start.linear.weight": "model.safetensors", + "audio_tower.layers.10.lconv1d.linear_start.output_max": "model.safetensors", + "audio_tower.layers.10.lconv1d.linear_start.output_min": "model.safetensors", + "audio_tower.layers.10.lconv1d.pre_layer_norm.weight": "model.safetensors", + "audio_tower.layers.10.norm_out.weight": "model.safetensors", + "audio_tower.layers.10.norm_post_attn.weight": "model.safetensors", + "audio_tower.layers.10.norm_pre_attn.weight": "model.safetensors", + "audio_tower.layers.10.self_attn.k_proj.input_max": "model.safetensors", + "audio_tower.layers.10.self_attn.k_proj.input_min": "model.safetensors", + "audio_tower.layers.10.self_attn.k_proj.linear.weight": "model.safetensors", + "audio_tower.layers.10.self_attn.k_proj.output_max": "model.safetensors", + "audio_tower.layers.10.self_attn.k_proj.output_min": "model.safetensors", + "audio_tower.layers.10.self_attn.per_dim_scale": "model.safetensors", + "audio_tower.layers.10.self_attn.post.input_max": "model.safetensors", + "audio_tower.layers.10.self_attn.post.input_min": "model.safetensors", + "audio_tower.layers.10.self_attn.post.linear.weight": "model.safetensors", + "audio_tower.layers.10.self_attn.post.output_max": "model.safetensors", + "audio_tower.layers.10.self_attn.post.output_min": "model.safetensors", + "audio_tower.layers.10.self_attn.q_proj.input_max": "model.safetensors", + "audio_tower.layers.10.self_attn.q_proj.input_min": "model.safetensors", + "audio_tower.layers.10.self_attn.q_proj.linear.weight": "model.safetensors", + "audio_tower.layers.10.self_attn.q_proj.output_max": "model.safetensors", + "audio_tower.layers.10.self_attn.q_proj.output_min": "model.safetensors", + "audio_tower.layers.10.self_attn.relative_k_proj.weight": "model.safetensors", + "audio_tower.layers.10.self_attn.v_proj.input_max": "model.safetensors", + "audio_tower.layers.10.self_attn.v_proj.input_min": "model.safetensors", + "audio_tower.layers.10.self_attn.v_proj.linear.weight": "model.safetensors", + "audio_tower.layers.10.self_attn.v_proj.output_max": "model.safetensors", + "audio_tower.layers.10.self_attn.v_proj.output_min": "model.safetensors", + "audio_tower.layers.11.feed_forward1.ffw_layer_1.input_max": "model.safetensors", + "audio_tower.layers.11.feed_forward1.ffw_layer_1.input_min": "model.safetensors", + "audio_tower.layers.11.feed_forward1.ffw_layer_1.linear.weight": "model.safetensors", + "audio_tower.layers.11.feed_forward1.ffw_layer_1.output_max": "model.safetensors", + "audio_tower.layers.11.feed_forward1.ffw_layer_1.output_min": "model.safetensors", + "audio_tower.layers.11.feed_forward1.ffw_layer_2.input_max": "model.safetensors", + "audio_tower.layers.11.feed_forward1.ffw_layer_2.input_min": "model.safetensors", + "audio_tower.layers.11.feed_forward1.ffw_layer_2.linear.weight": "model.safetensors", + "audio_tower.layers.11.feed_forward1.ffw_layer_2.output_max": "model.safetensors", + "audio_tower.layers.11.feed_forward1.ffw_layer_2.output_min": "model.safetensors", + "audio_tower.layers.11.feed_forward1.post_layer_norm.weight": "model.safetensors", + "audio_tower.layers.11.feed_forward1.pre_layer_norm.weight": "model.safetensors", + "audio_tower.layers.11.feed_forward2.ffw_layer_1.input_max": "model.safetensors", + "audio_tower.layers.11.feed_forward2.ffw_layer_1.input_min": "model.safetensors", + "audio_tower.layers.11.feed_forward2.ffw_layer_1.linear.weight": "model.safetensors", + "audio_tower.layers.11.feed_forward2.ffw_layer_1.output_max": "model.safetensors", + "audio_tower.layers.11.feed_forward2.ffw_layer_1.output_min": "model.safetensors", + "audio_tower.layers.11.feed_forward2.ffw_layer_2.input_max": "model.safetensors", + "audio_tower.layers.11.feed_forward2.ffw_layer_2.input_min": "model.safetensors", + "audio_tower.layers.11.feed_forward2.ffw_layer_2.linear.weight": "model.safetensors", + "audio_tower.layers.11.feed_forward2.ffw_layer_2.output_max": "model.safetensors", + "audio_tower.layers.11.feed_forward2.ffw_layer_2.output_min": "model.safetensors", + "audio_tower.layers.11.feed_forward2.post_layer_norm.weight": "model.safetensors", + "audio_tower.layers.11.feed_forward2.pre_layer_norm.weight": "model.safetensors", + "audio_tower.layers.11.lconv1d.conv_norm.weight": "model.safetensors", + "audio_tower.layers.11.lconv1d.depthwise_conv1d.weight": "model.safetensors", + "audio_tower.layers.11.lconv1d.linear_end.input_max": "model.safetensors", + "audio_tower.layers.11.lconv1d.linear_end.input_min": "model.safetensors", + "audio_tower.layers.11.lconv1d.linear_end.linear.weight": "model.safetensors", + "audio_tower.layers.11.lconv1d.linear_end.output_max": "model.safetensors", + "audio_tower.layers.11.lconv1d.linear_end.output_min": "model.safetensors", + "audio_tower.layers.11.lconv1d.linear_start.input_max": "model.safetensors", + "audio_tower.layers.11.lconv1d.linear_start.input_min": "model.safetensors", + "audio_tower.layers.11.lconv1d.linear_start.linear.weight": "model.safetensors", + "audio_tower.layers.11.lconv1d.linear_start.output_max": "model.safetensors", + "audio_tower.layers.11.lconv1d.linear_start.output_min": "model.safetensors", + "audio_tower.layers.11.lconv1d.pre_layer_norm.weight": "model.safetensors", + "audio_tower.layers.11.norm_out.weight": "model.safetensors", + "audio_tower.layers.11.norm_post_attn.weight": "model.safetensors", + "audio_tower.layers.11.norm_pre_attn.weight": "model.safetensors", + "audio_tower.layers.11.self_attn.k_proj.input_max": "model.safetensors", + "audio_tower.layers.11.self_attn.k_proj.input_min": "model.safetensors", + "audio_tower.layers.11.self_attn.k_proj.linear.weight": "model.safetensors", + "audio_tower.layers.11.self_attn.k_proj.output_max": "model.safetensors", + "audio_tower.layers.11.self_attn.k_proj.output_min": "model.safetensors", + "audio_tower.layers.11.self_attn.per_dim_scale": "model.safetensors", + "audio_tower.layers.11.self_attn.post.input_max": "model.safetensors", + "audio_tower.layers.11.self_attn.post.input_min": "model.safetensors", + "audio_tower.layers.11.self_attn.post.linear.weight": "model.safetensors", + "audio_tower.layers.11.self_attn.post.output_max": "model.safetensors", + "audio_tower.layers.11.self_attn.post.output_min": "model.safetensors", + "audio_tower.layers.11.self_attn.q_proj.input_max": "model.safetensors", + "audio_tower.layers.11.self_attn.q_proj.input_min": "model.safetensors", + "audio_tower.layers.11.self_attn.q_proj.linear.weight": "model.safetensors", + "audio_tower.layers.11.self_attn.q_proj.output_max": "model.safetensors", + "audio_tower.layers.11.self_attn.q_proj.output_min": "model.safetensors", + "audio_tower.layers.11.self_attn.relative_k_proj.weight": "model.safetensors", + "audio_tower.layers.11.self_attn.v_proj.input_max": "model.safetensors", + "audio_tower.layers.11.self_attn.v_proj.input_min": "model.safetensors", + "audio_tower.layers.11.self_attn.v_proj.linear.weight": "model.safetensors", + "audio_tower.layers.11.self_attn.v_proj.output_max": "model.safetensors", + "audio_tower.layers.11.self_attn.v_proj.output_min": "model.safetensors", + "audio_tower.layers.2.feed_forward1.ffw_layer_1.input_max": "model.safetensors", + "audio_tower.layers.2.feed_forward1.ffw_layer_1.input_min": "model.safetensors", + "audio_tower.layers.2.feed_forward1.ffw_layer_1.linear.weight": "model.safetensors", + "audio_tower.layers.2.feed_forward1.ffw_layer_1.output_max": "model.safetensors", + "audio_tower.layers.2.feed_forward1.ffw_layer_1.output_min": "model.safetensors", + "audio_tower.layers.2.feed_forward1.ffw_layer_2.input_max": "model.safetensors", + "audio_tower.layers.2.feed_forward1.ffw_layer_2.input_min": "model.safetensors", + "audio_tower.layers.2.feed_forward1.ffw_layer_2.linear.weight": "model.safetensors", + "audio_tower.layers.2.feed_forward1.ffw_layer_2.output_max": "model.safetensors", + "audio_tower.layers.2.feed_forward1.ffw_layer_2.output_min": "model.safetensors", + "audio_tower.layers.2.feed_forward1.post_layer_norm.weight": "model.safetensors", + "audio_tower.layers.2.feed_forward1.pre_layer_norm.weight": "model.safetensors", + "audio_tower.layers.2.feed_forward2.ffw_layer_1.input_max": "model.safetensors", + "audio_tower.layers.2.feed_forward2.ffw_layer_1.input_min": "model.safetensors", + "audio_tower.layers.2.feed_forward2.ffw_layer_1.linear.weight": "model.safetensors", + "audio_tower.layers.2.feed_forward2.ffw_layer_1.output_max": "model.safetensors", + "audio_tower.layers.2.feed_forward2.ffw_layer_1.output_min": "model.safetensors", + "audio_tower.layers.2.feed_forward2.ffw_layer_2.input_max": "model.safetensors", + "audio_tower.layers.2.feed_forward2.ffw_layer_2.input_min": "model.safetensors", + "audio_tower.layers.2.feed_forward2.ffw_layer_2.linear.weight": "model.safetensors", + "audio_tower.layers.2.feed_forward2.ffw_layer_2.output_max": "model.safetensors", + "audio_tower.layers.2.feed_forward2.ffw_layer_2.output_min": "model.safetensors", + "audio_tower.layers.2.feed_forward2.post_layer_norm.weight": "model.safetensors", + "audio_tower.layers.2.feed_forward2.pre_layer_norm.weight": "model.safetensors", + "audio_tower.layers.2.lconv1d.conv_norm.weight": "model.safetensors", + "audio_tower.layers.2.lconv1d.depthwise_conv1d.weight": "model.safetensors", + "audio_tower.layers.2.lconv1d.linear_end.input_max": "model.safetensors", + "audio_tower.layers.2.lconv1d.linear_end.input_min": "model.safetensors", + "audio_tower.layers.2.lconv1d.linear_end.linear.weight": "model.safetensors", + "audio_tower.layers.2.lconv1d.linear_end.output_max": "model.safetensors", + "audio_tower.layers.2.lconv1d.linear_end.output_min": "model.safetensors", + "audio_tower.layers.2.lconv1d.linear_start.input_max": "model.safetensors", + "audio_tower.layers.2.lconv1d.linear_start.input_min": "model.safetensors", + "audio_tower.layers.2.lconv1d.linear_start.linear.weight": "model.safetensors", + "audio_tower.layers.2.lconv1d.linear_start.output_max": "model.safetensors", + "audio_tower.layers.2.lconv1d.linear_start.output_min": "model.safetensors", + "audio_tower.layers.2.lconv1d.pre_layer_norm.weight": "model.safetensors", + "audio_tower.layers.2.norm_out.weight": "model.safetensors", + "audio_tower.layers.2.norm_post_attn.weight": "model.safetensors", + "audio_tower.layers.2.norm_pre_attn.weight": "model.safetensors", + "audio_tower.layers.2.self_attn.k_proj.input_max": "model.safetensors", + "audio_tower.layers.2.self_attn.k_proj.input_min": "model.safetensors", + "audio_tower.layers.2.self_attn.k_proj.linear.weight": "model.safetensors", + "audio_tower.layers.2.self_attn.k_proj.output_max": "model.safetensors", + "audio_tower.layers.2.self_attn.k_proj.output_min": "model.safetensors", + "audio_tower.layers.2.self_attn.per_dim_scale": "model.safetensors", + "audio_tower.layers.2.self_attn.post.input_max": "model.safetensors", + "audio_tower.layers.2.self_attn.post.input_min": "model.safetensors", + "audio_tower.layers.2.self_attn.post.linear.weight": "model.safetensors", + "audio_tower.layers.2.self_attn.post.output_max": "model.safetensors", + "audio_tower.layers.2.self_attn.post.output_min": "model.safetensors", + "audio_tower.layers.2.self_attn.q_proj.input_max": "model.safetensors", + "audio_tower.layers.2.self_attn.q_proj.input_min": "model.safetensors", + "audio_tower.layers.2.self_attn.q_proj.linear.weight": "model.safetensors", + "audio_tower.layers.2.self_attn.q_proj.output_max": "model.safetensors", + "audio_tower.layers.2.self_attn.q_proj.output_min": "model.safetensors", + "audio_tower.layers.2.self_attn.relative_k_proj.weight": "model.safetensors", + "audio_tower.layers.2.self_attn.v_proj.input_max": "model.safetensors", + "audio_tower.layers.2.self_attn.v_proj.input_min": "model.safetensors", + "audio_tower.layers.2.self_attn.v_proj.linear.weight": "model.safetensors", + "audio_tower.layers.2.self_attn.v_proj.output_max": "model.safetensors", + "audio_tower.layers.2.self_attn.v_proj.output_min": "model.safetensors", + "audio_tower.layers.3.feed_forward1.ffw_layer_1.input_max": "model.safetensors", + "audio_tower.layers.3.feed_forward1.ffw_layer_1.input_min": "model.safetensors", + "audio_tower.layers.3.feed_forward1.ffw_layer_1.linear.weight": "model.safetensors", + "audio_tower.layers.3.feed_forward1.ffw_layer_1.output_max": "model.safetensors", + "audio_tower.layers.3.feed_forward1.ffw_layer_1.output_min": "model.safetensors", + "audio_tower.layers.3.feed_forward1.ffw_layer_2.input_max": "model.safetensors", + "audio_tower.layers.3.feed_forward1.ffw_layer_2.input_min": "model.safetensors", + "audio_tower.layers.3.feed_forward1.ffw_layer_2.linear.weight": "model.safetensors", + "audio_tower.layers.3.feed_forward1.ffw_layer_2.output_max": "model.safetensors", + "audio_tower.layers.3.feed_forward1.ffw_layer_2.output_min": "model.safetensors", + "audio_tower.layers.3.feed_forward1.post_layer_norm.weight": "model.safetensors", + "audio_tower.layers.3.feed_forward1.pre_layer_norm.weight": "model.safetensors", + "audio_tower.layers.3.feed_forward2.ffw_layer_1.input_max": "model.safetensors", + "audio_tower.layers.3.feed_forward2.ffw_layer_1.input_min": "model.safetensors", + "audio_tower.layers.3.feed_forward2.ffw_layer_1.linear.weight": "model.safetensors", + "audio_tower.layers.3.feed_forward2.ffw_layer_1.output_max": "model.safetensors", + "audio_tower.layers.3.feed_forward2.ffw_layer_1.output_min": "model.safetensors", + "audio_tower.layers.3.feed_forward2.ffw_layer_2.input_max": "model.safetensors", + "audio_tower.layers.3.feed_forward2.ffw_layer_2.input_min": "model.safetensors", + "audio_tower.layers.3.feed_forward2.ffw_layer_2.linear.weight": "model.safetensors", + "audio_tower.layers.3.feed_forward2.ffw_layer_2.output_max": "model.safetensors", + "audio_tower.layers.3.feed_forward2.ffw_layer_2.output_min": "model.safetensors", + "audio_tower.layers.3.feed_forward2.post_layer_norm.weight": "model.safetensors", + "audio_tower.layers.3.feed_forward2.pre_layer_norm.weight": "model.safetensors", + "audio_tower.layers.3.lconv1d.conv_norm.weight": "model.safetensors", + "audio_tower.layers.3.lconv1d.depthwise_conv1d.weight": "model.safetensors", + "audio_tower.layers.3.lconv1d.linear_end.input_max": "model.safetensors", + "audio_tower.layers.3.lconv1d.linear_end.input_min": "model.safetensors", + "audio_tower.layers.3.lconv1d.linear_end.linear.weight": "model.safetensors", + "audio_tower.layers.3.lconv1d.linear_end.output_max": "model.safetensors", + "audio_tower.layers.3.lconv1d.linear_end.output_min": "model.safetensors", + "audio_tower.layers.3.lconv1d.linear_start.input_max": "model.safetensors", + "audio_tower.layers.3.lconv1d.linear_start.input_min": "model.safetensors", + "audio_tower.layers.3.lconv1d.linear_start.linear.weight": "model.safetensors", + "audio_tower.layers.3.lconv1d.linear_start.output_max": "model.safetensors", + "audio_tower.layers.3.lconv1d.linear_start.output_min": "model.safetensors", + "audio_tower.layers.3.lconv1d.pre_layer_norm.weight": "model.safetensors", + "audio_tower.layers.3.norm_out.weight": "model.safetensors", + "audio_tower.layers.3.norm_post_attn.weight": "model.safetensors", + "audio_tower.layers.3.norm_pre_attn.weight": "model.safetensors", + "audio_tower.layers.3.self_attn.k_proj.input_max": "model.safetensors", + "audio_tower.layers.3.self_attn.k_proj.input_min": "model.safetensors", + "audio_tower.layers.3.self_attn.k_proj.linear.weight": "model.safetensors", + "audio_tower.layers.3.self_attn.k_proj.output_max": "model.safetensors", + "audio_tower.layers.3.self_attn.k_proj.output_min": "model.safetensors", + "audio_tower.layers.3.self_attn.per_dim_scale": "model.safetensors", + "audio_tower.layers.3.self_attn.post.input_max": "model.safetensors", + "audio_tower.layers.3.self_attn.post.input_min": "model.safetensors", + "audio_tower.layers.3.self_attn.post.linear.weight": "model.safetensors", + "audio_tower.layers.3.self_attn.post.output_max": "model.safetensors", + "audio_tower.layers.3.self_attn.post.output_min": "model.safetensors", + "audio_tower.layers.3.self_attn.q_proj.input_max": "model.safetensors", + "audio_tower.layers.3.self_attn.q_proj.input_min": "model.safetensors", + "audio_tower.layers.3.self_attn.q_proj.linear.weight": "model.safetensors", + "audio_tower.layers.3.self_attn.q_proj.output_max": "model.safetensors", + "audio_tower.layers.3.self_attn.q_proj.output_min": "model.safetensors", + "audio_tower.layers.3.self_attn.relative_k_proj.weight": "model.safetensors", + "audio_tower.layers.3.self_attn.v_proj.input_max": "model.safetensors", + "audio_tower.layers.3.self_attn.v_proj.input_min": "model.safetensors", + "audio_tower.layers.3.self_attn.v_proj.linear.weight": "model.safetensors", + "audio_tower.layers.3.self_attn.v_proj.output_max": "model.safetensors", + "audio_tower.layers.3.self_attn.v_proj.output_min": "model.safetensors", + "audio_tower.layers.4.feed_forward1.ffw_layer_1.input_max": "model.safetensors", + "audio_tower.layers.4.feed_forward1.ffw_layer_1.input_min": "model.safetensors", + "audio_tower.layers.4.feed_forward1.ffw_layer_1.linear.weight": "model.safetensors", + "audio_tower.layers.4.feed_forward1.ffw_layer_1.output_max": "model.safetensors", + "audio_tower.layers.4.feed_forward1.ffw_layer_1.output_min": "model.safetensors", + "audio_tower.layers.4.feed_forward1.ffw_layer_2.input_max": "model.safetensors", + "audio_tower.layers.4.feed_forward1.ffw_layer_2.input_min": "model.safetensors", + "audio_tower.layers.4.feed_forward1.ffw_layer_2.linear.weight": "model.safetensors", + "audio_tower.layers.4.feed_forward1.ffw_layer_2.output_max": "model.safetensors", + "audio_tower.layers.4.feed_forward1.ffw_layer_2.output_min": "model.safetensors", + "audio_tower.layers.4.feed_forward1.post_layer_norm.weight": "model.safetensors", + "audio_tower.layers.4.feed_forward1.pre_layer_norm.weight": "model.safetensors", + "audio_tower.layers.4.feed_forward2.ffw_layer_1.input_max": "model.safetensors", + "audio_tower.layers.4.feed_forward2.ffw_layer_1.input_min": "model.safetensors", + "audio_tower.layers.4.feed_forward2.ffw_layer_1.linear.weight": "model.safetensors", + "audio_tower.layers.4.feed_forward2.ffw_layer_1.output_max": "model.safetensors", + "audio_tower.layers.4.feed_forward2.ffw_layer_1.output_min": "model.safetensors", + "audio_tower.layers.4.feed_forward2.ffw_layer_2.input_max": "model.safetensors", + "audio_tower.layers.4.feed_forward2.ffw_layer_2.input_min": "model.safetensors", + "audio_tower.layers.4.feed_forward2.ffw_layer_2.linear.weight": "model.safetensors", + "audio_tower.layers.4.feed_forward2.ffw_layer_2.output_max": "model.safetensors", + "audio_tower.layers.4.feed_forward2.ffw_layer_2.output_min": "model.safetensors", + "audio_tower.layers.4.feed_forward2.post_layer_norm.weight": "model.safetensors", + "audio_tower.layers.4.feed_forward2.pre_layer_norm.weight": "model.safetensors", + "audio_tower.layers.4.lconv1d.conv_norm.weight": "model.safetensors", + "audio_tower.layers.4.lconv1d.depthwise_conv1d.weight": "model.safetensors", + "audio_tower.layers.4.lconv1d.linear_end.input_max": "model.safetensors", + "audio_tower.layers.4.lconv1d.linear_end.input_min": "model.safetensors", + "audio_tower.layers.4.lconv1d.linear_end.linear.weight": "model.safetensors", + "audio_tower.layers.4.lconv1d.linear_end.output_max": "model.safetensors", + "audio_tower.layers.4.lconv1d.linear_end.output_min": "model.safetensors", + "audio_tower.layers.4.lconv1d.linear_start.input_max": "model.safetensors", + "audio_tower.layers.4.lconv1d.linear_start.input_min": "model.safetensors", + "audio_tower.layers.4.lconv1d.linear_start.linear.weight": "model.safetensors", + "audio_tower.layers.4.lconv1d.linear_start.output_max": "model.safetensors", + "audio_tower.layers.4.lconv1d.linear_start.output_min": "model.safetensors", + "audio_tower.layers.4.lconv1d.pre_layer_norm.weight": "model.safetensors", + "audio_tower.layers.4.norm_out.weight": "model.safetensors", + "audio_tower.layers.4.norm_post_attn.weight": "model.safetensors", + "audio_tower.layers.4.norm_pre_attn.weight": "model.safetensors", + "audio_tower.layers.4.self_attn.k_proj.input_max": "model.safetensors", + "audio_tower.layers.4.self_attn.k_proj.input_min": "model.safetensors", + "audio_tower.layers.4.self_attn.k_proj.linear.weight": "model.safetensors", + "audio_tower.layers.4.self_attn.k_proj.output_max": "model.safetensors", + "audio_tower.layers.4.self_attn.k_proj.output_min": "model.safetensors", + "audio_tower.layers.4.self_attn.per_dim_scale": "model.safetensors", + "audio_tower.layers.4.self_attn.post.input_max": "model.safetensors", + "audio_tower.layers.4.self_attn.post.input_min": "model.safetensors", + "audio_tower.layers.4.self_attn.post.linear.weight": "model.safetensors", + "audio_tower.layers.4.self_attn.post.output_max": "model.safetensors", + "audio_tower.layers.4.self_attn.post.output_min": "model.safetensors", + "audio_tower.layers.4.self_attn.q_proj.input_max": "model.safetensors", + "audio_tower.layers.4.self_attn.q_proj.input_min": "model.safetensors", + "audio_tower.layers.4.self_attn.q_proj.linear.weight": "model.safetensors", + "audio_tower.layers.4.self_attn.q_proj.output_max": "model.safetensors", + "audio_tower.layers.4.self_attn.q_proj.output_min": "model.safetensors", + "audio_tower.layers.4.self_attn.relative_k_proj.weight": "model.safetensors", + "audio_tower.layers.4.self_attn.v_proj.input_max": "model.safetensors", + "audio_tower.layers.4.self_attn.v_proj.input_min": "model.safetensors", + "audio_tower.layers.4.self_attn.v_proj.linear.weight": "model.safetensors", + "audio_tower.layers.4.self_attn.v_proj.output_max": "model.safetensors", + "audio_tower.layers.4.self_attn.v_proj.output_min": "model.safetensors", + "audio_tower.layers.5.feed_forward1.ffw_layer_1.input_max": "model.safetensors", + "audio_tower.layers.5.feed_forward1.ffw_layer_1.input_min": "model.safetensors", + "audio_tower.layers.5.feed_forward1.ffw_layer_1.linear.weight": "model.safetensors", + "audio_tower.layers.5.feed_forward1.ffw_layer_1.output_max": "model.safetensors", + "audio_tower.layers.5.feed_forward1.ffw_layer_1.output_min": "model.safetensors", + "audio_tower.layers.5.feed_forward1.ffw_layer_2.input_max": "model.safetensors", + "audio_tower.layers.5.feed_forward1.ffw_layer_2.input_min": "model.safetensors", + "audio_tower.layers.5.feed_forward1.ffw_layer_2.linear.weight": "model.safetensors", + "audio_tower.layers.5.feed_forward1.ffw_layer_2.output_max": "model.safetensors", + "audio_tower.layers.5.feed_forward1.ffw_layer_2.output_min": "model.safetensors", + "audio_tower.layers.5.feed_forward1.post_layer_norm.weight": "model.safetensors", + "audio_tower.layers.5.feed_forward1.pre_layer_norm.weight": "model.safetensors", + "audio_tower.layers.5.feed_forward2.ffw_layer_1.input_max": "model.safetensors", + "audio_tower.layers.5.feed_forward2.ffw_layer_1.input_min": "model.safetensors", + "audio_tower.layers.5.feed_forward2.ffw_layer_1.linear.weight": "model.safetensors", + "audio_tower.layers.5.feed_forward2.ffw_layer_1.output_max": "model.safetensors", + "audio_tower.layers.5.feed_forward2.ffw_layer_1.output_min": "model.safetensors", + "audio_tower.layers.5.feed_forward2.ffw_layer_2.input_max": "model.safetensors", + "audio_tower.layers.5.feed_forward2.ffw_layer_2.input_min": "model.safetensors", + "audio_tower.layers.5.feed_forward2.ffw_layer_2.linear.weight": "model.safetensors", + "audio_tower.layers.5.feed_forward2.ffw_layer_2.output_max": "model.safetensors", + "audio_tower.layers.5.feed_forward2.ffw_layer_2.output_min": "model.safetensors", + "audio_tower.layers.5.feed_forward2.post_layer_norm.weight": "model.safetensors", + "audio_tower.layers.5.feed_forward2.pre_layer_norm.weight": "model.safetensors", + "audio_tower.layers.5.lconv1d.conv_norm.weight": "model.safetensors", + "audio_tower.layers.5.lconv1d.depthwise_conv1d.weight": "model.safetensors", + "audio_tower.layers.5.lconv1d.linear_end.input_max": "model.safetensors", + "audio_tower.layers.5.lconv1d.linear_end.input_min": "model.safetensors", + "audio_tower.layers.5.lconv1d.linear_end.linear.weight": "model.safetensors", + "audio_tower.layers.5.lconv1d.linear_end.output_max": "model.safetensors", + "audio_tower.layers.5.lconv1d.linear_end.output_min": "model.safetensors", + "audio_tower.layers.5.lconv1d.linear_start.input_max": "model.safetensors", + "audio_tower.layers.5.lconv1d.linear_start.input_min": "model.safetensors", + "audio_tower.layers.5.lconv1d.linear_start.linear.weight": "model.safetensors", + "audio_tower.layers.5.lconv1d.linear_start.output_max": "model.safetensors", + "audio_tower.layers.5.lconv1d.linear_start.output_min": "model.safetensors", + "audio_tower.layers.5.lconv1d.pre_layer_norm.weight": "model.safetensors", + "audio_tower.layers.5.norm_out.weight": "model.safetensors", + "audio_tower.layers.5.norm_post_attn.weight": "model.safetensors", + "audio_tower.layers.5.norm_pre_attn.weight": "model.safetensors", + "audio_tower.layers.5.self_attn.k_proj.input_max": "model.safetensors", + "audio_tower.layers.5.self_attn.k_proj.input_min": "model.safetensors", + "audio_tower.layers.5.self_attn.k_proj.linear.weight": "model.safetensors", + "audio_tower.layers.5.self_attn.k_proj.output_max": "model.safetensors", + "audio_tower.layers.5.self_attn.k_proj.output_min": "model.safetensors", + "audio_tower.layers.5.self_attn.per_dim_scale": "model.safetensors", + "audio_tower.layers.5.self_attn.post.input_max": "model.safetensors", + "audio_tower.layers.5.self_attn.post.input_min": "model.safetensors", + "audio_tower.layers.5.self_attn.post.linear.weight": "model.safetensors", + "audio_tower.layers.5.self_attn.post.output_max": "model.safetensors", + "audio_tower.layers.5.self_attn.post.output_min": "model.safetensors", + "audio_tower.layers.5.self_attn.q_proj.input_max": "model.safetensors", + "audio_tower.layers.5.self_attn.q_proj.input_min": "model.safetensors", + "audio_tower.layers.5.self_attn.q_proj.linear.weight": "model.safetensors", + "audio_tower.layers.5.self_attn.q_proj.output_max": "model.safetensors", + "audio_tower.layers.5.self_attn.q_proj.output_min": "model.safetensors", + "audio_tower.layers.5.self_attn.relative_k_proj.weight": "model.safetensors", + "audio_tower.layers.5.self_attn.v_proj.input_max": "model.safetensors", + "audio_tower.layers.5.self_attn.v_proj.input_min": "model.safetensors", + "audio_tower.layers.5.self_attn.v_proj.linear.weight": "model.safetensors", + "audio_tower.layers.5.self_attn.v_proj.output_max": "model.safetensors", + "audio_tower.layers.5.self_attn.v_proj.output_min": "model.safetensors", + "audio_tower.layers.6.feed_forward1.ffw_layer_1.input_max": "model.safetensors", + "audio_tower.layers.6.feed_forward1.ffw_layer_1.input_min": "model.safetensors", + "audio_tower.layers.6.feed_forward1.ffw_layer_1.linear.weight": "model.safetensors", + "audio_tower.layers.6.feed_forward1.ffw_layer_1.output_max": "model.safetensors", + "audio_tower.layers.6.feed_forward1.ffw_layer_1.output_min": "model.safetensors", + "audio_tower.layers.6.feed_forward1.ffw_layer_2.input_max": "model.safetensors", + "audio_tower.layers.6.feed_forward1.ffw_layer_2.input_min": "model.safetensors", + "audio_tower.layers.6.feed_forward1.ffw_layer_2.linear.weight": "model.safetensors", + "audio_tower.layers.6.feed_forward1.ffw_layer_2.output_max": "model.safetensors", + "audio_tower.layers.6.feed_forward1.ffw_layer_2.output_min": "model.safetensors", + "audio_tower.layers.6.feed_forward1.post_layer_norm.weight": "model.safetensors", + "audio_tower.layers.6.feed_forward1.pre_layer_norm.weight": "model.safetensors", + "audio_tower.layers.6.feed_forward2.ffw_layer_1.input_max": "model.safetensors", + "audio_tower.layers.6.feed_forward2.ffw_layer_1.input_min": "model.safetensors", + "audio_tower.layers.6.feed_forward2.ffw_layer_1.linear.weight": "model.safetensors", + "audio_tower.layers.6.feed_forward2.ffw_layer_1.output_max": "model.safetensors", + "audio_tower.layers.6.feed_forward2.ffw_layer_1.output_min": "model.safetensors", + "audio_tower.layers.6.feed_forward2.ffw_layer_2.input_max": "model.safetensors", + "audio_tower.layers.6.feed_forward2.ffw_layer_2.input_min": "model.safetensors", + "audio_tower.layers.6.feed_forward2.ffw_layer_2.linear.weight": "model.safetensors", + "audio_tower.layers.6.feed_forward2.ffw_layer_2.output_max": "model.safetensors", + "audio_tower.layers.6.feed_forward2.ffw_layer_2.output_min": "model.safetensors", + "audio_tower.layers.6.feed_forward2.post_layer_norm.weight": "model.safetensors", + "audio_tower.layers.6.feed_forward2.pre_layer_norm.weight": "model.safetensors", + "audio_tower.layers.6.lconv1d.conv_norm.weight": "model.safetensors", + "audio_tower.layers.6.lconv1d.depthwise_conv1d.weight": "model.safetensors", + "audio_tower.layers.6.lconv1d.linear_end.input_max": "model.safetensors", + "audio_tower.layers.6.lconv1d.linear_end.input_min": "model.safetensors", + "audio_tower.layers.6.lconv1d.linear_end.linear.weight": "model.safetensors", + "audio_tower.layers.6.lconv1d.linear_end.output_max": "model.safetensors", + "audio_tower.layers.6.lconv1d.linear_end.output_min": "model.safetensors", + "audio_tower.layers.6.lconv1d.linear_start.input_max": "model.safetensors", + "audio_tower.layers.6.lconv1d.linear_start.input_min": "model.safetensors", + "audio_tower.layers.6.lconv1d.linear_start.linear.weight": "model.safetensors", + "audio_tower.layers.6.lconv1d.linear_start.output_max": "model.safetensors", + "audio_tower.layers.6.lconv1d.linear_start.output_min": "model.safetensors", + "audio_tower.layers.6.lconv1d.pre_layer_norm.weight": "model.safetensors", + "audio_tower.layers.6.norm_out.weight": "model.safetensors", + "audio_tower.layers.6.norm_post_attn.weight": "model.safetensors", + "audio_tower.layers.6.norm_pre_attn.weight": "model.safetensors", + "audio_tower.layers.6.self_attn.k_proj.input_max": "model.safetensors", + "audio_tower.layers.6.self_attn.k_proj.input_min": "model.safetensors", + "audio_tower.layers.6.self_attn.k_proj.linear.weight": "model.safetensors", + "audio_tower.layers.6.self_attn.k_proj.output_max": "model.safetensors", + "audio_tower.layers.6.self_attn.k_proj.output_min": "model.safetensors", + "audio_tower.layers.6.self_attn.per_dim_scale": "model.safetensors", + "audio_tower.layers.6.self_attn.post.input_max": "model.safetensors", + "audio_tower.layers.6.self_attn.post.input_min": "model.safetensors", + "audio_tower.layers.6.self_attn.post.linear.weight": "model.safetensors", + "audio_tower.layers.6.self_attn.post.output_max": "model.safetensors", + "audio_tower.layers.6.self_attn.post.output_min": "model.safetensors", + "audio_tower.layers.6.self_attn.q_proj.input_max": "model.safetensors", + "audio_tower.layers.6.self_attn.q_proj.input_min": "model.safetensors", + "audio_tower.layers.6.self_attn.q_proj.linear.weight": "model.safetensors", + "audio_tower.layers.6.self_attn.q_proj.output_max": "model.safetensors", + "audio_tower.layers.6.self_attn.q_proj.output_min": "model.safetensors", + "audio_tower.layers.6.self_attn.relative_k_proj.weight": "model.safetensors", + "audio_tower.layers.6.self_attn.v_proj.input_max": "model.safetensors", + "audio_tower.layers.6.self_attn.v_proj.input_min": "model.safetensors", + "audio_tower.layers.6.self_attn.v_proj.linear.weight": "model.safetensors", + "audio_tower.layers.6.self_attn.v_proj.output_max": "model.safetensors", + "audio_tower.layers.6.self_attn.v_proj.output_min": "model.safetensors", + "audio_tower.layers.7.feed_forward1.ffw_layer_1.input_max": "model.safetensors", + "audio_tower.layers.7.feed_forward1.ffw_layer_1.input_min": "model.safetensors", + "audio_tower.layers.7.feed_forward1.ffw_layer_1.linear.weight": "model.safetensors", + "audio_tower.layers.7.feed_forward1.ffw_layer_1.output_max": "model.safetensors", + "audio_tower.layers.7.feed_forward1.ffw_layer_1.output_min": "model.safetensors", + "audio_tower.layers.7.feed_forward1.ffw_layer_2.input_max": "model.safetensors", + "audio_tower.layers.7.feed_forward1.ffw_layer_2.input_min": "model.safetensors", + "audio_tower.layers.7.feed_forward1.ffw_layer_2.linear.weight": "model.safetensors", + "audio_tower.layers.7.feed_forward1.ffw_layer_2.output_max": "model.safetensors", + "audio_tower.layers.7.feed_forward1.ffw_layer_2.output_min": "model.safetensors", + "audio_tower.layers.7.feed_forward1.post_layer_norm.weight": "model.safetensors", + "audio_tower.layers.7.feed_forward1.pre_layer_norm.weight": "model.safetensors", + "audio_tower.layers.7.feed_forward2.ffw_layer_1.input_max": "model.safetensors", + "audio_tower.layers.7.feed_forward2.ffw_layer_1.input_min": "model.safetensors", + "audio_tower.layers.7.feed_forward2.ffw_layer_1.linear.weight": "model.safetensors", + "audio_tower.layers.7.feed_forward2.ffw_layer_1.output_max": "model.safetensors", + "audio_tower.layers.7.feed_forward2.ffw_layer_1.output_min": "model.safetensors", + "audio_tower.layers.7.feed_forward2.ffw_layer_2.input_max": "model.safetensors", + "audio_tower.layers.7.feed_forward2.ffw_layer_2.input_min": "model.safetensors", + "audio_tower.layers.7.feed_forward2.ffw_layer_2.linear.weight": "model.safetensors", + "audio_tower.layers.7.feed_forward2.ffw_layer_2.output_max": "model.safetensors", + "audio_tower.layers.7.feed_forward2.ffw_layer_2.output_min": "model.safetensors", + "audio_tower.layers.7.feed_forward2.post_layer_norm.weight": "model.safetensors", + "audio_tower.layers.7.feed_forward2.pre_layer_norm.weight": "model.safetensors", + "audio_tower.layers.7.lconv1d.conv_norm.weight": "model.safetensors", + "audio_tower.layers.7.lconv1d.depthwise_conv1d.weight": "model.safetensors", + "audio_tower.layers.7.lconv1d.linear_end.input_max": "model.safetensors", + "audio_tower.layers.7.lconv1d.linear_end.input_min": "model.safetensors", + "audio_tower.layers.7.lconv1d.linear_end.linear.weight": "model.safetensors", + "audio_tower.layers.7.lconv1d.linear_end.output_max": "model.safetensors", + "audio_tower.layers.7.lconv1d.linear_end.output_min": "model.safetensors", + "audio_tower.layers.7.lconv1d.linear_start.input_max": "model.safetensors", + "audio_tower.layers.7.lconv1d.linear_start.input_min": "model.safetensors", + "audio_tower.layers.7.lconv1d.linear_start.linear.weight": "model.safetensors", + "audio_tower.layers.7.lconv1d.linear_start.output_max": "model.safetensors", + "audio_tower.layers.7.lconv1d.linear_start.output_min": "model.safetensors", + "audio_tower.layers.7.lconv1d.pre_layer_norm.weight": "model.safetensors", + "audio_tower.layers.7.norm_out.weight": "model.safetensors", + "audio_tower.layers.7.norm_post_attn.weight": "model.safetensors", + "audio_tower.layers.7.norm_pre_attn.weight": "model.safetensors", + "audio_tower.layers.7.self_attn.k_proj.input_max": "model.safetensors", + "audio_tower.layers.7.self_attn.k_proj.input_min": "model.safetensors", + "audio_tower.layers.7.self_attn.k_proj.linear.weight": "model.safetensors", + "audio_tower.layers.7.self_attn.k_proj.output_max": "model.safetensors", + "audio_tower.layers.7.self_attn.k_proj.output_min": "model.safetensors", + "audio_tower.layers.7.self_attn.per_dim_scale": "model.safetensors", + "audio_tower.layers.7.self_attn.post.input_max": "model.safetensors", + "audio_tower.layers.7.self_attn.post.input_min": "model.safetensors", + "audio_tower.layers.7.self_attn.post.linear.weight": "model.safetensors", + "audio_tower.layers.7.self_attn.post.output_max": "model.safetensors", + "audio_tower.layers.7.self_attn.post.output_min": "model.safetensors", + "audio_tower.layers.7.self_attn.q_proj.input_max": "model.safetensors", + "audio_tower.layers.7.self_attn.q_proj.input_min": "model.safetensors", + "audio_tower.layers.7.self_attn.q_proj.linear.weight": "model.safetensors", + "audio_tower.layers.7.self_attn.q_proj.output_max": "model.safetensors", + "audio_tower.layers.7.self_attn.q_proj.output_min": "model.safetensors", + "audio_tower.layers.7.self_attn.relative_k_proj.weight": "model.safetensors", + "audio_tower.layers.7.self_attn.v_proj.input_max": "model.safetensors", + "audio_tower.layers.7.self_attn.v_proj.input_min": "model.safetensors", + "audio_tower.layers.7.self_attn.v_proj.linear.weight": "model.safetensors", + "audio_tower.layers.7.self_attn.v_proj.output_max": "model.safetensors", + "audio_tower.layers.7.self_attn.v_proj.output_min": "model.safetensors", + "audio_tower.layers.8.feed_forward1.ffw_layer_1.input_max": "model.safetensors", + "audio_tower.layers.8.feed_forward1.ffw_layer_1.input_min": "model.safetensors", + "audio_tower.layers.8.feed_forward1.ffw_layer_1.linear.weight": "model.safetensors", + "audio_tower.layers.8.feed_forward1.ffw_layer_1.output_max": "model.safetensors", + "audio_tower.layers.8.feed_forward1.ffw_layer_1.output_min": "model.safetensors", + "audio_tower.layers.8.feed_forward1.ffw_layer_2.input_max": "model.safetensors", + "audio_tower.layers.8.feed_forward1.ffw_layer_2.input_min": "model.safetensors", + "audio_tower.layers.8.feed_forward1.ffw_layer_2.linear.weight": "model.safetensors", + "audio_tower.layers.8.feed_forward1.ffw_layer_2.output_max": "model.safetensors", + "audio_tower.layers.8.feed_forward1.ffw_layer_2.output_min": "model.safetensors", + "audio_tower.layers.8.feed_forward1.post_layer_norm.weight": "model.safetensors", + "audio_tower.layers.8.feed_forward1.pre_layer_norm.weight": "model.safetensors", + "audio_tower.layers.8.feed_forward2.ffw_layer_1.input_max": "model.safetensors", + "audio_tower.layers.8.feed_forward2.ffw_layer_1.input_min": "model.safetensors", + "audio_tower.layers.8.feed_forward2.ffw_layer_1.linear.weight": "model.safetensors", + "audio_tower.layers.8.feed_forward2.ffw_layer_1.output_max": "model.safetensors", + "audio_tower.layers.8.feed_forward2.ffw_layer_1.output_min": "model.safetensors", + "audio_tower.layers.8.feed_forward2.ffw_layer_2.input_max": "model.safetensors", + "audio_tower.layers.8.feed_forward2.ffw_layer_2.input_min": "model.safetensors", + "audio_tower.layers.8.feed_forward2.ffw_layer_2.linear.weight": "model.safetensors", + "audio_tower.layers.8.feed_forward2.ffw_layer_2.output_max": "model.safetensors", + "audio_tower.layers.8.feed_forward2.ffw_layer_2.output_min": "model.safetensors", + "audio_tower.layers.8.feed_forward2.post_layer_norm.weight": "model.safetensors", + "audio_tower.layers.8.feed_forward2.pre_layer_norm.weight": "model.safetensors", + "audio_tower.layers.8.lconv1d.conv_norm.weight": "model.safetensors", + "audio_tower.layers.8.lconv1d.depthwise_conv1d.weight": "model.safetensors", + "audio_tower.layers.8.lconv1d.linear_end.input_max": "model.safetensors", + "audio_tower.layers.8.lconv1d.linear_end.input_min": "model.safetensors", + "audio_tower.layers.8.lconv1d.linear_end.linear.weight": "model.safetensors", + "audio_tower.layers.8.lconv1d.linear_end.output_max": "model.safetensors", + "audio_tower.layers.8.lconv1d.linear_end.output_min": "model.safetensors", + "audio_tower.layers.8.lconv1d.linear_start.input_max": "model.safetensors", + "audio_tower.layers.8.lconv1d.linear_start.input_min": "model.safetensors", + "audio_tower.layers.8.lconv1d.linear_start.linear.weight": "model.safetensors", + "audio_tower.layers.8.lconv1d.linear_start.output_max": "model.safetensors", + "audio_tower.layers.8.lconv1d.linear_start.output_min": "model.safetensors", + "audio_tower.layers.8.lconv1d.pre_layer_norm.weight": "model.safetensors", + "audio_tower.layers.8.norm_out.weight": "model.safetensors", + "audio_tower.layers.8.norm_post_attn.weight": "model.safetensors", + "audio_tower.layers.8.norm_pre_attn.weight": "model.safetensors", + "audio_tower.layers.8.self_attn.k_proj.input_max": "model.safetensors", + "audio_tower.layers.8.self_attn.k_proj.input_min": "model.safetensors", + "audio_tower.layers.8.self_attn.k_proj.linear.weight": "model.safetensors", + "audio_tower.layers.8.self_attn.k_proj.output_max": "model.safetensors", + "audio_tower.layers.8.self_attn.k_proj.output_min": "model.safetensors", + "audio_tower.layers.8.self_attn.per_dim_scale": "model.safetensors", + "audio_tower.layers.8.self_attn.post.input_max": "model.safetensors", + "audio_tower.layers.8.self_attn.post.input_min": "model.safetensors", + "audio_tower.layers.8.self_attn.post.linear.weight": "model.safetensors", + "audio_tower.layers.8.self_attn.post.output_max": "model.safetensors", + "audio_tower.layers.8.self_attn.post.output_min": "model.safetensors", + "audio_tower.layers.8.self_attn.q_proj.input_max": "model.safetensors", + "audio_tower.layers.8.self_attn.q_proj.input_min": "model.safetensors", + "audio_tower.layers.8.self_attn.q_proj.linear.weight": "model.safetensors", + "audio_tower.layers.8.self_attn.q_proj.output_max": "model.safetensors", + "audio_tower.layers.8.self_attn.q_proj.output_min": "model.safetensors", + "audio_tower.layers.8.self_attn.relative_k_proj.weight": "model.safetensors", + "audio_tower.layers.8.self_attn.v_proj.input_max": "model.safetensors", + "audio_tower.layers.8.self_attn.v_proj.input_min": "model.safetensors", + "audio_tower.layers.8.self_attn.v_proj.linear.weight": "model.safetensors", + "audio_tower.layers.8.self_attn.v_proj.output_max": "model.safetensors", + "audio_tower.layers.8.self_attn.v_proj.output_min": "model.safetensors", + "audio_tower.layers.9.feed_forward1.ffw_layer_1.input_max": "model.safetensors", + "audio_tower.layers.9.feed_forward1.ffw_layer_1.input_min": "model.safetensors", + "audio_tower.layers.9.feed_forward1.ffw_layer_1.linear.weight": "model.safetensors", + "audio_tower.layers.9.feed_forward1.ffw_layer_1.output_max": "model.safetensors", + "audio_tower.layers.9.feed_forward1.ffw_layer_1.output_min": "model.safetensors", + "audio_tower.layers.9.feed_forward1.ffw_layer_2.input_max": "model.safetensors", + "audio_tower.layers.9.feed_forward1.ffw_layer_2.input_min": "model.safetensors", + "audio_tower.layers.9.feed_forward1.ffw_layer_2.linear.weight": "model.safetensors", + "audio_tower.layers.9.feed_forward1.ffw_layer_2.output_max": "model.safetensors", + "audio_tower.layers.9.feed_forward1.ffw_layer_2.output_min": "model.safetensors", + "audio_tower.layers.9.feed_forward1.post_layer_norm.weight": "model.safetensors", + "audio_tower.layers.9.feed_forward1.pre_layer_norm.weight": "model.safetensors", + "audio_tower.layers.9.feed_forward2.ffw_layer_1.input_max": "model.safetensors", + "audio_tower.layers.9.feed_forward2.ffw_layer_1.input_min": "model.safetensors", + "audio_tower.layers.9.feed_forward2.ffw_layer_1.linear.weight": "model.safetensors", + "audio_tower.layers.9.feed_forward2.ffw_layer_1.output_max": "model.safetensors", + "audio_tower.layers.9.feed_forward2.ffw_layer_1.output_min": "model.safetensors", + "audio_tower.layers.9.feed_forward2.ffw_layer_2.input_max": "model.safetensors", + "audio_tower.layers.9.feed_forward2.ffw_layer_2.input_min": "model.safetensors", + "audio_tower.layers.9.feed_forward2.ffw_layer_2.linear.weight": "model.safetensors", + "audio_tower.layers.9.feed_forward2.ffw_layer_2.output_max": "model.safetensors", + "audio_tower.layers.9.feed_forward2.ffw_layer_2.output_min": "model.safetensors", + "audio_tower.layers.9.feed_forward2.post_layer_norm.weight": "model.safetensors", + "audio_tower.layers.9.feed_forward2.pre_layer_norm.weight": "model.safetensors", + "audio_tower.layers.9.lconv1d.conv_norm.weight": "model.safetensors", + "audio_tower.layers.9.lconv1d.depthwise_conv1d.weight": "model.safetensors", + "audio_tower.layers.9.lconv1d.linear_end.input_max": "model.safetensors", + "audio_tower.layers.9.lconv1d.linear_end.input_min": "model.safetensors", + "audio_tower.layers.9.lconv1d.linear_end.linear.weight": "model.safetensors", + "audio_tower.layers.9.lconv1d.linear_end.output_max": "model.safetensors", + "audio_tower.layers.9.lconv1d.linear_end.output_min": "model.safetensors", + "audio_tower.layers.9.lconv1d.linear_start.input_max": "model.safetensors", + "audio_tower.layers.9.lconv1d.linear_start.input_min": "model.safetensors", + "audio_tower.layers.9.lconv1d.linear_start.linear.weight": "model.safetensors", + "audio_tower.layers.9.lconv1d.linear_start.output_max": "model.safetensors", + "audio_tower.layers.9.lconv1d.linear_start.output_min": "model.safetensors", + "audio_tower.layers.9.lconv1d.pre_layer_norm.weight": "model.safetensors", + "audio_tower.layers.9.norm_out.weight": "model.safetensors", + "audio_tower.layers.9.norm_post_attn.weight": "model.safetensors", + "audio_tower.layers.9.norm_pre_attn.weight": "model.safetensors", + "audio_tower.layers.9.self_attn.k_proj.input_max": "model.safetensors", + "audio_tower.layers.9.self_attn.k_proj.input_min": "model.safetensors", + "audio_tower.layers.9.self_attn.k_proj.linear.weight": "model.safetensors", + "audio_tower.layers.9.self_attn.k_proj.output_max": "model.safetensors", + "audio_tower.layers.9.self_attn.k_proj.output_min": "model.safetensors", + "audio_tower.layers.9.self_attn.per_dim_scale": "model.safetensors", + "audio_tower.layers.9.self_attn.post.input_max": "model.safetensors", + "audio_tower.layers.9.self_attn.post.input_min": "model.safetensors", + "audio_tower.layers.9.self_attn.post.linear.weight": "model.safetensors", + "audio_tower.layers.9.self_attn.post.output_max": "model.safetensors", + "audio_tower.layers.9.self_attn.post.output_min": "model.safetensors", + "audio_tower.layers.9.self_attn.q_proj.input_max": "model.safetensors", + "audio_tower.layers.9.self_attn.q_proj.input_min": "model.safetensors", + "audio_tower.layers.9.self_attn.q_proj.linear.weight": "model.safetensors", + "audio_tower.layers.9.self_attn.q_proj.output_max": "model.safetensors", + "audio_tower.layers.9.self_attn.q_proj.output_min": "model.safetensors", + "audio_tower.layers.9.self_attn.relative_k_proj.weight": "model.safetensors", + "audio_tower.layers.9.self_attn.v_proj.input_max": "model.safetensors", + "audio_tower.layers.9.self_attn.v_proj.input_min": "model.safetensors", + "audio_tower.layers.9.self_attn.v_proj.linear.weight": "model.safetensors", + "audio_tower.layers.9.self_attn.v_proj.output_max": "model.safetensors", + "audio_tower.layers.9.self_attn.v_proj.output_min": "model.safetensors", + "audio_tower.output_proj.bias": "model.safetensors", + "audio_tower.output_proj.weight": "model.safetensors", + "audio_tower.subsample_conv_projection.input_proj_linear.weight": "model.safetensors", + "audio_tower.subsample_conv_projection.layer0.conv.weight": "model.safetensors", + "audio_tower.subsample_conv_projection.layer0.norm.weight": "model.safetensors", + "audio_tower.subsample_conv_projection.layer1.conv.weight": "model.safetensors", + "audio_tower.subsample_conv_projection.layer1.norm.weight": "model.safetensors", + "embed_audio.embedding_projection.biases": "model.safetensors", + "embed_audio.embedding_projection.scales": "model.safetensors", + "embed_audio.embedding_projection.weight": "model.safetensors", + "embed_vision.embedding_projection.biases": "model.safetensors", + "embed_vision.embedding_projection.scales": "model.safetensors", + "embed_vision.embedding_projection.weight": "model.safetensors", + "language_model.model.embed_tokens.biases": "model.safetensors", + "language_model.model.embed_tokens.scales": "model.safetensors", + "language_model.model.embed_tokens.weight": "model.safetensors", + "language_model.model.embed_tokens_per_layer.biases": "model.safetensors", + "language_model.model.embed_tokens_per_layer.scales": "model.safetensors", + "language_model.model.embed_tokens_per_layer.weight": "model.safetensors", + "language_model.model.layers.0.input_layernorm.weight": "model.safetensors", + "language_model.model.layers.0.layer_scalar": "model.safetensors", + "language_model.model.layers.0.mlp.down_proj.biases": "model.safetensors", + "language_model.model.layers.0.mlp.down_proj.scales": "model.safetensors", + "language_model.model.layers.0.mlp.down_proj.weight": "model.safetensors", + "language_model.model.layers.0.mlp.gate_proj.biases": "model.safetensors", + "language_model.model.layers.0.mlp.gate_proj.scales": "model.safetensors", + "language_model.model.layers.0.mlp.gate_proj.weight": "model.safetensors", + "language_model.model.layers.0.mlp.up_proj.biases": "model.safetensors", + "language_model.model.layers.0.mlp.up_proj.scales": "model.safetensors", + "language_model.model.layers.0.mlp.up_proj.weight": "model.safetensors", + "language_model.model.layers.0.per_layer_input_gate.biases": "model.safetensors", + "language_model.model.layers.0.per_layer_input_gate.scales": "model.safetensors", + "language_model.model.layers.0.per_layer_input_gate.weight": "model.safetensors", + "language_model.model.layers.0.per_layer_projection.biases": "model.safetensors", + "language_model.model.layers.0.per_layer_projection.scales": "model.safetensors", + "language_model.model.layers.0.per_layer_projection.weight": "model.safetensors", + "language_model.model.layers.0.post_attention_layernorm.weight": "model.safetensors", + "language_model.model.layers.0.post_feedforward_layernorm.weight": "model.safetensors", + "language_model.model.layers.0.post_per_layer_input_norm.weight": "model.safetensors", + "language_model.model.layers.0.pre_feedforward_layernorm.weight": "model.safetensors", + "language_model.model.layers.0.self_attn.k_norm.weight": "model.safetensors", + "language_model.model.layers.0.self_attn.k_proj.biases": "model.safetensors", + "language_model.model.layers.0.self_attn.k_proj.scales": "model.safetensors", + "language_model.model.layers.0.self_attn.k_proj.weight": "model.safetensors", + "language_model.model.layers.0.self_attn.o_proj.biases": "model.safetensors", + "language_model.model.layers.0.self_attn.o_proj.scales": "model.safetensors", + "language_model.model.layers.0.self_attn.o_proj.weight": "model.safetensors", + "language_model.model.layers.0.self_attn.q_norm.weight": "model.safetensors", + "language_model.model.layers.0.self_attn.q_proj.biases": "model.safetensors", + "language_model.model.layers.0.self_attn.q_proj.scales": "model.safetensors", + "language_model.model.layers.0.self_attn.q_proj.weight": "model.safetensors", + "language_model.model.layers.0.self_attn.v_proj.biases": "model.safetensors", + "language_model.model.layers.0.self_attn.v_proj.scales": "model.safetensors", + "language_model.model.layers.0.self_attn.v_proj.weight": "model.safetensors", + "language_model.model.layers.1.input_layernorm.weight": "model.safetensors", + "language_model.model.layers.1.layer_scalar": "model.safetensors", + "language_model.model.layers.1.mlp.down_proj.biases": "model.safetensors", + "language_model.model.layers.1.mlp.down_proj.scales": "model.safetensors", + "language_model.model.layers.1.mlp.down_proj.weight": "model.safetensors", + "language_model.model.layers.1.mlp.gate_proj.biases": "model.safetensors", + "language_model.model.layers.1.mlp.gate_proj.scales": "model.safetensors", + "language_model.model.layers.1.mlp.gate_proj.weight": "model.safetensors", + "language_model.model.layers.1.mlp.up_proj.biases": "model.safetensors", + "language_model.model.layers.1.mlp.up_proj.scales": "model.safetensors", + "language_model.model.layers.1.mlp.up_proj.weight": "model.safetensors", + "language_model.model.layers.1.per_layer_input_gate.biases": "model.safetensors", + "language_model.model.layers.1.per_layer_input_gate.scales": "model.safetensors", + "language_model.model.layers.1.per_layer_input_gate.weight": "model.safetensors", + "language_model.model.layers.1.per_layer_projection.biases": "model.safetensors", + "language_model.model.layers.1.per_layer_projection.scales": "model.safetensors", + "language_model.model.layers.1.per_layer_projection.weight": "model.safetensors", + "language_model.model.layers.1.post_attention_layernorm.weight": "model.safetensors", + "language_model.model.layers.1.post_feedforward_layernorm.weight": "model.safetensors", + "language_model.model.layers.1.post_per_layer_input_norm.weight": "model.safetensors", + "language_model.model.layers.1.pre_feedforward_layernorm.weight": "model.safetensors", + "language_model.model.layers.1.self_attn.k_norm.weight": "model.safetensors", + "language_model.model.layers.1.self_attn.k_proj.biases": "model.safetensors", + "language_model.model.layers.1.self_attn.k_proj.scales": "model.safetensors", + "language_model.model.layers.1.self_attn.k_proj.weight": "model.safetensors", + "language_model.model.layers.1.self_attn.o_proj.biases": "model.safetensors", + "language_model.model.layers.1.self_attn.o_proj.scales": "model.safetensors", + "language_model.model.layers.1.self_attn.o_proj.weight": "model.safetensors", + "language_model.model.layers.1.self_attn.q_norm.weight": "model.safetensors", + "language_model.model.layers.1.self_attn.q_proj.biases": "model.safetensors", + "language_model.model.layers.1.self_attn.q_proj.scales": "model.safetensors", + "language_model.model.layers.1.self_attn.q_proj.weight": "model.safetensors", + "language_model.model.layers.1.self_attn.v_proj.biases": "model.safetensors", + "language_model.model.layers.1.self_attn.v_proj.scales": "model.safetensors", + "language_model.model.layers.1.self_attn.v_proj.weight": "model.safetensors", + "language_model.model.layers.10.input_layernorm.weight": "model.safetensors", + "language_model.model.layers.10.layer_scalar": "model.safetensors", + "language_model.model.layers.10.mlp.down_proj.biases": "model.safetensors", + "language_model.model.layers.10.mlp.down_proj.scales": "model.safetensors", + "language_model.model.layers.10.mlp.down_proj.weight": "model.safetensors", + "language_model.model.layers.10.mlp.gate_proj.biases": "model.safetensors", + "language_model.model.layers.10.mlp.gate_proj.scales": "model.safetensors", + "language_model.model.layers.10.mlp.gate_proj.weight": "model.safetensors", + "language_model.model.layers.10.mlp.up_proj.biases": "model.safetensors", + "language_model.model.layers.10.mlp.up_proj.scales": "model.safetensors", + "language_model.model.layers.10.mlp.up_proj.weight": "model.safetensors", + "language_model.model.layers.10.per_layer_input_gate.biases": "model.safetensors", + "language_model.model.layers.10.per_layer_input_gate.scales": "model.safetensors", + "language_model.model.layers.10.per_layer_input_gate.weight": "model.safetensors", + "language_model.model.layers.10.per_layer_projection.biases": "model.safetensors", + "language_model.model.layers.10.per_layer_projection.scales": "model.safetensors", + "language_model.model.layers.10.per_layer_projection.weight": "model.safetensors", + "language_model.model.layers.10.post_attention_layernorm.weight": "model.safetensors", + "language_model.model.layers.10.post_feedforward_layernorm.weight": "model.safetensors", + "language_model.model.layers.10.post_per_layer_input_norm.weight": "model.safetensors", + "language_model.model.layers.10.pre_feedforward_layernorm.weight": "model.safetensors", + "language_model.model.layers.10.self_attn.k_norm.weight": "model.safetensors", + "language_model.model.layers.10.self_attn.k_proj.biases": "model.safetensors", + "language_model.model.layers.10.self_attn.k_proj.scales": "model.safetensors", + "language_model.model.layers.10.self_attn.k_proj.weight": "model.safetensors", + "language_model.model.layers.10.self_attn.o_proj.biases": "model.safetensors", + "language_model.model.layers.10.self_attn.o_proj.scales": "model.safetensors", + "language_model.model.layers.10.self_attn.o_proj.weight": "model.safetensors", + "language_model.model.layers.10.self_attn.q_norm.weight": "model.safetensors", + "language_model.model.layers.10.self_attn.q_proj.biases": "model.safetensors", + "language_model.model.layers.10.self_attn.q_proj.scales": "model.safetensors", + "language_model.model.layers.10.self_attn.q_proj.weight": "model.safetensors", + "language_model.model.layers.10.self_attn.v_proj.biases": "model.safetensors", + "language_model.model.layers.10.self_attn.v_proj.scales": "model.safetensors", + "language_model.model.layers.10.self_attn.v_proj.weight": "model.safetensors", + "language_model.model.layers.11.input_layernorm.weight": "model.safetensors", + "language_model.model.layers.11.layer_scalar": "model.safetensors", + "language_model.model.layers.11.mlp.down_proj.biases": "model.safetensors", + "language_model.model.layers.11.mlp.down_proj.scales": "model.safetensors", + "language_model.model.layers.11.mlp.down_proj.weight": "model.safetensors", + "language_model.model.layers.11.mlp.gate_proj.biases": "model.safetensors", + "language_model.model.layers.11.mlp.gate_proj.scales": "model.safetensors", + "language_model.model.layers.11.mlp.gate_proj.weight": "model.safetensors", + "language_model.model.layers.11.mlp.up_proj.biases": "model.safetensors", + "language_model.model.layers.11.mlp.up_proj.scales": "model.safetensors", + "language_model.model.layers.11.mlp.up_proj.weight": "model.safetensors", + "language_model.model.layers.11.per_layer_input_gate.biases": "model.safetensors", + "language_model.model.layers.11.per_layer_input_gate.scales": "model.safetensors", + "language_model.model.layers.11.per_layer_input_gate.weight": "model.safetensors", + "language_model.model.layers.11.per_layer_projection.biases": "model.safetensors", + "language_model.model.layers.11.per_layer_projection.scales": "model.safetensors", + "language_model.model.layers.11.per_layer_projection.weight": "model.safetensors", + "language_model.model.layers.11.post_attention_layernorm.weight": "model.safetensors", + "language_model.model.layers.11.post_feedforward_layernorm.weight": "model.safetensors", + "language_model.model.layers.11.post_per_layer_input_norm.weight": "model.safetensors", + "language_model.model.layers.11.pre_feedforward_layernorm.weight": "model.safetensors", + "language_model.model.layers.11.self_attn.k_norm.weight": "model.safetensors", + "language_model.model.layers.11.self_attn.k_proj.biases": "model.safetensors", + "language_model.model.layers.11.self_attn.k_proj.scales": "model.safetensors", + "language_model.model.layers.11.self_attn.k_proj.weight": "model.safetensors", + "language_model.model.layers.11.self_attn.o_proj.biases": "model.safetensors", + "language_model.model.layers.11.self_attn.o_proj.scales": "model.safetensors", + "language_model.model.layers.11.self_attn.o_proj.weight": "model.safetensors", + "language_model.model.layers.11.self_attn.q_norm.weight": "model.safetensors", + "language_model.model.layers.11.self_attn.q_proj.biases": "model.safetensors", + "language_model.model.layers.11.self_attn.q_proj.scales": "model.safetensors", + "language_model.model.layers.11.self_attn.q_proj.weight": "model.safetensors", + "language_model.model.layers.11.self_attn.v_proj.biases": "model.safetensors", + "language_model.model.layers.11.self_attn.v_proj.scales": "model.safetensors", + "language_model.model.layers.11.self_attn.v_proj.weight": "model.safetensors", + "language_model.model.layers.12.input_layernorm.weight": "model.safetensors", + "language_model.model.layers.12.layer_scalar": "model.safetensors", + "language_model.model.layers.12.mlp.down_proj.biases": "model.safetensors", + "language_model.model.layers.12.mlp.down_proj.scales": "model.safetensors", + "language_model.model.layers.12.mlp.down_proj.weight": "model.safetensors", + "language_model.model.layers.12.mlp.gate_proj.biases": "model.safetensors", + "language_model.model.layers.12.mlp.gate_proj.scales": "model.safetensors", + "language_model.model.layers.12.mlp.gate_proj.weight": "model.safetensors", + "language_model.model.layers.12.mlp.up_proj.biases": "model.safetensors", + "language_model.model.layers.12.mlp.up_proj.scales": "model.safetensors", + "language_model.model.layers.12.mlp.up_proj.weight": "model.safetensors", + "language_model.model.layers.12.per_layer_input_gate.biases": "model.safetensors", + "language_model.model.layers.12.per_layer_input_gate.scales": "model.safetensors", + "language_model.model.layers.12.per_layer_input_gate.weight": "model.safetensors", + "language_model.model.layers.12.per_layer_projection.biases": "model.safetensors", + "language_model.model.layers.12.per_layer_projection.scales": "model.safetensors", + "language_model.model.layers.12.per_layer_projection.weight": "model.safetensors", + "language_model.model.layers.12.post_attention_layernorm.weight": "model.safetensors", + "language_model.model.layers.12.post_feedforward_layernorm.weight": "model.safetensors", + "language_model.model.layers.12.post_per_layer_input_norm.weight": "model.safetensors", + "language_model.model.layers.12.pre_feedforward_layernorm.weight": "model.safetensors", + "language_model.model.layers.12.self_attn.k_norm.weight": "model.safetensors", + "language_model.model.layers.12.self_attn.k_proj.biases": "model.safetensors", + "language_model.model.layers.12.self_attn.k_proj.scales": "model.safetensors", + "language_model.model.layers.12.self_attn.k_proj.weight": "model.safetensors", + "language_model.model.layers.12.self_attn.o_proj.biases": "model.safetensors", + "language_model.model.layers.12.self_attn.o_proj.scales": "model.safetensors", + "language_model.model.layers.12.self_attn.o_proj.weight": "model.safetensors", + "language_model.model.layers.12.self_attn.q_norm.weight": "model.safetensors", + "language_model.model.layers.12.self_attn.q_proj.biases": "model.safetensors", + "language_model.model.layers.12.self_attn.q_proj.scales": "model.safetensors", + "language_model.model.layers.12.self_attn.q_proj.weight": "model.safetensors", + "language_model.model.layers.12.self_attn.v_proj.biases": "model.safetensors", + "language_model.model.layers.12.self_attn.v_proj.scales": "model.safetensors", + "language_model.model.layers.12.self_attn.v_proj.weight": "model.safetensors", + "language_model.model.layers.13.input_layernorm.weight": "model.safetensors", + "language_model.model.layers.13.layer_scalar": "model.safetensors", + "language_model.model.layers.13.mlp.down_proj.biases": "model.safetensors", + "language_model.model.layers.13.mlp.down_proj.scales": "model.safetensors", + "language_model.model.layers.13.mlp.down_proj.weight": "model.safetensors", + "language_model.model.layers.13.mlp.gate_proj.biases": "model.safetensors", + "language_model.model.layers.13.mlp.gate_proj.scales": "model.safetensors", + "language_model.model.layers.13.mlp.gate_proj.weight": "model.safetensors", + "language_model.model.layers.13.mlp.up_proj.biases": "model.safetensors", + "language_model.model.layers.13.mlp.up_proj.scales": "model.safetensors", + "language_model.model.layers.13.mlp.up_proj.weight": "model.safetensors", + "language_model.model.layers.13.per_layer_input_gate.biases": "model.safetensors", + "language_model.model.layers.13.per_layer_input_gate.scales": "model.safetensors", + "language_model.model.layers.13.per_layer_input_gate.weight": "model.safetensors", + "language_model.model.layers.13.per_layer_projection.biases": "model.safetensors", + "language_model.model.layers.13.per_layer_projection.scales": "model.safetensors", + "language_model.model.layers.13.per_layer_projection.weight": "model.safetensors", + "language_model.model.layers.13.post_attention_layernorm.weight": "model.safetensors", + "language_model.model.layers.13.post_feedforward_layernorm.weight": "model.safetensors", + "language_model.model.layers.13.post_per_layer_input_norm.weight": "model.safetensors", + "language_model.model.layers.13.pre_feedforward_layernorm.weight": "model.safetensors", + "language_model.model.layers.13.self_attn.k_norm.weight": "model.safetensors", + "language_model.model.layers.13.self_attn.k_proj.biases": "model.safetensors", + "language_model.model.layers.13.self_attn.k_proj.scales": "model.safetensors", + "language_model.model.layers.13.self_attn.k_proj.weight": "model.safetensors", + "language_model.model.layers.13.self_attn.o_proj.biases": "model.safetensors", + "language_model.model.layers.13.self_attn.o_proj.scales": "model.safetensors", + "language_model.model.layers.13.self_attn.o_proj.weight": "model.safetensors", + "language_model.model.layers.13.self_attn.q_norm.weight": "model.safetensors", + "language_model.model.layers.13.self_attn.q_proj.biases": "model.safetensors", + "language_model.model.layers.13.self_attn.q_proj.scales": "model.safetensors", + "language_model.model.layers.13.self_attn.q_proj.weight": "model.safetensors", + "language_model.model.layers.13.self_attn.v_proj.biases": "model.safetensors", + "language_model.model.layers.13.self_attn.v_proj.scales": "model.safetensors", + "language_model.model.layers.13.self_attn.v_proj.weight": "model.safetensors", + "language_model.model.layers.14.input_layernorm.weight": "model.safetensors", + "language_model.model.layers.14.layer_scalar": "model.safetensors", + "language_model.model.layers.14.mlp.down_proj.biases": "model.safetensors", + "language_model.model.layers.14.mlp.down_proj.scales": "model.safetensors", + "language_model.model.layers.14.mlp.down_proj.weight": "model.safetensors", + "language_model.model.layers.14.mlp.gate_proj.biases": "model.safetensors", + "language_model.model.layers.14.mlp.gate_proj.scales": "model.safetensors", + "language_model.model.layers.14.mlp.gate_proj.weight": "model.safetensors", + "language_model.model.layers.14.mlp.up_proj.biases": "model.safetensors", + "language_model.model.layers.14.mlp.up_proj.scales": "model.safetensors", + "language_model.model.layers.14.mlp.up_proj.weight": "model.safetensors", + "language_model.model.layers.14.per_layer_input_gate.biases": "model.safetensors", + "language_model.model.layers.14.per_layer_input_gate.scales": "model.safetensors", + "language_model.model.layers.14.per_layer_input_gate.weight": "model.safetensors", + "language_model.model.layers.14.per_layer_projection.biases": "model.safetensors", + "language_model.model.layers.14.per_layer_projection.scales": "model.safetensors", + "language_model.model.layers.14.per_layer_projection.weight": "model.safetensors", + "language_model.model.layers.14.post_attention_layernorm.weight": "model.safetensors", + "language_model.model.layers.14.post_feedforward_layernorm.weight": "model.safetensors", + "language_model.model.layers.14.post_per_layer_input_norm.weight": "model.safetensors", + "language_model.model.layers.14.pre_feedforward_layernorm.weight": "model.safetensors", + "language_model.model.layers.14.self_attn.k_norm.weight": "model.safetensors", + "language_model.model.layers.14.self_attn.k_proj.biases": "model.safetensors", + "language_model.model.layers.14.self_attn.k_proj.scales": "model.safetensors", + "language_model.model.layers.14.self_attn.k_proj.weight": "model.safetensors", + "language_model.model.layers.14.self_attn.o_proj.biases": "model.safetensors", + "language_model.model.layers.14.self_attn.o_proj.scales": "model.safetensors", + "language_model.model.layers.14.self_attn.o_proj.weight": "model.safetensors", + "language_model.model.layers.14.self_attn.q_norm.weight": "model.safetensors", + "language_model.model.layers.14.self_attn.q_proj.biases": "model.safetensors", + "language_model.model.layers.14.self_attn.q_proj.scales": "model.safetensors", + "language_model.model.layers.14.self_attn.q_proj.weight": "model.safetensors", + "language_model.model.layers.14.self_attn.v_proj.biases": "model.safetensors", + "language_model.model.layers.14.self_attn.v_proj.scales": "model.safetensors", + "language_model.model.layers.14.self_attn.v_proj.weight": "model.safetensors", + "language_model.model.layers.15.input_layernorm.weight": "model.safetensors", + "language_model.model.layers.15.layer_scalar": "model.safetensors", + "language_model.model.layers.15.mlp.down_proj.biases": "model.safetensors", + "language_model.model.layers.15.mlp.down_proj.scales": "model.safetensors", + "language_model.model.layers.15.mlp.down_proj.weight": "model.safetensors", + "language_model.model.layers.15.mlp.gate_proj.biases": "model.safetensors", + "language_model.model.layers.15.mlp.gate_proj.scales": "model.safetensors", + "language_model.model.layers.15.mlp.gate_proj.weight": "model.safetensors", + "language_model.model.layers.15.mlp.up_proj.biases": "model.safetensors", + "language_model.model.layers.15.mlp.up_proj.scales": "model.safetensors", + "language_model.model.layers.15.mlp.up_proj.weight": "model.safetensors", + "language_model.model.layers.15.per_layer_input_gate.biases": "model.safetensors", + "language_model.model.layers.15.per_layer_input_gate.scales": "model.safetensors", + "language_model.model.layers.15.per_layer_input_gate.weight": "model.safetensors", + "language_model.model.layers.15.per_layer_projection.biases": "model.safetensors", + "language_model.model.layers.15.per_layer_projection.scales": "model.safetensors", + "language_model.model.layers.15.per_layer_projection.weight": "model.safetensors", + "language_model.model.layers.15.post_attention_layernorm.weight": "model.safetensors", + "language_model.model.layers.15.post_feedforward_layernorm.weight": "model.safetensors", + "language_model.model.layers.15.post_per_layer_input_norm.weight": "model.safetensors", + "language_model.model.layers.15.pre_feedforward_layernorm.weight": "model.safetensors", + "language_model.model.layers.15.self_attn.k_norm.weight": "model.safetensors", + "language_model.model.layers.15.self_attn.k_proj.biases": "model.safetensors", + "language_model.model.layers.15.self_attn.k_proj.scales": "model.safetensors", + "language_model.model.layers.15.self_attn.k_proj.weight": "model.safetensors", + "language_model.model.layers.15.self_attn.o_proj.biases": "model.safetensors", + "language_model.model.layers.15.self_attn.o_proj.scales": "model.safetensors", + "language_model.model.layers.15.self_attn.o_proj.weight": "model.safetensors", + "language_model.model.layers.15.self_attn.q_norm.weight": "model.safetensors", + "language_model.model.layers.15.self_attn.q_proj.biases": "model.safetensors", + "language_model.model.layers.15.self_attn.q_proj.scales": "model.safetensors", + "language_model.model.layers.15.self_attn.q_proj.weight": "model.safetensors", + "language_model.model.layers.15.self_attn.v_proj.biases": "model.safetensors", + "language_model.model.layers.15.self_attn.v_proj.scales": "model.safetensors", + "language_model.model.layers.15.self_attn.v_proj.weight": "model.safetensors", + "language_model.model.layers.16.input_layernorm.weight": "model.safetensors", + "language_model.model.layers.16.layer_scalar": "model.safetensors", + "language_model.model.layers.16.mlp.down_proj.biases": "model.safetensors", + "language_model.model.layers.16.mlp.down_proj.scales": "model.safetensors", + "language_model.model.layers.16.mlp.down_proj.weight": "model.safetensors", + "language_model.model.layers.16.mlp.gate_proj.biases": "model.safetensors", + "language_model.model.layers.16.mlp.gate_proj.scales": "model.safetensors", + "language_model.model.layers.16.mlp.gate_proj.weight": "model.safetensors", + "language_model.model.layers.16.mlp.up_proj.biases": "model.safetensors", + "language_model.model.layers.16.mlp.up_proj.scales": "model.safetensors", + "language_model.model.layers.16.mlp.up_proj.weight": "model.safetensors", + "language_model.model.layers.16.per_layer_input_gate.biases": "model.safetensors", + "language_model.model.layers.16.per_layer_input_gate.scales": "model.safetensors", + "language_model.model.layers.16.per_layer_input_gate.weight": "model.safetensors", + "language_model.model.layers.16.per_layer_projection.biases": "model.safetensors", + "language_model.model.layers.16.per_layer_projection.scales": "model.safetensors", + "language_model.model.layers.16.per_layer_projection.weight": "model.safetensors", + "language_model.model.layers.16.post_attention_layernorm.weight": "model.safetensors", + "language_model.model.layers.16.post_feedforward_layernorm.weight": "model.safetensors", + "language_model.model.layers.16.post_per_layer_input_norm.weight": "model.safetensors", + "language_model.model.layers.16.pre_feedforward_layernorm.weight": "model.safetensors", + "language_model.model.layers.16.self_attn.k_norm.weight": "model.safetensors", + "language_model.model.layers.16.self_attn.k_proj.biases": "model.safetensors", + "language_model.model.layers.16.self_attn.k_proj.scales": "model.safetensors", + "language_model.model.layers.16.self_attn.k_proj.weight": "model.safetensors", + "language_model.model.layers.16.self_attn.o_proj.biases": "model.safetensors", + "language_model.model.layers.16.self_attn.o_proj.scales": "model.safetensors", + "language_model.model.layers.16.self_attn.o_proj.weight": "model.safetensors", + "language_model.model.layers.16.self_attn.q_norm.weight": "model.safetensors", + "language_model.model.layers.16.self_attn.q_proj.biases": "model.safetensors", + "language_model.model.layers.16.self_attn.q_proj.scales": "model.safetensors", + "language_model.model.layers.16.self_attn.q_proj.weight": "model.safetensors", + "language_model.model.layers.16.self_attn.v_proj.biases": "model.safetensors", + "language_model.model.layers.16.self_attn.v_proj.scales": "model.safetensors", + "language_model.model.layers.16.self_attn.v_proj.weight": "model.safetensors", + "language_model.model.layers.17.input_layernorm.weight": "model.safetensors", + "language_model.model.layers.17.layer_scalar": "model.safetensors", + "language_model.model.layers.17.mlp.down_proj.biases": "model.safetensors", + "language_model.model.layers.17.mlp.down_proj.scales": "model.safetensors", + "language_model.model.layers.17.mlp.down_proj.weight": "model.safetensors", + "language_model.model.layers.17.mlp.gate_proj.biases": "model.safetensors", + "language_model.model.layers.17.mlp.gate_proj.scales": "model.safetensors", + "language_model.model.layers.17.mlp.gate_proj.weight": "model.safetensors", + "language_model.model.layers.17.mlp.up_proj.biases": "model.safetensors", + "language_model.model.layers.17.mlp.up_proj.scales": "model.safetensors", + "language_model.model.layers.17.mlp.up_proj.weight": "model.safetensors", + "language_model.model.layers.17.per_layer_input_gate.biases": "model.safetensors", + "language_model.model.layers.17.per_layer_input_gate.scales": "model.safetensors", + "language_model.model.layers.17.per_layer_input_gate.weight": "model.safetensors", + "language_model.model.layers.17.per_layer_projection.biases": "model.safetensors", + "language_model.model.layers.17.per_layer_projection.scales": "model.safetensors", + "language_model.model.layers.17.per_layer_projection.weight": "model.safetensors", + "language_model.model.layers.17.post_attention_layernorm.weight": "model.safetensors", + "language_model.model.layers.17.post_feedforward_layernorm.weight": "model.safetensors", + "language_model.model.layers.17.post_per_layer_input_norm.weight": "model.safetensors", + "language_model.model.layers.17.pre_feedforward_layernorm.weight": "model.safetensors", + "language_model.model.layers.17.self_attn.k_norm.weight": "model.safetensors", + "language_model.model.layers.17.self_attn.k_proj.biases": "model.safetensors", + "language_model.model.layers.17.self_attn.k_proj.scales": "model.safetensors", + "language_model.model.layers.17.self_attn.k_proj.weight": "model.safetensors", + "language_model.model.layers.17.self_attn.o_proj.biases": "model.safetensors", + "language_model.model.layers.17.self_attn.o_proj.scales": "model.safetensors", + "language_model.model.layers.17.self_attn.o_proj.weight": "model.safetensors", + "language_model.model.layers.17.self_attn.q_norm.weight": "model.safetensors", + "language_model.model.layers.17.self_attn.q_proj.biases": "model.safetensors", + "language_model.model.layers.17.self_attn.q_proj.scales": "model.safetensors", + "language_model.model.layers.17.self_attn.q_proj.weight": "model.safetensors", + "language_model.model.layers.17.self_attn.v_proj.biases": "model.safetensors", + "language_model.model.layers.17.self_attn.v_proj.scales": "model.safetensors", + "language_model.model.layers.17.self_attn.v_proj.weight": "model.safetensors", + "language_model.model.layers.18.input_layernorm.weight": "model.safetensors", + "language_model.model.layers.18.layer_scalar": "model.safetensors", + "language_model.model.layers.18.mlp.down_proj.biases": "model.safetensors", + "language_model.model.layers.18.mlp.down_proj.scales": "model.safetensors", + "language_model.model.layers.18.mlp.down_proj.weight": "model.safetensors", + "language_model.model.layers.18.mlp.gate_proj.biases": "model.safetensors", + "language_model.model.layers.18.mlp.gate_proj.scales": "model.safetensors", + "language_model.model.layers.18.mlp.gate_proj.weight": "model.safetensors", + "language_model.model.layers.18.mlp.up_proj.biases": "model.safetensors", + "language_model.model.layers.18.mlp.up_proj.scales": "model.safetensors", + "language_model.model.layers.18.mlp.up_proj.weight": "model.safetensors", + "language_model.model.layers.18.per_layer_input_gate.biases": "model.safetensors", + "language_model.model.layers.18.per_layer_input_gate.scales": "model.safetensors", + "language_model.model.layers.18.per_layer_input_gate.weight": "model.safetensors", + "language_model.model.layers.18.per_layer_projection.biases": "model.safetensors", + "language_model.model.layers.18.per_layer_projection.scales": "model.safetensors", + "language_model.model.layers.18.per_layer_projection.weight": "model.safetensors", + "language_model.model.layers.18.post_attention_layernorm.weight": "model.safetensors", + "language_model.model.layers.18.post_feedforward_layernorm.weight": "model.safetensors", + "language_model.model.layers.18.post_per_layer_input_norm.weight": "model.safetensors", + "language_model.model.layers.18.pre_feedforward_layernorm.weight": "model.safetensors", + "language_model.model.layers.18.self_attn.k_norm.weight": "model.safetensors", + "language_model.model.layers.18.self_attn.k_proj.biases": "model.safetensors", + "language_model.model.layers.18.self_attn.k_proj.scales": "model.safetensors", + "language_model.model.layers.18.self_attn.k_proj.weight": "model.safetensors", + "language_model.model.layers.18.self_attn.o_proj.biases": "model.safetensors", + "language_model.model.layers.18.self_attn.o_proj.scales": "model.safetensors", + "language_model.model.layers.18.self_attn.o_proj.weight": "model.safetensors", + "language_model.model.layers.18.self_attn.q_norm.weight": "model.safetensors", + "language_model.model.layers.18.self_attn.q_proj.biases": "model.safetensors", + "language_model.model.layers.18.self_attn.q_proj.scales": "model.safetensors", + "language_model.model.layers.18.self_attn.q_proj.weight": "model.safetensors", + "language_model.model.layers.18.self_attn.v_proj.biases": "model.safetensors", + "language_model.model.layers.18.self_attn.v_proj.scales": "model.safetensors", + "language_model.model.layers.18.self_attn.v_proj.weight": "model.safetensors", + "language_model.model.layers.19.input_layernorm.weight": "model.safetensors", + "language_model.model.layers.19.layer_scalar": "model.safetensors", + "language_model.model.layers.19.mlp.down_proj.biases": "model.safetensors", + "language_model.model.layers.19.mlp.down_proj.scales": "model.safetensors", + "language_model.model.layers.19.mlp.down_proj.weight": "model.safetensors", + "language_model.model.layers.19.mlp.gate_proj.biases": "model.safetensors", + "language_model.model.layers.19.mlp.gate_proj.scales": "model.safetensors", + "language_model.model.layers.19.mlp.gate_proj.weight": "model.safetensors", + "language_model.model.layers.19.mlp.up_proj.biases": "model.safetensors", + "language_model.model.layers.19.mlp.up_proj.scales": "model.safetensors", + "language_model.model.layers.19.mlp.up_proj.weight": "model.safetensors", + "language_model.model.layers.19.per_layer_input_gate.biases": "model.safetensors", + "language_model.model.layers.19.per_layer_input_gate.scales": "model.safetensors", + "language_model.model.layers.19.per_layer_input_gate.weight": "model.safetensors", + "language_model.model.layers.19.per_layer_projection.biases": "model.safetensors", + "language_model.model.layers.19.per_layer_projection.scales": "model.safetensors", + "language_model.model.layers.19.per_layer_projection.weight": "model.safetensors", + "language_model.model.layers.19.post_attention_layernorm.weight": "model.safetensors", + "language_model.model.layers.19.post_feedforward_layernorm.weight": "model.safetensors", + "language_model.model.layers.19.post_per_layer_input_norm.weight": "model.safetensors", + "language_model.model.layers.19.pre_feedforward_layernorm.weight": "model.safetensors", + "language_model.model.layers.19.self_attn.k_norm.weight": "model.safetensors", + "language_model.model.layers.19.self_attn.k_proj.biases": "model.safetensors", + "language_model.model.layers.19.self_attn.k_proj.scales": "model.safetensors", + "language_model.model.layers.19.self_attn.k_proj.weight": "model.safetensors", + "language_model.model.layers.19.self_attn.o_proj.biases": "model.safetensors", + "language_model.model.layers.19.self_attn.o_proj.scales": "model.safetensors", + "language_model.model.layers.19.self_attn.o_proj.weight": "model.safetensors", + "language_model.model.layers.19.self_attn.q_norm.weight": "model.safetensors", + "language_model.model.layers.19.self_attn.q_proj.biases": "model.safetensors", + "language_model.model.layers.19.self_attn.q_proj.scales": "model.safetensors", + "language_model.model.layers.19.self_attn.q_proj.weight": "model.safetensors", + "language_model.model.layers.19.self_attn.v_proj.biases": "model.safetensors", + "language_model.model.layers.19.self_attn.v_proj.scales": "model.safetensors", + "language_model.model.layers.19.self_attn.v_proj.weight": "model.safetensors", + "language_model.model.layers.2.input_layernorm.weight": "model.safetensors", + "language_model.model.layers.2.layer_scalar": "model.safetensors", + "language_model.model.layers.2.mlp.down_proj.biases": "model.safetensors", + "language_model.model.layers.2.mlp.down_proj.scales": "model.safetensors", + "language_model.model.layers.2.mlp.down_proj.weight": "model.safetensors", + "language_model.model.layers.2.mlp.gate_proj.biases": "model.safetensors", + "language_model.model.layers.2.mlp.gate_proj.scales": "model.safetensors", + "language_model.model.layers.2.mlp.gate_proj.weight": "model.safetensors", + "language_model.model.layers.2.mlp.up_proj.biases": "model.safetensors", + "language_model.model.layers.2.mlp.up_proj.scales": "model.safetensors", + "language_model.model.layers.2.mlp.up_proj.weight": "model.safetensors", + "language_model.model.layers.2.per_layer_input_gate.biases": "model.safetensors", + "language_model.model.layers.2.per_layer_input_gate.scales": "model.safetensors", + "language_model.model.layers.2.per_layer_input_gate.weight": "model.safetensors", + "language_model.model.layers.2.per_layer_projection.biases": "model.safetensors", + "language_model.model.layers.2.per_layer_projection.scales": "model.safetensors", + "language_model.model.layers.2.per_layer_projection.weight": "model.safetensors", + "language_model.model.layers.2.post_attention_layernorm.weight": "model.safetensors", + "language_model.model.layers.2.post_feedforward_layernorm.weight": "model.safetensors", + "language_model.model.layers.2.post_per_layer_input_norm.weight": "model.safetensors", + "language_model.model.layers.2.pre_feedforward_layernorm.weight": "model.safetensors", + "language_model.model.layers.2.self_attn.k_norm.weight": "model.safetensors", + "language_model.model.layers.2.self_attn.k_proj.biases": "model.safetensors", + "language_model.model.layers.2.self_attn.k_proj.scales": "model.safetensors", + "language_model.model.layers.2.self_attn.k_proj.weight": "model.safetensors", + "language_model.model.layers.2.self_attn.o_proj.biases": "model.safetensors", + "language_model.model.layers.2.self_attn.o_proj.scales": "model.safetensors", + "language_model.model.layers.2.self_attn.o_proj.weight": "model.safetensors", + "language_model.model.layers.2.self_attn.q_norm.weight": "model.safetensors", + "language_model.model.layers.2.self_attn.q_proj.biases": "model.safetensors", + "language_model.model.layers.2.self_attn.q_proj.scales": "model.safetensors", + "language_model.model.layers.2.self_attn.q_proj.weight": "model.safetensors", + "language_model.model.layers.2.self_attn.v_proj.biases": "model.safetensors", + "language_model.model.layers.2.self_attn.v_proj.scales": "model.safetensors", + "language_model.model.layers.2.self_attn.v_proj.weight": "model.safetensors", + "language_model.model.layers.20.input_layernorm.weight": "model.safetensors", + "language_model.model.layers.20.layer_scalar": "model.safetensors", + "language_model.model.layers.20.mlp.down_proj.biases": "model.safetensors", + "language_model.model.layers.20.mlp.down_proj.scales": "model.safetensors", + "language_model.model.layers.20.mlp.down_proj.weight": "model.safetensors", + "language_model.model.layers.20.mlp.gate_proj.biases": "model.safetensors", + "language_model.model.layers.20.mlp.gate_proj.scales": "model.safetensors", + "language_model.model.layers.20.mlp.gate_proj.weight": "model.safetensors", + "language_model.model.layers.20.mlp.up_proj.biases": "model.safetensors", + "language_model.model.layers.20.mlp.up_proj.scales": "model.safetensors", + "language_model.model.layers.20.mlp.up_proj.weight": "model.safetensors", + "language_model.model.layers.20.per_layer_input_gate.biases": "model.safetensors", + "language_model.model.layers.20.per_layer_input_gate.scales": "model.safetensors", + "language_model.model.layers.20.per_layer_input_gate.weight": "model.safetensors", + "language_model.model.layers.20.per_layer_projection.biases": "model.safetensors", + "language_model.model.layers.20.per_layer_projection.scales": "model.safetensors", + "language_model.model.layers.20.per_layer_projection.weight": "model.safetensors", + "language_model.model.layers.20.post_attention_layernorm.weight": "model.safetensors", + "language_model.model.layers.20.post_feedforward_layernorm.weight": "model.safetensors", + "language_model.model.layers.20.post_per_layer_input_norm.weight": "model.safetensors", + "language_model.model.layers.20.pre_feedforward_layernorm.weight": "model.safetensors", + "language_model.model.layers.20.self_attn.k_norm.weight": "model.safetensors", + "language_model.model.layers.20.self_attn.k_proj.biases": "model.safetensors", + "language_model.model.layers.20.self_attn.k_proj.scales": "model.safetensors", + "language_model.model.layers.20.self_attn.k_proj.weight": "model.safetensors", + "language_model.model.layers.20.self_attn.o_proj.biases": "model.safetensors", + "language_model.model.layers.20.self_attn.o_proj.scales": "model.safetensors", + "language_model.model.layers.20.self_attn.o_proj.weight": "model.safetensors", + "language_model.model.layers.20.self_attn.q_norm.weight": "model.safetensors", + "language_model.model.layers.20.self_attn.q_proj.biases": "model.safetensors", + "language_model.model.layers.20.self_attn.q_proj.scales": "model.safetensors", + "language_model.model.layers.20.self_attn.q_proj.weight": "model.safetensors", + "language_model.model.layers.20.self_attn.v_proj.biases": "model.safetensors", + "language_model.model.layers.20.self_attn.v_proj.scales": "model.safetensors", + "language_model.model.layers.20.self_attn.v_proj.weight": "model.safetensors", + "language_model.model.layers.21.input_layernorm.weight": "model.safetensors", + "language_model.model.layers.21.layer_scalar": "model.safetensors", + "language_model.model.layers.21.mlp.down_proj.biases": "model.safetensors", + "language_model.model.layers.21.mlp.down_proj.scales": "model.safetensors", + "language_model.model.layers.21.mlp.down_proj.weight": "model.safetensors", + "language_model.model.layers.21.mlp.gate_proj.biases": "model.safetensors", + "language_model.model.layers.21.mlp.gate_proj.scales": "model.safetensors", + "language_model.model.layers.21.mlp.gate_proj.weight": "model.safetensors", + "language_model.model.layers.21.mlp.up_proj.biases": "model.safetensors", + "language_model.model.layers.21.mlp.up_proj.scales": "model.safetensors", + "language_model.model.layers.21.mlp.up_proj.weight": "model.safetensors", + "language_model.model.layers.21.per_layer_input_gate.biases": "model.safetensors", + "language_model.model.layers.21.per_layer_input_gate.scales": "model.safetensors", + "language_model.model.layers.21.per_layer_input_gate.weight": "model.safetensors", + "language_model.model.layers.21.per_layer_projection.biases": "model.safetensors", + "language_model.model.layers.21.per_layer_projection.scales": "model.safetensors", + "language_model.model.layers.21.per_layer_projection.weight": "model.safetensors", + "language_model.model.layers.21.post_attention_layernorm.weight": "model.safetensors", + "language_model.model.layers.21.post_feedforward_layernorm.weight": "model.safetensors", + "language_model.model.layers.21.post_per_layer_input_norm.weight": "model.safetensors", + "language_model.model.layers.21.pre_feedforward_layernorm.weight": "model.safetensors", + "language_model.model.layers.21.self_attn.k_norm.weight": "model.safetensors", + "language_model.model.layers.21.self_attn.k_proj.biases": "model.safetensors", + "language_model.model.layers.21.self_attn.k_proj.scales": "model.safetensors", + "language_model.model.layers.21.self_attn.k_proj.weight": "model.safetensors", + "language_model.model.layers.21.self_attn.o_proj.biases": "model.safetensors", + "language_model.model.layers.21.self_attn.o_proj.scales": "model.safetensors", + "language_model.model.layers.21.self_attn.o_proj.weight": "model.safetensors", + "language_model.model.layers.21.self_attn.q_norm.weight": "model.safetensors", + "language_model.model.layers.21.self_attn.q_proj.biases": "model.safetensors", + "language_model.model.layers.21.self_attn.q_proj.scales": "model.safetensors", + "language_model.model.layers.21.self_attn.q_proj.weight": "model.safetensors", + "language_model.model.layers.21.self_attn.v_proj.biases": "model.safetensors", + "language_model.model.layers.21.self_attn.v_proj.scales": "model.safetensors", + "language_model.model.layers.21.self_attn.v_proj.weight": "model.safetensors", + "language_model.model.layers.22.input_layernorm.weight": "model.safetensors", + "language_model.model.layers.22.layer_scalar": "model.safetensors", + "language_model.model.layers.22.mlp.down_proj.biases": "model.safetensors", + "language_model.model.layers.22.mlp.down_proj.scales": "model.safetensors", + "language_model.model.layers.22.mlp.down_proj.weight": "model.safetensors", + "language_model.model.layers.22.mlp.gate_proj.biases": "model.safetensors", + "language_model.model.layers.22.mlp.gate_proj.scales": "model.safetensors", + "language_model.model.layers.22.mlp.gate_proj.weight": "model.safetensors", + "language_model.model.layers.22.mlp.up_proj.biases": "model.safetensors", + "language_model.model.layers.22.mlp.up_proj.scales": "model.safetensors", + "language_model.model.layers.22.mlp.up_proj.weight": "model.safetensors", + "language_model.model.layers.22.per_layer_input_gate.biases": "model.safetensors", + "language_model.model.layers.22.per_layer_input_gate.scales": "model.safetensors", + "language_model.model.layers.22.per_layer_input_gate.weight": "model.safetensors", + "language_model.model.layers.22.per_layer_projection.biases": "model.safetensors", + "language_model.model.layers.22.per_layer_projection.scales": "model.safetensors", + "language_model.model.layers.22.per_layer_projection.weight": "model.safetensors", + "language_model.model.layers.22.post_attention_layernorm.weight": "model.safetensors", + "language_model.model.layers.22.post_feedforward_layernorm.weight": "model.safetensors", + "language_model.model.layers.22.post_per_layer_input_norm.weight": "model.safetensors", + "language_model.model.layers.22.pre_feedforward_layernorm.weight": "model.safetensors", + "language_model.model.layers.22.self_attn.k_norm.weight": "model.safetensors", + "language_model.model.layers.22.self_attn.k_proj.biases": "model.safetensors", + "language_model.model.layers.22.self_attn.k_proj.scales": "model.safetensors", + "language_model.model.layers.22.self_attn.k_proj.weight": "model.safetensors", + "language_model.model.layers.22.self_attn.o_proj.biases": "model.safetensors", + "language_model.model.layers.22.self_attn.o_proj.scales": "model.safetensors", + "language_model.model.layers.22.self_attn.o_proj.weight": "model.safetensors", + "language_model.model.layers.22.self_attn.q_norm.weight": "model.safetensors", + "language_model.model.layers.22.self_attn.q_proj.biases": "model.safetensors", + "language_model.model.layers.22.self_attn.q_proj.scales": "model.safetensors", + "language_model.model.layers.22.self_attn.q_proj.weight": "model.safetensors", + "language_model.model.layers.22.self_attn.v_proj.biases": "model.safetensors", + "language_model.model.layers.22.self_attn.v_proj.scales": "model.safetensors", + "language_model.model.layers.22.self_attn.v_proj.weight": "model.safetensors", + "language_model.model.layers.23.input_layernorm.weight": "model.safetensors", + "language_model.model.layers.23.layer_scalar": "model.safetensors", + "language_model.model.layers.23.mlp.down_proj.biases": "model.safetensors", + "language_model.model.layers.23.mlp.down_proj.scales": "model.safetensors", + "language_model.model.layers.23.mlp.down_proj.weight": "model.safetensors", + "language_model.model.layers.23.mlp.gate_proj.biases": "model.safetensors", + "language_model.model.layers.23.mlp.gate_proj.scales": "model.safetensors", + "language_model.model.layers.23.mlp.gate_proj.weight": "model.safetensors", + "language_model.model.layers.23.mlp.up_proj.biases": "model.safetensors", + "language_model.model.layers.23.mlp.up_proj.scales": "model.safetensors", + "language_model.model.layers.23.mlp.up_proj.weight": "model.safetensors", + "language_model.model.layers.23.per_layer_input_gate.biases": "model.safetensors", + "language_model.model.layers.23.per_layer_input_gate.scales": "model.safetensors", + "language_model.model.layers.23.per_layer_input_gate.weight": "model.safetensors", + "language_model.model.layers.23.per_layer_projection.biases": "model.safetensors", + "language_model.model.layers.23.per_layer_projection.scales": "model.safetensors", + "language_model.model.layers.23.per_layer_projection.weight": "model.safetensors", + "language_model.model.layers.23.post_attention_layernorm.weight": "model.safetensors", + "language_model.model.layers.23.post_feedforward_layernorm.weight": "model.safetensors", + "language_model.model.layers.23.post_per_layer_input_norm.weight": "model.safetensors", + "language_model.model.layers.23.pre_feedforward_layernorm.weight": "model.safetensors", + "language_model.model.layers.23.self_attn.k_norm.weight": "model.safetensors", + "language_model.model.layers.23.self_attn.k_proj.biases": "model.safetensors", + "language_model.model.layers.23.self_attn.k_proj.scales": "model.safetensors", + "language_model.model.layers.23.self_attn.k_proj.weight": "model.safetensors", + "language_model.model.layers.23.self_attn.o_proj.biases": "model.safetensors", + "language_model.model.layers.23.self_attn.o_proj.scales": "model.safetensors", + "language_model.model.layers.23.self_attn.o_proj.weight": "model.safetensors", + "language_model.model.layers.23.self_attn.q_norm.weight": "model.safetensors", + "language_model.model.layers.23.self_attn.q_proj.biases": "model.safetensors", + "language_model.model.layers.23.self_attn.q_proj.scales": "model.safetensors", + "language_model.model.layers.23.self_attn.q_proj.weight": "model.safetensors", + "language_model.model.layers.23.self_attn.v_proj.biases": "model.safetensors", + "language_model.model.layers.23.self_attn.v_proj.scales": "model.safetensors", + "language_model.model.layers.23.self_attn.v_proj.weight": "model.safetensors", + "language_model.model.layers.24.input_layernorm.weight": "model.safetensors", + "language_model.model.layers.24.layer_scalar": "model.safetensors", + "language_model.model.layers.24.mlp.down_proj.biases": "model.safetensors", + "language_model.model.layers.24.mlp.down_proj.scales": "model.safetensors", + "language_model.model.layers.24.mlp.down_proj.weight": "model.safetensors", + "language_model.model.layers.24.mlp.gate_proj.biases": "model.safetensors", + "language_model.model.layers.24.mlp.gate_proj.scales": "model.safetensors", + "language_model.model.layers.24.mlp.gate_proj.weight": "model.safetensors", + "language_model.model.layers.24.mlp.up_proj.biases": "model.safetensors", + "language_model.model.layers.24.mlp.up_proj.scales": "model.safetensors", + "language_model.model.layers.24.mlp.up_proj.weight": "model.safetensors", + "language_model.model.layers.24.per_layer_input_gate.biases": "model.safetensors", + "language_model.model.layers.24.per_layer_input_gate.scales": "model.safetensors", + "language_model.model.layers.24.per_layer_input_gate.weight": "model.safetensors", + "language_model.model.layers.24.per_layer_projection.biases": "model.safetensors", + "language_model.model.layers.24.per_layer_projection.scales": "model.safetensors", + "language_model.model.layers.24.per_layer_projection.weight": "model.safetensors", + "language_model.model.layers.24.post_attention_layernorm.weight": "model.safetensors", + "language_model.model.layers.24.post_feedforward_layernorm.weight": "model.safetensors", + "language_model.model.layers.24.post_per_layer_input_norm.weight": "model.safetensors", + "language_model.model.layers.24.pre_feedforward_layernorm.weight": "model.safetensors", + "language_model.model.layers.24.self_attn.k_norm.weight": "model.safetensors", + "language_model.model.layers.24.self_attn.k_proj.biases": "model.safetensors", + "language_model.model.layers.24.self_attn.k_proj.scales": "model.safetensors", + "language_model.model.layers.24.self_attn.k_proj.weight": "model.safetensors", + "language_model.model.layers.24.self_attn.o_proj.biases": "model.safetensors", + "language_model.model.layers.24.self_attn.o_proj.scales": "model.safetensors", + "language_model.model.layers.24.self_attn.o_proj.weight": "model.safetensors", + "language_model.model.layers.24.self_attn.q_norm.weight": "model.safetensors", + "language_model.model.layers.24.self_attn.q_proj.biases": "model.safetensors", + "language_model.model.layers.24.self_attn.q_proj.scales": "model.safetensors", + "language_model.model.layers.24.self_attn.q_proj.weight": "model.safetensors", + "language_model.model.layers.24.self_attn.v_proj.biases": "model.safetensors", + "language_model.model.layers.24.self_attn.v_proj.scales": "model.safetensors", + "language_model.model.layers.24.self_attn.v_proj.weight": "model.safetensors", + "language_model.model.layers.25.input_layernorm.weight": "model.safetensors", + "language_model.model.layers.25.layer_scalar": "model.safetensors", + "language_model.model.layers.25.mlp.down_proj.biases": "model.safetensors", + "language_model.model.layers.25.mlp.down_proj.scales": "model.safetensors", + "language_model.model.layers.25.mlp.down_proj.weight": "model.safetensors", + "language_model.model.layers.25.mlp.gate_proj.biases": "model.safetensors", + "language_model.model.layers.25.mlp.gate_proj.scales": "model.safetensors", + "language_model.model.layers.25.mlp.gate_proj.weight": "model.safetensors", + "language_model.model.layers.25.mlp.up_proj.biases": "model.safetensors", + "language_model.model.layers.25.mlp.up_proj.scales": "model.safetensors", + "language_model.model.layers.25.mlp.up_proj.weight": "model.safetensors", + "language_model.model.layers.25.per_layer_input_gate.biases": "model.safetensors", + "language_model.model.layers.25.per_layer_input_gate.scales": "model.safetensors", + "language_model.model.layers.25.per_layer_input_gate.weight": "model.safetensors", + "language_model.model.layers.25.per_layer_projection.biases": "model.safetensors", + "language_model.model.layers.25.per_layer_projection.scales": "model.safetensors", + "language_model.model.layers.25.per_layer_projection.weight": "model.safetensors", + "language_model.model.layers.25.post_attention_layernorm.weight": "model.safetensors", + "language_model.model.layers.25.post_feedforward_layernorm.weight": "model.safetensors", + "language_model.model.layers.25.post_per_layer_input_norm.weight": "model.safetensors", + "language_model.model.layers.25.pre_feedforward_layernorm.weight": "model.safetensors", + "language_model.model.layers.25.self_attn.k_norm.weight": "model.safetensors", + "language_model.model.layers.25.self_attn.k_proj.biases": "model.safetensors", + "language_model.model.layers.25.self_attn.k_proj.scales": "model.safetensors", + "language_model.model.layers.25.self_attn.k_proj.weight": "model.safetensors", + "language_model.model.layers.25.self_attn.o_proj.biases": "model.safetensors", + "language_model.model.layers.25.self_attn.o_proj.scales": "model.safetensors", + "language_model.model.layers.25.self_attn.o_proj.weight": "model.safetensors", + "language_model.model.layers.25.self_attn.q_norm.weight": "model.safetensors", + "language_model.model.layers.25.self_attn.q_proj.biases": "model.safetensors", + "language_model.model.layers.25.self_attn.q_proj.scales": "model.safetensors", + "language_model.model.layers.25.self_attn.q_proj.weight": "model.safetensors", + "language_model.model.layers.25.self_attn.v_proj.biases": "model.safetensors", + "language_model.model.layers.25.self_attn.v_proj.scales": "model.safetensors", + "language_model.model.layers.25.self_attn.v_proj.weight": "model.safetensors", + "language_model.model.layers.26.input_layernorm.weight": "model.safetensors", + "language_model.model.layers.26.layer_scalar": "model.safetensors", + "language_model.model.layers.26.mlp.down_proj.biases": "model.safetensors", + "language_model.model.layers.26.mlp.down_proj.scales": "model.safetensors", + "language_model.model.layers.26.mlp.down_proj.weight": "model.safetensors", + "language_model.model.layers.26.mlp.gate_proj.biases": "model.safetensors", + "language_model.model.layers.26.mlp.gate_proj.scales": "model.safetensors", + "language_model.model.layers.26.mlp.gate_proj.weight": "model.safetensors", + "language_model.model.layers.26.mlp.up_proj.biases": "model.safetensors", + "language_model.model.layers.26.mlp.up_proj.scales": "model.safetensors", + "language_model.model.layers.26.mlp.up_proj.weight": "model.safetensors", + "language_model.model.layers.26.per_layer_input_gate.biases": "model.safetensors", + "language_model.model.layers.26.per_layer_input_gate.scales": "model.safetensors", + "language_model.model.layers.26.per_layer_input_gate.weight": "model.safetensors", + "language_model.model.layers.26.per_layer_projection.biases": "model.safetensors", + "language_model.model.layers.26.per_layer_projection.scales": "model.safetensors", + "language_model.model.layers.26.per_layer_projection.weight": "model.safetensors", + "language_model.model.layers.26.post_attention_layernorm.weight": "model.safetensors", + "language_model.model.layers.26.post_feedforward_layernorm.weight": "model.safetensors", + "language_model.model.layers.26.post_per_layer_input_norm.weight": "model.safetensors", + "language_model.model.layers.26.pre_feedforward_layernorm.weight": "model.safetensors", + "language_model.model.layers.26.self_attn.k_norm.weight": "model.safetensors", + "language_model.model.layers.26.self_attn.k_proj.biases": "model.safetensors", + "language_model.model.layers.26.self_attn.k_proj.scales": "model.safetensors", + "language_model.model.layers.26.self_attn.k_proj.weight": "model.safetensors", + "language_model.model.layers.26.self_attn.o_proj.biases": "model.safetensors", + "language_model.model.layers.26.self_attn.o_proj.scales": "model.safetensors", + "language_model.model.layers.26.self_attn.o_proj.weight": "model.safetensors", + "language_model.model.layers.26.self_attn.q_norm.weight": "model.safetensors", + "language_model.model.layers.26.self_attn.q_proj.biases": "model.safetensors", + "language_model.model.layers.26.self_attn.q_proj.scales": "model.safetensors", + "language_model.model.layers.26.self_attn.q_proj.weight": "model.safetensors", + "language_model.model.layers.26.self_attn.v_proj.biases": "model.safetensors", + "language_model.model.layers.26.self_attn.v_proj.scales": "model.safetensors", + "language_model.model.layers.26.self_attn.v_proj.weight": "model.safetensors", + "language_model.model.layers.27.input_layernorm.weight": "model.safetensors", + "language_model.model.layers.27.layer_scalar": "model.safetensors", + "language_model.model.layers.27.mlp.down_proj.biases": "model.safetensors", + "language_model.model.layers.27.mlp.down_proj.scales": "model.safetensors", + "language_model.model.layers.27.mlp.down_proj.weight": "model.safetensors", + "language_model.model.layers.27.mlp.gate_proj.biases": "model.safetensors", + "language_model.model.layers.27.mlp.gate_proj.scales": "model.safetensors", + "language_model.model.layers.27.mlp.gate_proj.weight": "model.safetensors", + "language_model.model.layers.27.mlp.up_proj.biases": "model.safetensors", + "language_model.model.layers.27.mlp.up_proj.scales": "model.safetensors", + "language_model.model.layers.27.mlp.up_proj.weight": "model.safetensors", + "language_model.model.layers.27.per_layer_input_gate.biases": "model.safetensors", + "language_model.model.layers.27.per_layer_input_gate.scales": "model.safetensors", + "language_model.model.layers.27.per_layer_input_gate.weight": "model.safetensors", + "language_model.model.layers.27.per_layer_projection.biases": "model.safetensors", + "language_model.model.layers.27.per_layer_projection.scales": "model.safetensors", + "language_model.model.layers.27.per_layer_projection.weight": "model.safetensors", + "language_model.model.layers.27.post_attention_layernorm.weight": "model.safetensors", + "language_model.model.layers.27.post_feedforward_layernorm.weight": "model.safetensors", + "language_model.model.layers.27.post_per_layer_input_norm.weight": "model.safetensors", + "language_model.model.layers.27.pre_feedforward_layernorm.weight": "model.safetensors", + "language_model.model.layers.27.self_attn.k_norm.weight": "model.safetensors", + "language_model.model.layers.27.self_attn.k_proj.biases": "model.safetensors", + "language_model.model.layers.27.self_attn.k_proj.scales": "model.safetensors", + "language_model.model.layers.27.self_attn.k_proj.weight": "model.safetensors", + "language_model.model.layers.27.self_attn.o_proj.biases": "model.safetensors", + "language_model.model.layers.27.self_attn.o_proj.scales": "model.safetensors", + "language_model.model.layers.27.self_attn.o_proj.weight": "model.safetensors", + "language_model.model.layers.27.self_attn.q_norm.weight": "model.safetensors", + "language_model.model.layers.27.self_attn.q_proj.biases": "model.safetensors", + "language_model.model.layers.27.self_attn.q_proj.scales": "model.safetensors", + "language_model.model.layers.27.self_attn.q_proj.weight": "model.safetensors", + "language_model.model.layers.27.self_attn.v_proj.biases": "model.safetensors", + "language_model.model.layers.27.self_attn.v_proj.scales": "model.safetensors", + "language_model.model.layers.27.self_attn.v_proj.weight": "model.safetensors", + "language_model.model.layers.28.input_layernorm.weight": "model.safetensors", + "language_model.model.layers.28.layer_scalar": "model.safetensors", + "language_model.model.layers.28.mlp.down_proj.biases": "model.safetensors", + "language_model.model.layers.28.mlp.down_proj.scales": "model.safetensors", + "language_model.model.layers.28.mlp.down_proj.weight": "model.safetensors", + "language_model.model.layers.28.mlp.gate_proj.biases": "model.safetensors", + "language_model.model.layers.28.mlp.gate_proj.scales": "model.safetensors", + "language_model.model.layers.28.mlp.gate_proj.weight": "model.safetensors", + "language_model.model.layers.28.mlp.up_proj.biases": "model.safetensors", + "language_model.model.layers.28.mlp.up_proj.scales": "model.safetensors", + "language_model.model.layers.28.mlp.up_proj.weight": "model.safetensors", + "language_model.model.layers.28.per_layer_input_gate.biases": "model.safetensors", + "language_model.model.layers.28.per_layer_input_gate.scales": "model.safetensors", + "language_model.model.layers.28.per_layer_input_gate.weight": "model.safetensors", + "language_model.model.layers.28.per_layer_projection.biases": "model.safetensors", + "language_model.model.layers.28.per_layer_projection.scales": "model.safetensors", + "language_model.model.layers.28.per_layer_projection.weight": "model.safetensors", + "language_model.model.layers.28.post_attention_layernorm.weight": "model.safetensors", + "language_model.model.layers.28.post_feedforward_layernorm.weight": "model.safetensors", + "language_model.model.layers.28.post_per_layer_input_norm.weight": "model.safetensors", + "language_model.model.layers.28.pre_feedforward_layernorm.weight": "model.safetensors", + "language_model.model.layers.28.self_attn.k_norm.weight": "model.safetensors", + "language_model.model.layers.28.self_attn.k_proj.biases": "model.safetensors", + "language_model.model.layers.28.self_attn.k_proj.scales": "model.safetensors", + "language_model.model.layers.28.self_attn.k_proj.weight": "model.safetensors", + "language_model.model.layers.28.self_attn.o_proj.biases": "model.safetensors", + "language_model.model.layers.28.self_attn.o_proj.scales": "model.safetensors", + "language_model.model.layers.28.self_attn.o_proj.weight": "model.safetensors", + "language_model.model.layers.28.self_attn.q_norm.weight": "model.safetensors", + "language_model.model.layers.28.self_attn.q_proj.biases": "model.safetensors", + "language_model.model.layers.28.self_attn.q_proj.scales": "model.safetensors", + "language_model.model.layers.28.self_attn.q_proj.weight": "model.safetensors", + "language_model.model.layers.28.self_attn.v_proj.biases": "model.safetensors", + "language_model.model.layers.28.self_attn.v_proj.scales": "model.safetensors", + "language_model.model.layers.28.self_attn.v_proj.weight": "model.safetensors", + "language_model.model.layers.29.input_layernorm.weight": "model.safetensors", + "language_model.model.layers.29.layer_scalar": "model.safetensors", + "language_model.model.layers.29.mlp.down_proj.biases": "model.safetensors", + "language_model.model.layers.29.mlp.down_proj.scales": "model.safetensors", + "language_model.model.layers.29.mlp.down_proj.weight": "model.safetensors", + "language_model.model.layers.29.mlp.gate_proj.biases": "model.safetensors", + "language_model.model.layers.29.mlp.gate_proj.scales": "model.safetensors", + "language_model.model.layers.29.mlp.gate_proj.weight": "model.safetensors", + "language_model.model.layers.29.mlp.up_proj.biases": "model.safetensors", + "language_model.model.layers.29.mlp.up_proj.scales": "model.safetensors", + "language_model.model.layers.29.mlp.up_proj.weight": "model.safetensors", + "language_model.model.layers.29.per_layer_input_gate.biases": "model.safetensors", + "language_model.model.layers.29.per_layer_input_gate.scales": "model.safetensors", + "language_model.model.layers.29.per_layer_input_gate.weight": "model.safetensors", + "language_model.model.layers.29.per_layer_projection.biases": "model.safetensors", + "language_model.model.layers.29.per_layer_projection.scales": "model.safetensors", + "language_model.model.layers.29.per_layer_projection.weight": "model.safetensors", + "language_model.model.layers.29.post_attention_layernorm.weight": "model.safetensors", + "language_model.model.layers.29.post_feedforward_layernorm.weight": "model.safetensors", + "language_model.model.layers.29.post_per_layer_input_norm.weight": "model.safetensors", + "language_model.model.layers.29.pre_feedforward_layernorm.weight": "model.safetensors", + "language_model.model.layers.29.self_attn.k_norm.weight": "model.safetensors", + "language_model.model.layers.29.self_attn.k_proj.biases": "model.safetensors", + "language_model.model.layers.29.self_attn.k_proj.scales": "model.safetensors", + "language_model.model.layers.29.self_attn.k_proj.weight": "model.safetensors", + "language_model.model.layers.29.self_attn.o_proj.biases": "model.safetensors", + "language_model.model.layers.29.self_attn.o_proj.scales": "model.safetensors", + "language_model.model.layers.29.self_attn.o_proj.weight": "model.safetensors", + "language_model.model.layers.29.self_attn.q_norm.weight": "model.safetensors", + "language_model.model.layers.29.self_attn.q_proj.biases": "model.safetensors", + "language_model.model.layers.29.self_attn.q_proj.scales": "model.safetensors", + "language_model.model.layers.29.self_attn.q_proj.weight": "model.safetensors", + "language_model.model.layers.29.self_attn.v_proj.biases": "model.safetensors", + "language_model.model.layers.29.self_attn.v_proj.scales": "model.safetensors", + "language_model.model.layers.29.self_attn.v_proj.weight": "model.safetensors", + "language_model.model.layers.3.input_layernorm.weight": "model.safetensors", + "language_model.model.layers.3.layer_scalar": "model.safetensors", + "language_model.model.layers.3.mlp.down_proj.biases": "model.safetensors", + "language_model.model.layers.3.mlp.down_proj.scales": "model.safetensors", + "language_model.model.layers.3.mlp.down_proj.weight": "model.safetensors", + "language_model.model.layers.3.mlp.gate_proj.biases": "model.safetensors", + "language_model.model.layers.3.mlp.gate_proj.scales": "model.safetensors", + "language_model.model.layers.3.mlp.gate_proj.weight": "model.safetensors", + "language_model.model.layers.3.mlp.up_proj.biases": "model.safetensors", + "language_model.model.layers.3.mlp.up_proj.scales": "model.safetensors", + "language_model.model.layers.3.mlp.up_proj.weight": "model.safetensors", + "language_model.model.layers.3.per_layer_input_gate.biases": "model.safetensors", + "language_model.model.layers.3.per_layer_input_gate.scales": "model.safetensors", + "language_model.model.layers.3.per_layer_input_gate.weight": "model.safetensors", + "language_model.model.layers.3.per_layer_projection.biases": "model.safetensors", + "language_model.model.layers.3.per_layer_projection.scales": "model.safetensors", + "language_model.model.layers.3.per_layer_projection.weight": "model.safetensors", + "language_model.model.layers.3.post_attention_layernorm.weight": "model.safetensors", + "language_model.model.layers.3.post_feedforward_layernorm.weight": "model.safetensors", + "language_model.model.layers.3.post_per_layer_input_norm.weight": "model.safetensors", + "language_model.model.layers.3.pre_feedforward_layernorm.weight": "model.safetensors", + "language_model.model.layers.3.self_attn.k_norm.weight": "model.safetensors", + "language_model.model.layers.3.self_attn.k_proj.biases": "model.safetensors", + "language_model.model.layers.3.self_attn.k_proj.scales": "model.safetensors", + "language_model.model.layers.3.self_attn.k_proj.weight": "model.safetensors", + "language_model.model.layers.3.self_attn.o_proj.biases": "model.safetensors", + "language_model.model.layers.3.self_attn.o_proj.scales": "model.safetensors", + "language_model.model.layers.3.self_attn.o_proj.weight": "model.safetensors", + "language_model.model.layers.3.self_attn.q_norm.weight": "model.safetensors", + "language_model.model.layers.3.self_attn.q_proj.biases": "model.safetensors", + "language_model.model.layers.3.self_attn.q_proj.scales": "model.safetensors", + "language_model.model.layers.3.self_attn.q_proj.weight": "model.safetensors", + "language_model.model.layers.3.self_attn.v_proj.biases": "model.safetensors", + "language_model.model.layers.3.self_attn.v_proj.scales": "model.safetensors", + "language_model.model.layers.3.self_attn.v_proj.weight": "model.safetensors", + "language_model.model.layers.30.input_layernorm.weight": "model.safetensors", + "language_model.model.layers.30.layer_scalar": "model.safetensors", + "language_model.model.layers.30.mlp.down_proj.biases": "model.safetensors", + "language_model.model.layers.30.mlp.down_proj.scales": "model.safetensors", + "language_model.model.layers.30.mlp.down_proj.weight": "model.safetensors", + "language_model.model.layers.30.mlp.gate_proj.biases": "model.safetensors", + "language_model.model.layers.30.mlp.gate_proj.scales": "model.safetensors", + "language_model.model.layers.30.mlp.gate_proj.weight": "model.safetensors", + "language_model.model.layers.30.mlp.up_proj.biases": "model.safetensors", + "language_model.model.layers.30.mlp.up_proj.scales": "model.safetensors", + "language_model.model.layers.30.mlp.up_proj.weight": "model.safetensors", + "language_model.model.layers.30.per_layer_input_gate.biases": "model.safetensors", + "language_model.model.layers.30.per_layer_input_gate.scales": "model.safetensors", + "language_model.model.layers.30.per_layer_input_gate.weight": "model.safetensors", + "language_model.model.layers.30.per_layer_projection.biases": "model.safetensors", + "language_model.model.layers.30.per_layer_projection.scales": "model.safetensors", + "language_model.model.layers.30.per_layer_projection.weight": "model.safetensors", + "language_model.model.layers.30.post_attention_layernorm.weight": "model.safetensors", + "language_model.model.layers.30.post_feedforward_layernorm.weight": "model.safetensors", + "language_model.model.layers.30.post_per_layer_input_norm.weight": "model.safetensors", + "language_model.model.layers.30.pre_feedforward_layernorm.weight": "model.safetensors", + "language_model.model.layers.30.self_attn.k_norm.weight": "model.safetensors", + "language_model.model.layers.30.self_attn.k_proj.biases": "model.safetensors", + "language_model.model.layers.30.self_attn.k_proj.scales": "model.safetensors", + "language_model.model.layers.30.self_attn.k_proj.weight": "model.safetensors", + "language_model.model.layers.30.self_attn.o_proj.biases": "model.safetensors", + "language_model.model.layers.30.self_attn.o_proj.scales": "model.safetensors", + "language_model.model.layers.30.self_attn.o_proj.weight": "model.safetensors", + "language_model.model.layers.30.self_attn.q_norm.weight": "model.safetensors", + "language_model.model.layers.30.self_attn.q_proj.biases": "model.safetensors", + "language_model.model.layers.30.self_attn.q_proj.scales": "model.safetensors", + "language_model.model.layers.30.self_attn.q_proj.weight": "model.safetensors", + "language_model.model.layers.30.self_attn.v_proj.biases": "model.safetensors", + "language_model.model.layers.30.self_attn.v_proj.scales": "model.safetensors", + "language_model.model.layers.30.self_attn.v_proj.weight": "model.safetensors", + "language_model.model.layers.31.input_layernorm.weight": "model.safetensors", + "language_model.model.layers.31.layer_scalar": "model.safetensors", + "language_model.model.layers.31.mlp.down_proj.biases": "model.safetensors", + "language_model.model.layers.31.mlp.down_proj.scales": "model.safetensors", + "language_model.model.layers.31.mlp.down_proj.weight": "model.safetensors", + "language_model.model.layers.31.mlp.gate_proj.biases": "model.safetensors", + "language_model.model.layers.31.mlp.gate_proj.scales": "model.safetensors", + "language_model.model.layers.31.mlp.gate_proj.weight": "model.safetensors", + "language_model.model.layers.31.mlp.up_proj.biases": "model.safetensors", + "language_model.model.layers.31.mlp.up_proj.scales": "model.safetensors", + "language_model.model.layers.31.mlp.up_proj.weight": "model.safetensors", + "language_model.model.layers.31.per_layer_input_gate.biases": "model.safetensors", + "language_model.model.layers.31.per_layer_input_gate.scales": "model.safetensors", + "language_model.model.layers.31.per_layer_input_gate.weight": "model.safetensors", + "language_model.model.layers.31.per_layer_projection.biases": "model.safetensors", + "language_model.model.layers.31.per_layer_projection.scales": "model.safetensors", + "language_model.model.layers.31.per_layer_projection.weight": "model.safetensors", + "language_model.model.layers.31.post_attention_layernorm.weight": "model.safetensors", + "language_model.model.layers.31.post_feedforward_layernorm.weight": "model.safetensors", + "language_model.model.layers.31.post_per_layer_input_norm.weight": "model.safetensors", + "language_model.model.layers.31.pre_feedforward_layernorm.weight": "model.safetensors", + "language_model.model.layers.31.self_attn.k_norm.weight": "model.safetensors", + "language_model.model.layers.31.self_attn.k_proj.biases": "model.safetensors", + "language_model.model.layers.31.self_attn.k_proj.scales": "model.safetensors", + "language_model.model.layers.31.self_attn.k_proj.weight": "model.safetensors", + "language_model.model.layers.31.self_attn.o_proj.biases": "model.safetensors", + "language_model.model.layers.31.self_attn.o_proj.scales": "model.safetensors", + "language_model.model.layers.31.self_attn.o_proj.weight": "model.safetensors", + "language_model.model.layers.31.self_attn.q_norm.weight": "model.safetensors", + "language_model.model.layers.31.self_attn.q_proj.biases": "model.safetensors", + "language_model.model.layers.31.self_attn.q_proj.scales": "model.safetensors", + "language_model.model.layers.31.self_attn.q_proj.weight": "model.safetensors", + "language_model.model.layers.31.self_attn.v_proj.biases": "model.safetensors", + "language_model.model.layers.31.self_attn.v_proj.scales": "model.safetensors", + "language_model.model.layers.31.self_attn.v_proj.weight": "model.safetensors", + "language_model.model.layers.32.input_layernorm.weight": "model.safetensors", + "language_model.model.layers.32.layer_scalar": "model.safetensors", + "language_model.model.layers.32.mlp.down_proj.biases": "model.safetensors", + "language_model.model.layers.32.mlp.down_proj.scales": "model.safetensors", + "language_model.model.layers.32.mlp.down_proj.weight": "model.safetensors", + "language_model.model.layers.32.mlp.gate_proj.biases": "model.safetensors", + "language_model.model.layers.32.mlp.gate_proj.scales": "model.safetensors", + "language_model.model.layers.32.mlp.gate_proj.weight": "model.safetensors", + "language_model.model.layers.32.mlp.up_proj.biases": "model.safetensors", + "language_model.model.layers.32.mlp.up_proj.scales": "model.safetensors", + "language_model.model.layers.32.mlp.up_proj.weight": "model.safetensors", + "language_model.model.layers.32.per_layer_input_gate.biases": "model.safetensors", + "language_model.model.layers.32.per_layer_input_gate.scales": "model.safetensors", + "language_model.model.layers.32.per_layer_input_gate.weight": "model.safetensors", + "language_model.model.layers.32.per_layer_projection.biases": "model.safetensors", + "language_model.model.layers.32.per_layer_projection.scales": "model.safetensors", + "language_model.model.layers.32.per_layer_projection.weight": "model.safetensors", + "language_model.model.layers.32.post_attention_layernorm.weight": "model.safetensors", + "language_model.model.layers.32.post_feedforward_layernorm.weight": "model.safetensors", + "language_model.model.layers.32.post_per_layer_input_norm.weight": "model.safetensors", + "language_model.model.layers.32.pre_feedforward_layernorm.weight": "model.safetensors", + "language_model.model.layers.32.self_attn.k_norm.weight": "model.safetensors", + "language_model.model.layers.32.self_attn.k_proj.biases": "model.safetensors", + "language_model.model.layers.32.self_attn.k_proj.scales": "model.safetensors", + "language_model.model.layers.32.self_attn.k_proj.weight": "model.safetensors", + "language_model.model.layers.32.self_attn.o_proj.biases": "model.safetensors", + "language_model.model.layers.32.self_attn.o_proj.scales": "model.safetensors", + "language_model.model.layers.32.self_attn.o_proj.weight": "model.safetensors", + "language_model.model.layers.32.self_attn.q_norm.weight": "model.safetensors", + "language_model.model.layers.32.self_attn.q_proj.biases": "model.safetensors", + "language_model.model.layers.32.self_attn.q_proj.scales": "model.safetensors", + "language_model.model.layers.32.self_attn.q_proj.weight": "model.safetensors", + "language_model.model.layers.32.self_attn.v_proj.biases": "model.safetensors", + "language_model.model.layers.32.self_attn.v_proj.scales": "model.safetensors", + "language_model.model.layers.32.self_attn.v_proj.weight": "model.safetensors", + "language_model.model.layers.33.input_layernorm.weight": "model.safetensors", + "language_model.model.layers.33.layer_scalar": "model.safetensors", + "language_model.model.layers.33.mlp.down_proj.biases": "model.safetensors", + "language_model.model.layers.33.mlp.down_proj.scales": "model.safetensors", + "language_model.model.layers.33.mlp.down_proj.weight": "model.safetensors", + "language_model.model.layers.33.mlp.gate_proj.biases": "model.safetensors", + "language_model.model.layers.33.mlp.gate_proj.scales": "model.safetensors", + "language_model.model.layers.33.mlp.gate_proj.weight": "model.safetensors", + "language_model.model.layers.33.mlp.up_proj.biases": "model.safetensors", + "language_model.model.layers.33.mlp.up_proj.scales": "model.safetensors", + "language_model.model.layers.33.mlp.up_proj.weight": "model.safetensors", + "language_model.model.layers.33.per_layer_input_gate.biases": "model.safetensors", + "language_model.model.layers.33.per_layer_input_gate.scales": "model.safetensors", + "language_model.model.layers.33.per_layer_input_gate.weight": "model.safetensors", + "language_model.model.layers.33.per_layer_projection.biases": "model.safetensors", + "language_model.model.layers.33.per_layer_projection.scales": "model.safetensors", + "language_model.model.layers.33.per_layer_projection.weight": "model.safetensors", + "language_model.model.layers.33.post_attention_layernorm.weight": "model.safetensors", + "language_model.model.layers.33.post_feedforward_layernorm.weight": "model.safetensors", + "language_model.model.layers.33.post_per_layer_input_norm.weight": "model.safetensors", + "language_model.model.layers.33.pre_feedforward_layernorm.weight": "model.safetensors", + "language_model.model.layers.33.self_attn.k_norm.weight": "model.safetensors", + "language_model.model.layers.33.self_attn.k_proj.biases": "model.safetensors", + "language_model.model.layers.33.self_attn.k_proj.scales": "model.safetensors", + "language_model.model.layers.33.self_attn.k_proj.weight": "model.safetensors", + "language_model.model.layers.33.self_attn.o_proj.biases": "model.safetensors", + "language_model.model.layers.33.self_attn.o_proj.scales": "model.safetensors", + "language_model.model.layers.33.self_attn.o_proj.weight": "model.safetensors", + "language_model.model.layers.33.self_attn.q_norm.weight": "model.safetensors", + "language_model.model.layers.33.self_attn.q_proj.biases": "model.safetensors", + "language_model.model.layers.33.self_attn.q_proj.scales": "model.safetensors", + "language_model.model.layers.33.self_attn.q_proj.weight": "model.safetensors", + "language_model.model.layers.33.self_attn.v_proj.biases": "model.safetensors", + "language_model.model.layers.33.self_attn.v_proj.scales": "model.safetensors", + "language_model.model.layers.33.self_attn.v_proj.weight": "model.safetensors", + "language_model.model.layers.34.input_layernorm.weight": "model.safetensors", + "language_model.model.layers.34.layer_scalar": "model.safetensors", + "language_model.model.layers.34.mlp.down_proj.biases": "model.safetensors", + "language_model.model.layers.34.mlp.down_proj.scales": "model.safetensors", + "language_model.model.layers.34.mlp.down_proj.weight": "model.safetensors", + "language_model.model.layers.34.mlp.gate_proj.biases": "model.safetensors", + "language_model.model.layers.34.mlp.gate_proj.scales": "model.safetensors", + "language_model.model.layers.34.mlp.gate_proj.weight": "model.safetensors", + "language_model.model.layers.34.mlp.up_proj.biases": "model.safetensors", + "language_model.model.layers.34.mlp.up_proj.scales": "model.safetensors", + "language_model.model.layers.34.mlp.up_proj.weight": "model.safetensors", + "language_model.model.layers.34.per_layer_input_gate.biases": "model.safetensors", + "language_model.model.layers.34.per_layer_input_gate.scales": "model.safetensors", + "language_model.model.layers.34.per_layer_input_gate.weight": "model.safetensors", + "language_model.model.layers.34.per_layer_projection.biases": "model.safetensors", + "language_model.model.layers.34.per_layer_projection.scales": "model.safetensors", + "language_model.model.layers.34.per_layer_projection.weight": "model.safetensors", + "language_model.model.layers.34.post_attention_layernorm.weight": "model.safetensors", + "language_model.model.layers.34.post_feedforward_layernorm.weight": "model.safetensors", + "language_model.model.layers.34.post_per_layer_input_norm.weight": "model.safetensors", + "language_model.model.layers.34.pre_feedforward_layernorm.weight": "model.safetensors", + "language_model.model.layers.34.self_attn.k_norm.weight": "model.safetensors", + "language_model.model.layers.34.self_attn.k_proj.biases": "model.safetensors", + "language_model.model.layers.34.self_attn.k_proj.scales": "model.safetensors", + "language_model.model.layers.34.self_attn.k_proj.weight": "model.safetensors", + "language_model.model.layers.34.self_attn.o_proj.biases": "model.safetensors", + "language_model.model.layers.34.self_attn.o_proj.scales": "model.safetensors", + "language_model.model.layers.34.self_attn.o_proj.weight": "model.safetensors", + "language_model.model.layers.34.self_attn.q_norm.weight": "model.safetensors", + "language_model.model.layers.34.self_attn.q_proj.biases": "model.safetensors", + "language_model.model.layers.34.self_attn.q_proj.scales": "model.safetensors", + "language_model.model.layers.34.self_attn.q_proj.weight": "model.safetensors", + "language_model.model.layers.34.self_attn.v_proj.biases": "model.safetensors", + "language_model.model.layers.34.self_attn.v_proj.scales": "model.safetensors", + "language_model.model.layers.34.self_attn.v_proj.weight": "model.safetensors", + "language_model.model.layers.4.input_layernorm.weight": "model.safetensors", + "language_model.model.layers.4.layer_scalar": "model.safetensors", + "language_model.model.layers.4.mlp.down_proj.biases": "model.safetensors", + "language_model.model.layers.4.mlp.down_proj.scales": "model.safetensors", + "language_model.model.layers.4.mlp.down_proj.weight": "model.safetensors", + "language_model.model.layers.4.mlp.gate_proj.biases": "model.safetensors", + "language_model.model.layers.4.mlp.gate_proj.scales": "model.safetensors", + "language_model.model.layers.4.mlp.gate_proj.weight": "model.safetensors", + "language_model.model.layers.4.mlp.up_proj.biases": "model.safetensors", + "language_model.model.layers.4.mlp.up_proj.scales": "model.safetensors", + "language_model.model.layers.4.mlp.up_proj.weight": "model.safetensors", + "language_model.model.layers.4.per_layer_input_gate.biases": "model.safetensors", + "language_model.model.layers.4.per_layer_input_gate.scales": "model.safetensors", + "language_model.model.layers.4.per_layer_input_gate.weight": "model.safetensors", + "language_model.model.layers.4.per_layer_projection.biases": "model.safetensors", + "language_model.model.layers.4.per_layer_projection.scales": "model.safetensors", + "language_model.model.layers.4.per_layer_projection.weight": "model.safetensors", + "language_model.model.layers.4.post_attention_layernorm.weight": "model.safetensors", + "language_model.model.layers.4.post_feedforward_layernorm.weight": "model.safetensors", + "language_model.model.layers.4.post_per_layer_input_norm.weight": "model.safetensors", + "language_model.model.layers.4.pre_feedforward_layernorm.weight": "model.safetensors", + "language_model.model.layers.4.self_attn.k_norm.weight": "model.safetensors", + "language_model.model.layers.4.self_attn.k_proj.biases": "model.safetensors", + "language_model.model.layers.4.self_attn.k_proj.scales": "model.safetensors", + "language_model.model.layers.4.self_attn.k_proj.weight": "model.safetensors", + "language_model.model.layers.4.self_attn.o_proj.biases": "model.safetensors", + "language_model.model.layers.4.self_attn.o_proj.scales": "model.safetensors", + "language_model.model.layers.4.self_attn.o_proj.weight": "model.safetensors", + "language_model.model.layers.4.self_attn.q_norm.weight": "model.safetensors", + "language_model.model.layers.4.self_attn.q_proj.biases": "model.safetensors", + "language_model.model.layers.4.self_attn.q_proj.scales": "model.safetensors", + "language_model.model.layers.4.self_attn.q_proj.weight": "model.safetensors", + "language_model.model.layers.4.self_attn.v_proj.biases": "model.safetensors", + "language_model.model.layers.4.self_attn.v_proj.scales": "model.safetensors", + "language_model.model.layers.4.self_attn.v_proj.weight": "model.safetensors", + "language_model.model.layers.5.input_layernorm.weight": "model.safetensors", + "language_model.model.layers.5.layer_scalar": "model.safetensors", + "language_model.model.layers.5.mlp.down_proj.biases": "model.safetensors", + "language_model.model.layers.5.mlp.down_proj.scales": "model.safetensors", + "language_model.model.layers.5.mlp.down_proj.weight": "model.safetensors", + "language_model.model.layers.5.mlp.gate_proj.biases": "model.safetensors", + "language_model.model.layers.5.mlp.gate_proj.scales": "model.safetensors", + "language_model.model.layers.5.mlp.gate_proj.weight": "model.safetensors", + "language_model.model.layers.5.mlp.up_proj.biases": "model.safetensors", + "language_model.model.layers.5.mlp.up_proj.scales": "model.safetensors", + "language_model.model.layers.5.mlp.up_proj.weight": "model.safetensors", + "language_model.model.layers.5.per_layer_input_gate.biases": "model.safetensors", + "language_model.model.layers.5.per_layer_input_gate.scales": "model.safetensors", + "language_model.model.layers.5.per_layer_input_gate.weight": "model.safetensors", + "language_model.model.layers.5.per_layer_projection.biases": "model.safetensors", + "language_model.model.layers.5.per_layer_projection.scales": "model.safetensors", + "language_model.model.layers.5.per_layer_projection.weight": "model.safetensors", + "language_model.model.layers.5.post_attention_layernorm.weight": "model.safetensors", + "language_model.model.layers.5.post_feedforward_layernorm.weight": "model.safetensors", + "language_model.model.layers.5.post_per_layer_input_norm.weight": "model.safetensors", + "language_model.model.layers.5.pre_feedforward_layernorm.weight": "model.safetensors", + "language_model.model.layers.5.self_attn.k_norm.weight": "model.safetensors", + "language_model.model.layers.5.self_attn.k_proj.biases": "model.safetensors", + "language_model.model.layers.5.self_attn.k_proj.scales": "model.safetensors", + "language_model.model.layers.5.self_attn.k_proj.weight": "model.safetensors", + "language_model.model.layers.5.self_attn.o_proj.biases": "model.safetensors", + "language_model.model.layers.5.self_attn.o_proj.scales": "model.safetensors", + "language_model.model.layers.5.self_attn.o_proj.weight": "model.safetensors", + "language_model.model.layers.5.self_attn.q_norm.weight": "model.safetensors", + "language_model.model.layers.5.self_attn.q_proj.biases": "model.safetensors", + "language_model.model.layers.5.self_attn.q_proj.scales": "model.safetensors", + "language_model.model.layers.5.self_attn.q_proj.weight": "model.safetensors", + "language_model.model.layers.5.self_attn.v_proj.biases": "model.safetensors", + "language_model.model.layers.5.self_attn.v_proj.scales": "model.safetensors", + "language_model.model.layers.5.self_attn.v_proj.weight": "model.safetensors", + "language_model.model.layers.6.input_layernorm.weight": "model.safetensors", + "language_model.model.layers.6.layer_scalar": "model.safetensors", + "language_model.model.layers.6.mlp.down_proj.biases": "model.safetensors", + "language_model.model.layers.6.mlp.down_proj.scales": "model.safetensors", + "language_model.model.layers.6.mlp.down_proj.weight": "model.safetensors", + "language_model.model.layers.6.mlp.gate_proj.biases": "model.safetensors", + "language_model.model.layers.6.mlp.gate_proj.scales": "model.safetensors", + "language_model.model.layers.6.mlp.gate_proj.weight": "model.safetensors", + "language_model.model.layers.6.mlp.up_proj.biases": "model.safetensors", + "language_model.model.layers.6.mlp.up_proj.scales": "model.safetensors", + "language_model.model.layers.6.mlp.up_proj.weight": "model.safetensors", + "language_model.model.layers.6.per_layer_input_gate.biases": "model.safetensors", + "language_model.model.layers.6.per_layer_input_gate.scales": "model.safetensors", + "language_model.model.layers.6.per_layer_input_gate.weight": "model.safetensors", + "language_model.model.layers.6.per_layer_projection.biases": "model.safetensors", + "language_model.model.layers.6.per_layer_projection.scales": "model.safetensors", + "language_model.model.layers.6.per_layer_projection.weight": "model.safetensors", + "language_model.model.layers.6.post_attention_layernorm.weight": "model.safetensors", + "language_model.model.layers.6.post_feedforward_layernorm.weight": "model.safetensors", + "language_model.model.layers.6.post_per_layer_input_norm.weight": "model.safetensors", + "language_model.model.layers.6.pre_feedforward_layernorm.weight": "model.safetensors", + "language_model.model.layers.6.self_attn.k_norm.weight": "model.safetensors", + "language_model.model.layers.6.self_attn.k_proj.biases": "model.safetensors", + "language_model.model.layers.6.self_attn.k_proj.scales": "model.safetensors", + "language_model.model.layers.6.self_attn.k_proj.weight": "model.safetensors", + "language_model.model.layers.6.self_attn.o_proj.biases": "model.safetensors", + "language_model.model.layers.6.self_attn.o_proj.scales": "model.safetensors", + "language_model.model.layers.6.self_attn.o_proj.weight": "model.safetensors", + "language_model.model.layers.6.self_attn.q_norm.weight": "model.safetensors", + "language_model.model.layers.6.self_attn.q_proj.biases": "model.safetensors", + "language_model.model.layers.6.self_attn.q_proj.scales": "model.safetensors", + "language_model.model.layers.6.self_attn.q_proj.weight": "model.safetensors", + "language_model.model.layers.6.self_attn.v_proj.biases": "model.safetensors", + "language_model.model.layers.6.self_attn.v_proj.scales": "model.safetensors", + "language_model.model.layers.6.self_attn.v_proj.weight": "model.safetensors", + "language_model.model.layers.7.input_layernorm.weight": "model.safetensors", + "language_model.model.layers.7.layer_scalar": "model.safetensors", + "language_model.model.layers.7.mlp.down_proj.biases": "model.safetensors", + "language_model.model.layers.7.mlp.down_proj.scales": "model.safetensors", + "language_model.model.layers.7.mlp.down_proj.weight": "model.safetensors", + "language_model.model.layers.7.mlp.gate_proj.biases": "model.safetensors", + "language_model.model.layers.7.mlp.gate_proj.scales": "model.safetensors", + "language_model.model.layers.7.mlp.gate_proj.weight": "model.safetensors", + "language_model.model.layers.7.mlp.up_proj.biases": "model.safetensors", + "language_model.model.layers.7.mlp.up_proj.scales": "model.safetensors", + "language_model.model.layers.7.mlp.up_proj.weight": "model.safetensors", + "language_model.model.layers.7.per_layer_input_gate.biases": "model.safetensors", + "language_model.model.layers.7.per_layer_input_gate.scales": "model.safetensors", + "language_model.model.layers.7.per_layer_input_gate.weight": "model.safetensors", + "language_model.model.layers.7.per_layer_projection.biases": "model.safetensors", + "language_model.model.layers.7.per_layer_projection.scales": "model.safetensors", + "language_model.model.layers.7.per_layer_projection.weight": "model.safetensors", + "language_model.model.layers.7.post_attention_layernorm.weight": "model.safetensors", + "language_model.model.layers.7.post_feedforward_layernorm.weight": "model.safetensors", + "language_model.model.layers.7.post_per_layer_input_norm.weight": "model.safetensors", + "language_model.model.layers.7.pre_feedforward_layernorm.weight": "model.safetensors", + "language_model.model.layers.7.self_attn.k_norm.weight": "model.safetensors", + "language_model.model.layers.7.self_attn.k_proj.biases": "model.safetensors", + "language_model.model.layers.7.self_attn.k_proj.scales": "model.safetensors", + "language_model.model.layers.7.self_attn.k_proj.weight": "model.safetensors", + "language_model.model.layers.7.self_attn.o_proj.biases": "model.safetensors", + "language_model.model.layers.7.self_attn.o_proj.scales": "model.safetensors", + "language_model.model.layers.7.self_attn.o_proj.weight": "model.safetensors", + "language_model.model.layers.7.self_attn.q_norm.weight": "model.safetensors", + "language_model.model.layers.7.self_attn.q_proj.biases": "model.safetensors", + "language_model.model.layers.7.self_attn.q_proj.scales": "model.safetensors", + "language_model.model.layers.7.self_attn.q_proj.weight": "model.safetensors", + "language_model.model.layers.7.self_attn.v_proj.biases": "model.safetensors", + "language_model.model.layers.7.self_attn.v_proj.scales": "model.safetensors", + "language_model.model.layers.7.self_attn.v_proj.weight": "model.safetensors", + "language_model.model.layers.8.input_layernorm.weight": "model.safetensors", + "language_model.model.layers.8.layer_scalar": "model.safetensors", + "language_model.model.layers.8.mlp.down_proj.biases": "model.safetensors", + "language_model.model.layers.8.mlp.down_proj.scales": "model.safetensors", + "language_model.model.layers.8.mlp.down_proj.weight": "model.safetensors", + "language_model.model.layers.8.mlp.gate_proj.biases": "model.safetensors", + "language_model.model.layers.8.mlp.gate_proj.scales": "model.safetensors", + "language_model.model.layers.8.mlp.gate_proj.weight": "model.safetensors", + "language_model.model.layers.8.mlp.up_proj.biases": "model.safetensors", + "language_model.model.layers.8.mlp.up_proj.scales": "model.safetensors", + "language_model.model.layers.8.mlp.up_proj.weight": "model.safetensors", + "language_model.model.layers.8.per_layer_input_gate.biases": "model.safetensors", + "language_model.model.layers.8.per_layer_input_gate.scales": "model.safetensors", + "language_model.model.layers.8.per_layer_input_gate.weight": "model.safetensors", + "language_model.model.layers.8.per_layer_projection.biases": "model.safetensors", + "language_model.model.layers.8.per_layer_projection.scales": "model.safetensors", + "language_model.model.layers.8.per_layer_projection.weight": "model.safetensors", + "language_model.model.layers.8.post_attention_layernorm.weight": "model.safetensors", + "language_model.model.layers.8.post_feedforward_layernorm.weight": "model.safetensors", + "language_model.model.layers.8.post_per_layer_input_norm.weight": "model.safetensors", + "language_model.model.layers.8.pre_feedforward_layernorm.weight": "model.safetensors", + "language_model.model.layers.8.self_attn.k_norm.weight": "model.safetensors", + "language_model.model.layers.8.self_attn.k_proj.biases": "model.safetensors", + "language_model.model.layers.8.self_attn.k_proj.scales": "model.safetensors", + "language_model.model.layers.8.self_attn.k_proj.weight": "model.safetensors", + "language_model.model.layers.8.self_attn.o_proj.biases": "model.safetensors", + "language_model.model.layers.8.self_attn.o_proj.scales": "model.safetensors", + "language_model.model.layers.8.self_attn.o_proj.weight": "model.safetensors", + "language_model.model.layers.8.self_attn.q_norm.weight": "model.safetensors", + "language_model.model.layers.8.self_attn.q_proj.biases": "model.safetensors", + "language_model.model.layers.8.self_attn.q_proj.scales": "model.safetensors", + "language_model.model.layers.8.self_attn.q_proj.weight": "model.safetensors", + "language_model.model.layers.8.self_attn.v_proj.biases": "model.safetensors", + "language_model.model.layers.8.self_attn.v_proj.scales": "model.safetensors", + "language_model.model.layers.8.self_attn.v_proj.weight": "model.safetensors", + "language_model.model.layers.9.input_layernorm.weight": "model.safetensors", + "language_model.model.layers.9.layer_scalar": "model.safetensors", + "language_model.model.layers.9.mlp.down_proj.biases": "model.safetensors", + "language_model.model.layers.9.mlp.down_proj.scales": "model.safetensors", + "language_model.model.layers.9.mlp.down_proj.weight": "model.safetensors", + "language_model.model.layers.9.mlp.gate_proj.biases": "model.safetensors", + "language_model.model.layers.9.mlp.gate_proj.scales": "model.safetensors", + "language_model.model.layers.9.mlp.gate_proj.weight": "model.safetensors", + "language_model.model.layers.9.mlp.up_proj.biases": "model.safetensors", + "language_model.model.layers.9.mlp.up_proj.scales": "model.safetensors", + "language_model.model.layers.9.mlp.up_proj.weight": "model.safetensors", + "language_model.model.layers.9.per_layer_input_gate.biases": "model.safetensors", + "language_model.model.layers.9.per_layer_input_gate.scales": "model.safetensors", + "language_model.model.layers.9.per_layer_input_gate.weight": "model.safetensors", + "language_model.model.layers.9.per_layer_projection.biases": "model.safetensors", + "language_model.model.layers.9.per_layer_projection.scales": "model.safetensors", + "language_model.model.layers.9.per_layer_projection.weight": "model.safetensors", + "language_model.model.layers.9.post_attention_layernorm.weight": "model.safetensors", + "language_model.model.layers.9.post_feedforward_layernorm.weight": "model.safetensors", + "language_model.model.layers.9.post_per_layer_input_norm.weight": "model.safetensors", + "language_model.model.layers.9.pre_feedforward_layernorm.weight": "model.safetensors", + "language_model.model.layers.9.self_attn.k_norm.weight": "model.safetensors", + "language_model.model.layers.9.self_attn.k_proj.biases": "model.safetensors", + "language_model.model.layers.9.self_attn.k_proj.scales": "model.safetensors", + "language_model.model.layers.9.self_attn.k_proj.weight": "model.safetensors", + "language_model.model.layers.9.self_attn.o_proj.biases": "model.safetensors", + "language_model.model.layers.9.self_attn.o_proj.scales": "model.safetensors", + "language_model.model.layers.9.self_attn.o_proj.weight": "model.safetensors", + "language_model.model.layers.9.self_attn.q_norm.weight": "model.safetensors", + "language_model.model.layers.9.self_attn.q_proj.biases": "model.safetensors", + "language_model.model.layers.9.self_attn.q_proj.scales": "model.safetensors", + "language_model.model.layers.9.self_attn.q_proj.weight": "model.safetensors", + "language_model.model.layers.9.self_attn.v_proj.biases": "model.safetensors", + "language_model.model.layers.9.self_attn.v_proj.scales": "model.safetensors", + "language_model.model.layers.9.self_attn.v_proj.weight": "model.safetensors", + "language_model.model.norm.weight": "model.safetensors", + "language_model.model.per_layer_model_projection.weight": "model.safetensors", + "language_model.model.per_layer_projection_norm.weight": "model.safetensors", + "vision_tower.encoder.layers.0.input_layernorm.weight": "model.safetensors", + "vision_tower.encoder.layers.0.mlp.down_proj.input_max": "model.safetensors", + "vision_tower.encoder.layers.0.mlp.down_proj.input_min": "model.safetensors", + "vision_tower.encoder.layers.0.mlp.down_proj.linear.weight": "model.safetensors", + "vision_tower.encoder.layers.0.mlp.down_proj.output_max": "model.safetensors", + "vision_tower.encoder.layers.0.mlp.down_proj.output_min": "model.safetensors", + "vision_tower.encoder.layers.0.mlp.gate_proj.input_max": "model.safetensors", + "vision_tower.encoder.layers.0.mlp.gate_proj.input_min": "model.safetensors", + "vision_tower.encoder.layers.0.mlp.gate_proj.linear.weight": "model.safetensors", + "vision_tower.encoder.layers.0.mlp.gate_proj.output_max": "model.safetensors", + "vision_tower.encoder.layers.0.mlp.gate_proj.output_min": "model.safetensors", + "vision_tower.encoder.layers.0.mlp.up_proj.input_max": "model.safetensors", + "vision_tower.encoder.layers.0.mlp.up_proj.input_min": "model.safetensors", + "vision_tower.encoder.layers.0.mlp.up_proj.linear.weight": "model.safetensors", + "vision_tower.encoder.layers.0.mlp.up_proj.output_max": "model.safetensors", + "vision_tower.encoder.layers.0.mlp.up_proj.output_min": "model.safetensors", + "vision_tower.encoder.layers.0.post_attention_layernorm.weight": "model.safetensors", + "vision_tower.encoder.layers.0.post_feedforward_layernorm.weight": "model.safetensors", + "vision_tower.encoder.layers.0.pre_feedforward_layernorm.weight": "model.safetensors", + "vision_tower.encoder.layers.0.self_attn.k_norm.weight": "model.safetensors", + "vision_tower.encoder.layers.0.self_attn.k_proj.input_max": "model.safetensors", + "vision_tower.encoder.layers.0.self_attn.k_proj.input_min": "model.safetensors", + "vision_tower.encoder.layers.0.self_attn.k_proj.linear.weight": "model.safetensors", + "vision_tower.encoder.layers.0.self_attn.k_proj.output_max": "model.safetensors", + "vision_tower.encoder.layers.0.self_attn.k_proj.output_min": "model.safetensors", + "vision_tower.encoder.layers.0.self_attn.o_proj.input_max": "model.safetensors", + "vision_tower.encoder.layers.0.self_attn.o_proj.input_min": "model.safetensors", + "vision_tower.encoder.layers.0.self_attn.o_proj.linear.weight": "model.safetensors", + "vision_tower.encoder.layers.0.self_attn.o_proj.output_max": "model.safetensors", + "vision_tower.encoder.layers.0.self_attn.o_proj.output_min": "model.safetensors", + "vision_tower.encoder.layers.0.self_attn.q_norm.weight": "model.safetensors", + "vision_tower.encoder.layers.0.self_attn.q_proj.input_max": "model.safetensors", + "vision_tower.encoder.layers.0.self_attn.q_proj.input_min": "model.safetensors", + "vision_tower.encoder.layers.0.self_attn.q_proj.linear.weight": "model.safetensors", + "vision_tower.encoder.layers.0.self_attn.q_proj.output_max": "model.safetensors", + "vision_tower.encoder.layers.0.self_attn.q_proj.output_min": "model.safetensors", + "vision_tower.encoder.layers.0.self_attn.v_proj.input_max": "model.safetensors", + "vision_tower.encoder.layers.0.self_attn.v_proj.input_min": "model.safetensors", + "vision_tower.encoder.layers.0.self_attn.v_proj.linear.weight": "model.safetensors", + "vision_tower.encoder.layers.0.self_attn.v_proj.output_max": "model.safetensors", + "vision_tower.encoder.layers.0.self_attn.v_proj.output_min": "model.safetensors", + "vision_tower.encoder.layers.1.input_layernorm.weight": "model.safetensors", + "vision_tower.encoder.layers.1.mlp.down_proj.input_max": "model.safetensors", + "vision_tower.encoder.layers.1.mlp.down_proj.input_min": "model.safetensors", + "vision_tower.encoder.layers.1.mlp.down_proj.linear.weight": "model.safetensors", + "vision_tower.encoder.layers.1.mlp.down_proj.output_max": "model.safetensors", + "vision_tower.encoder.layers.1.mlp.down_proj.output_min": "model.safetensors", + "vision_tower.encoder.layers.1.mlp.gate_proj.input_max": "model.safetensors", + "vision_tower.encoder.layers.1.mlp.gate_proj.input_min": "model.safetensors", + "vision_tower.encoder.layers.1.mlp.gate_proj.linear.weight": "model.safetensors", + "vision_tower.encoder.layers.1.mlp.gate_proj.output_max": "model.safetensors", + "vision_tower.encoder.layers.1.mlp.gate_proj.output_min": "model.safetensors", + "vision_tower.encoder.layers.1.mlp.up_proj.input_max": "model.safetensors", + "vision_tower.encoder.layers.1.mlp.up_proj.input_min": "model.safetensors", + "vision_tower.encoder.layers.1.mlp.up_proj.linear.weight": "model.safetensors", + "vision_tower.encoder.layers.1.mlp.up_proj.output_max": "model.safetensors", + "vision_tower.encoder.layers.1.mlp.up_proj.output_min": "model.safetensors", + "vision_tower.encoder.layers.1.post_attention_layernorm.weight": "model.safetensors", + "vision_tower.encoder.layers.1.post_feedforward_layernorm.weight": "model.safetensors", + "vision_tower.encoder.layers.1.pre_feedforward_layernorm.weight": "model.safetensors", + "vision_tower.encoder.layers.1.self_attn.k_norm.weight": "model.safetensors", + "vision_tower.encoder.layers.1.self_attn.k_proj.input_max": "model.safetensors", + "vision_tower.encoder.layers.1.self_attn.k_proj.input_min": "model.safetensors", + "vision_tower.encoder.layers.1.self_attn.k_proj.linear.weight": "model.safetensors", + "vision_tower.encoder.layers.1.self_attn.k_proj.output_max": "model.safetensors", + "vision_tower.encoder.layers.1.self_attn.k_proj.output_min": "model.safetensors", + "vision_tower.encoder.layers.1.self_attn.o_proj.input_max": "model.safetensors", + "vision_tower.encoder.layers.1.self_attn.o_proj.input_min": "model.safetensors", + "vision_tower.encoder.layers.1.self_attn.o_proj.linear.weight": "model.safetensors", + "vision_tower.encoder.layers.1.self_attn.o_proj.output_max": "model.safetensors", + "vision_tower.encoder.layers.1.self_attn.o_proj.output_min": "model.safetensors", + "vision_tower.encoder.layers.1.self_attn.q_norm.weight": "model.safetensors", + "vision_tower.encoder.layers.1.self_attn.q_proj.input_max": "model.safetensors", + "vision_tower.encoder.layers.1.self_attn.q_proj.input_min": "model.safetensors", + "vision_tower.encoder.layers.1.self_attn.q_proj.linear.weight": "model.safetensors", + "vision_tower.encoder.layers.1.self_attn.q_proj.output_max": "model.safetensors", + "vision_tower.encoder.layers.1.self_attn.q_proj.output_min": "model.safetensors", + "vision_tower.encoder.layers.1.self_attn.v_proj.input_max": "model.safetensors", + "vision_tower.encoder.layers.1.self_attn.v_proj.input_min": "model.safetensors", + "vision_tower.encoder.layers.1.self_attn.v_proj.linear.weight": "model.safetensors", + "vision_tower.encoder.layers.1.self_attn.v_proj.output_max": "model.safetensors", + "vision_tower.encoder.layers.1.self_attn.v_proj.output_min": "model.safetensors", + "vision_tower.encoder.layers.10.input_layernorm.weight": "model.safetensors", + "vision_tower.encoder.layers.10.mlp.down_proj.input_max": "model.safetensors", + "vision_tower.encoder.layers.10.mlp.down_proj.input_min": "model.safetensors", + "vision_tower.encoder.layers.10.mlp.down_proj.linear.weight": "model.safetensors", + "vision_tower.encoder.layers.10.mlp.down_proj.output_max": "model.safetensors", + "vision_tower.encoder.layers.10.mlp.down_proj.output_min": "model.safetensors", + "vision_tower.encoder.layers.10.mlp.gate_proj.input_max": "model.safetensors", + "vision_tower.encoder.layers.10.mlp.gate_proj.input_min": "model.safetensors", + "vision_tower.encoder.layers.10.mlp.gate_proj.linear.weight": "model.safetensors", + "vision_tower.encoder.layers.10.mlp.gate_proj.output_max": "model.safetensors", + "vision_tower.encoder.layers.10.mlp.gate_proj.output_min": "model.safetensors", + "vision_tower.encoder.layers.10.mlp.up_proj.input_max": "model.safetensors", + "vision_tower.encoder.layers.10.mlp.up_proj.input_min": "model.safetensors", + "vision_tower.encoder.layers.10.mlp.up_proj.linear.weight": "model.safetensors", + "vision_tower.encoder.layers.10.mlp.up_proj.output_max": "model.safetensors", + "vision_tower.encoder.layers.10.mlp.up_proj.output_min": "model.safetensors", + "vision_tower.encoder.layers.10.post_attention_layernorm.weight": "model.safetensors", + "vision_tower.encoder.layers.10.post_feedforward_layernorm.weight": "model.safetensors", + "vision_tower.encoder.layers.10.pre_feedforward_layernorm.weight": "model.safetensors", + "vision_tower.encoder.layers.10.self_attn.k_norm.weight": "model.safetensors", + "vision_tower.encoder.layers.10.self_attn.k_proj.input_max": "model.safetensors", + "vision_tower.encoder.layers.10.self_attn.k_proj.input_min": "model.safetensors", + "vision_tower.encoder.layers.10.self_attn.k_proj.linear.weight": "model.safetensors", + "vision_tower.encoder.layers.10.self_attn.k_proj.output_max": "model.safetensors", + "vision_tower.encoder.layers.10.self_attn.k_proj.output_min": "model.safetensors", + "vision_tower.encoder.layers.10.self_attn.o_proj.input_max": "model.safetensors", + "vision_tower.encoder.layers.10.self_attn.o_proj.input_min": "model.safetensors", + "vision_tower.encoder.layers.10.self_attn.o_proj.linear.weight": "model.safetensors", + "vision_tower.encoder.layers.10.self_attn.o_proj.output_max": "model.safetensors", + "vision_tower.encoder.layers.10.self_attn.o_proj.output_min": "model.safetensors", + "vision_tower.encoder.layers.10.self_attn.q_norm.weight": "model.safetensors", + "vision_tower.encoder.layers.10.self_attn.q_proj.input_max": "model.safetensors", + "vision_tower.encoder.layers.10.self_attn.q_proj.input_min": "model.safetensors", + "vision_tower.encoder.layers.10.self_attn.q_proj.linear.weight": "model.safetensors", + "vision_tower.encoder.layers.10.self_attn.q_proj.output_max": "model.safetensors", + "vision_tower.encoder.layers.10.self_attn.q_proj.output_min": "model.safetensors", + "vision_tower.encoder.layers.10.self_attn.v_proj.input_max": "model.safetensors", + "vision_tower.encoder.layers.10.self_attn.v_proj.input_min": "model.safetensors", + "vision_tower.encoder.layers.10.self_attn.v_proj.linear.weight": "model.safetensors", + "vision_tower.encoder.layers.10.self_attn.v_proj.output_max": "model.safetensors", + "vision_tower.encoder.layers.10.self_attn.v_proj.output_min": "model.safetensors", + "vision_tower.encoder.layers.11.input_layernorm.weight": "model.safetensors", + "vision_tower.encoder.layers.11.mlp.down_proj.input_max": "model.safetensors", + "vision_tower.encoder.layers.11.mlp.down_proj.input_min": "model.safetensors", + "vision_tower.encoder.layers.11.mlp.down_proj.linear.weight": "model.safetensors", + "vision_tower.encoder.layers.11.mlp.down_proj.output_max": "model.safetensors", + "vision_tower.encoder.layers.11.mlp.down_proj.output_min": "model.safetensors", + "vision_tower.encoder.layers.11.mlp.gate_proj.input_max": "model.safetensors", + "vision_tower.encoder.layers.11.mlp.gate_proj.input_min": "model.safetensors", + "vision_tower.encoder.layers.11.mlp.gate_proj.linear.weight": "model.safetensors", + "vision_tower.encoder.layers.11.mlp.gate_proj.output_max": "model.safetensors", + "vision_tower.encoder.layers.11.mlp.gate_proj.output_min": "model.safetensors", + "vision_tower.encoder.layers.11.mlp.up_proj.input_max": "model.safetensors", + "vision_tower.encoder.layers.11.mlp.up_proj.input_min": "model.safetensors", + "vision_tower.encoder.layers.11.mlp.up_proj.linear.weight": "model.safetensors", + "vision_tower.encoder.layers.11.mlp.up_proj.output_max": "model.safetensors", + "vision_tower.encoder.layers.11.mlp.up_proj.output_min": "model.safetensors", + "vision_tower.encoder.layers.11.post_attention_layernorm.weight": "model.safetensors", + "vision_tower.encoder.layers.11.post_feedforward_layernorm.weight": "model.safetensors", + "vision_tower.encoder.layers.11.pre_feedforward_layernorm.weight": "model.safetensors", + "vision_tower.encoder.layers.11.self_attn.k_norm.weight": "model.safetensors", + "vision_tower.encoder.layers.11.self_attn.k_proj.input_max": "model.safetensors", + "vision_tower.encoder.layers.11.self_attn.k_proj.input_min": "model.safetensors", + "vision_tower.encoder.layers.11.self_attn.k_proj.linear.weight": "model.safetensors", + "vision_tower.encoder.layers.11.self_attn.k_proj.output_max": "model.safetensors", + "vision_tower.encoder.layers.11.self_attn.k_proj.output_min": "model.safetensors", + "vision_tower.encoder.layers.11.self_attn.o_proj.input_max": "model.safetensors", + "vision_tower.encoder.layers.11.self_attn.o_proj.input_min": "model.safetensors", + "vision_tower.encoder.layers.11.self_attn.o_proj.linear.weight": "model.safetensors", + "vision_tower.encoder.layers.11.self_attn.o_proj.output_max": "model.safetensors", + "vision_tower.encoder.layers.11.self_attn.o_proj.output_min": "model.safetensors", + "vision_tower.encoder.layers.11.self_attn.q_norm.weight": "model.safetensors", + "vision_tower.encoder.layers.11.self_attn.q_proj.input_max": "model.safetensors", + "vision_tower.encoder.layers.11.self_attn.q_proj.input_min": "model.safetensors", + "vision_tower.encoder.layers.11.self_attn.q_proj.linear.weight": "model.safetensors", + "vision_tower.encoder.layers.11.self_attn.q_proj.output_max": "model.safetensors", + "vision_tower.encoder.layers.11.self_attn.q_proj.output_min": "model.safetensors", + "vision_tower.encoder.layers.11.self_attn.v_proj.input_max": "model.safetensors", + "vision_tower.encoder.layers.11.self_attn.v_proj.input_min": "model.safetensors", + "vision_tower.encoder.layers.11.self_attn.v_proj.linear.weight": "model.safetensors", + "vision_tower.encoder.layers.11.self_attn.v_proj.output_max": "model.safetensors", + "vision_tower.encoder.layers.11.self_attn.v_proj.output_min": "model.safetensors", + "vision_tower.encoder.layers.12.input_layernorm.weight": "model.safetensors", + "vision_tower.encoder.layers.12.mlp.down_proj.input_max": "model.safetensors", + "vision_tower.encoder.layers.12.mlp.down_proj.input_min": "model.safetensors", + "vision_tower.encoder.layers.12.mlp.down_proj.linear.weight": "model.safetensors", + "vision_tower.encoder.layers.12.mlp.down_proj.output_max": "model.safetensors", + "vision_tower.encoder.layers.12.mlp.down_proj.output_min": "model.safetensors", + "vision_tower.encoder.layers.12.mlp.gate_proj.input_max": "model.safetensors", + "vision_tower.encoder.layers.12.mlp.gate_proj.input_min": "model.safetensors", + "vision_tower.encoder.layers.12.mlp.gate_proj.linear.weight": "model.safetensors", + "vision_tower.encoder.layers.12.mlp.gate_proj.output_max": "model.safetensors", + "vision_tower.encoder.layers.12.mlp.gate_proj.output_min": "model.safetensors", + "vision_tower.encoder.layers.12.mlp.up_proj.input_max": "model.safetensors", + "vision_tower.encoder.layers.12.mlp.up_proj.input_min": "model.safetensors", + "vision_tower.encoder.layers.12.mlp.up_proj.linear.weight": "model.safetensors", + "vision_tower.encoder.layers.12.mlp.up_proj.output_max": "model.safetensors", + "vision_tower.encoder.layers.12.mlp.up_proj.output_min": "model.safetensors", + "vision_tower.encoder.layers.12.post_attention_layernorm.weight": "model.safetensors", + "vision_tower.encoder.layers.12.post_feedforward_layernorm.weight": "model.safetensors", + "vision_tower.encoder.layers.12.pre_feedforward_layernorm.weight": "model.safetensors", + "vision_tower.encoder.layers.12.self_attn.k_norm.weight": "model.safetensors", + "vision_tower.encoder.layers.12.self_attn.k_proj.input_max": "model.safetensors", + "vision_tower.encoder.layers.12.self_attn.k_proj.input_min": "model.safetensors", + "vision_tower.encoder.layers.12.self_attn.k_proj.linear.weight": "model.safetensors", + "vision_tower.encoder.layers.12.self_attn.k_proj.output_max": "model.safetensors", + "vision_tower.encoder.layers.12.self_attn.k_proj.output_min": "model.safetensors", + "vision_tower.encoder.layers.12.self_attn.o_proj.input_max": "model.safetensors", + "vision_tower.encoder.layers.12.self_attn.o_proj.input_min": "model.safetensors", + "vision_tower.encoder.layers.12.self_attn.o_proj.linear.weight": "model.safetensors", + "vision_tower.encoder.layers.12.self_attn.o_proj.output_max": "model.safetensors", + "vision_tower.encoder.layers.12.self_attn.o_proj.output_min": "model.safetensors", + "vision_tower.encoder.layers.12.self_attn.q_norm.weight": "model.safetensors", + "vision_tower.encoder.layers.12.self_attn.q_proj.input_max": "model.safetensors", + "vision_tower.encoder.layers.12.self_attn.q_proj.input_min": "model.safetensors", + "vision_tower.encoder.layers.12.self_attn.q_proj.linear.weight": "model.safetensors", + "vision_tower.encoder.layers.12.self_attn.q_proj.output_max": "model.safetensors", + "vision_tower.encoder.layers.12.self_attn.q_proj.output_min": "model.safetensors", + "vision_tower.encoder.layers.12.self_attn.v_proj.input_max": "model.safetensors", + "vision_tower.encoder.layers.12.self_attn.v_proj.input_min": "model.safetensors", + "vision_tower.encoder.layers.12.self_attn.v_proj.linear.weight": "model.safetensors", + "vision_tower.encoder.layers.12.self_attn.v_proj.output_max": "model.safetensors", + "vision_tower.encoder.layers.12.self_attn.v_proj.output_min": "model.safetensors", + "vision_tower.encoder.layers.13.input_layernorm.weight": "model.safetensors", + "vision_tower.encoder.layers.13.mlp.down_proj.input_max": "model.safetensors", + "vision_tower.encoder.layers.13.mlp.down_proj.input_min": "model.safetensors", + "vision_tower.encoder.layers.13.mlp.down_proj.linear.weight": "model.safetensors", + "vision_tower.encoder.layers.13.mlp.down_proj.output_max": "model.safetensors", + "vision_tower.encoder.layers.13.mlp.down_proj.output_min": "model.safetensors", + "vision_tower.encoder.layers.13.mlp.gate_proj.input_max": "model.safetensors", + "vision_tower.encoder.layers.13.mlp.gate_proj.input_min": "model.safetensors", + "vision_tower.encoder.layers.13.mlp.gate_proj.linear.weight": "model.safetensors", + "vision_tower.encoder.layers.13.mlp.gate_proj.output_max": "model.safetensors", + "vision_tower.encoder.layers.13.mlp.gate_proj.output_min": "model.safetensors", + "vision_tower.encoder.layers.13.mlp.up_proj.input_max": "model.safetensors", + "vision_tower.encoder.layers.13.mlp.up_proj.input_min": "model.safetensors", + "vision_tower.encoder.layers.13.mlp.up_proj.linear.weight": "model.safetensors", + "vision_tower.encoder.layers.13.mlp.up_proj.output_max": "model.safetensors", + "vision_tower.encoder.layers.13.mlp.up_proj.output_min": "model.safetensors", + "vision_tower.encoder.layers.13.post_attention_layernorm.weight": "model.safetensors", + "vision_tower.encoder.layers.13.post_feedforward_layernorm.weight": "model.safetensors", + "vision_tower.encoder.layers.13.pre_feedforward_layernorm.weight": "model.safetensors", + "vision_tower.encoder.layers.13.self_attn.k_norm.weight": "model.safetensors", + "vision_tower.encoder.layers.13.self_attn.k_proj.input_max": "model.safetensors", + "vision_tower.encoder.layers.13.self_attn.k_proj.input_min": "model.safetensors", + "vision_tower.encoder.layers.13.self_attn.k_proj.linear.weight": "model.safetensors", + "vision_tower.encoder.layers.13.self_attn.k_proj.output_max": "model.safetensors", + "vision_tower.encoder.layers.13.self_attn.k_proj.output_min": "model.safetensors", + "vision_tower.encoder.layers.13.self_attn.o_proj.input_max": "model.safetensors", + "vision_tower.encoder.layers.13.self_attn.o_proj.input_min": "model.safetensors", + "vision_tower.encoder.layers.13.self_attn.o_proj.linear.weight": "model.safetensors", + "vision_tower.encoder.layers.13.self_attn.o_proj.output_max": "model.safetensors", + "vision_tower.encoder.layers.13.self_attn.o_proj.output_min": "model.safetensors", + "vision_tower.encoder.layers.13.self_attn.q_norm.weight": "model.safetensors", + "vision_tower.encoder.layers.13.self_attn.q_proj.input_max": "model.safetensors", + "vision_tower.encoder.layers.13.self_attn.q_proj.input_min": "model.safetensors", + "vision_tower.encoder.layers.13.self_attn.q_proj.linear.weight": "model.safetensors", + "vision_tower.encoder.layers.13.self_attn.q_proj.output_max": "model.safetensors", + "vision_tower.encoder.layers.13.self_attn.q_proj.output_min": "model.safetensors", + "vision_tower.encoder.layers.13.self_attn.v_proj.input_max": "model.safetensors", + "vision_tower.encoder.layers.13.self_attn.v_proj.input_min": "model.safetensors", + "vision_tower.encoder.layers.13.self_attn.v_proj.linear.weight": "model.safetensors", + "vision_tower.encoder.layers.13.self_attn.v_proj.output_max": "model.safetensors", + "vision_tower.encoder.layers.13.self_attn.v_proj.output_min": "model.safetensors", + "vision_tower.encoder.layers.14.input_layernorm.weight": "model.safetensors", + "vision_tower.encoder.layers.14.mlp.down_proj.input_max": "model.safetensors", + "vision_tower.encoder.layers.14.mlp.down_proj.input_min": "model.safetensors", + "vision_tower.encoder.layers.14.mlp.down_proj.linear.weight": "model.safetensors", + "vision_tower.encoder.layers.14.mlp.down_proj.output_max": "model.safetensors", + "vision_tower.encoder.layers.14.mlp.down_proj.output_min": "model.safetensors", + "vision_tower.encoder.layers.14.mlp.gate_proj.input_max": "model.safetensors", + "vision_tower.encoder.layers.14.mlp.gate_proj.input_min": "model.safetensors", + "vision_tower.encoder.layers.14.mlp.gate_proj.linear.weight": "model.safetensors", + "vision_tower.encoder.layers.14.mlp.gate_proj.output_max": "model.safetensors", + "vision_tower.encoder.layers.14.mlp.gate_proj.output_min": "model.safetensors", + "vision_tower.encoder.layers.14.mlp.up_proj.input_max": "model.safetensors", + "vision_tower.encoder.layers.14.mlp.up_proj.input_min": "model.safetensors", + "vision_tower.encoder.layers.14.mlp.up_proj.linear.weight": "model.safetensors", + "vision_tower.encoder.layers.14.mlp.up_proj.output_max": "model.safetensors", + "vision_tower.encoder.layers.14.mlp.up_proj.output_min": "model.safetensors", + "vision_tower.encoder.layers.14.post_attention_layernorm.weight": "model.safetensors", + "vision_tower.encoder.layers.14.post_feedforward_layernorm.weight": "model.safetensors", + "vision_tower.encoder.layers.14.pre_feedforward_layernorm.weight": "model.safetensors", + "vision_tower.encoder.layers.14.self_attn.k_norm.weight": "model.safetensors", + "vision_tower.encoder.layers.14.self_attn.k_proj.input_max": "model.safetensors", + "vision_tower.encoder.layers.14.self_attn.k_proj.input_min": "model.safetensors", + "vision_tower.encoder.layers.14.self_attn.k_proj.linear.weight": "model.safetensors", + "vision_tower.encoder.layers.14.self_attn.k_proj.output_max": "model.safetensors", + "vision_tower.encoder.layers.14.self_attn.k_proj.output_min": "model.safetensors", + "vision_tower.encoder.layers.14.self_attn.o_proj.input_max": "model.safetensors", + "vision_tower.encoder.layers.14.self_attn.o_proj.input_min": "model.safetensors", + "vision_tower.encoder.layers.14.self_attn.o_proj.linear.weight": "model.safetensors", + "vision_tower.encoder.layers.14.self_attn.o_proj.output_max": "model.safetensors", + "vision_tower.encoder.layers.14.self_attn.o_proj.output_min": "model.safetensors", + "vision_tower.encoder.layers.14.self_attn.q_norm.weight": "model.safetensors", + "vision_tower.encoder.layers.14.self_attn.q_proj.input_max": "model.safetensors", + "vision_tower.encoder.layers.14.self_attn.q_proj.input_min": "model.safetensors", + "vision_tower.encoder.layers.14.self_attn.q_proj.linear.weight": "model.safetensors", + "vision_tower.encoder.layers.14.self_attn.q_proj.output_max": "model.safetensors", + "vision_tower.encoder.layers.14.self_attn.q_proj.output_min": "model.safetensors", + "vision_tower.encoder.layers.14.self_attn.v_proj.input_max": "model.safetensors", + "vision_tower.encoder.layers.14.self_attn.v_proj.input_min": "model.safetensors", + "vision_tower.encoder.layers.14.self_attn.v_proj.linear.weight": "model.safetensors", + "vision_tower.encoder.layers.14.self_attn.v_proj.output_max": "model.safetensors", + "vision_tower.encoder.layers.14.self_attn.v_proj.output_min": "model.safetensors", + "vision_tower.encoder.layers.15.input_layernorm.weight": "model.safetensors", + "vision_tower.encoder.layers.15.mlp.down_proj.input_max": "model.safetensors", + "vision_tower.encoder.layers.15.mlp.down_proj.input_min": "model.safetensors", + "vision_tower.encoder.layers.15.mlp.down_proj.linear.weight": "model.safetensors", + "vision_tower.encoder.layers.15.mlp.down_proj.output_max": "model.safetensors", + "vision_tower.encoder.layers.15.mlp.down_proj.output_min": "model.safetensors", + "vision_tower.encoder.layers.15.mlp.gate_proj.input_max": "model.safetensors", + "vision_tower.encoder.layers.15.mlp.gate_proj.input_min": "model.safetensors", + "vision_tower.encoder.layers.15.mlp.gate_proj.linear.weight": "model.safetensors", + "vision_tower.encoder.layers.15.mlp.gate_proj.output_max": "model.safetensors", + "vision_tower.encoder.layers.15.mlp.gate_proj.output_min": "model.safetensors", + "vision_tower.encoder.layers.15.mlp.up_proj.input_max": "model.safetensors", + "vision_tower.encoder.layers.15.mlp.up_proj.input_min": "model.safetensors", + "vision_tower.encoder.layers.15.mlp.up_proj.linear.weight": "model.safetensors", + "vision_tower.encoder.layers.15.mlp.up_proj.output_max": "model.safetensors", + "vision_tower.encoder.layers.15.mlp.up_proj.output_min": "model.safetensors", + "vision_tower.encoder.layers.15.post_attention_layernorm.weight": "model.safetensors", + "vision_tower.encoder.layers.15.post_feedforward_layernorm.weight": "model.safetensors", + "vision_tower.encoder.layers.15.pre_feedforward_layernorm.weight": "model.safetensors", + "vision_tower.encoder.layers.15.self_attn.k_norm.weight": "model.safetensors", + "vision_tower.encoder.layers.15.self_attn.k_proj.input_max": "model.safetensors", + "vision_tower.encoder.layers.15.self_attn.k_proj.input_min": "model.safetensors", + "vision_tower.encoder.layers.15.self_attn.k_proj.linear.weight": "model.safetensors", + "vision_tower.encoder.layers.15.self_attn.k_proj.output_max": "model.safetensors", + "vision_tower.encoder.layers.15.self_attn.k_proj.output_min": "model.safetensors", + "vision_tower.encoder.layers.15.self_attn.o_proj.input_max": "model.safetensors", + "vision_tower.encoder.layers.15.self_attn.o_proj.input_min": "model.safetensors", + "vision_tower.encoder.layers.15.self_attn.o_proj.linear.weight": "model.safetensors", + "vision_tower.encoder.layers.15.self_attn.o_proj.output_max": "model.safetensors", + "vision_tower.encoder.layers.15.self_attn.o_proj.output_min": "model.safetensors", + "vision_tower.encoder.layers.15.self_attn.q_norm.weight": "model.safetensors", + "vision_tower.encoder.layers.15.self_attn.q_proj.input_max": "model.safetensors", + "vision_tower.encoder.layers.15.self_attn.q_proj.input_min": "model.safetensors", + "vision_tower.encoder.layers.15.self_attn.q_proj.linear.weight": "model.safetensors", + "vision_tower.encoder.layers.15.self_attn.q_proj.output_max": "model.safetensors", + "vision_tower.encoder.layers.15.self_attn.q_proj.output_min": "model.safetensors", + "vision_tower.encoder.layers.15.self_attn.v_proj.input_max": "model.safetensors", + "vision_tower.encoder.layers.15.self_attn.v_proj.input_min": "model.safetensors", + "vision_tower.encoder.layers.15.self_attn.v_proj.linear.weight": "model.safetensors", + "vision_tower.encoder.layers.15.self_attn.v_proj.output_max": "model.safetensors", + "vision_tower.encoder.layers.15.self_attn.v_proj.output_min": "model.safetensors", + "vision_tower.encoder.layers.2.input_layernorm.weight": "model.safetensors", + "vision_tower.encoder.layers.2.mlp.down_proj.input_max": "model.safetensors", + "vision_tower.encoder.layers.2.mlp.down_proj.input_min": "model.safetensors", + "vision_tower.encoder.layers.2.mlp.down_proj.linear.weight": "model.safetensors", + "vision_tower.encoder.layers.2.mlp.down_proj.output_max": "model.safetensors", + "vision_tower.encoder.layers.2.mlp.down_proj.output_min": "model.safetensors", + "vision_tower.encoder.layers.2.mlp.gate_proj.input_max": "model.safetensors", + "vision_tower.encoder.layers.2.mlp.gate_proj.input_min": "model.safetensors", + "vision_tower.encoder.layers.2.mlp.gate_proj.linear.weight": "model.safetensors", + "vision_tower.encoder.layers.2.mlp.gate_proj.output_max": "model.safetensors", + "vision_tower.encoder.layers.2.mlp.gate_proj.output_min": "model.safetensors", + "vision_tower.encoder.layers.2.mlp.up_proj.input_max": "model.safetensors", + "vision_tower.encoder.layers.2.mlp.up_proj.input_min": "model.safetensors", + "vision_tower.encoder.layers.2.mlp.up_proj.linear.weight": "model.safetensors", + "vision_tower.encoder.layers.2.mlp.up_proj.output_max": "model.safetensors", + "vision_tower.encoder.layers.2.mlp.up_proj.output_min": "model.safetensors", + "vision_tower.encoder.layers.2.post_attention_layernorm.weight": "model.safetensors", + "vision_tower.encoder.layers.2.post_feedforward_layernorm.weight": "model.safetensors", + "vision_tower.encoder.layers.2.pre_feedforward_layernorm.weight": "model.safetensors", + "vision_tower.encoder.layers.2.self_attn.k_norm.weight": "model.safetensors", + "vision_tower.encoder.layers.2.self_attn.k_proj.input_max": "model.safetensors", + "vision_tower.encoder.layers.2.self_attn.k_proj.input_min": "model.safetensors", + "vision_tower.encoder.layers.2.self_attn.k_proj.linear.weight": "model.safetensors", + "vision_tower.encoder.layers.2.self_attn.k_proj.output_max": "model.safetensors", + "vision_tower.encoder.layers.2.self_attn.k_proj.output_min": "model.safetensors", + "vision_tower.encoder.layers.2.self_attn.o_proj.input_max": "model.safetensors", + "vision_tower.encoder.layers.2.self_attn.o_proj.input_min": "model.safetensors", + "vision_tower.encoder.layers.2.self_attn.o_proj.linear.weight": "model.safetensors", + "vision_tower.encoder.layers.2.self_attn.o_proj.output_max": "model.safetensors", + "vision_tower.encoder.layers.2.self_attn.o_proj.output_min": "model.safetensors", + "vision_tower.encoder.layers.2.self_attn.q_norm.weight": "model.safetensors", + "vision_tower.encoder.layers.2.self_attn.q_proj.input_max": "model.safetensors", + "vision_tower.encoder.layers.2.self_attn.q_proj.input_min": "model.safetensors", + "vision_tower.encoder.layers.2.self_attn.q_proj.linear.weight": "model.safetensors", + "vision_tower.encoder.layers.2.self_attn.q_proj.output_max": "model.safetensors", + "vision_tower.encoder.layers.2.self_attn.q_proj.output_min": "model.safetensors", + "vision_tower.encoder.layers.2.self_attn.v_proj.input_max": "model.safetensors", + "vision_tower.encoder.layers.2.self_attn.v_proj.input_min": "model.safetensors", + "vision_tower.encoder.layers.2.self_attn.v_proj.linear.weight": "model.safetensors", + "vision_tower.encoder.layers.2.self_attn.v_proj.output_max": "model.safetensors", + "vision_tower.encoder.layers.2.self_attn.v_proj.output_min": "model.safetensors", + "vision_tower.encoder.layers.3.input_layernorm.weight": "model.safetensors", + "vision_tower.encoder.layers.3.mlp.down_proj.input_max": "model.safetensors", + "vision_tower.encoder.layers.3.mlp.down_proj.input_min": "model.safetensors", + "vision_tower.encoder.layers.3.mlp.down_proj.linear.weight": "model.safetensors", + "vision_tower.encoder.layers.3.mlp.down_proj.output_max": "model.safetensors", + "vision_tower.encoder.layers.3.mlp.down_proj.output_min": "model.safetensors", + "vision_tower.encoder.layers.3.mlp.gate_proj.input_max": "model.safetensors", + "vision_tower.encoder.layers.3.mlp.gate_proj.input_min": "model.safetensors", + "vision_tower.encoder.layers.3.mlp.gate_proj.linear.weight": "model.safetensors", + "vision_tower.encoder.layers.3.mlp.gate_proj.output_max": "model.safetensors", + "vision_tower.encoder.layers.3.mlp.gate_proj.output_min": "model.safetensors", + "vision_tower.encoder.layers.3.mlp.up_proj.input_max": "model.safetensors", + "vision_tower.encoder.layers.3.mlp.up_proj.input_min": "model.safetensors", + "vision_tower.encoder.layers.3.mlp.up_proj.linear.weight": "model.safetensors", + "vision_tower.encoder.layers.3.mlp.up_proj.output_max": "model.safetensors", + "vision_tower.encoder.layers.3.mlp.up_proj.output_min": "model.safetensors", + "vision_tower.encoder.layers.3.post_attention_layernorm.weight": "model.safetensors", + "vision_tower.encoder.layers.3.post_feedforward_layernorm.weight": "model.safetensors", + "vision_tower.encoder.layers.3.pre_feedforward_layernorm.weight": "model.safetensors", + "vision_tower.encoder.layers.3.self_attn.k_norm.weight": "model.safetensors", + "vision_tower.encoder.layers.3.self_attn.k_proj.input_max": "model.safetensors", + "vision_tower.encoder.layers.3.self_attn.k_proj.input_min": "model.safetensors", + "vision_tower.encoder.layers.3.self_attn.k_proj.linear.weight": "model.safetensors", + "vision_tower.encoder.layers.3.self_attn.k_proj.output_max": "model.safetensors", + "vision_tower.encoder.layers.3.self_attn.k_proj.output_min": "model.safetensors", + "vision_tower.encoder.layers.3.self_attn.o_proj.input_max": "model.safetensors", + "vision_tower.encoder.layers.3.self_attn.o_proj.input_min": "model.safetensors", + "vision_tower.encoder.layers.3.self_attn.o_proj.linear.weight": "model.safetensors", + "vision_tower.encoder.layers.3.self_attn.o_proj.output_max": "model.safetensors", + "vision_tower.encoder.layers.3.self_attn.o_proj.output_min": "model.safetensors", + "vision_tower.encoder.layers.3.self_attn.q_norm.weight": "model.safetensors", + "vision_tower.encoder.layers.3.self_attn.q_proj.input_max": "model.safetensors", + "vision_tower.encoder.layers.3.self_attn.q_proj.input_min": "model.safetensors", + "vision_tower.encoder.layers.3.self_attn.q_proj.linear.weight": "model.safetensors", + "vision_tower.encoder.layers.3.self_attn.q_proj.output_max": "model.safetensors", + "vision_tower.encoder.layers.3.self_attn.q_proj.output_min": "model.safetensors", + "vision_tower.encoder.layers.3.self_attn.v_proj.input_max": "model.safetensors", + "vision_tower.encoder.layers.3.self_attn.v_proj.input_min": "model.safetensors", + "vision_tower.encoder.layers.3.self_attn.v_proj.linear.weight": "model.safetensors", + "vision_tower.encoder.layers.3.self_attn.v_proj.output_max": "model.safetensors", + "vision_tower.encoder.layers.3.self_attn.v_proj.output_min": "model.safetensors", + "vision_tower.encoder.layers.4.input_layernorm.weight": "model.safetensors", + "vision_tower.encoder.layers.4.mlp.down_proj.input_max": "model.safetensors", + "vision_tower.encoder.layers.4.mlp.down_proj.input_min": "model.safetensors", + "vision_tower.encoder.layers.4.mlp.down_proj.linear.weight": "model.safetensors", + "vision_tower.encoder.layers.4.mlp.down_proj.output_max": "model.safetensors", + "vision_tower.encoder.layers.4.mlp.down_proj.output_min": "model.safetensors", + "vision_tower.encoder.layers.4.mlp.gate_proj.input_max": "model.safetensors", + "vision_tower.encoder.layers.4.mlp.gate_proj.input_min": "model.safetensors", + "vision_tower.encoder.layers.4.mlp.gate_proj.linear.weight": "model.safetensors", + "vision_tower.encoder.layers.4.mlp.gate_proj.output_max": "model.safetensors", + "vision_tower.encoder.layers.4.mlp.gate_proj.output_min": "model.safetensors", + "vision_tower.encoder.layers.4.mlp.up_proj.input_max": "model.safetensors", + "vision_tower.encoder.layers.4.mlp.up_proj.input_min": "model.safetensors", + "vision_tower.encoder.layers.4.mlp.up_proj.linear.weight": "model.safetensors", + "vision_tower.encoder.layers.4.mlp.up_proj.output_max": "model.safetensors", + "vision_tower.encoder.layers.4.mlp.up_proj.output_min": "model.safetensors", + "vision_tower.encoder.layers.4.post_attention_layernorm.weight": "model.safetensors", + "vision_tower.encoder.layers.4.post_feedforward_layernorm.weight": "model.safetensors", + "vision_tower.encoder.layers.4.pre_feedforward_layernorm.weight": "model.safetensors", + "vision_tower.encoder.layers.4.self_attn.k_norm.weight": "model.safetensors", + "vision_tower.encoder.layers.4.self_attn.k_proj.input_max": "model.safetensors", + "vision_tower.encoder.layers.4.self_attn.k_proj.input_min": "model.safetensors", + "vision_tower.encoder.layers.4.self_attn.k_proj.linear.weight": "model.safetensors", + "vision_tower.encoder.layers.4.self_attn.k_proj.output_max": "model.safetensors", + "vision_tower.encoder.layers.4.self_attn.k_proj.output_min": "model.safetensors", + "vision_tower.encoder.layers.4.self_attn.o_proj.input_max": "model.safetensors", + "vision_tower.encoder.layers.4.self_attn.o_proj.input_min": "model.safetensors", + "vision_tower.encoder.layers.4.self_attn.o_proj.linear.weight": "model.safetensors", + "vision_tower.encoder.layers.4.self_attn.o_proj.output_max": "model.safetensors", + "vision_tower.encoder.layers.4.self_attn.o_proj.output_min": "model.safetensors", + "vision_tower.encoder.layers.4.self_attn.q_norm.weight": "model.safetensors", + "vision_tower.encoder.layers.4.self_attn.q_proj.input_max": "model.safetensors", + "vision_tower.encoder.layers.4.self_attn.q_proj.input_min": "model.safetensors", + "vision_tower.encoder.layers.4.self_attn.q_proj.linear.weight": "model.safetensors", + "vision_tower.encoder.layers.4.self_attn.q_proj.output_max": "model.safetensors", + "vision_tower.encoder.layers.4.self_attn.q_proj.output_min": "model.safetensors", + "vision_tower.encoder.layers.4.self_attn.v_proj.input_max": "model.safetensors", + "vision_tower.encoder.layers.4.self_attn.v_proj.input_min": "model.safetensors", + "vision_tower.encoder.layers.4.self_attn.v_proj.linear.weight": "model.safetensors", + "vision_tower.encoder.layers.4.self_attn.v_proj.output_max": "model.safetensors", + "vision_tower.encoder.layers.4.self_attn.v_proj.output_min": "model.safetensors", + "vision_tower.encoder.layers.5.input_layernorm.weight": "model.safetensors", + "vision_tower.encoder.layers.5.mlp.down_proj.input_max": "model.safetensors", + "vision_tower.encoder.layers.5.mlp.down_proj.input_min": "model.safetensors", + "vision_tower.encoder.layers.5.mlp.down_proj.linear.weight": "model.safetensors", + "vision_tower.encoder.layers.5.mlp.down_proj.output_max": "model.safetensors", + "vision_tower.encoder.layers.5.mlp.down_proj.output_min": "model.safetensors", + "vision_tower.encoder.layers.5.mlp.gate_proj.input_max": "model.safetensors", + "vision_tower.encoder.layers.5.mlp.gate_proj.input_min": "model.safetensors", + "vision_tower.encoder.layers.5.mlp.gate_proj.linear.weight": "model.safetensors", + "vision_tower.encoder.layers.5.mlp.gate_proj.output_max": "model.safetensors", + "vision_tower.encoder.layers.5.mlp.gate_proj.output_min": "model.safetensors", + "vision_tower.encoder.layers.5.mlp.up_proj.input_max": "model.safetensors", + "vision_tower.encoder.layers.5.mlp.up_proj.input_min": "model.safetensors", + "vision_tower.encoder.layers.5.mlp.up_proj.linear.weight": "model.safetensors", + "vision_tower.encoder.layers.5.mlp.up_proj.output_max": "model.safetensors", + "vision_tower.encoder.layers.5.mlp.up_proj.output_min": "model.safetensors", + "vision_tower.encoder.layers.5.post_attention_layernorm.weight": "model.safetensors", + "vision_tower.encoder.layers.5.post_feedforward_layernorm.weight": "model.safetensors", + "vision_tower.encoder.layers.5.pre_feedforward_layernorm.weight": "model.safetensors", + "vision_tower.encoder.layers.5.self_attn.k_norm.weight": "model.safetensors", + "vision_tower.encoder.layers.5.self_attn.k_proj.input_max": "model.safetensors", + "vision_tower.encoder.layers.5.self_attn.k_proj.input_min": "model.safetensors", + "vision_tower.encoder.layers.5.self_attn.k_proj.linear.weight": "model.safetensors", + "vision_tower.encoder.layers.5.self_attn.k_proj.output_max": "model.safetensors", + "vision_tower.encoder.layers.5.self_attn.k_proj.output_min": "model.safetensors", + "vision_tower.encoder.layers.5.self_attn.o_proj.input_max": "model.safetensors", + "vision_tower.encoder.layers.5.self_attn.o_proj.input_min": "model.safetensors", + "vision_tower.encoder.layers.5.self_attn.o_proj.linear.weight": "model.safetensors", + "vision_tower.encoder.layers.5.self_attn.o_proj.output_max": "model.safetensors", + "vision_tower.encoder.layers.5.self_attn.o_proj.output_min": "model.safetensors", + "vision_tower.encoder.layers.5.self_attn.q_norm.weight": "model.safetensors", + "vision_tower.encoder.layers.5.self_attn.q_proj.input_max": "model.safetensors", + "vision_tower.encoder.layers.5.self_attn.q_proj.input_min": "model.safetensors", + "vision_tower.encoder.layers.5.self_attn.q_proj.linear.weight": "model.safetensors", + "vision_tower.encoder.layers.5.self_attn.q_proj.output_max": "model.safetensors", + "vision_tower.encoder.layers.5.self_attn.q_proj.output_min": "model.safetensors", + "vision_tower.encoder.layers.5.self_attn.v_proj.input_max": "model.safetensors", + "vision_tower.encoder.layers.5.self_attn.v_proj.input_min": "model.safetensors", + "vision_tower.encoder.layers.5.self_attn.v_proj.linear.weight": "model.safetensors", + "vision_tower.encoder.layers.5.self_attn.v_proj.output_max": "model.safetensors", + "vision_tower.encoder.layers.5.self_attn.v_proj.output_min": "model.safetensors", + "vision_tower.encoder.layers.6.input_layernorm.weight": "model.safetensors", + "vision_tower.encoder.layers.6.mlp.down_proj.input_max": "model.safetensors", + "vision_tower.encoder.layers.6.mlp.down_proj.input_min": "model.safetensors", + "vision_tower.encoder.layers.6.mlp.down_proj.linear.weight": "model.safetensors", + "vision_tower.encoder.layers.6.mlp.down_proj.output_max": "model.safetensors", + "vision_tower.encoder.layers.6.mlp.down_proj.output_min": "model.safetensors", + "vision_tower.encoder.layers.6.mlp.gate_proj.input_max": "model.safetensors", + "vision_tower.encoder.layers.6.mlp.gate_proj.input_min": "model.safetensors", + "vision_tower.encoder.layers.6.mlp.gate_proj.linear.weight": "model.safetensors", + "vision_tower.encoder.layers.6.mlp.gate_proj.output_max": "model.safetensors", + "vision_tower.encoder.layers.6.mlp.gate_proj.output_min": "model.safetensors", + "vision_tower.encoder.layers.6.mlp.up_proj.input_max": "model.safetensors", + "vision_tower.encoder.layers.6.mlp.up_proj.input_min": "model.safetensors", + "vision_tower.encoder.layers.6.mlp.up_proj.linear.weight": "model.safetensors", + "vision_tower.encoder.layers.6.mlp.up_proj.output_max": "model.safetensors", + "vision_tower.encoder.layers.6.mlp.up_proj.output_min": "model.safetensors", + "vision_tower.encoder.layers.6.post_attention_layernorm.weight": "model.safetensors", + "vision_tower.encoder.layers.6.post_feedforward_layernorm.weight": "model.safetensors", + "vision_tower.encoder.layers.6.pre_feedforward_layernorm.weight": "model.safetensors", + "vision_tower.encoder.layers.6.self_attn.k_norm.weight": "model.safetensors", + "vision_tower.encoder.layers.6.self_attn.k_proj.input_max": "model.safetensors", + "vision_tower.encoder.layers.6.self_attn.k_proj.input_min": "model.safetensors", + "vision_tower.encoder.layers.6.self_attn.k_proj.linear.weight": "model.safetensors", + "vision_tower.encoder.layers.6.self_attn.k_proj.output_max": "model.safetensors", + "vision_tower.encoder.layers.6.self_attn.k_proj.output_min": "model.safetensors", + "vision_tower.encoder.layers.6.self_attn.o_proj.input_max": "model.safetensors", + "vision_tower.encoder.layers.6.self_attn.o_proj.input_min": "model.safetensors", + "vision_tower.encoder.layers.6.self_attn.o_proj.linear.weight": "model.safetensors", + "vision_tower.encoder.layers.6.self_attn.o_proj.output_max": "model.safetensors", + "vision_tower.encoder.layers.6.self_attn.o_proj.output_min": "model.safetensors", + "vision_tower.encoder.layers.6.self_attn.q_norm.weight": "model.safetensors", + "vision_tower.encoder.layers.6.self_attn.q_proj.input_max": "model.safetensors", + "vision_tower.encoder.layers.6.self_attn.q_proj.input_min": "model.safetensors", + "vision_tower.encoder.layers.6.self_attn.q_proj.linear.weight": "model.safetensors", + "vision_tower.encoder.layers.6.self_attn.q_proj.output_max": "model.safetensors", + "vision_tower.encoder.layers.6.self_attn.q_proj.output_min": "model.safetensors", + "vision_tower.encoder.layers.6.self_attn.v_proj.input_max": "model.safetensors", + "vision_tower.encoder.layers.6.self_attn.v_proj.input_min": "model.safetensors", + "vision_tower.encoder.layers.6.self_attn.v_proj.linear.weight": "model.safetensors", + "vision_tower.encoder.layers.6.self_attn.v_proj.output_max": "model.safetensors", + "vision_tower.encoder.layers.6.self_attn.v_proj.output_min": "model.safetensors", + "vision_tower.encoder.layers.7.input_layernorm.weight": "model.safetensors", + "vision_tower.encoder.layers.7.mlp.down_proj.input_max": "model.safetensors", + "vision_tower.encoder.layers.7.mlp.down_proj.input_min": "model.safetensors", + "vision_tower.encoder.layers.7.mlp.down_proj.linear.weight": "model.safetensors", + "vision_tower.encoder.layers.7.mlp.down_proj.output_max": "model.safetensors", + "vision_tower.encoder.layers.7.mlp.down_proj.output_min": "model.safetensors", + "vision_tower.encoder.layers.7.mlp.gate_proj.input_max": "model.safetensors", + "vision_tower.encoder.layers.7.mlp.gate_proj.input_min": "model.safetensors", + "vision_tower.encoder.layers.7.mlp.gate_proj.linear.weight": "model.safetensors", + "vision_tower.encoder.layers.7.mlp.gate_proj.output_max": "model.safetensors", + "vision_tower.encoder.layers.7.mlp.gate_proj.output_min": "model.safetensors", + "vision_tower.encoder.layers.7.mlp.up_proj.input_max": "model.safetensors", + "vision_tower.encoder.layers.7.mlp.up_proj.input_min": "model.safetensors", + "vision_tower.encoder.layers.7.mlp.up_proj.linear.weight": "model.safetensors", + "vision_tower.encoder.layers.7.mlp.up_proj.output_max": "model.safetensors", + "vision_tower.encoder.layers.7.mlp.up_proj.output_min": "model.safetensors", + "vision_tower.encoder.layers.7.post_attention_layernorm.weight": "model.safetensors", + "vision_tower.encoder.layers.7.post_feedforward_layernorm.weight": "model.safetensors", + "vision_tower.encoder.layers.7.pre_feedforward_layernorm.weight": "model.safetensors", + "vision_tower.encoder.layers.7.self_attn.k_norm.weight": "model.safetensors", + "vision_tower.encoder.layers.7.self_attn.k_proj.input_max": "model.safetensors", + "vision_tower.encoder.layers.7.self_attn.k_proj.input_min": "model.safetensors", + "vision_tower.encoder.layers.7.self_attn.k_proj.linear.weight": "model.safetensors", + "vision_tower.encoder.layers.7.self_attn.k_proj.output_max": "model.safetensors", + "vision_tower.encoder.layers.7.self_attn.k_proj.output_min": "model.safetensors", + "vision_tower.encoder.layers.7.self_attn.o_proj.input_max": "model.safetensors", + "vision_tower.encoder.layers.7.self_attn.o_proj.input_min": "model.safetensors", + "vision_tower.encoder.layers.7.self_attn.o_proj.linear.weight": "model.safetensors", + "vision_tower.encoder.layers.7.self_attn.o_proj.output_max": "model.safetensors", + "vision_tower.encoder.layers.7.self_attn.o_proj.output_min": "model.safetensors", + "vision_tower.encoder.layers.7.self_attn.q_norm.weight": "model.safetensors", + "vision_tower.encoder.layers.7.self_attn.q_proj.input_max": "model.safetensors", + "vision_tower.encoder.layers.7.self_attn.q_proj.input_min": "model.safetensors", + "vision_tower.encoder.layers.7.self_attn.q_proj.linear.weight": "model.safetensors", + "vision_tower.encoder.layers.7.self_attn.q_proj.output_max": "model.safetensors", + "vision_tower.encoder.layers.7.self_attn.q_proj.output_min": "model.safetensors", + "vision_tower.encoder.layers.7.self_attn.v_proj.input_max": "model.safetensors", + "vision_tower.encoder.layers.7.self_attn.v_proj.input_min": "model.safetensors", + "vision_tower.encoder.layers.7.self_attn.v_proj.linear.weight": "model.safetensors", + "vision_tower.encoder.layers.7.self_attn.v_proj.output_max": "model.safetensors", + "vision_tower.encoder.layers.7.self_attn.v_proj.output_min": "model.safetensors", + "vision_tower.encoder.layers.8.input_layernorm.weight": "model.safetensors", + "vision_tower.encoder.layers.8.mlp.down_proj.input_max": "model.safetensors", + "vision_tower.encoder.layers.8.mlp.down_proj.input_min": "model.safetensors", + "vision_tower.encoder.layers.8.mlp.down_proj.linear.weight": "model.safetensors", + "vision_tower.encoder.layers.8.mlp.down_proj.output_max": "model.safetensors", + "vision_tower.encoder.layers.8.mlp.down_proj.output_min": "model.safetensors", + "vision_tower.encoder.layers.8.mlp.gate_proj.input_max": "model.safetensors", + "vision_tower.encoder.layers.8.mlp.gate_proj.input_min": "model.safetensors", + "vision_tower.encoder.layers.8.mlp.gate_proj.linear.weight": "model.safetensors", + "vision_tower.encoder.layers.8.mlp.gate_proj.output_max": "model.safetensors", + "vision_tower.encoder.layers.8.mlp.gate_proj.output_min": "model.safetensors", + "vision_tower.encoder.layers.8.mlp.up_proj.input_max": "model.safetensors", + "vision_tower.encoder.layers.8.mlp.up_proj.input_min": "model.safetensors", + "vision_tower.encoder.layers.8.mlp.up_proj.linear.weight": "model.safetensors", + "vision_tower.encoder.layers.8.mlp.up_proj.output_max": "model.safetensors", + "vision_tower.encoder.layers.8.mlp.up_proj.output_min": "model.safetensors", + "vision_tower.encoder.layers.8.post_attention_layernorm.weight": "model.safetensors", + "vision_tower.encoder.layers.8.post_feedforward_layernorm.weight": "model.safetensors", + "vision_tower.encoder.layers.8.pre_feedforward_layernorm.weight": "model.safetensors", + "vision_tower.encoder.layers.8.self_attn.k_norm.weight": "model.safetensors", + "vision_tower.encoder.layers.8.self_attn.k_proj.input_max": "model.safetensors", + "vision_tower.encoder.layers.8.self_attn.k_proj.input_min": "model.safetensors", + "vision_tower.encoder.layers.8.self_attn.k_proj.linear.weight": "model.safetensors", + "vision_tower.encoder.layers.8.self_attn.k_proj.output_max": "model.safetensors", + "vision_tower.encoder.layers.8.self_attn.k_proj.output_min": "model.safetensors", + "vision_tower.encoder.layers.8.self_attn.o_proj.input_max": "model.safetensors", + "vision_tower.encoder.layers.8.self_attn.o_proj.input_min": "model.safetensors", + "vision_tower.encoder.layers.8.self_attn.o_proj.linear.weight": "model.safetensors", + "vision_tower.encoder.layers.8.self_attn.o_proj.output_max": "model.safetensors", + "vision_tower.encoder.layers.8.self_attn.o_proj.output_min": "model.safetensors", + "vision_tower.encoder.layers.8.self_attn.q_norm.weight": "model.safetensors", + "vision_tower.encoder.layers.8.self_attn.q_proj.input_max": "model.safetensors", + "vision_tower.encoder.layers.8.self_attn.q_proj.input_min": "model.safetensors", + "vision_tower.encoder.layers.8.self_attn.q_proj.linear.weight": "model.safetensors", + "vision_tower.encoder.layers.8.self_attn.q_proj.output_max": "model.safetensors", + "vision_tower.encoder.layers.8.self_attn.q_proj.output_min": "model.safetensors", + "vision_tower.encoder.layers.8.self_attn.v_proj.input_max": "model.safetensors", + "vision_tower.encoder.layers.8.self_attn.v_proj.input_min": "model.safetensors", + "vision_tower.encoder.layers.8.self_attn.v_proj.linear.weight": "model.safetensors", + "vision_tower.encoder.layers.8.self_attn.v_proj.output_max": "model.safetensors", + "vision_tower.encoder.layers.8.self_attn.v_proj.output_min": "model.safetensors", + "vision_tower.encoder.layers.9.input_layernorm.weight": "model.safetensors", + "vision_tower.encoder.layers.9.mlp.down_proj.input_max": "model.safetensors", + "vision_tower.encoder.layers.9.mlp.down_proj.input_min": "model.safetensors", + "vision_tower.encoder.layers.9.mlp.down_proj.linear.weight": "model.safetensors", + "vision_tower.encoder.layers.9.mlp.down_proj.output_max": "model.safetensors", + "vision_tower.encoder.layers.9.mlp.down_proj.output_min": "model.safetensors", + "vision_tower.encoder.layers.9.mlp.gate_proj.input_max": "model.safetensors", + "vision_tower.encoder.layers.9.mlp.gate_proj.input_min": "model.safetensors", + "vision_tower.encoder.layers.9.mlp.gate_proj.linear.weight": "model.safetensors", + "vision_tower.encoder.layers.9.mlp.gate_proj.output_max": "model.safetensors", + "vision_tower.encoder.layers.9.mlp.gate_proj.output_min": "model.safetensors", + "vision_tower.encoder.layers.9.mlp.up_proj.input_max": "model.safetensors", + "vision_tower.encoder.layers.9.mlp.up_proj.input_min": "model.safetensors", + "vision_tower.encoder.layers.9.mlp.up_proj.linear.weight": "model.safetensors", + "vision_tower.encoder.layers.9.mlp.up_proj.output_max": "model.safetensors", + "vision_tower.encoder.layers.9.mlp.up_proj.output_min": "model.safetensors", + "vision_tower.encoder.layers.9.post_attention_layernorm.weight": "model.safetensors", + "vision_tower.encoder.layers.9.post_feedforward_layernorm.weight": "model.safetensors", + "vision_tower.encoder.layers.9.pre_feedforward_layernorm.weight": "model.safetensors", + "vision_tower.encoder.layers.9.self_attn.k_norm.weight": "model.safetensors", + "vision_tower.encoder.layers.9.self_attn.k_proj.input_max": "model.safetensors", + "vision_tower.encoder.layers.9.self_attn.k_proj.input_min": "model.safetensors", + "vision_tower.encoder.layers.9.self_attn.k_proj.linear.weight": "model.safetensors", + "vision_tower.encoder.layers.9.self_attn.k_proj.output_max": "model.safetensors", + "vision_tower.encoder.layers.9.self_attn.k_proj.output_min": "model.safetensors", + "vision_tower.encoder.layers.9.self_attn.o_proj.input_max": "model.safetensors", + "vision_tower.encoder.layers.9.self_attn.o_proj.input_min": "model.safetensors", + "vision_tower.encoder.layers.9.self_attn.o_proj.linear.weight": "model.safetensors", + "vision_tower.encoder.layers.9.self_attn.o_proj.output_max": "model.safetensors", + "vision_tower.encoder.layers.9.self_attn.o_proj.output_min": "model.safetensors", + "vision_tower.encoder.layers.9.self_attn.q_norm.weight": "model.safetensors", + "vision_tower.encoder.layers.9.self_attn.q_proj.input_max": "model.safetensors", + "vision_tower.encoder.layers.9.self_attn.q_proj.input_min": "model.safetensors", + "vision_tower.encoder.layers.9.self_attn.q_proj.linear.weight": "model.safetensors", + "vision_tower.encoder.layers.9.self_attn.q_proj.output_max": "model.safetensors", + "vision_tower.encoder.layers.9.self_attn.q_proj.output_min": "model.safetensors", + "vision_tower.encoder.layers.9.self_attn.v_proj.input_max": "model.safetensors", + "vision_tower.encoder.layers.9.self_attn.v_proj.input_min": "model.safetensors", + "vision_tower.encoder.layers.9.self_attn.v_proj.linear.weight": "model.safetensors", + "vision_tower.encoder.layers.9.self_attn.v_proj.output_max": "model.safetensors", + "vision_tower.encoder.layers.9.self_attn.v_proj.output_min": "model.safetensors", + "vision_tower.patch_embedder.input_proj.weight": "model.safetensors", + "vision_tower.patch_embedder.position_embedding_table": "model.safetensors" + } +} \ No newline at end of file diff --git a/chat/mlx/mlx-community/gemma-4-e2b-it-4bit/processor_config.json b/chat/mlx/mlx-community/gemma-4-e2b-it-4bit/processor_config.json new file mode 100644 index 0000000..13e92a4 --- /dev/null +++ b/chat/mlx/mlx-community/gemma-4-e2b-it-4bit/processor_config.json @@ -0,0 +1,42 @@ +{ + "audio_seq_length": 750, + "image_processor": { + "do_convert_rgb": true, + "do_normalize": false, + "do_rescale": true, + "do_resize": true, + "image_mean": [ + 0.0, + 0.0, + 0.0 + ], + "image_processor_type": "Gemma4ImageProcessor", + "image_seq_length": 280, + "image_std": [ + 1.0, + 1.0, + 1.0 + ], + "max_soft_tokens": 280, + "patch_size": 16, + "pooling_kernel_size": 3, + "resample": 3, + "rescale_factor": 0.00392156862745098, + "size": { + "height": 224, + "width": 224 + } + }, + "image_seq_length": 280, + "processor_class": "Gemma4Processor", + "feature_extractor": { + "feature_extractor_type": "Gemma4AudioFeatureExtractor", + "sampling_rate": 16000, + "num_mel_filters": 128, + "fft_length": 512, + "hop_length": 160, + "chunk_duration": 8.0, + "overlap_duration": 1.0 + }, + "audio_ms_per_token": 40 +} \ No newline at end of file diff --git a/chat/mlx/mlx-community/gemma-4-e2b-it-4bit/tokenizer.json b/chat/mlx/mlx-community/gemma-4-e2b-it-4bit/tokenizer.json new file mode 100644 index 0000000..1ff9f3e --- /dev/null +++ b/chat/mlx/mlx-community/gemma-4-e2b-it-4bit/tokenizer.json @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:cc8d3a0ce36466ccc1278bf987df5f71db1719b9ca6b4118264f45cb627bfe0f +size 32169626 diff --git a/chat/mlx/mlx-community/gemma-4-e2b-it-4bit/tokenizer_config.json b/chat/mlx/mlx-community/gemma-4-e2b-it-4bit/tokenizer_config.json new file mode 100644 index 0000000..375b25d --- /dev/null +++ b/chat/mlx/mlx-community/gemma-4-e2b-it-4bit/tokenizer_config.json @@ -0,0 +1,74 @@ +{ + "audio_token": "<|audio|>", + "backend": "tokenizers", + "boa_token": "<|audio>", + "boi_token": "<|image>", + "bos_token": "", + "eoa_token": "", + "eoc_token": "", + "eoi_token": "", + "eos_token": "", + "eot_token": "", + "escape_token": "<|\"|>", + "etc_token": "", + "etd_token": "", + "etr_token": "", + "extra_special_tokens": [ + "<|video|>" + ], + "image_token": "<|image|>", + "mask_token": "", + "model_max_length": 1000000000000000019884624838656, + "pad_token": "", + "padding_side": "left", + "processor_class": "Gemma4Processor", + "response_schema": { + "type": "object", + "properties": { + "role": { + "const": "assistant" + }, + "thinking": { + "type": "string" + }, + "content": { + "type": "string" + }, + "tool_calls": { + "x-regex-iterator": "<\\|tool_call>(.*?)", + "type": "array", + "items": { + "type": "object", + "properties": { + "type": { + "const": "function" + }, + "function": { + "type": "object", + "x-regex": "call\\:(?P\\w+)(?P\\{.*\\})", + "properties": { + "name": { + "type": "string" + }, + "arguments": { + "type": "object", + "x-parser": "gemma4-tool-call", + "additionalProperties": {} + } + } + } + } + } + } + }, + "x-regex": "(\\<\\|channel\\>thought\\n(?P.*?)\\)?(?P\\<\\|tool_call\\>.*\\)?(?P(?:(?!\\)(?!\\<\\|tool_response\\>).)+)?(?:\\|\\<\\|tool_response\\>)?" + }, + "soc_token": "<|channel>", + "sot_token": "<|turn>", + "stc_token": "<|tool_call>", + "std_token": "<|tool>", + "str_token": "<|tool_response>", + "think_token": "<|think|>", + "tokenizer_class": "GemmaTokenizer", + "unk_token": "" +} diff --git a/chat/mlx/mlx-community/gemma-4-e4b-it-4bit/.gitattributes b/chat/mlx/mlx-community/gemma-4-e4b-it-4bit/.gitattributes new file mode 100644 index 0000000..52373fe --- /dev/null +++ b/chat/mlx/mlx-community/gemma-4-e4b-it-4bit/.gitattributes @@ -0,0 +1,36 @@ +*.7z filter=lfs diff=lfs merge=lfs -text +*.arrow filter=lfs diff=lfs merge=lfs -text +*.bin filter=lfs diff=lfs merge=lfs -text +*.bz2 filter=lfs diff=lfs merge=lfs -text +*.ckpt filter=lfs diff=lfs merge=lfs -text +*.ftz filter=lfs diff=lfs merge=lfs -text +*.gz filter=lfs diff=lfs merge=lfs -text +*.h5 filter=lfs diff=lfs merge=lfs -text +*.joblib filter=lfs diff=lfs merge=lfs -text +*.lfs.* filter=lfs diff=lfs merge=lfs -text +*.mlmodel filter=lfs diff=lfs merge=lfs -text +*.model filter=lfs diff=lfs merge=lfs -text +*.msgpack filter=lfs diff=lfs merge=lfs -text +*.npy filter=lfs diff=lfs merge=lfs -text +*.npz filter=lfs diff=lfs merge=lfs -text +*.onnx filter=lfs diff=lfs merge=lfs -text +*.ot filter=lfs diff=lfs merge=lfs -text +*.parquet filter=lfs diff=lfs merge=lfs -text +*.pb filter=lfs diff=lfs merge=lfs -text +*.pickle filter=lfs diff=lfs merge=lfs -text +*.pkl filter=lfs diff=lfs merge=lfs -text +*.pt filter=lfs diff=lfs merge=lfs -text +*.pth filter=lfs diff=lfs merge=lfs -text +*.rar filter=lfs diff=lfs merge=lfs -text +*.safetensors filter=lfs diff=lfs merge=lfs -text +saved_model/**/* filter=lfs diff=lfs merge=lfs -text +*.tar.* filter=lfs diff=lfs merge=lfs -text +*.tar filter=lfs diff=lfs merge=lfs -text +*.tflite filter=lfs diff=lfs merge=lfs -text +*.tgz filter=lfs diff=lfs merge=lfs -text +*.wasm filter=lfs diff=lfs merge=lfs -text +*.xz filter=lfs diff=lfs merge=lfs -text +*.zip filter=lfs diff=lfs merge=lfs -text +*.zst filter=lfs diff=lfs merge=lfs -text +*tfevents* filter=lfs diff=lfs merge=lfs -text +tokenizer.json filter=lfs diff=lfs merge=lfs -text diff --git a/chat/mlx/mlx-community/gemma-4-e4b-it-4bit/README.md b/chat/mlx/mlx-community/gemma-4-e4b-it-4bit/README.md new file mode 100644 index 0000000..c33c32d --- /dev/null +++ b/chat/mlx/mlx-community/gemma-4-e4b-it-4bit/README.md @@ -0,0 +1,25 @@ +--- +library_name: mlx +license: apache-2.0 +license_link: https://ai.google.dev/gemma/docs/gemma_4_license +pipeline_tag: any-to-any +base_model: google/gemma-4-e4b-it +tags: +- mlx +--- + +# mlx-community/gemma-4-e4b-it-4bit + +This model was converted to MLX format from [`google/gemma-4-e4b-it`](https://huggingface.co/google/gemma-4-e4b-it) +using mlx-vlm version **0.4.3**. +Refer to the [original model card](https://huggingface.co/google/gemma-4-e4b-it) for more details on the model. + +## Use with mlx + +```bash +pip install -U mlx-vlm +``` + +```bash +python -m mlx_vlm.generate --model mlx-community/gemma-4-e4b-it-4bit --max-tokens 100 --temperature 0.0 --prompt "Describe this image." --image +``` diff --git a/chat/mlx/mlx-community/gemma-4-e4b-it-4bit/chat_template.jinja b/chat/mlx/mlx-community/gemma-4-e4b-it-4bit/chat_template.jinja new file mode 100644 index 0000000..c19999a --- /dev/null +++ b/chat/mlx/mlx-community/gemma-4-e4b-it-4bit/chat_template.jinja @@ -0,0 +1,360 @@ +{%- macro format_parameters(properties, required, filter_keys=false) -%} + {%- set standard_keys = ['description', 'type', 'properties', 'required', 'nullable'] -%} + {%- set ns = namespace(found_first=false) -%} + {%- for key, value in properties | dictsort -%} + {%- set add_comma = false -%} + {%- if not filter_keys or key not in standard_keys -%} + {%- if ns.found_first %},{% endif -%} + {%- set ns.found_first = true -%} + {{ key }}:{ + {%- if value['description'] -%} + description:<|"|>{{ value['description'] }}<|"|> + {%- set add_comma = true -%} + {%- endif -%} + {%- if value['type'] | upper == 'STRING' -%} + {%- if value['enum'] -%} + {%- if add_comma %},{%- else -%} {%- set add_comma = true -%} {% endif -%} + enum:{{ format_argument(value['enum']) }} + {%- endif -%} + {%- elif value['type'] | upper == 'ARRAY' -%} + {%- if value['items'] is mapping and value['items'] -%} + {%- if add_comma %},{%- else -%} {%- set add_comma = true -%} {% endif -%} + items:{ + {%- set ns_items = namespace(found_first=false) -%} + {%- for item_key, item_value in value['items'] | dictsort -%} + {%- if item_value is not none -%} + {%- if ns_items.found_first %},{% endif -%} + {%- set ns_items.found_first = true -%} + {%- if item_key == 'properties' -%} + properties:{ + {%- if item_value is mapping -%} + {{- format_parameters(item_value, value['items']['required'] | default([])) -}} + {%- endif -%} + } + {%- elif item_key == 'required' -%} + required:[ + {%- for req_item in item_value -%} + <|"|>{{- req_item -}}<|"|> + {%- if not loop.last %},{% endif -%} + {%- endfor -%} + ] + {%- elif item_key == 'type' -%} + {%- if item_value is string -%} + type:{{ format_argument(item_value | upper) }} + {%- else -%} + type:{{ format_argument(item_value | map('upper') | list) }} + {%- endif -%} + {%- else -%} + {{ item_key }}:{{ format_argument(item_value) }} + {%- endif -%} + {%- endif -%} + {%- endfor -%} + } + {%- endif -%} + {%- endif -%} + {%- if value['nullable'] %} + {%- if add_comma %},{%- else -%} {%- set add_comma = true -%} {% endif -%} + nullable:true + {%- endif -%} + {%- if value['type'] | upper == 'OBJECT' -%} + {%- if value['properties'] is defined and value['properties'] is mapping -%} + {%- if add_comma %},{%- else -%} {%- set add_comma = true -%} {% endif -%} + properties:{ + {{- format_parameters(value['properties'], value['required'] | default([])) -}} + } + {%- elif value is mapping -%} + {%- if add_comma %},{%- else -%} {%- set add_comma = true -%} {% endif -%} + properties:{ + {{- format_parameters(value, value['required'] | default([]), filter_keys=true) -}} + } + {%- endif -%} + {%- if value['required'] -%} + {%- if add_comma %},{%- else -%} {%- set add_comma = true -%} {% endif -%} + required:[ + {%- for item in value['required'] | default([]) -%} + <|"|>{{- item -}}<|"|> + {%- if not loop.last %},{% endif -%} + {%- endfor -%} + ] + {%- endif -%} + {%- endif -%} + {%- if add_comma %},{%- else -%} {%- set add_comma = true -%} {% endif -%} + type:<|"|>{{ value['type'] | upper }}<|"|>} + {%- endif -%} + {%- endfor -%} +{%- endmacro -%} +{%- macro format_function_declaration(tool_data) -%} + declaration:{{- tool_data['function']['name'] -}}{description:<|"|>{{- tool_data['function']['description'] -}}<|"|> + {%- set params = tool_data['function']['parameters'] -%} + {%- if params -%} + ,parameters:{ + {%- if params['properties'] -%} + properties:{ {{- format_parameters(params['properties'], params['required']) -}} }, + {%- endif -%} + {%- if params['required'] -%} + required:[ + {%- for item in params['required'] -%} + <|"|>{{- item -}}<|"|> + {{- ',' if not loop.last -}} + {%- endfor -%} + ], + {%- endif -%} + {%- if params['type'] -%} + type:<|"|>{{- params['type'] | upper -}}<|"|>} + {%- endif -%} + {%- endif -%} + {%- if 'response' in tool_data['function'] -%} + {%- set response_declaration = tool_data['function']['response'] -%} + ,response:{ + {%- if response_declaration['description'] -%} + description:<|"|>{{- response_declaration['description'] -}}<|"|>, + {%- endif -%} + {%- if response_declaration['type'] | upper == 'OBJECT' -%} + type:<|"|>{{- response_declaration['type'] | upper -}}<|"|>} + {%- endif -%} + {%- endif -%} + } +{%- endmacro -%} +{%- macro format_argument(argument, escape_keys=True) -%} + {%- if argument is string -%} + {{- '<|"|>' + argument + '<|"|>' -}} + {%- elif argument is boolean -%} + {{- 'true' if argument else 'false' -}} + {%- elif argument is mapping -%} + {{- '{' -}} + {%- set ns = namespace(found_first=false) -%} + {%- for key, value in argument | dictsort -%} + {%- if ns.found_first %},{% endif -%} + {%- set ns.found_first = true -%} + {%- if escape_keys -%} + {{- '<|"|>' + key + '<|"|>' -}} + {%- else -%} + {{- key -}} + {%- endif -%} + :{{- format_argument(value, escape_keys=escape_keys) -}} + {%- endfor -%} + {{- '}' -}} + {%- elif argument is sequence -%} + {{- '[' -}} + {%- for item in argument -%} + {{- format_argument(item, escape_keys=escape_keys) -}} + {%- if not loop.last %},{% endif -%} + {%- endfor -%} + {{- ']' -}} + {%- else -%} + {{- argument -}} + {%- endif -%} +{%- endmacro -%} +{%- macro strip_thinking(text) -%} + {%- set ns = namespace(result='') -%} + {%- for part in text.split('') -%} + {%- if '<|channel>' in part -%} + {%- set ns.result = ns.result + part.split('<|channel>')[0] -%} + {%- else -%} + {%- set ns.result = ns.result + part -%} + {%- endif -%} + {%- endfor -%} + {{- ns.result | trim -}} +{%- endmacro -%} + +{%- macro format_tool_response_block(tool_name, response) -%} + {{- '<|tool_response>' -}} + {%- if response is mapping -%} + {{- 'response:' + tool_name + '{' -}} + {%- for key, value in response | dictsort -%} + {{- key -}}:{{- format_argument(value, escape_keys=False) -}} + {%- if not loop.last %},{% endif -%} + {%- endfor -%} + {{- '}' -}} + {%- else -%} + {{- 'response:' + tool_name + '{value:' + format_argument(response, escape_keys=False) + '}' -}} + {%- endif -%} + {{- '' -}} +{%- endmacro -%} + +{%- set ns = namespace(prev_message_type=None) -%} +{%- set loop_messages = messages -%} +{{- bos_token -}} +{#- Handle System/Tool Definitions Block -#} +{%- if (enable_thinking is defined and enable_thinking) or tools or messages[0]['role'] in ['system', 'developer'] -%} + {{- '<|turn>system\n' -}} + {#- Inject Thinking token at the very top of the FIRST system turn -#} + {%- if enable_thinking is defined and enable_thinking -%} + {{- '<|think|>\n' -}} + {%- set ns.prev_message_type = 'think' -%} + {%- endif -%} + {%- if messages[0]['role'] in ['system', 'developer'] -%} + {%- if messages[0]['content'] is string -%} + {{- messages[0]['content'] | trim -}} + {%- elif messages[0]['content'] is sequence -%} + {%- for item in messages[0]['content'] -%} + {{- item['text'] | trim + ' '-}} + {%- endfor -%} + {%- endif -%} + {%- set loop_messages = messages[1:] -%} + {%- endif -%} + {%- if tools -%} + {%- for tool in tools %} + {{- '<|tool>' -}} + {{- format_function_declaration(tool) | trim -}} + {{- '' -}} + {%- endfor %} + {%- set ns.prev_message_type = 'tool' -%} + {%- endif -%} + {{- '\n' -}} +{%- endif %} + +{#- Pre-scan: find last user message index for reasoning guard -#} +{%- set ns_turn = namespace(last_user_idx=-1) -%} +{%- for i in range(loop_messages | length) -%} + {%- if loop_messages[i]['role'] == 'user' -%} + {%- set ns_turn.last_user_idx = i -%} + {%- endif -%} +{%- endfor -%} + +{#- Loop through messages -#} +{%- for message in loop_messages -%} + {%- if message['role'] != 'tool' -%} + {%- set ns.prev_message_type = None -%} + {%- set role = 'model' if message['role'] == 'assistant' else message['role'] -%} + {#- Detect continuation: suppress duplicate <|turn>model when previous non-tool message was also assistant -#} + {%- set prev_nt = namespace(role=None, found=false) -%} + {%- if loop.index0 > 0 -%} + {%- for j in range(loop.index0 - 1, -1, -1) -%} + {%- if not prev_nt.found -%} + {%- if loop_messages[j]['role'] != 'tool' -%} + {%- set prev_nt.role = loop_messages[j]['role'] -%} + {%- set prev_nt.found = true -%} + {%- endif -%} + {%- endif -%} + {%- endfor -%} + {%- endif -%} + {%- set continue_same_model_turn = (role == 'model' and prev_nt.role == 'assistant') -%} + {%- if not continue_same_model_turn -%} + {{- '<|turn>' + role + '\n' }} + {%- endif -%} + + {#- Render reasoning/reasoning_content as thinking channel -#} + {%- set thinking_text = message.get('reasoning') or message.get('reasoning_content') -%} + {%- if thinking_text and loop.index0 > ns_turn.last_user_idx and message.get('tool_calls') -%} + {{- '<|channel>thought\n' + thinking_text + '\n' -}} + {%- endif -%} + + {%- if message['tool_calls'] -%} + {%- for tool_call in message['tool_calls'] -%} + {%- set function = tool_call['function'] -%} + {{- '<|tool_call>call:' + function['name'] + '{' -}} + {%- if function['arguments'] is mapping -%} + {%- set ns_args = namespace(found_first=false) -%} + {%- for key, value in function['arguments'] | dictsort -%} + {%- if ns_args.found_first %},{% endif -%} + {%- set ns_args.found_first = true -%} + {{- key -}}:{{- format_argument(value, escape_keys=False) -}} + {%- endfor -%} + {%- elif function['arguments'] is string -%} + {{- function['arguments'] -}} + {%- endif -%} + {{- '}' -}} + {%- endfor -%} + {%- set ns.prev_message_type = 'tool_call' -%} + {%- endif -%} + + {%- set ns_tr_out = namespace(flag=false) -%} + {%- if message.get('tool_responses') -%} + {#- Legacy: tool_responses embedded on the assistant message (Google/Gemma native) -#} + {%- for tool_response in message['tool_responses'] -%} + {{- format_tool_response_block(tool_response['name'] | default('unknown'), tool_response['response']) -}} + {%- set ns_tr_out.flag = true -%} + {%- set ns.prev_message_type = 'tool_response' -%} + {%- endfor -%} + {%- elif message.get('tool_calls') -%} + {#- OpenAI Chat Completions: forward-scan consecutive role:tool messages -#} + {%- set ns_tool_scan = namespace(stopped=false) -%} + {%- for k in range(loop.index0 + 1, loop_messages | length) -%} + {%- if ns_tool_scan.stopped -%} + {%- elif loop_messages[k]['role'] != 'tool' -%} + {%- set ns_tool_scan.stopped = true -%} + {%- else -%} + {%- set follow = loop_messages[k] -%} + {#- Resolve tool_call_id to function name -#} + {%- set ns_tname = namespace(name=follow.get('name') | default('unknown')) -%} + {%- for tc in message['tool_calls'] -%} + {%- if tc.get('id') == follow.get('tool_call_id') -%} + {%- set ns_tname.name = tc['function']['name'] -%} + {%- endif -%} + {%- endfor -%} + {#- Handle content as string or content-parts array -#} + {%- set tool_body = follow.get('content') -%} + {%- if tool_body is string -%} + {{- format_tool_response_block(ns_tname.name, tool_body) -}} + {%- elif tool_body is sequence and tool_body is not string -%} + {%- set ns_txt = namespace(s='') -%} + {%- for part in tool_body -%} + {%- if part.get('type') == 'text' -%} + {%- set ns_txt.s = ns_txt.s + (part.get('text') | default('')) -%} + {%- endif -%} + {%- endfor -%} + {{- format_tool_response_block(ns_tname.name, ns_txt.s) -}} + {%- for part in tool_body -%} + {%- if part.get('type') == 'image' -%} + {{- '<|image|>' -}} + {%- elif part.get('type') == 'audio' -%} + {{- '<|audio|>' -}} + {%- elif part.get('type') == 'video' -%} + {{- '<|video|>' -}} + {%- endif -%} + {%- endfor -%} + {%- else -%} + {{- format_tool_response_block(ns_tname.name, tool_body) -}} + {%- endif -%} + {%- set ns_tr_out.flag = true -%} + {%- set ns.prev_message_type = 'tool_response' -%} + {%- endif -%} + {%- endfor -%} + {%- endif -%} + + {%- set captured_content -%} + {%- if message['content'] is string -%} + {%- if role == 'model' -%} + {{- strip_thinking(message['content']) -}} + {%- else -%} + {{- message['content'] | trim -}} + {%- endif -%} + {%- elif message['content'] is sequence -%} + {%- for item in message['content'] -%} + {%- if item['type'] == 'text' -%} + {%- if role == 'model' -%} + {{- strip_thinking(item['text']) -}} + {%- else -%} + {{- item['text'] | trim -}} + {%- endif -%} + {%- elif item['type'] == 'image' -%} + {{- '<|image|>' -}} + {%- set ns.prev_message_type = 'image' -%} + {%- elif item['type'] == 'audio' -%} + {{- '<|audio|>' -}} + {%- set ns.prev_message_type = 'audio' -%} + {%- elif item['type'] == 'video' -%} + {{- '<|video|>' -}} + {%- set ns.prev_message_type = 'video' -%} + {%- endif -%} + {%- endfor -%} + {%- endif -%} + {%- endset -%} + + {{- captured_content -}} + {%- set has_content = captured_content | trim | length > 0 -%} + + {%- if ns.prev_message_type == 'tool_call' and not ns_tr_out.flag -%} + {{- '<|tool_response>' -}} + {%- elif not (ns_tr_out.flag and not has_content) -%} + {{- '\n' -}} + {%- endif -%} + {%- endif -%} +{%- endfor -%} + +{%- if add_generation_prompt -%} + {%- if ns.prev_message_type != 'tool_response' and ns.prev_message_type != 'tool_call' -%} + {{- '<|turn>model\n' -}} + {%- endif -%} +{%- endif -%} \ No newline at end of file diff --git a/chat/mlx/mlx-community/gemma-4-e4b-it-4bit/config.json b/chat/mlx/mlx-community/gemma-4-e4b-it-4bit/config.json new file mode 100644 index 0000000..2bd7183 --- /dev/null +++ b/chat/mlx/mlx-community/gemma-4-e4b-it-4bit/config.json @@ -0,0 +1,208 @@ +{ + "architectures": [ + "Gemma4ForConditionalGeneration" + ], + "audio_config": { + "_name_or_path": "", + "architectures": null, + "attention_chunk_size": 12, + "attention_context_left": 13, + "attention_context_right": 0, + "attention_invalid_logits_value": -1000000000.0, + "attention_logit_cap": 50.0, + "chunk_size_feed_forward": 0, + "conv_kernel_size": 5, + "dtype": "bfloat16", + "gradient_clipping": 10000000000.0, + "hidden_act": "silu", + "hidden_size": 1024, + "id2label": { + "0": "LABEL_0", + "1": "LABEL_1" + }, + "initializer_range": 0.02, + "is_encoder_decoder": false, + "label2id": { + "LABEL_0": 0, + "LABEL_1": 1 + }, + "model_type": "gemma4_audio", + "num_attention_heads": 8, + "num_hidden_layers": 12, + "output_attentions": false, + "output_hidden_states": false, + "output_proj_dims": 1536, + "problem_type": null, + "residual_weight": 0.5, + "return_dict": true, + "rms_norm_eps": 1e-06, + "subsampling_conv_channels": [ + 128, + 32 + ], + "use_clipped_linears": true + }, + "audio_token_id": 258881, + "boa_token_id": 256000, + "boi_token_id": 255999, + "dtype": "bfloat16", + "eoa_token_id": 258883, + "eoa_token_index": 258883, + "eoi_token_id": 258882, + "eos_token_id": [ + 1, + 106, + 50 + ], + "image_token_id": 258880, + "initializer_range": 0.02, + "model_type": "gemma4", + "quantization": { + "group_size": 64, + "bits": 4, + "mode": "affine" + }, + "quantization_config": { + "group_size": 64, + "bits": 4, + "mode": "affine" + }, + "text_config": { + "attention_bias": false, + "attention_dropout": 0.0, + "attention_k_eq_v": false, + "bos_token_id": 2, + "dtype": "bfloat16", + "enable_moe_block": false, + "eos_token_id": 1, + "expert_intermediate_size": null, + "final_logit_softcapping": 30.0, + "global_head_dim": 512, + "head_dim": 256, + "hidden_activation": "gelu_pytorch_tanh", + "hidden_size": 2560, + "hidden_size_per_layer_input": 256, + "initializer_range": 0.02, + "intermediate_size": 10240, + "layer_types": [ + "sliding_attention", + "sliding_attention", + "sliding_attention", + "sliding_attention", + "sliding_attention", + "full_attention", + "sliding_attention", + "sliding_attention", + "sliding_attention", + "sliding_attention", + "sliding_attention", + "full_attention", + "sliding_attention", + "sliding_attention", + "sliding_attention", + "sliding_attention", + "sliding_attention", + "full_attention", + "sliding_attention", + "sliding_attention", + "sliding_attention", + "sliding_attention", + "sliding_attention", + "full_attention", + "sliding_attention", + "sliding_attention", + "sliding_attention", + "sliding_attention", + "sliding_attention", + "full_attention", + "sliding_attention", + "sliding_attention", + "sliding_attention", + "sliding_attention", + "sliding_attention", + "full_attention", + "sliding_attention", + "sliding_attention", + "sliding_attention", + "sliding_attention", + "sliding_attention", + "full_attention" + ], + "max_position_embeddings": 131072, + "model_type": "gemma4_text", + "num_attention_heads": 8, + "num_experts": null, + "num_global_key_value_heads": null, + "num_hidden_layers": 42, + "num_key_value_heads": 2, + "num_kv_shared_layers": 18, + "pad_token_id": 0, + "rms_norm_eps": 1e-06, + "rope_parameters": { + "full_attention": { + "partial_rotary_factor": 0.25, + "rope_theta": 1000000.0, + "rope_type": "proportional" + }, + "sliding_attention": { + "rope_theta": 10000.0, + "rope_type": "default" + } + }, + "sliding_window": 512, + "tie_word_embeddings": true, + "top_k_experts": null, + "use_bidirectional_attention": null, + "use_cache": true, + "use_double_wide_mlp": false, + "vocab_size": 262144, + "vocab_size_per_layer_input": 262144 + }, + "tie_word_embeddings": true, + "transformers_version": "5.5.0.dev0", + "video_token_id": 258884, + "vision_config": { + "_name_or_path": "", + "architectures": null, + "attention_bias": false, + "attention_dropout": 0.0, + "chunk_size_feed_forward": 0, + "default_output_length": 280, + "dtype": "bfloat16", + "global_head_dim": 64, + "head_dim": 64, + "hidden_activation": "gelu_pytorch_tanh", + "hidden_size": 768, + "id2label": { + "0": "LABEL_0", + "1": "LABEL_1" + }, + "initializer_range": 0.02, + "intermediate_size": 3072, + "is_encoder_decoder": false, + "label2id": { + "LABEL_0": 0, + "LABEL_1": 1 + }, + "max_position_embeddings": 131072, + "model_type": "gemma4_vision", + "num_attention_heads": 12, + "num_hidden_layers": 16, + "num_key_value_heads": 12, + "output_attentions": false, + "output_hidden_states": false, + "patch_size": 16, + "pooling_kernel_size": 3, + "position_embedding_size": 10240, + "problem_type": null, + "return_dict": true, + "rms_norm_eps": 1e-06, + "rope_parameters": { + "rope_theta": 100.0, + "rope_type": "default" + }, + "standardize": false, + "use_clipped_linears": true + }, + "vision_soft_tokens_per_image": 280 +} \ No newline at end of file diff --git a/chat/mlx/mlx-community/gemma-4-e4b-it-4bit/generation_config.json b/chat/mlx/mlx-community/gemma-4-e4b-it-4bit/generation_config.json new file mode 100644 index 0000000..e605bb4 --- /dev/null +++ b/chat/mlx/mlx-community/gemma-4-e4b-it-4bit/generation_config.json @@ -0,0 +1,14 @@ +{ + "bos_token_id": 2, + "do_sample": true, + "eos_token_id": [ + 1, + 106, + 50 + ], + "pad_token_id": 0, + "temperature": 1.0, + "top_k": 64, + "top_p": 0.95, + "transformers_version": "5.5.0.dev0" +} diff --git a/chat/mlx/mlx-community/gemma-4-e4b-it-4bit/model.safetensors b/chat/mlx/mlx-community/gemma-4-e4b-it-4bit/model.safetensors new file mode 100644 index 0000000..f80840c --- /dev/null +++ b/chat/mlx/mlx-community/gemma-4-e4b-it-4bit/model.safetensors @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:339409bd18494955556e1fde6ccc15faaa9f707b911b74791fe290b9d722beed +size 5217361182 diff --git a/chat/mlx/mlx-community/gemma-4-e4b-it-4bit/model.safetensors.index.json b/chat/mlx/mlx-community/gemma-4-e4b-it-4bit/model.safetensors.index.json new file mode 100644 index 0000000..81d2aa1 --- /dev/null +++ b/chat/mlx/mlx-community/gemma-4-e4b-it-4bit/model.safetensors.index.json @@ -0,0 +1,2901 @@ +{ + "metadata": { + "total_size": 5216992212 + }, + "weight_map": { + "audio_tower.layers.0.feed_forward1.ffw_layer_1.input_max": "model.safetensors", + "audio_tower.layers.0.feed_forward1.ffw_layer_1.input_min": "model.safetensors", + "audio_tower.layers.0.feed_forward1.ffw_layer_1.linear.weight": "model.safetensors", + "audio_tower.layers.0.feed_forward1.ffw_layer_1.output_max": "model.safetensors", + "audio_tower.layers.0.feed_forward1.ffw_layer_1.output_min": "model.safetensors", + "audio_tower.layers.0.feed_forward1.ffw_layer_2.input_max": "model.safetensors", + "audio_tower.layers.0.feed_forward1.ffw_layer_2.input_min": "model.safetensors", + "audio_tower.layers.0.feed_forward1.ffw_layer_2.linear.weight": "model.safetensors", + "audio_tower.layers.0.feed_forward1.ffw_layer_2.output_max": "model.safetensors", + "audio_tower.layers.0.feed_forward1.ffw_layer_2.output_min": "model.safetensors", + "audio_tower.layers.0.feed_forward1.post_layer_norm.weight": "model.safetensors", + "audio_tower.layers.0.feed_forward1.pre_layer_norm.weight": "model.safetensors", + "audio_tower.layers.0.feed_forward2.ffw_layer_1.input_max": "model.safetensors", + "audio_tower.layers.0.feed_forward2.ffw_layer_1.input_min": "model.safetensors", + "audio_tower.layers.0.feed_forward2.ffw_layer_1.linear.weight": "model.safetensors", + "audio_tower.layers.0.feed_forward2.ffw_layer_1.output_max": "model.safetensors", + "audio_tower.layers.0.feed_forward2.ffw_layer_1.output_min": "model.safetensors", + "audio_tower.layers.0.feed_forward2.ffw_layer_2.input_max": "model.safetensors", + "audio_tower.layers.0.feed_forward2.ffw_layer_2.input_min": "model.safetensors", + "audio_tower.layers.0.feed_forward2.ffw_layer_2.linear.weight": "model.safetensors", + "audio_tower.layers.0.feed_forward2.ffw_layer_2.output_max": "model.safetensors", + "audio_tower.layers.0.feed_forward2.ffw_layer_2.output_min": "model.safetensors", + "audio_tower.layers.0.feed_forward2.post_layer_norm.weight": "model.safetensors", + "audio_tower.layers.0.feed_forward2.pre_layer_norm.weight": "model.safetensors", + "audio_tower.layers.0.lconv1d.conv_norm.weight": "model.safetensors", + "audio_tower.layers.0.lconv1d.depthwise_conv1d.weight": "model.safetensors", + "audio_tower.layers.0.lconv1d.linear_end.input_max": "model.safetensors", + "audio_tower.layers.0.lconv1d.linear_end.input_min": "model.safetensors", + "audio_tower.layers.0.lconv1d.linear_end.linear.weight": "model.safetensors", + "audio_tower.layers.0.lconv1d.linear_end.output_max": "model.safetensors", + "audio_tower.layers.0.lconv1d.linear_end.output_min": "model.safetensors", + "audio_tower.layers.0.lconv1d.linear_start.input_max": "model.safetensors", + "audio_tower.layers.0.lconv1d.linear_start.input_min": "model.safetensors", + "audio_tower.layers.0.lconv1d.linear_start.linear.weight": "model.safetensors", + "audio_tower.layers.0.lconv1d.linear_start.output_max": "model.safetensors", + "audio_tower.layers.0.lconv1d.linear_start.output_min": "model.safetensors", + "audio_tower.layers.0.lconv1d.pre_layer_norm.weight": "model.safetensors", + "audio_tower.layers.0.norm_out.weight": "model.safetensors", + "audio_tower.layers.0.norm_post_attn.weight": "model.safetensors", + "audio_tower.layers.0.norm_pre_attn.weight": "model.safetensors", + "audio_tower.layers.0.self_attn.k_proj.input_max": "model.safetensors", + "audio_tower.layers.0.self_attn.k_proj.input_min": "model.safetensors", + "audio_tower.layers.0.self_attn.k_proj.linear.weight": "model.safetensors", + "audio_tower.layers.0.self_attn.k_proj.output_max": "model.safetensors", + "audio_tower.layers.0.self_attn.k_proj.output_min": "model.safetensors", + "audio_tower.layers.0.self_attn.per_dim_scale": "model.safetensors", + "audio_tower.layers.0.self_attn.post.input_max": "model.safetensors", + "audio_tower.layers.0.self_attn.post.input_min": "model.safetensors", + "audio_tower.layers.0.self_attn.post.linear.weight": "model.safetensors", + "audio_tower.layers.0.self_attn.post.output_max": "model.safetensors", + "audio_tower.layers.0.self_attn.post.output_min": "model.safetensors", + "audio_tower.layers.0.self_attn.q_proj.input_max": "model.safetensors", + "audio_tower.layers.0.self_attn.q_proj.input_min": "model.safetensors", + "audio_tower.layers.0.self_attn.q_proj.linear.weight": "model.safetensors", + "audio_tower.layers.0.self_attn.q_proj.output_max": "model.safetensors", + "audio_tower.layers.0.self_attn.q_proj.output_min": "model.safetensors", + "audio_tower.layers.0.self_attn.relative_k_proj.weight": "model.safetensors", + "audio_tower.layers.0.self_attn.v_proj.input_max": "model.safetensors", + "audio_tower.layers.0.self_attn.v_proj.input_min": "model.safetensors", + "audio_tower.layers.0.self_attn.v_proj.linear.weight": "model.safetensors", + "audio_tower.layers.0.self_attn.v_proj.output_max": "model.safetensors", + "audio_tower.layers.0.self_attn.v_proj.output_min": "model.safetensors", + "audio_tower.layers.1.feed_forward1.ffw_layer_1.input_max": "model.safetensors", + "audio_tower.layers.1.feed_forward1.ffw_layer_1.input_min": "model.safetensors", + "audio_tower.layers.1.feed_forward1.ffw_layer_1.linear.weight": "model.safetensors", + "audio_tower.layers.1.feed_forward1.ffw_layer_1.output_max": "model.safetensors", + "audio_tower.layers.1.feed_forward1.ffw_layer_1.output_min": "model.safetensors", + "audio_tower.layers.1.feed_forward1.ffw_layer_2.input_max": "model.safetensors", + "audio_tower.layers.1.feed_forward1.ffw_layer_2.input_min": "model.safetensors", + "audio_tower.layers.1.feed_forward1.ffw_layer_2.linear.weight": "model.safetensors", + "audio_tower.layers.1.feed_forward1.ffw_layer_2.output_max": "model.safetensors", + "audio_tower.layers.1.feed_forward1.ffw_layer_2.output_min": "model.safetensors", + "audio_tower.layers.1.feed_forward1.post_layer_norm.weight": "model.safetensors", + "audio_tower.layers.1.feed_forward1.pre_layer_norm.weight": "model.safetensors", + "audio_tower.layers.1.feed_forward2.ffw_layer_1.input_max": "model.safetensors", + "audio_tower.layers.1.feed_forward2.ffw_layer_1.input_min": "model.safetensors", + "audio_tower.layers.1.feed_forward2.ffw_layer_1.linear.weight": "model.safetensors", + "audio_tower.layers.1.feed_forward2.ffw_layer_1.output_max": "model.safetensors", + "audio_tower.layers.1.feed_forward2.ffw_layer_1.output_min": "model.safetensors", + "audio_tower.layers.1.feed_forward2.ffw_layer_2.input_max": "model.safetensors", + "audio_tower.layers.1.feed_forward2.ffw_layer_2.input_min": "model.safetensors", + "audio_tower.layers.1.feed_forward2.ffw_layer_2.linear.weight": "model.safetensors", + "audio_tower.layers.1.feed_forward2.ffw_layer_2.output_max": "model.safetensors", + "audio_tower.layers.1.feed_forward2.ffw_layer_2.output_min": "model.safetensors", + "audio_tower.layers.1.feed_forward2.post_layer_norm.weight": "model.safetensors", + "audio_tower.layers.1.feed_forward2.pre_layer_norm.weight": "model.safetensors", + "audio_tower.layers.1.lconv1d.conv_norm.weight": "model.safetensors", + "audio_tower.layers.1.lconv1d.depthwise_conv1d.weight": "model.safetensors", + "audio_tower.layers.1.lconv1d.linear_end.input_max": "model.safetensors", + "audio_tower.layers.1.lconv1d.linear_end.input_min": "model.safetensors", + "audio_tower.layers.1.lconv1d.linear_end.linear.weight": "model.safetensors", + "audio_tower.layers.1.lconv1d.linear_end.output_max": "model.safetensors", + "audio_tower.layers.1.lconv1d.linear_end.output_min": "model.safetensors", + "audio_tower.layers.1.lconv1d.linear_start.input_max": "model.safetensors", + "audio_tower.layers.1.lconv1d.linear_start.input_min": "model.safetensors", + "audio_tower.layers.1.lconv1d.linear_start.linear.weight": "model.safetensors", + "audio_tower.layers.1.lconv1d.linear_start.output_max": "model.safetensors", + "audio_tower.layers.1.lconv1d.linear_start.output_min": "model.safetensors", + "audio_tower.layers.1.lconv1d.pre_layer_norm.weight": "model.safetensors", + "audio_tower.layers.1.norm_out.weight": "model.safetensors", + "audio_tower.layers.1.norm_post_attn.weight": "model.safetensors", + "audio_tower.layers.1.norm_pre_attn.weight": "model.safetensors", + "audio_tower.layers.1.self_attn.k_proj.input_max": "model.safetensors", + "audio_tower.layers.1.self_attn.k_proj.input_min": "model.safetensors", + "audio_tower.layers.1.self_attn.k_proj.linear.weight": "model.safetensors", + "audio_tower.layers.1.self_attn.k_proj.output_max": "model.safetensors", + "audio_tower.layers.1.self_attn.k_proj.output_min": "model.safetensors", + "audio_tower.layers.1.self_attn.per_dim_scale": "model.safetensors", + "audio_tower.layers.1.self_attn.post.input_max": "model.safetensors", + "audio_tower.layers.1.self_attn.post.input_min": "model.safetensors", + "audio_tower.layers.1.self_attn.post.linear.weight": "model.safetensors", + "audio_tower.layers.1.self_attn.post.output_max": "model.safetensors", + "audio_tower.layers.1.self_attn.post.output_min": "model.safetensors", + "audio_tower.layers.1.self_attn.q_proj.input_max": "model.safetensors", + "audio_tower.layers.1.self_attn.q_proj.input_min": "model.safetensors", + "audio_tower.layers.1.self_attn.q_proj.linear.weight": "model.safetensors", + "audio_tower.layers.1.self_attn.q_proj.output_max": "model.safetensors", + "audio_tower.layers.1.self_attn.q_proj.output_min": "model.safetensors", + "audio_tower.layers.1.self_attn.relative_k_proj.weight": "model.safetensors", + "audio_tower.layers.1.self_attn.v_proj.input_max": "model.safetensors", + "audio_tower.layers.1.self_attn.v_proj.input_min": "model.safetensors", + "audio_tower.layers.1.self_attn.v_proj.linear.weight": "model.safetensors", + "audio_tower.layers.1.self_attn.v_proj.output_max": "model.safetensors", + "audio_tower.layers.1.self_attn.v_proj.output_min": "model.safetensors", + "audio_tower.layers.10.feed_forward1.ffw_layer_1.input_max": "model.safetensors", + "audio_tower.layers.10.feed_forward1.ffw_layer_1.input_min": "model.safetensors", + "audio_tower.layers.10.feed_forward1.ffw_layer_1.linear.weight": "model.safetensors", + "audio_tower.layers.10.feed_forward1.ffw_layer_1.output_max": "model.safetensors", + "audio_tower.layers.10.feed_forward1.ffw_layer_1.output_min": "model.safetensors", + "audio_tower.layers.10.feed_forward1.ffw_layer_2.input_max": "model.safetensors", + "audio_tower.layers.10.feed_forward1.ffw_layer_2.input_min": "model.safetensors", + "audio_tower.layers.10.feed_forward1.ffw_layer_2.linear.weight": "model.safetensors", + "audio_tower.layers.10.feed_forward1.ffw_layer_2.output_max": "model.safetensors", + "audio_tower.layers.10.feed_forward1.ffw_layer_2.output_min": "model.safetensors", + "audio_tower.layers.10.feed_forward1.post_layer_norm.weight": "model.safetensors", + "audio_tower.layers.10.feed_forward1.pre_layer_norm.weight": "model.safetensors", + "audio_tower.layers.10.feed_forward2.ffw_layer_1.input_max": "model.safetensors", + "audio_tower.layers.10.feed_forward2.ffw_layer_1.input_min": "model.safetensors", + "audio_tower.layers.10.feed_forward2.ffw_layer_1.linear.weight": "model.safetensors", + "audio_tower.layers.10.feed_forward2.ffw_layer_1.output_max": "model.safetensors", + "audio_tower.layers.10.feed_forward2.ffw_layer_1.output_min": "model.safetensors", + "audio_tower.layers.10.feed_forward2.ffw_layer_2.input_max": "model.safetensors", + "audio_tower.layers.10.feed_forward2.ffw_layer_2.input_min": "model.safetensors", + "audio_tower.layers.10.feed_forward2.ffw_layer_2.linear.weight": "model.safetensors", + "audio_tower.layers.10.feed_forward2.ffw_layer_2.output_max": "model.safetensors", + "audio_tower.layers.10.feed_forward2.ffw_layer_2.output_min": "model.safetensors", + "audio_tower.layers.10.feed_forward2.post_layer_norm.weight": "model.safetensors", + "audio_tower.layers.10.feed_forward2.pre_layer_norm.weight": "model.safetensors", + "audio_tower.layers.10.lconv1d.conv_norm.weight": "model.safetensors", + "audio_tower.layers.10.lconv1d.depthwise_conv1d.weight": "model.safetensors", + "audio_tower.layers.10.lconv1d.linear_end.input_max": "model.safetensors", + "audio_tower.layers.10.lconv1d.linear_end.input_min": "model.safetensors", + "audio_tower.layers.10.lconv1d.linear_end.linear.weight": "model.safetensors", + "audio_tower.layers.10.lconv1d.linear_end.output_max": "model.safetensors", + "audio_tower.layers.10.lconv1d.linear_end.output_min": "model.safetensors", + "audio_tower.layers.10.lconv1d.linear_start.input_max": "model.safetensors", + "audio_tower.layers.10.lconv1d.linear_start.input_min": "model.safetensors", + "audio_tower.layers.10.lconv1d.linear_start.linear.weight": "model.safetensors", + "audio_tower.layers.10.lconv1d.linear_start.output_max": "model.safetensors", + "audio_tower.layers.10.lconv1d.linear_start.output_min": "model.safetensors", + "audio_tower.layers.10.lconv1d.pre_layer_norm.weight": "model.safetensors", + "audio_tower.layers.10.norm_out.weight": "model.safetensors", + "audio_tower.layers.10.norm_post_attn.weight": "model.safetensors", + "audio_tower.layers.10.norm_pre_attn.weight": "model.safetensors", + "audio_tower.layers.10.self_attn.k_proj.input_max": "model.safetensors", + "audio_tower.layers.10.self_attn.k_proj.input_min": "model.safetensors", + "audio_tower.layers.10.self_attn.k_proj.linear.weight": "model.safetensors", + "audio_tower.layers.10.self_attn.k_proj.output_max": "model.safetensors", + "audio_tower.layers.10.self_attn.k_proj.output_min": "model.safetensors", + "audio_tower.layers.10.self_attn.per_dim_scale": "model.safetensors", + "audio_tower.layers.10.self_attn.post.input_max": "model.safetensors", + "audio_tower.layers.10.self_attn.post.input_min": "model.safetensors", + "audio_tower.layers.10.self_attn.post.linear.weight": "model.safetensors", + "audio_tower.layers.10.self_attn.post.output_max": "model.safetensors", + "audio_tower.layers.10.self_attn.post.output_min": "model.safetensors", + "audio_tower.layers.10.self_attn.q_proj.input_max": "model.safetensors", + "audio_tower.layers.10.self_attn.q_proj.input_min": "model.safetensors", + "audio_tower.layers.10.self_attn.q_proj.linear.weight": "model.safetensors", + "audio_tower.layers.10.self_attn.q_proj.output_max": "model.safetensors", + "audio_tower.layers.10.self_attn.q_proj.output_min": "model.safetensors", + "audio_tower.layers.10.self_attn.relative_k_proj.weight": "model.safetensors", + "audio_tower.layers.10.self_attn.v_proj.input_max": "model.safetensors", + "audio_tower.layers.10.self_attn.v_proj.input_min": "model.safetensors", + "audio_tower.layers.10.self_attn.v_proj.linear.weight": "model.safetensors", + "audio_tower.layers.10.self_attn.v_proj.output_max": "model.safetensors", + "audio_tower.layers.10.self_attn.v_proj.output_min": "model.safetensors", + "audio_tower.layers.11.feed_forward1.ffw_layer_1.input_max": "model.safetensors", + "audio_tower.layers.11.feed_forward1.ffw_layer_1.input_min": "model.safetensors", + "audio_tower.layers.11.feed_forward1.ffw_layer_1.linear.weight": "model.safetensors", + "audio_tower.layers.11.feed_forward1.ffw_layer_1.output_max": "model.safetensors", + "audio_tower.layers.11.feed_forward1.ffw_layer_1.output_min": "model.safetensors", + "audio_tower.layers.11.feed_forward1.ffw_layer_2.input_max": "model.safetensors", + "audio_tower.layers.11.feed_forward1.ffw_layer_2.input_min": "model.safetensors", + "audio_tower.layers.11.feed_forward1.ffw_layer_2.linear.weight": "model.safetensors", + "audio_tower.layers.11.feed_forward1.ffw_layer_2.output_max": "model.safetensors", + "audio_tower.layers.11.feed_forward1.ffw_layer_2.output_min": "model.safetensors", + "audio_tower.layers.11.feed_forward1.post_layer_norm.weight": "model.safetensors", + "audio_tower.layers.11.feed_forward1.pre_layer_norm.weight": "model.safetensors", + "audio_tower.layers.11.feed_forward2.ffw_layer_1.input_max": "model.safetensors", + "audio_tower.layers.11.feed_forward2.ffw_layer_1.input_min": "model.safetensors", + "audio_tower.layers.11.feed_forward2.ffw_layer_1.linear.weight": "model.safetensors", + "audio_tower.layers.11.feed_forward2.ffw_layer_1.output_max": "model.safetensors", + "audio_tower.layers.11.feed_forward2.ffw_layer_1.output_min": "model.safetensors", + "audio_tower.layers.11.feed_forward2.ffw_layer_2.input_max": "model.safetensors", + "audio_tower.layers.11.feed_forward2.ffw_layer_2.input_min": "model.safetensors", + "audio_tower.layers.11.feed_forward2.ffw_layer_2.linear.weight": "model.safetensors", + "audio_tower.layers.11.feed_forward2.ffw_layer_2.output_max": "model.safetensors", + "audio_tower.layers.11.feed_forward2.ffw_layer_2.output_min": "model.safetensors", + "audio_tower.layers.11.feed_forward2.post_layer_norm.weight": "model.safetensors", + "audio_tower.layers.11.feed_forward2.pre_layer_norm.weight": "model.safetensors", + "audio_tower.layers.11.lconv1d.conv_norm.weight": "model.safetensors", + "audio_tower.layers.11.lconv1d.depthwise_conv1d.weight": "model.safetensors", + "audio_tower.layers.11.lconv1d.linear_end.input_max": "model.safetensors", + "audio_tower.layers.11.lconv1d.linear_end.input_min": "model.safetensors", + "audio_tower.layers.11.lconv1d.linear_end.linear.weight": "model.safetensors", + "audio_tower.layers.11.lconv1d.linear_end.output_max": "model.safetensors", + "audio_tower.layers.11.lconv1d.linear_end.output_min": "model.safetensors", + "audio_tower.layers.11.lconv1d.linear_start.input_max": "model.safetensors", + "audio_tower.layers.11.lconv1d.linear_start.input_min": "model.safetensors", + "audio_tower.layers.11.lconv1d.linear_start.linear.weight": "model.safetensors", + "audio_tower.layers.11.lconv1d.linear_start.output_max": "model.safetensors", + "audio_tower.layers.11.lconv1d.linear_start.output_min": "model.safetensors", + "audio_tower.layers.11.lconv1d.pre_layer_norm.weight": "model.safetensors", + "audio_tower.layers.11.norm_out.weight": "model.safetensors", + "audio_tower.layers.11.norm_post_attn.weight": "model.safetensors", + "audio_tower.layers.11.norm_pre_attn.weight": "model.safetensors", + "audio_tower.layers.11.self_attn.k_proj.input_max": "model.safetensors", + "audio_tower.layers.11.self_attn.k_proj.input_min": "model.safetensors", + "audio_tower.layers.11.self_attn.k_proj.linear.weight": "model.safetensors", + "audio_tower.layers.11.self_attn.k_proj.output_max": "model.safetensors", + "audio_tower.layers.11.self_attn.k_proj.output_min": "model.safetensors", + "audio_tower.layers.11.self_attn.per_dim_scale": "model.safetensors", + "audio_tower.layers.11.self_attn.post.input_max": "model.safetensors", + "audio_tower.layers.11.self_attn.post.input_min": "model.safetensors", + "audio_tower.layers.11.self_attn.post.linear.weight": "model.safetensors", + "audio_tower.layers.11.self_attn.post.output_max": "model.safetensors", + "audio_tower.layers.11.self_attn.post.output_min": "model.safetensors", + "audio_tower.layers.11.self_attn.q_proj.input_max": "model.safetensors", + "audio_tower.layers.11.self_attn.q_proj.input_min": "model.safetensors", + "audio_tower.layers.11.self_attn.q_proj.linear.weight": "model.safetensors", + "audio_tower.layers.11.self_attn.q_proj.output_max": "model.safetensors", + "audio_tower.layers.11.self_attn.q_proj.output_min": "model.safetensors", + "audio_tower.layers.11.self_attn.relative_k_proj.weight": "model.safetensors", + "audio_tower.layers.11.self_attn.v_proj.input_max": "model.safetensors", + "audio_tower.layers.11.self_attn.v_proj.input_min": "model.safetensors", + "audio_tower.layers.11.self_attn.v_proj.linear.weight": "model.safetensors", + "audio_tower.layers.11.self_attn.v_proj.output_max": "model.safetensors", + "audio_tower.layers.11.self_attn.v_proj.output_min": "model.safetensors", + "audio_tower.layers.2.feed_forward1.ffw_layer_1.input_max": "model.safetensors", + "audio_tower.layers.2.feed_forward1.ffw_layer_1.input_min": "model.safetensors", + "audio_tower.layers.2.feed_forward1.ffw_layer_1.linear.weight": "model.safetensors", + "audio_tower.layers.2.feed_forward1.ffw_layer_1.output_max": "model.safetensors", + "audio_tower.layers.2.feed_forward1.ffw_layer_1.output_min": "model.safetensors", + "audio_tower.layers.2.feed_forward1.ffw_layer_2.input_max": "model.safetensors", + "audio_tower.layers.2.feed_forward1.ffw_layer_2.input_min": "model.safetensors", + "audio_tower.layers.2.feed_forward1.ffw_layer_2.linear.weight": "model.safetensors", + "audio_tower.layers.2.feed_forward1.ffw_layer_2.output_max": "model.safetensors", + "audio_tower.layers.2.feed_forward1.ffw_layer_2.output_min": "model.safetensors", + "audio_tower.layers.2.feed_forward1.post_layer_norm.weight": "model.safetensors", + "audio_tower.layers.2.feed_forward1.pre_layer_norm.weight": "model.safetensors", + "audio_tower.layers.2.feed_forward2.ffw_layer_1.input_max": "model.safetensors", + "audio_tower.layers.2.feed_forward2.ffw_layer_1.input_min": "model.safetensors", + "audio_tower.layers.2.feed_forward2.ffw_layer_1.linear.weight": "model.safetensors", + "audio_tower.layers.2.feed_forward2.ffw_layer_1.output_max": "model.safetensors", + "audio_tower.layers.2.feed_forward2.ffw_layer_1.output_min": "model.safetensors", + "audio_tower.layers.2.feed_forward2.ffw_layer_2.input_max": "model.safetensors", + "audio_tower.layers.2.feed_forward2.ffw_layer_2.input_min": "model.safetensors", + "audio_tower.layers.2.feed_forward2.ffw_layer_2.linear.weight": "model.safetensors", + "audio_tower.layers.2.feed_forward2.ffw_layer_2.output_max": "model.safetensors", + "audio_tower.layers.2.feed_forward2.ffw_layer_2.output_min": "model.safetensors", + "audio_tower.layers.2.feed_forward2.post_layer_norm.weight": "model.safetensors", + "audio_tower.layers.2.feed_forward2.pre_layer_norm.weight": "model.safetensors", + "audio_tower.layers.2.lconv1d.conv_norm.weight": "model.safetensors", + "audio_tower.layers.2.lconv1d.depthwise_conv1d.weight": "model.safetensors", + "audio_tower.layers.2.lconv1d.linear_end.input_max": "model.safetensors", + "audio_tower.layers.2.lconv1d.linear_end.input_min": "model.safetensors", + "audio_tower.layers.2.lconv1d.linear_end.linear.weight": "model.safetensors", + "audio_tower.layers.2.lconv1d.linear_end.output_max": "model.safetensors", + "audio_tower.layers.2.lconv1d.linear_end.output_min": "model.safetensors", + "audio_tower.layers.2.lconv1d.linear_start.input_max": "model.safetensors", + "audio_tower.layers.2.lconv1d.linear_start.input_min": "model.safetensors", + "audio_tower.layers.2.lconv1d.linear_start.linear.weight": "model.safetensors", + "audio_tower.layers.2.lconv1d.linear_start.output_max": "model.safetensors", + "audio_tower.layers.2.lconv1d.linear_start.output_min": "model.safetensors", + "audio_tower.layers.2.lconv1d.pre_layer_norm.weight": "model.safetensors", + "audio_tower.layers.2.norm_out.weight": "model.safetensors", + "audio_tower.layers.2.norm_post_attn.weight": "model.safetensors", + "audio_tower.layers.2.norm_pre_attn.weight": "model.safetensors", + "audio_tower.layers.2.self_attn.k_proj.input_max": "model.safetensors", + "audio_tower.layers.2.self_attn.k_proj.input_min": "model.safetensors", + "audio_tower.layers.2.self_attn.k_proj.linear.weight": "model.safetensors", + "audio_tower.layers.2.self_attn.k_proj.output_max": "model.safetensors", + "audio_tower.layers.2.self_attn.k_proj.output_min": "model.safetensors", + "audio_tower.layers.2.self_attn.per_dim_scale": "model.safetensors", + "audio_tower.layers.2.self_attn.post.input_max": "model.safetensors", + "audio_tower.layers.2.self_attn.post.input_min": "model.safetensors", + "audio_tower.layers.2.self_attn.post.linear.weight": "model.safetensors", + "audio_tower.layers.2.self_attn.post.output_max": "model.safetensors", + "audio_tower.layers.2.self_attn.post.output_min": "model.safetensors", + "audio_tower.layers.2.self_attn.q_proj.input_max": "model.safetensors", + "audio_tower.layers.2.self_attn.q_proj.input_min": "model.safetensors", + "audio_tower.layers.2.self_attn.q_proj.linear.weight": "model.safetensors", + "audio_tower.layers.2.self_attn.q_proj.output_max": "model.safetensors", + "audio_tower.layers.2.self_attn.q_proj.output_min": "model.safetensors", + "audio_tower.layers.2.self_attn.relative_k_proj.weight": "model.safetensors", + "audio_tower.layers.2.self_attn.v_proj.input_max": "model.safetensors", + "audio_tower.layers.2.self_attn.v_proj.input_min": "model.safetensors", + "audio_tower.layers.2.self_attn.v_proj.linear.weight": "model.safetensors", + "audio_tower.layers.2.self_attn.v_proj.output_max": "model.safetensors", + "audio_tower.layers.2.self_attn.v_proj.output_min": "model.safetensors", + "audio_tower.layers.3.feed_forward1.ffw_layer_1.input_max": "model.safetensors", + "audio_tower.layers.3.feed_forward1.ffw_layer_1.input_min": "model.safetensors", + "audio_tower.layers.3.feed_forward1.ffw_layer_1.linear.weight": "model.safetensors", + "audio_tower.layers.3.feed_forward1.ffw_layer_1.output_max": "model.safetensors", + "audio_tower.layers.3.feed_forward1.ffw_layer_1.output_min": "model.safetensors", + "audio_tower.layers.3.feed_forward1.ffw_layer_2.input_max": "model.safetensors", + "audio_tower.layers.3.feed_forward1.ffw_layer_2.input_min": "model.safetensors", + "audio_tower.layers.3.feed_forward1.ffw_layer_2.linear.weight": "model.safetensors", + "audio_tower.layers.3.feed_forward1.ffw_layer_2.output_max": "model.safetensors", + "audio_tower.layers.3.feed_forward1.ffw_layer_2.output_min": "model.safetensors", + "audio_tower.layers.3.feed_forward1.post_layer_norm.weight": "model.safetensors", + "audio_tower.layers.3.feed_forward1.pre_layer_norm.weight": "model.safetensors", + "audio_tower.layers.3.feed_forward2.ffw_layer_1.input_max": "model.safetensors", + "audio_tower.layers.3.feed_forward2.ffw_layer_1.input_min": "model.safetensors", + "audio_tower.layers.3.feed_forward2.ffw_layer_1.linear.weight": "model.safetensors", + "audio_tower.layers.3.feed_forward2.ffw_layer_1.output_max": "model.safetensors", + "audio_tower.layers.3.feed_forward2.ffw_layer_1.output_min": "model.safetensors", + "audio_tower.layers.3.feed_forward2.ffw_layer_2.input_max": "model.safetensors", + "audio_tower.layers.3.feed_forward2.ffw_layer_2.input_min": "model.safetensors", + "audio_tower.layers.3.feed_forward2.ffw_layer_2.linear.weight": "model.safetensors", + "audio_tower.layers.3.feed_forward2.ffw_layer_2.output_max": "model.safetensors", + "audio_tower.layers.3.feed_forward2.ffw_layer_2.output_min": "model.safetensors", + "audio_tower.layers.3.feed_forward2.post_layer_norm.weight": "model.safetensors", + "audio_tower.layers.3.feed_forward2.pre_layer_norm.weight": "model.safetensors", + "audio_tower.layers.3.lconv1d.conv_norm.weight": "model.safetensors", + "audio_tower.layers.3.lconv1d.depthwise_conv1d.weight": "model.safetensors", + "audio_tower.layers.3.lconv1d.linear_end.input_max": "model.safetensors", + "audio_tower.layers.3.lconv1d.linear_end.input_min": "model.safetensors", + "audio_tower.layers.3.lconv1d.linear_end.linear.weight": "model.safetensors", + "audio_tower.layers.3.lconv1d.linear_end.output_max": "model.safetensors", + "audio_tower.layers.3.lconv1d.linear_end.output_min": "model.safetensors", + "audio_tower.layers.3.lconv1d.linear_start.input_max": "model.safetensors", + "audio_tower.layers.3.lconv1d.linear_start.input_min": "model.safetensors", + "audio_tower.layers.3.lconv1d.linear_start.linear.weight": "model.safetensors", + "audio_tower.layers.3.lconv1d.linear_start.output_max": "model.safetensors", + "audio_tower.layers.3.lconv1d.linear_start.output_min": "model.safetensors", + "audio_tower.layers.3.lconv1d.pre_layer_norm.weight": "model.safetensors", + "audio_tower.layers.3.norm_out.weight": "model.safetensors", + "audio_tower.layers.3.norm_post_attn.weight": "model.safetensors", + "audio_tower.layers.3.norm_pre_attn.weight": "model.safetensors", + "audio_tower.layers.3.self_attn.k_proj.input_max": "model.safetensors", + "audio_tower.layers.3.self_attn.k_proj.input_min": "model.safetensors", + "audio_tower.layers.3.self_attn.k_proj.linear.weight": "model.safetensors", + "audio_tower.layers.3.self_attn.k_proj.output_max": "model.safetensors", + "audio_tower.layers.3.self_attn.k_proj.output_min": "model.safetensors", + "audio_tower.layers.3.self_attn.per_dim_scale": "model.safetensors", + "audio_tower.layers.3.self_attn.post.input_max": "model.safetensors", + "audio_tower.layers.3.self_attn.post.input_min": "model.safetensors", + "audio_tower.layers.3.self_attn.post.linear.weight": "model.safetensors", + "audio_tower.layers.3.self_attn.post.output_max": "model.safetensors", + "audio_tower.layers.3.self_attn.post.output_min": "model.safetensors", + "audio_tower.layers.3.self_attn.q_proj.input_max": "model.safetensors", + "audio_tower.layers.3.self_attn.q_proj.input_min": "model.safetensors", + "audio_tower.layers.3.self_attn.q_proj.linear.weight": "model.safetensors", + "audio_tower.layers.3.self_attn.q_proj.output_max": "model.safetensors", + "audio_tower.layers.3.self_attn.q_proj.output_min": "model.safetensors", + "audio_tower.layers.3.self_attn.relative_k_proj.weight": "model.safetensors", + "audio_tower.layers.3.self_attn.v_proj.input_max": "model.safetensors", + "audio_tower.layers.3.self_attn.v_proj.input_min": "model.safetensors", + "audio_tower.layers.3.self_attn.v_proj.linear.weight": "model.safetensors", + "audio_tower.layers.3.self_attn.v_proj.output_max": "model.safetensors", + "audio_tower.layers.3.self_attn.v_proj.output_min": "model.safetensors", + "audio_tower.layers.4.feed_forward1.ffw_layer_1.input_max": "model.safetensors", + "audio_tower.layers.4.feed_forward1.ffw_layer_1.input_min": "model.safetensors", + "audio_tower.layers.4.feed_forward1.ffw_layer_1.linear.weight": "model.safetensors", + "audio_tower.layers.4.feed_forward1.ffw_layer_1.output_max": "model.safetensors", + "audio_tower.layers.4.feed_forward1.ffw_layer_1.output_min": "model.safetensors", + "audio_tower.layers.4.feed_forward1.ffw_layer_2.input_max": "model.safetensors", + "audio_tower.layers.4.feed_forward1.ffw_layer_2.input_min": "model.safetensors", + "audio_tower.layers.4.feed_forward1.ffw_layer_2.linear.weight": "model.safetensors", + "audio_tower.layers.4.feed_forward1.ffw_layer_2.output_max": "model.safetensors", + "audio_tower.layers.4.feed_forward1.ffw_layer_2.output_min": "model.safetensors", + "audio_tower.layers.4.feed_forward1.post_layer_norm.weight": "model.safetensors", + "audio_tower.layers.4.feed_forward1.pre_layer_norm.weight": "model.safetensors", + "audio_tower.layers.4.feed_forward2.ffw_layer_1.input_max": "model.safetensors", + "audio_tower.layers.4.feed_forward2.ffw_layer_1.input_min": "model.safetensors", + "audio_tower.layers.4.feed_forward2.ffw_layer_1.linear.weight": "model.safetensors", + "audio_tower.layers.4.feed_forward2.ffw_layer_1.output_max": "model.safetensors", + "audio_tower.layers.4.feed_forward2.ffw_layer_1.output_min": "model.safetensors", + "audio_tower.layers.4.feed_forward2.ffw_layer_2.input_max": "model.safetensors", + "audio_tower.layers.4.feed_forward2.ffw_layer_2.input_min": "model.safetensors", + "audio_tower.layers.4.feed_forward2.ffw_layer_2.linear.weight": "model.safetensors", + "audio_tower.layers.4.feed_forward2.ffw_layer_2.output_max": "model.safetensors", + "audio_tower.layers.4.feed_forward2.ffw_layer_2.output_min": "model.safetensors", + "audio_tower.layers.4.feed_forward2.post_layer_norm.weight": "model.safetensors", + "audio_tower.layers.4.feed_forward2.pre_layer_norm.weight": "model.safetensors", + "audio_tower.layers.4.lconv1d.conv_norm.weight": "model.safetensors", + "audio_tower.layers.4.lconv1d.depthwise_conv1d.weight": "model.safetensors", + "audio_tower.layers.4.lconv1d.linear_end.input_max": "model.safetensors", + "audio_tower.layers.4.lconv1d.linear_end.input_min": "model.safetensors", + "audio_tower.layers.4.lconv1d.linear_end.linear.weight": "model.safetensors", + "audio_tower.layers.4.lconv1d.linear_end.output_max": "model.safetensors", + "audio_tower.layers.4.lconv1d.linear_end.output_min": "model.safetensors", + "audio_tower.layers.4.lconv1d.linear_start.input_max": "model.safetensors", + "audio_tower.layers.4.lconv1d.linear_start.input_min": "model.safetensors", + "audio_tower.layers.4.lconv1d.linear_start.linear.weight": "model.safetensors", + "audio_tower.layers.4.lconv1d.linear_start.output_max": "model.safetensors", + "audio_tower.layers.4.lconv1d.linear_start.output_min": "model.safetensors", + "audio_tower.layers.4.lconv1d.pre_layer_norm.weight": "model.safetensors", + "audio_tower.layers.4.norm_out.weight": "model.safetensors", + "audio_tower.layers.4.norm_post_attn.weight": "model.safetensors", + "audio_tower.layers.4.norm_pre_attn.weight": "model.safetensors", + "audio_tower.layers.4.self_attn.k_proj.input_max": "model.safetensors", + "audio_tower.layers.4.self_attn.k_proj.input_min": "model.safetensors", + "audio_tower.layers.4.self_attn.k_proj.linear.weight": "model.safetensors", + "audio_tower.layers.4.self_attn.k_proj.output_max": "model.safetensors", + "audio_tower.layers.4.self_attn.k_proj.output_min": "model.safetensors", + "audio_tower.layers.4.self_attn.per_dim_scale": "model.safetensors", + "audio_tower.layers.4.self_attn.post.input_max": "model.safetensors", + "audio_tower.layers.4.self_attn.post.input_min": "model.safetensors", + "audio_tower.layers.4.self_attn.post.linear.weight": "model.safetensors", + "audio_tower.layers.4.self_attn.post.output_max": "model.safetensors", + "audio_tower.layers.4.self_attn.post.output_min": "model.safetensors", + "audio_tower.layers.4.self_attn.q_proj.input_max": "model.safetensors", + "audio_tower.layers.4.self_attn.q_proj.input_min": "model.safetensors", + "audio_tower.layers.4.self_attn.q_proj.linear.weight": "model.safetensors", + "audio_tower.layers.4.self_attn.q_proj.output_max": "model.safetensors", + "audio_tower.layers.4.self_attn.q_proj.output_min": "model.safetensors", + "audio_tower.layers.4.self_attn.relative_k_proj.weight": "model.safetensors", + "audio_tower.layers.4.self_attn.v_proj.input_max": "model.safetensors", + "audio_tower.layers.4.self_attn.v_proj.input_min": "model.safetensors", + "audio_tower.layers.4.self_attn.v_proj.linear.weight": "model.safetensors", + "audio_tower.layers.4.self_attn.v_proj.output_max": "model.safetensors", + "audio_tower.layers.4.self_attn.v_proj.output_min": "model.safetensors", + "audio_tower.layers.5.feed_forward1.ffw_layer_1.input_max": "model.safetensors", + "audio_tower.layers.5.feed_forward1.ffw_layer_1.input_min": "model.safetensors", + "audio_tower.layers.5.feed_forward1.ffw_layer_1.linear.weight": "model.safetensors", + "audio_tower.layers.5.feed_forward1.ffw_layer_1.output_max": "model.safetensors", + "audio_tower.layers.5.feed_forward1.ffw_layer_1.output_min": "model.safetensors", + "audio_tower.layers.5.feed_forward1.ffw_layer_2.input_max": "model.safetensors", + "audio_tower.layers.5.feed_forward1.ffw_layer_2.input_min": "model.safetensors", + "audio_tower.layers.5.feed_forward1.ffw_layer_2.linear.weight": "model.safetensors", + "audio_tower.layers.5.feed_forward1.ffw_layer_2.output_max": "model.safetensors", + "audio_tower.layers.5.feed_forward1.ffw_layer_2.output_min": "model.safetensors", + "audio_tower.layers.5.feed_forward1.post_layer_norm.weight": "model.safetensors", + "audio_tower.layers.5.feed_forward1.pre_layer_norm.weight": "model.safetensors", + "audio_tower.layers.5.feed_forward2.ffw_layer_1.input_max": "model.safetensors", + "audio_tower.layers.5.feed_forward2.ffw_layer_1.input_min": "model.safetensors", + "audio_tower.layers.5.feed_forward2.ffw_layer_1.linear.weight": "model.safetensors", + "audio_tower.layers.5.feed_forward2.ffw_layer_1.output_max": "model.safetensors", + "audio_tower.layers.5.feed_forward2.ffw_layer_1.output_min": "model.safetensors", + "audio_tower.layers.5.feed_forward2.ffw_layer_2.input_max": "model.safetensors", + "audio_tower.layers.5.feed_forward2.ffw_layer_2.input_min": "model.safetensors", + "audio_tower.layers.5.feed_forward2.ffw_layer_2.linear.weight": "model.safetensors", + "audio_tower.layers.5.feed_forward2.ffw_layer_2.output_max": "model.safetensors", + "audio_tower.layers.5.feed_forward2.ffw_layer_2.output_min": "model.safetensors", + "audio_tower.layers.5.feed_forward2.post_layer_norm.weight": "model.safetensors", + "audio_tower.layers.5.feed_forward2.pre_layer_norm.weight": "model.safetensors", + "audio_tower.layers.5.lconv1d.conv_norm.weight": "model.safetensors", + "audio_tower.layers.5.lconv1d.depthwise_conv1d.weight": "model.safetensors", + "audio_tower.layers.5.lconv1d.linear_end.input_max": "model.safetensors", + "audio_tower.layers.5.lconv1d.linear_end.input_min": "model.safetensors", + "audio_tower.layers.5.lconv1d.linear_end.linear.weight": "model.safetensors", + "audio_tower.layers.5.lconv1d.linear_end.output_max": "model.safetensors", + "audio_tower.layers.5.lconv1d.linear_end.output_min": "model.safetensors", + "audio_tower.layers.5.lconv1d.linear_start.input_max": "model.safetensors", + "audio_tower.layers.5.lconv1d.linear_start.input_min": "model.safetensors", + "audio_tower.layers.5.lconv1d.linear_start.linear.weight": "model.safetensors", + "audio_tower.layers.5.lconv1d.linear_start.output_max": "model.safetensors", + "audio_tower.layers.5.lconv1d.linear_start.output_min": "model.safetensors", + "audio_tower.layers.5.lconv1d.pre_layer_norm.weight": "model.safetensors", + "audio_tower.layers.5.norm_out.weight": "model.safetensors", + "audio_tower.layers.5.norm_post_attn.weight": "model.safetensors", + "audio_tower.layers.5.norm_pre_attn.weight": "model.safetensors", + "audio_tower.layers.5.self_attn.k_proj.input_max": "model.safetensors", + "audio_tower.layers.5.self_attn.k_proj.input_min": "model.safetensors", + "audio_tower.layers.5.self_attn.k_proj.linear.weight": "model.safetensors", + "audio_tower.layers.5.self_attn.k_proj.output_max": "model.safetensors", + "audio_tower.layers.5.self_attn.k_proj.output_min": "model.safetensors", + "audio_tower.layers.5.self_attn.per_dim_scale": "model.safetensors", + "audio_tower.layers.5.self_attn.post.input_max": "model.safetensors", + "audio_tower.layers.5.self_attn.post.input_min": "model.safetensors", + "audio_tower.layers.5.self_attn.post.linear.weight": "model.safetensors", + "audio_tower.layers.5.self_attn.post.output_max": "model.safetensors", + "audio_tower.layers.5.self_attn.post.output_min": "model.safetensors", + "audio_tower.layers.5.self_attn.q_proj.input_max": "model.safetensors", + "audio_tower.layers.5.self_attn.q_proj.input_min": "model.safetensors", + "audio_tower.layers.5.self_attn.q_proj.linear.weight": "model.safetensors", + "audio_tower.layers.5.self_attn.q_proj.output_max": "model.safetensors", + "audio_tower.layers.5.self_attn.q_proj.output_min": "model.safetensors", + "audio_tower.layers.5.self_attn.relative_k_proj.weight": "model.safetensors", + "audio_tower.layers.5.self_attn.v_proj.input_max": "model.safetensors", + "audio_tower.layers.5.self_attn.v_proj.input_min": "model.safetensors", + "audio_tower.layers.5.self_attn.v_proj.linear.weight": "model.safetensors", + "audio_tower.layers.5.self_attn.v_proj.output_max": "model.safetensors", + "audio_tower.layers.5.self_attn.v_proj.output_min": "model.safetensors", + "audio_tower.layers.6.feed_forward1.ffw_layer_1.input_max": "model.safetensors", + "audio_tower.layers.6.feed_forward1.ffw_layer_1.input_min": "model.safetensors", + "audio_tower.layers.6.feed_forward1.ffw_layer_1.linear.weight": "model.safetensors", + "audio_tower.layers.6.feed_forward1.ffw_layer_1.output_max": "model.safetensors", + "audio_tower.layers.6.feed_forward1.ffw_layer_1.output_min": "model.safetensors", + "audio_tower.layers.6.feed_forward1.ffw_layer_2.input_max": "model.safetensors", + "audio_tower.layers.6.feed_forward1.ffw_layer_2.input_min": "model.safetensors", + "audio_tower.layers.6.feed_forward1.ffw_layer_2.linear.weight": "model.safetensors", + "audio_tower.layers.6.feed_forward1.ffw_layer_2.output_max": "model.safetensors", + "audio_tower.layers.6.feed_forward1.ffw_layer_2.output_min": "model.safetensors", + "audio_tower.layers.6.feed_forward1.post_layer_norm.weight": "model.safetensors", + "audio_tower.layers.6.feed_forward1.pre_layer_norm.weight": "model.safetensors", + "audio_tower.layers.6.feed_forward2.ffw_layer_1.input_max": "model.safetensors", + "audio_tower.layers.6.feed_forward2.ffw_layer_1.input_min": "model.safetensors", + "audio_tower.layers.6.feed_forward2.ffw_layer_1.linear.weight": "model.safetensors", + "audio_tower.layers.6.feed_forward2.ffw_layer_1.output_max": "model.safetensors", + "audio_tower.layers.6.feed_forward2.ffw_layer_1.output_min": "model.safetensors", + "audio_tower.layers.6.feed_forward2.ffw_layer_2.input_max": "model.safetensors", + "audio_tower.layers.6.feed_forward2.ffw_layer_2.input_min": "model.safetensors", + "audio_tower.layers.6.feed_forward2.ffw_layer_2.linear.weight": "model.safetensors", + "audio_tower.layers.6.feed_forward2.ffw_layer_2.output_max": "model.safetensors", + "audio_tower.layers.6.feed_forward2.ffw_layer_2.output_min": "model.safetensors", + "audio_tower.layers.6.feed_forward2.post_layer_norm.weight": "model.safetensors", + "audio_tower.layers.6.feed_forward2.pre_layer_norm.weight": "model.safetensors", + "audio_tower.layers.6.lconv1d.conv_norm.weight": "model.safetensors", + "audio_tower.layers.6.lconv1d.depthwise_conv1d.weight": "model.safetensors", + "audio_tower.layers.6.lconv1d.linear_end.input_max": "model.safetensors", + "audio_tower.layers.6.lconv1d.linear_end.input_min": "model.safetensors", + "audio_tower.layers.6.lconv1d.linear_end.linear.weight": "model.safetensors", + "audio_tower.layers.6.lconv1d.linear_end.output_max": "model.safetensors", + "audio_tower.layers.6.lconv1d.linear_end.output_min": "model.safetensors", + "audio_tower.layers.6.lconv1d.linear_start.input_max": "model.safetensors", + "audio_tower.layers.6.lconv1d.linear_start.input_min": "model.safetensors", + "audio_tower.layers.6.lconv1d.linear_start.linear.weight": "model.safetensors", + "audio_tower.layers.6.lconv1d.linear_start.output_max": "model.safetensors", + "audio_tower.layers.6.lconv1d.linear_start.output_min": "model.safetensors", + "audio_tower.layers.6.lconv1d.pre_layer_norm.weight": "model.safetensors", + "audio_tower.layers.6.norm_out.weight": "model.safetensors", + "audio_tower.layers.6.norm_post_attn.weight": "model.safetensors", + "audio_tower.layers.6.norm_pre_attn.weight": "model.safetensors", + "audio_tower.layers.6.self_attn.k_proj.input_max": "model.safetensors", + "audio_tower.layers.6.self_attn.k_proj.input_min": "model.safetensors", + "audio_tower.layers.6.self_attn.k_proj.linear.weight": "model.safetensors", + "audio_tower.layers.6.self_attn.k_proj.output_max": "model.safetensors", + "audio_tower.layers.6.self_attn.k_proj.output_min": "model.safetensors", + "audio_tower.layers.6.self_attn.per_dim_scale": "model.safetensors", + "audio_tower.layers.6.self_attn.post.input_max": "model.safetensors", + "audio_tower.layers.6.self_attn.post.input_min": "model.safetensors", + "audio_tower.layers.6.self_attn.post.linear.weight": "model.safetensors", + "audio_tower.layers.6.self_attn.post.output_max": "model.safetensors", + "audio_tower.layers.6.self_attn.post.output_min": "model.safetensors", + "audio_tower.layers.6.self_attn.q_proj.input_max": "model.safetensors", + "audio_tower.layers.6.self_attn.q_proj.input_min": "model.safetensors", + "audio_tower.layers.6.self_attn.q_proj.linear.weight": "model.safetensors", + "audio_tower.layers.6.self_attn.q_proj.output_max": "model.safetensors", + "audio_tower.layers.6.self_attn.q_proj.output_min": "model.safetensors", + "audio_tower.layers.6.self_attn.relative_k_proj.weight": "model.safetensors", + "audio_tower.layers.6.self_attn.v_proj.input_max": "model.safetensors", + "audio_tower.layers.6.self_attn.v_proj.input_min": "model.safetensors", + "audio_tower.layers.6.self_attn.v_proj.linear.weight": "model.safetensors", + "audio_tower.layers.6.self_attn.v_proj.output_max": "model.safetensors", + "audio_tower.layers.6.self_attn.v_proj.output_min": "model.safetensors", + "audio_tower.layers.7.feed_forward1.ffw_layer_1.input_max": "model.safetensors", + "audio_tower.layers.7.feed_forward1.ffw_layer_1.input_min": "model.safetensors", + "audio_tower.layers.7.feed_forward1.ffw_layer_1.linear.weight": "model.safetensors", + "audio_tower.layers.7.feed_forward1.ffw_layer_1.output_max": "model.safetensors", + "audio_tower.layers.7.feed_forward1.ffw_layer_1.output_min": "model.safetensors", + "audio_tower.layers.7.feed_forward1.ffw_layer_2.input_max": "model.safetensors", + "audio_tower.layers.7.feed_forward1.ffw_layer_2.input_min": "model.safetensors", + "audio_tower.layers.7.feed_forward1.ffw_layer_2.linear.weight": "model.safetensors", + "audio_tower.layers.7.feed_forward1.ffw_layer_2.output_max": "model.safetensors", + "audio_tower.layers.7.feed_forward1.ffw_layer_2.output_min": "model.safetensors", + "audio_tower.layers.7.feed_forward1.post_layer_norm.weight": "model.safetensors", + "audio_tower.layers.7.feed_forward1.pre_layer_norm.weight": "model.safetensors", + "audio_tower.layers.7.feed_forward2.ffw_layer_1.input_max": "model.safetensors", + "audio_tower.layers.7.feed_forward2.ffw_layer_1.input_min": "model.safetensors", + "audio_tower.layers.7.feed_forward2.ffw_layer_1.linear.weight": "model.safetensors", + "audio_tower.layers.7.feed_forward2.ffw_layer_1.output_max": "model.safetensors", + "audio_tower.layers.7.feed_forward2.ffw_layer_1.output_min": "model.safetensors", + "audio_tower.layers.7.feed_forward2.ffw_layer_2.input_max": "model.safetensors", + "audio_tower.layers.7.feed_forward2.ffw_layer_2.input_min": "model.safetensors", + "audio_tower.layers.7.feed_forward2.ffw_layer_2.linear.weight": "model.safetensors", + "audio_tower.layers.7.feed_forward2.ffw_layer_2.output_max": "model.safetensors", + "audio_tower.layers.7.feed_forward2.ffw_layer_2.output_min": "model.safetensors", + "audio_tower.layers.7.feed_forward2.post_layer_norm.weight": "model.safetensors", + "audio_tower.layers.7.feed_forward2.pre_layer_norm.weight": "model.safetensors", + "audio_tower.layers.7.lconv1d.conv_norm.weight": "model.safetensors", + "audio_tower.layers.7.lconv1d.depthwise_conv1d.weight": "model.safetensors", + "audio_tower.layers.7.lconv1d.linear_end.input_max": "model.safetensors", + "audio_tower.layers.7.lconv1d.linear_end.input_min": "model.safetensors", + "audio_tower.layers.7.lconv1d.linear_end.linear.weight": "model.safetensors", + "audio_tower.layers.7.lconv1d.linear_end.output_max": "model.safetensors", + "audio_tower.layers.7.lconv1d.linear_end.output_min": "model.safetensors", + "audio_tower.layers.7.lconv1d.linear_start.input_max": "model.safetensors", + "audio_tower.layers.7.lconv1d.linear_start.input_min": "model.safetensors", + "audio_tower.layers.7.lconv1d.linear_start.linear.weight": "model.safetensors", + "audio_tower.layers.7.lconv1d.linear_start.output_max": "model.safetensors", + "audio_tower.layers.7.lconv1d.linear_start.output_min": "model.safetensors", + "audio_tower.layers.7.lconv1d.pre_layer_norm.weight": "model.safetensors", + "audio_tower.layers.7.norm_out.weight": "model.safetensors", + "audio_tower.layers.7.norm_post_attn.weight": "model.safetensors", + "audio_tower.layers.7.norm_pre_attn.weight": "model.safetensors", + "audio_tower.layers.7.self_attn.k_proj.input_max": "model.safetensors", + "audio_tower.layers.7.self_attn.k_proj.input_min": "model.safetensors", + "audio_tower.layers.7.self_attn.k_proj.linear.weight": "model.safetensors", + "audio_tower.layers.7.self_attn.k_proj.output_max": "model.safetensors", + "audio_tower.layers.7.self_attn.k_proj.output_min": "model.safetensors", + "audio_tower.layers.7.self_attn.per_dim_scale": "model.safetensors", + "audio_tower.layers.7.self_attn.post.input_max": "model.safetensors", + "audio_tower.layers.7.self_attn.post.input_min": "model.safetensors", + "audio_tower.layers.7.self_attn.post.linear.weight": "model.safetensors", + "audio_tower.layers.7.self_attn.post.output_max": "model.safetensors", + "audio_tower.layers.7.self_attn.post.output_min": "model.safetensors", + "audio_tower.layers.7.self_attn.q_proj.input_max": "model.safetensors", + "audio_tower.layers.7.self_attn.q_proj.input_min": "model.safetensors", + "audio_tower.layers.7.self_attn.q_proj.linear.weight": "model.safetensors", + "audio_tower.layers.7.self_attn.q_proj.output_max": "model.safetensors", + "audio_tower.layers.7.self_attn.q_proj.output_min": "model.safetensors", + "audio_tower.layers.7.self_attn.relative_k_proj.weight": "model.safetensors", + "audio_tower.layers.7.self_attn.v_proj.input_max": "model.safetensors", + "audio_tower.layers.7.self_attn.v_proj.input_min": "model.safetensors", + "audio_tower.layers.7.self_attn.v_proj.linear.weight": "model.safetensors", + "audio_tower.layers.7.self_attn.v_proj.output_max": "model.safetensors", + "audio_tower.layers.7.self_attn.v_proj.output_min": "model.safetensors", + "audio_tower.layers.8.feed_forward1.ffw_layer_1.input_max": "model.safetensors", + "audio_tower.layers.8.feed_forward1.ffw_layer_1.input_min": "model.safetensors", + "audio_tower.layers.8.feed_forward1.ffw_layer_1.linear.weight": "model.safetensors", + "audio_tower.layers.8.feed_forward1.ffw_layer_1.output_max": "model.safetensors", + "audio_tower.layers.8.feed_forward1.ffw_layer_1.output_min": "model.safetensors", + "audio_tower.layers.8.feed_forward1.ffw_layer_2.input_max": "model.safetensors", + "audio_tower.layers.8.feed_forward1.ffw_layer_2.input_min": "model.safetensors", + "audio_tower.layers.8.feed_forward1.ffw_layer_2.linear.weight": "model.safetensors", + "audio_tower.layers.8.feed_forward1.ffw_layer_2.output_max": "model.safetensors", + "audio_tower.layers.8.feed_forward1.ffw_layer_2.output_min": "model.safetensors", + "audio_tower.layers.8.feed_forward1.post_layer_norm.weight": "model.safetensors", + "audio_tower.layers.8.feed_forward1.pre_layer_norm.weight": "model.safetensors", + "audio_tower.layers.8.feed_forward2.ffw_layer_1.input_max": "model.safetensors", + "audio_tower.layers.8.feed_forward2.ffw_layer_1.input_min": "model.safetensors", + "audio_tower.layers.8.feed_forward2.ffw_layer_1.linear.weight": "model.safetensors", + "audio_tower.layers.8.feed_forward2.ffw_layer_1.output_max": "model.safetensors", + "audio_tower.layers.8.feed_forward2.ffw_layer_1.output_min": "model.safetensors", + "audio_tower.layers.8.feed_forward2.ffw_layer_2.input_max": "model.safetensors", + "audio_tower.layers.8.feed_forward2.ffw_layer_2.input_min": "model.safetensors", + "audio_tower.layers.8.feed_forward2.ffw_layer_2.linear.weight": "model.safetensors", + "audio_tower.layers.8.feed_forward2.ffw_layer_2.output_max": "model.safetensors", + "audio_tower.layers.8.feed_forward2.ffw_layer_2.output_min": "model.safetensors", + "audio_tower.layers.8.feed_forward2.post_layer_norm.weight": "model.safetensors", + "audio_tower.layers.8.feed_forward2.pre_layer_norm.weight": "model.safetensors", + "audio_tower.layers.8.lconv1d.conv_norm.weight": "model.safetensors", + "audio_tower.layers.8.lconv1d.depthwise_conv1d.weight": "model.safetensors", + "audio_tower.layers.8.lconv1d.linear_end.input_max": "model.safetensors", + "audio_tower.layers.8.lconv1d.linear_end.input_min": "model.safetensors", + "audio_tower.layers.8.lconv1d.linear_end.linear.weight": "model.safetensors", + "audio_tower.layers.8.lconv1d.linear_end.output_max": "model.safetensors", + "audio_tower.layers.8.lconv1d.linear_end.output_min": "model.safetensors", + "audio_tower.layers.8.lconv1d.linear_start.input_max": "model.safetensors", + "audio_tower.layers.8.lconv1d.linear_start.input_min": "model.safetensors", + "audio_tower.layers.8.lconv1d.linear_start.linear.weight": "model.safetensors", + "audio_tower.layers.8.lconv1d.linear_start.output_max": "model.safetensors", + "audio_tower.layers.8.lconv1d.linear_start.output_min": "model.safetensors", + "audio_tower.layers.8.lconv1d.pre_layer_norm.weight": "model.safetensors", + "audio_tower.layers.8.norm_out.weight": "model.safetensors", + "audio_tower.layers.8.norm_post_attn.weight": "model.safetensors", + "audio_tower.layers.8.norm_pre_attn.weight": "model.safetensors", + "audio_tower.layers.8.self_attn.k_proj.input_max": "model.safetensors", + "audio_tower.layers.8.self_attn.k_proj.input_min": "model.safetensors", + "audio_tower.layers.8.self_attn.k_proj.linear.weight": "model.safetensors", + "audio_tower.layers.8.self_attn.k_proj.output_max": "model.safetensors", + "audio_tower.layers.8.self_attn.k_proj.output_min": "model.safetensors", + "audio_tower.layers.8.self_attn.per_dim_scale": "model.safetensors", + "audio_tower.layers.8.self_attn.post.input_max": "model.safetensors", + "audio_tower.layers.8.self_attn.post.input_min": "model.safetensors", + "audio_tower.layers.8.self_attn.post.linear.weight": "model.safetensors", + "audio_tower.layers.8.self_attn.post.output_max": "model.safetensors", + "audio_tower.layers.8.self_attn.post.output_min": "model.safetensors", + "audio_tower.layers.8.self_attn.q_proj.input_max": "model.safetensors", + "audio_tower.layers.8.self_attn.q_proj.input_min": "model.safetensors", + "audio_tower.layers.8.self_attn.q_proj.linear.weight": "model.safetensors", + "audio_tower.layers.8.self_attn.q_proj.output_max": "model.safetensors", + "audio_tower.layers.8.self_attn.q_proj.output_min": "model.safetensors", + "audio_tower.layers.8.self_attn.relative_k_proj.weight": "model.safetensors", + "audio_tower.layers.8.self_attn.v_proj.input_max": "model.safetensors", + "audio_tower.layers.8.self_attn.v_proj.input_min": "model.safetensors", + "audio_tower.layers.8.self_attn.v_proj.linear.weight": "model.safetensors", + "audio_tower.layers.8.self_attn.v_proj.output_max": "model.safetensors", + "audio_tower.layers.8.self_attn.v_proj.output_min": "model.safetensors", + "audio_tower.layers.9.feed_forward1.ffw_layer_1.input_max": "model.safetensors", + "audio_tower.layers.9.feed_forward1.ffw_layer_1.input_min": "model.safetensors", + "audio_tower.layers.9.feed_forward1.ffw_layer_1.linear.weight": "model.safetensors", + "audio_tower.layers.9.feed_forward1.ffw_layer_1.output_max": "model.safetensors", + "audio_tower.layers.9.feed_forward1.ffw_layer_1.output_min": "model.safetensors", + "audio_tower.layers.9.feed_forward1.ffw_layer_2.input_max": "model.safetensors", + "audio_tower.layers.9.feed_forward1.ffw_layer_2.input_min": "model.safetensors", + "audio_tower.layers.9.feed_forward1.ffw_layer_2.linear.weight": "model.safetensors", + "audio_tower.layers.9.feed_forward1.ffw_layer_2.output_max": "model.safetensors", + "audio_tower.layers.9.feed_forward1.ffw_layer_2.output_min": "model.safetensors", + "audio_tower.layers.9.feed_forward1.post_layer_norm.weight": "model.safetensors", + "audio_tower.layers.9.feed_forward1.pre_layer_norm.weight": "model.safetensors", + "audio_tower.layers.9.feed_forward2.ffw_layer_1.input_max": "model.safetensors", + "audio_tower.layers.9.feed_forward2.ffw_layer_1.input_min": "model.safetensors", + "audio_tower.layers.9.feed_forward2.ffw_layer_1.linear.weight": "model.safetensors", + "audio_tower.layers.9.feed_forward2.ffw_layer_1.output_max": "model.safetensors", + "audio_tower.layers.9.feed_forward2.ffw_layer_1.output_min": "model.safetensors", + "audio_tower.layers.9.feed_forward2.ffw_layer_2.input_max": "model.safetensors", + "audio_tower.layers.9.feed_forward2.ffw_layer_2.input_min": "model.safetensors", + "audio_tower.layers.9.feed_forward2.ffw_layer_2.linear.weight": "model.safetensors", + "audio_tower.layers.9.feed_forward2.ffw_layer_2.output_max": "model.safetensors", + "audio_tower.layers.9.feed_forward2.ffw_layer_2.output_min": "model.safetensors", + "audio_tower.layers.9.feed_forward2.post_layer_norm.weight": "model.safetensors", + "audio_tower.layers.9.feed_forward2.pre_layer_norm.weight": "model.safetensors", + "audio_tower.layers.9.lconv1d.conv_norm.weight": "model.safetensors", + "audio_tower.layers.9.lconv1d.depthwise_conv1d.weight": "model.safetensors", + "audio_tower.layers.9.lconv1d.linear_end.input_max": "model.safetensors", + "audio_tower.layers.9.lconv1d.linear_end.input_min": "model.safetensors", + "audio_tower.layers.9.lconv1d.linear_end.linear.weight": "model.safetensors", + "audio_tower.layers.9.lconv1d.linear_end.output_max": "model.safetensors", + "audio_tower.layers.9.lconv1d.linear_end.output_min": "model.safetensors", + "audio_tower.layers.9.lconv1d.linear_start.input_max": "model.safetensors", + "audio_tower.layers.9.lconv1d.linear_start.input_min": "model.safetensors", + "audio_tower.layers.9.lconv1d.linear_start.linear.weight": "model.safetensors", + "audio_tower.layers.9.lconv1d.linear_start.output_max": "model.safetensors", + "audio_tower.layers.9.lconv1d.linear_start.output_min": "model.safetensors", + "audio_tower.layers.9.lconv1d.pre_layer_norm.weight": "model.safetensors", + "audio_tower.layers.9.norm_out.weight": "model.safetensors", + "audio_tower.layers.9.norm_post_attn.weight": "model.safetensors", + "audio_tower.layers.9.norm_pre_attn.weight": "model.safetensors", + "audio_tower.layers.9.self_attn.k_proj.input_max": "model.safetensors", + "audio_tower.layers.9.self_attn.k_proj.input_min": "model.safetensors", + "audio_tower.layers.9.self_attn.k_proj.linear.weight": "model.safetensors", + "audio_tower.layers.9.self_attn.k_proj.output_max": "model.safetensors", + "audio_tower.layers.9.self_attn.k_proj.output_min": "model.safetensors", + "audio_tower.layers.9.self_attn.per_dim_scale": "model.safetensors", + "audio_tower.layers.9.self_attn.post.input_max": "model.safetensors", + "audio_tower.layers.9.self_attn.post.input_min": "model.safetensors", + "audio_tower.layers.9.self_attn.post.linear.weight": "model.safetensors", + "audio_tower.layers.9.self_attn.post.output_max": "model.safetensors", + "audio_tower.layers.9.self_attn.post.output_min": "model.safetensors", + "audio_tower.layers.9.self_attn.q_proj.input_max": "model.safetensors", + "audio_tower.layers.9.self_attn.q_proj.input_min": "model.safetensors", + "audio_tower.layers.9.self_attn.q_proj.linear.weight": "model.safetensors", + "audio_tower.layers.9.self_attn.q_proj.output_max": "model.safetensors", + "audio_tower.layers.9.self_attn.q_proj.output_min": "model.safetensors", + "audio_tower.layers.9.self_attn.relative_k_proj.weight": "model.safetensors", + "audio_tower.layers.9.self_attn.v_proj.input_max": "model.safetensors", + "audio_tower.layers.9.self_attn.v_proj.input_min": "model.safetensors", + "audio_tower.layers.9.self_attn.v_proj.linear.weight": "model.safetensors", + "audio_tower.layers.9.self_attn.v_proj.output_max": "model.safetensors", + "audio_tower.layers.9.self_attn.v_proj.output_min": "model.safetensors", + "audio_tower.output_proj.bias": "model.safetensors", + "audio_tower.output_proj.weight": "model.safetensors", + "audio_tower.subsample_conv_projection.input_proj_linear.weight": "model.safetensors", + "audio_tower.subsample_conv_projection.layer0.conv.weight": "model.safetensors", + "audio_tower.subsample_conv_projection.layer0.norm.weight": "model.safetensors", + "audio_tower.subsample_conv_projection.layer1.conv.weight": "model.safetensors", + "audio_tower.subsample_conv_projection.layer1.norm.weight": "model.safetensors", + "embed_audio.embedding_projection.biases": "model.safetensors", + "embed_audio.embedding_projection.scales": "model.safetensors", + "embed_audio.embedding_projection.weight": "model.safetensors", + "embed_vision.embedding_projection.biases": "model.safetensors", + "embed_vision.embedding_projection.scales": "model.safetensors", + "embed_vision.embedding_projection.weight": "model.safetensors", + "language_model.model.embed_tokens.biases": "model.safetensors", + "language_model.model.embed_tokens.scales": "model.safetensors", + "language_model.model.embed_tokens.weight": "model.safetensors", + "language_model.model.embed_tokens_per_layer.biases": "model.safetensors", + "language_model.model.embed_tokens_per_layer.scales": "model.safetensors", + "language_model.model.embed_tokens_per_layer.weight": "model.safetensors", + "language_model.model.layers.0.input_layernorm.weight": "model.safetensors", + "language_model.model.layers.0.layer_scalar": "model.safetensors", + "language_model.model.layers.0.mlp.down_proj.biases": "model.safetensors", + "language_model.model.layers.0.mlp.down_proj.scales": "model.safetensors", + "language_model.model.layers.0.mlp.down_proj.weight": "model.safetensors", + "language_model.model.layers.0.mlp.gate_proj.biases": "model.safetensors", + "language_model.model.layers.0.mlp.gate_proj.scales": "model.safetensors", + "language_model.model.layers.0.mlp.gate_proj.weight": "model.safetensors", + "language_model.model.layers.0.mlp.up_proj.biases": "model.safetensors", + "language_model.model.layers.0.mlp.up_proj.scales": "model.safetensors", + "language_model.model.layers.0.mlp.up_proj.weight": "model.safetensors", + "language_model.model.layers.0.per_layer_input_gate.biases": "model.safetensors", + "language_model.model.layers.0.per_layer_input_gate.scales": "model.safetensors", + "language_model.model.layers.0.per_layer_input_gate.weight": "model.safetensors", + "language_model.model.layers.0.per_layer_projection.biases": "model.safetensors", + "language_model.model.layers.0.per_layer_projection.scales": "model.safetensors", + "language_model.model.layers.0.per_layer_projection.weight": "model.safetensors", + "language_model.model.layers.0.post_attention_layernorm.weight": "model.safetensors", + "language_model.model.layers.0.post_feedforward_layernorm.weight": "model.safetensors", + "language_model.model.layers.0.post_per_layer_input_norm.weight": "model.safetensors", + "language_model.model.layers.0.pre_feedforward_layernorm.weight": "model.safetensors", + "language_model.model.layers.0.self_attn.k_norm.weight": "model.safetensors", + "language_model.model.layers.0.self_attn.k_proj.biases": "model.safetensors", + "language_model.model.layers.0.self_attn.k_proj.scales": "model.safetensors", + "language_model.model.layers.0.self_attn.k_proj.weight": "model.safetensors", + "language_model.model.layers.0.self_attn.o_proj.biases": "model.safetensors", + "language_model.model.layers.0.self_attn.o_proj.scales": "model.safetensors", + "language_model.model.layers.0.self_attn.o_proj.weight": "model.safetensors", + "language_model.model.layers.0.self_attn.q_norm.weight": "model.safetensors", + "language_model.model.layers.0.self_attn.q_proj.biases": "model.safetensors", + "language_model.model.layers.0.self_attn.q_proj.scales": "model.safetensors", + "language_model.model.layers.0.self_attn.q_proj.weight": "model.safetensors", + "language_model.model.layers.0.self_attn.v_proj.biases": "model.safetensors", + "language_model.model.layers.0.self_attn.v_proj.scales": "model.safetensors", + "language_model.model.layers.0.self_attn.v_proj.weight": "model.safetensors", + "language_model.model.layers.1.input_layernorm.weight": "model.safetensors", + "language_model.model.layers.1.layer_scalar": "model.safetensors", + "language_model.model.layers.1.mlp.down_proj.biases": "model.safetensors", + "language_model.model.layers.1.mlp.down_proj.scales": "model.safetensors", + "language_model.model.layers.1.mlp.down_proj.weight": "model.safetensors", + "language_model.model.layers.1.mlp.gate_proj.biases": "model.safetensors", + "language_model.model.layers.1.mlp.gate_proj.scales": "model.safetensors", + "language_model.model.layers.1.mlp.gate_proj.weight": "model.safetensors", + "language_model.model.layers.1.mlp.up_proj.biases": "model.safetensors", + "language_model.model.layers.1.mlp.up_proj.scales": "model.safetensors", + "language_model.model.layers.1.mlp.up_proj.weight": "model.safetensors", + "language_model.model.layers.1.per_layer_input_gate.biases": "model.safetensors", + "language_model.model.layers.1.per_layer_input_gate.scales": "model.safetensors", + "language_model.model.layers.1.per_layer_input_gate.weight": "model.safetensors", + "language_model.model.layers.1.per_layer_projection.biases": "model.safetensors", + "language_model.model.layers.1.per_layer_projection.scales": "model.safetensors", + "language_model.model.layers.1.per_layer_projection.weight": "model.safetensors", + "language_model.model.layers.1.post_attention_layernorm.weight": "model.safetensors", + "language_model.model.layers.1.post_feedforward_layernorm.weight": "model.safetensors", + "language_model.model.layers.1.post_per_layer_input_norm.weight": "model.safetensors", + "language_model.model.layers.1.pre_feedforward_layernorm.weight": "model.safetensors", + "language_model.model.layers.1.self_attn.k_norm.weight": "model.safetensors", + "language_model.model.layers.1.self_attn.k_proj.biases": "model.safetensors", + "language_model.model.layers.1.self_attn.k_proj.scales": "model.safetensors", + "language_model.model.layers.1.self_attn.k_proj.weight": "model.safetensors", + "language_model.model.layers.1.self_attn.o_proj.biases": "model.safetensors", + "language_model.model.layers.1.self_attn.o_proj.scales": "model.safetensors", + "language_model.model.layers.1.self_attn.o_proj.weight": "model.safetensors", + "language_model.model.layers.1.self_attn.q_norm.weight": "model.safetensors", + "language_model.model.layers.1.self_attn.q_proj.biases": "model.safetensors", + "language_model.model.layers.1.self_attn.q_proj.scales": "model.safetensors", + "language_model.model.layers.1.self_attn.q_proj.weight": "model.safetensors", + "language_model.model.layers.1.self_attn.v_proj.biases": "model.safetensors", + "language_model.model.layers.1.self_attn.v_proj.scales": "model.safetensors", + "language_model.model.layers.1.self_attn.v_proj.weight": "model.safetensors", + "language_model.model.layers.10.input_layernorm.weight": "model.safetensors", + "language_model.model.layers.10.layer_scalar": "model.safetensors", + "language_model.model.layers.10.mlp.down_proj.biases": "model.safetensors", + "language_model.model.layers.10.mlp.down_proj.scales": "model.safetensors", + "language_model.model.layers.10.mlp.down_proj.weight": "model.safetensors", + "language_model.model.layers.10.mlp.gate_proj.biases": "model.safetensors", + "language_model.model.layers.10.mlp.gate_proj.scales": "model.safetensors", + "language_model.model.layers.10.mlp.gate_proj.weight": "model.safetensors", + "language_model.model.layers.10.mlp.up_proj.biases": "model.safetensors", + "language_model.model.layers.10.mlp.up_proj.scales": "model.safetensors", + "language_model.model.layers.10.mlp.up_proj.weight": "model.safetensors", + "language_model.model.layers.10.per_layer_input_gate.biases": "model.safetensors", + "language_model.model.layers.10.per_layer_input_gate.scales": "model.safetensors", + "language_model.model.layers.10.per_layer_input_gate.weight": "model.safetensors", + "language_model.model.layers.10.per_layer_projection.biases": "model.safetensors", + "language_model.model.layers.10.per_layer_projection.scales": "model.safetensors", + "language_model.model.layers.10.per_layer_projection.weight": "model.safetensors", + "language_model.model.layers.10.post_attention_layernorm.weight": "model.safetensors", + "language_model.model.layers.10.post_feedforward_layernorm.weight": "model.safetensors", + "language_model.model.layers.10.post_per_layer_input_norm.weight": "model.safetensors", + "language_model.model.layers.10.pre_feedforward_layernorm.weight": "model.safetensors", + "language_model.model.layers.10.self_attn.k_norm.weight": "model.safetensors", + "language_model.model.layers.10.self_attn.k_proj.biases": "model.safetensors", + "language_model.model.layers.10.self_attn.k_proj.scales": "model.safetensors", + "language_model.model.layers.10.self_attn.k_proj.weight": "model.safetensors", + "language_model.model.layers.10.self_attn.o_proj.biases": "model.safetensors", + "language_model.model.layers.10.self_attn.o_proj.scales": "model.safetensors", + "language_model.model.layers.10.self_attn.o_proj.weight": "model.safetensors", + "language_model.model.layers.10.self_attn.q_norm.weight": "model.safetensors", + "language_model.model.layers.10.self_attn.q_proj.biases": "model.safetensors", + "language_model.model.layers.10.self_attn.q_proj.scales": "model.safetensors", + "language_model.model.layers.10.self_attn.q_proj.weight": "model.safetensors", + "language_model.model.layers.10.self_attn.v_proj.biases": "model.safetensors", + "language_model.model.layers.10.self_attn.v_proj.scales": "model.safetensors", + "language_model.model.layers.10.self_attn.v_proj.weight": "model.safetensors", + "language_model.model.layers.11.input_layernorm.weight": "model.safetensors", + "language_model.model.layers.11.layer_scalar": "model.safetensors", + "language_model.model.layers.11.mlp.down_proj.biases": "model.safetensors", + "language_model.model.layers.11.mlp.down_proj.scales": "model.safetensors", + "language_model.model.layers.11.mlp.down_proj.weight": "model.safetensors", + "language_model.model.layers.11.mlp.gate_proj.biases": "model.safetensors", + "language_model.model.layers.11.mlp.gate_proj.scales": "model.safetensors", + "language_model.model.layers.11.mlp.gate_proj.weight": "model.safetensors", + "language_model.model.layers.11.mlp.up_proj.biases": "model.safetensors", + "language_model.model.layers.11.mlp.up_proj.scales": "model.safetensors", + "language_model.model.layers.11.mlp.up_proj.weight": "model.safetensors", + "language_model.model.layers.11.per_layer_input_gate.biases": "model.safetensors", + "language_model.model.layers.11.per_layer_input_gate.scales": "model.safetensors", + "language_model.model.layers.11.per_layer_input_gate.weight": "model.safetensors", + "language_model.model.layers.11.per_layer_projection.biases": "model.safetensors", + "language_model.model.layers.11.per_layer_projection.scales": "model.safetensors", + "language_model.model.layers.11.per_layer_projection.weight": "model.safetensors", + "language_model.model.layers.11.post_attention_layernorm.weight": "model.safetensors", + "language_model.model.layers.11.post_feedforward_layernorm.weight": "model.safetensors", + "language_model.model.layers.11.post_per_layer_input_norm.weight": "model.safetensors", + "language_model.model.layers.11.pre_feedforward_layernorm.weight": "model.safetensors", + "language_model.model.layers.11.self_attn.k_norm.weight": "model.safetensors", + "language_model.model.layers.11.self_attn.k_proj.biases": "model.safetensors", + "language_model.model.layers.11.self_attn.k_proj.scales": "model.safetensors", + "language_model.model.layers.11.self_attn.k_proj.weight": "model.safetensors", + "language_model.model.layers.11.self_attn.o_proj.biases": "model.safetensors", + "language_model.model.layers.11.self_attn.o_proj.scales": "model.safetensors", + "language_model.model.layers.11.self_attn.o_proj.weight": "model.safetensors", + "language_model.model.layers.11.self_attn.q_norm.weight": "model.safetensors", + "language_model.model.layers.11.self_attn.q_proj.biases": "model.safetensors", + "language_model.model.layers.11.self_attn.q_proj.scales": "model.safetensors", + "language_model.model.layers.11.self_attn.q_proj.weight": "model.safetensors", + "language_model.model.layers.11.self_attn.v_proj.biases": "model.safetensors", + "language_model.model.layers.11.self_attn.v_proj.scales": "model.safetensors", + "language_model.model.layers.11.self_attn.v_proj.weight": "model.safetensors", + "language_model.model.layers.12.input_layernorm.weight": "model.safetensors", + "language_model.model.layers.12.layer_scalar": "model.safetensors", + "language_model.model.layers.12.mlp.down_proj.biases": "model.safetensors", + "language_model.model.layers.12.mlp.down_proj.scales": "model.safetensors", + "language_model.model.layers.12.mlp.down_proj.weight": "model.safetensors", + "language_model.model.layers.12.mlp.gate_proj.biases": "model.safetensors", + "language_model.model.layers.12.mlp.gate_proj.scales": "model.safetensors", + "language_model.model.layers.12.mlp.gate_proj.weight": "model.safetensors", + "language_model.model.layers.12.mlp.up_proj.biases": "model.safetensors", + "language_model.model.layers.12.mlp.up_proj.scales": "model.safetensors", + "language_model.model.layers.12.mlp.up_proj.weight": "model.safetensors", + "language_model.model.layers.12.per_layer_input_gate.biases": "model.safetensors", + "language_model.model.layers.12.per_layer_input_gate.scales": "model.safetensors", + "language_model.model.layers.12.per_layer_input_gate.weight": "model.safetensors", + "language_model.model.layers.12.per_layer_projection.biases": "model.safetensors", + "language_model.model.layers.12.per_layer_projection.scales": "model.safetensors", + "language_model.model.layers.12.per_layer_projection.weight": "model.safetensors", + "language_model.model.layers.12.post_attention_layernorm.weight": "model.safetensors", + "language_model.model.layers.12.post_feedforward_layernorm.weight": "model.safetensors", + "language_model.model.layers.12.post_per_layer_input_norm.weight": "model.safetensors", + "language_model.model.layers.12.pre_feedforward_layernorm.weight": "model.safetensors", + "language_model.model.layers.12.self_attn.k_norm.weight": "model.safetensors", + "language_model.model.layers.12.self_attn.k_proj.biases": "model.safetensors", + "language_model.model.layers.12.self_attn.k_proj.scales": "model.safetensors", + "language_model.model.layers.12.self_attn.k_proj.weight": "model.safetensors", + "language_model.model.layers.12.self_attn.o_proj.biases": "model.safetensors", + "language_model.model.layers.12.self_attn.o_proj.scales": "model.safetensors", + "language_model.model.layers.12.self_attn.o_proj.weight": "model.safetensors", + "language_model.model.layers.12.self_attn.q_norm.weight": "model.safetensors", + "language_model.model.layers.12.self_attn.q_proj.biases": "model.safetensors", + "language_model.model.layers.12.self_attn.q_proj.scales": "model.safetensors", + "language_model.model.layers.12.self_attn.q_proj.weight": "model.safetensors", + "language_model.model.layers.12.self_attn.v_proj.biases": "model.safetensors", + "language_model.model.layers.12.self_attn.v_proj.scales": "model.safetensors", + "language_model.model.layers.12.self_attn.v_proj.weight": "model.safetensors", + "language_model.model.layers.13.input_layernorm.weight": "model.safetensors", + "language_model.model.layers.13.layer_scalar": "model.safetensors", + "language_model.model.layers.13.mlp.down_proj.biases": "model.safetensors", + "language_model.model.layers.13.mlp.down_proj.scales": "model.safetensors", + "language_model.model.layers.13.mlp.down_proj.weight": "model.safetensors", + "language_model.model.layers.13.mlp.gate_proj.biases": "model.safetensors", + "language_model.model.layers.13.mlp.gate_proj.scales": "model.safetensors", + "language_model.model.layers.13.mlp.gate_proj.weight": "model.safetensors", + "language_model.model.layers.13.mlp.up_proj.biases": "model.safetensors", + "language_model.model.layers.13.mlp.up_proj.scales": "model.safetensors", + "language_model.model.layers.13.mlp.up_proj.weight": "model.safetensors", + "language_model.model.layers.13.per_layer_input_gate.biases": "model.safetensors", + "language_model.model.layers.13.per_layer_input_gate.scales": "model.safetensors", + "language_model.model.layers.13.per_layer_input_gate.weight": "model.safetensors", + "language_model.model.layers.13.per_layer_projection.biases": "model.safetensors", + "language_model.model.layers.13.per_layer_projection.scales": "model.safetensors", + "language_model.model.layers.13.per_layer_projection.weight": "model.safetensors", + "language_model.model.layers.13.post_attention_layernorm.weight": "model.safetensors", + "language_model.model.layers.13.post_feedforward_layernorm.weight": "model.safetensors", + "language_model.model.layers.13.post_per_layer_input_norm.weight": "model.safetensors", + "language_model.model.layers.13.pre_feedforward_layernorm.weight": "model.safetensors", + "language_model.model.layers.13.self_attn.k_norm.weight": "model.safetensors", + "language_model.model.layers.13.self_attn.k_proj.biases": "model.safetensors", + "language_model.model.layers.13.self_attn.k_proj.scales": "model.safetensors", + "language_model.model.layers.13.self_attn.k_proj.weight": "model.safetensors", + "language_model.model.layers.13.self_attn.o_proj.biases": "model.safetensors", + "language_model.model.layers.13.self_attn.o_proj.scales": "model.safetensors", + "language_model.model.layers.13.self_attn.o_proj.weight": "model.safetensors", + "language_model.model.layers.13.self_attn.q_norm.weight": "model.safetensors", + "language_model.model.layers.13.self_attn.q_proj.biases": "model.safetensors", + "language_model.model.layers.13.self_attn.q_proj.scales": "model.safetensors", + "language_model.model.layers.13.self_attn.q_proj.weight": "model.safetensors", + "language_model.model.layers.13.self_attn.v_proj.biases": "model.safetensors", + "language_model.model.layers.13.self_attn.v_proj.scales": "model.safetensors", + "language_model.model.layers.13.self_attn.v_proj.weight": "model.safetensors", + "language_model.model.layers.14.input_layernorm.weight": "model.safetensors", + "language_model.model.layers.14.layer_scalar": "model.safetensors", + "language_model.model.layers.14.mlp.down_proj.biases": "model.safetensors", + "language_model.model.layers.14.mlp.down_proj.scales": "model.safetensors", + "language_model.model.layers.14.mlp.down_proj.weight": "model.safetensors", + "language_model.model.layers.14.mlp.gate_proj.biases": "model.safetensors", + "language_model.model.layers.14.mlp.gate_proj.scales": "model.safetensors", + "language_model.model.layers.14.mlp.gate_proj.weight": "model.safetensors", + "language_model.model.layers.14.mlp.up_proj.biases": "model.safetensors", + "language_model.model.layers.14.mlp.up_proj.scales": "model.safetensors", + "language_model.model.layers.14.mlp.up_proj.weight": "model.safetensors", + "language_model.model.layers.14.per_layer_input_gate.biases": "model.safetensors", + "language_model.model.layers.14.per_layer_input_gate.scales": "model.safetensors", + "language_model.model.layers.14.per_layer_input_gate.weight": "model.safetensors", + "language_model.model.layers.14.per_layer_projection.biases": "model.safetensors", + "language_model.model.layers.14.per_layer_projection.scales": "model.safetensors", + "language_model.model.layers.14.per_layer_projection.weight": "model.safetensors", + "language_model.model.layers.14.post_attention_layernorm.weight": "model.safetensors", + "language_model.model.layers.14.post_feedforward_layernorm.weight": "model.safetensors", + "language_model.model.layers.14.post_per_layer_input_norm.weight": "model.safetensors", + "language_model.model.layers.14.pre_feedforward_layernorm.weight": "model.safetensors", + "language_model.model.layers.14.self_attn.k_norm.weight": "model.safetensors", + "language_model.model.layers.14.self_attn.k_proj.biases": "model.safetensors", + "language_model.model.layers.14.self_attn.k_proj.scales": "model.safetensors", + "language_model.model.layers.14.self_attn.k_proj.weight": "model.safetensors", + "language_model.model.layers.14.self_attn.o_proj.biases": "model.safetensors", + "language_model.model.layers.14.self_attn.o_proj.scales": "model.safetensors", + "language_model.model.layers.14.self_attn.o_proj.weight": "model.safetensors", + "language_model.model.layers.14.self_attn.q_norm.weight": "model.safetensors", + "language_model.model.layers.14.self_attn.q_proj.biases": "model.safetensors", + "language_model.model.layers.14.self_attn.q_proj.scales": "model.safetensors", + "language_model.model.layers.14.self_attn.q_proj.weight": "model.safetensors", + "language_model.model.layers.14.self_attn.v_proj.biases": "model.safetensors", + "language_model.model.layers.14.self_attn.v_proj.scales": "model.safetensors", + "language_model.model.layers.14.self_attn.v_proj.weight": "model.safetensors", + "language_model.model.layers.15.input_layernorm.weight": "model.safetensors", + "language_model.model.layers.15.layer_scalar": "model.safetensors", + "language_model.model.layers.15.mlp.down_proj.biases": "model.safetensors", + "language_model.model.layers.15.mlp.down_proj.scales": "model.safetensors", + "language_model.model.layers.15.mlp.down_proj.weight": "model.safetensors", + "language_model.model.layers.15.mlp.gate_proj.biases": "model.safetensors", + "language_model.model.layers.15.mlp.gate_proj.scales": "model.safetensors", + "language_model.model.layers.15.mlp.gate_proj.weight": "model.safetensors", + "language_model.model.layers.15.mlp.up_proj.biases": "model.safetensors", + "language_model.model.layers.15.mlp.up_proj.scales": "model.safetensors", + "language_model.model.layers.15.mlp.up_proj.weight": "model.safetensors", + "language_model.model.layers.15.per_layer_input_gate.biases": "model.safetensors", + "language_model.model.layers.15.per_layer_input_gate.scales": "model.safetensors", + "language_model.model.layers.15.per_layer_input_gate.weight": "model.safetensors", + "language_model.model.layers.15.per_layer_projection.biases": "model.safetensors", + "language_model.model.layers.15.per_layer_projection.scales": "model.safetensors", + "language_model.model.layers.15.per_layer_projection.weight": "model.safetensors", + "language_model.model.layers.15.post_attention_layernorm.weight": "model.safetensors", + "language_model.model.layers.15.post_feedforward_layernorm.weight": "model.safetensors", + "language_model.model.layers.15.post_per_layer_input_norm.weight": "model.safetensors", + "language_model.model.layers.15.pre_feedforward_layernorm.weight": "model.safetensors", + "language_model.model.layers.15.self_attn.k_norm.weight": "model.safetensors", + "language_model.model.layers.15.self_attn.k_proj.biases": "model.safetensors", + "language_model.model.layers.15.self_attn.k_proj.scales": "model.safetensors", + "language_model.model.layers.15.self_attn.k_proj.weight": "model.safetensors", + "language_model.model.layers.15.self_attn.o_proj.biases": "model.safetensors", + "language_model.model.layers.15.self_attn.o_proj.scales": "model.safetensors", + "language_model.model.layers.15.self_attn.o_proj.weight": "model.safetensors", + "language_model.model.layers.15.self_attn.q_norm.weight": "model.safetensors", + "language_model.model.layers.15.self_attn.q_proj.biases": "model.safetensors", + "language_model.model.layers.15.self_attn.q_proj.scales": "model.safetensors", + "language_model.model.layers.15.self_attn.q_proj.weight": "model.safetensors", + "language_model.model.layers.15.self_attn.v_proj.biases": "model.safetensors", + "language_model.model.layers.15.self_attn.v_proj.scales": "model.safetensors", + "language_model.model.layers.15.self_attn.v_proj.weight": "model.safetensors", + "language_model.model.layers.16.input_layernorm.weight": "model.safetensors", + "language_model.model.layers.16.layer_scalar": "model.safetensors", + "language_model.model.layers.16.mlp.down_proj.biases": "model.safetensors", + "language_model.model.layers.16.mlp.down_proj.scales": "model.safetensors", + "language_model.model.layers.16.mlp.down_proj.weight": "model.safetensors", + "language_model.model.layers.16.mlp.gate_proj.biases": "model.safetensors", + "language_model.model.layers.16.mlp.gate_proj.scales": "model.safetensors", + "language_model.model.layers.16.mlp.gate_proj.weight": "model.safetensors", + "language_model.model.layers.16.mlp.up_proj.biases": "model.safetensors", + "language_model.model.layers.16.mlp.up_proj.scales": "model.safetensors", + "language_model.model.layers.16.mlp.up_proj.weight": "model.safetensors", + "language_model.model.layers.16.per_layer_input_gate.biases": "model.safetensors", + "language_model.model.layers.16.per_layer_input_gate.scales": "model.safetensors", + "language_model.model.layers.16.per_layer_input_gate.weight": "model.safetensors", + "language_model.model.layers.16.per_layer_projection.biases": "model.safetensors", + "language_model.model.layers.16.per_layer_projection.scales": "model.safetensors", + "language_model.model.layers.16.per_layer_projection.weight": "model.safetensors", + "language_model.model.layers.16.post_attention_layernorm.weight": "model.safetensors", + "language_model.model.layers.16.post_feedforward_layernorm.weight": "model.safetensors", + "language_model.model.layers.16.post_per_layer_input_norm.weight": "model.safetensors", + "language_model.model.layers.16.pre_feedforward_layernorm.weight": "model.safetensors", + "language_model.model.layers.16.self_attn.k_norm.weight": "model.safetensors", + "language_model.model.layers.16.self_attn.k_proj.biases": "model.safetensors", + "language_model.model.layers.16.self_attn.k_proj.scales": "model.safetensors", + "language_model.model.layers.16.self_attn.k_proj.weight": "model.safetensors", + "language_model.model.layers.16.self_attn.o_proj.biases": "model.safetensors", + "language_model.model.layers.16.self_attn.o_proj.scales": "model.safetensors", + "language_model.model.layers.16.self_attn.o_proj.weight": "model.safetensors", + "language_model.model.layers.16.self_attn.q_norm.weight": "model.safetensors", + "language_model.model.layers.16.self_attn.q_proj.biases": "model.safetensors", + "language_model.model.layers.16.self_attn.q_proj.scales": "model.safetensors", + "language_model.model.layers.16.self_attn.q_proj.weight": "model.safetensors", + "language_model.model.layers.16.self_attn.v_proj.biases": "model.safetensors", + "language_model.model.layers.16.self_attn.v_proj.scales": "model.safetensors", + "language_model.model.layers.16.self_attn.v_proj.weight": "model.safetensors", + "language_model.model.layers.17.input_layernorm.weight": "model.safetensors", + "language_model.model.layers.17.layer_scalar": "model.safetensors", + "language_model.model.layers.17.mlp.down_proj.biases": "model.safetensors", + "language_model.model.layers.17.mlp.down_proj.scales": "model.safetensors", + "language_model.model.layers.17.mlp.down_proj.weight": "model.safetensors", + "language_model.model.layers.17.mlp.gate_proj.biases": "model.safetensors", + "language_model.model.layers.17.mlp.gate_proj.scales": "model.safetensors", + "language_model.model.layers.17.mlp.gate_proj.weight": "model.safetensors", + "language_model.model.layers.17.mlp.up_proj.biases": "model.safetensors", + "language_model.model.layers.17.mlp.up_proj.scales": "model.safetensors", + "language_model.model.layers.17.mlp.up_proj.weight": "model.safetensors", + "language_model.model.layers.17.per_layer_input_gate.biases": "model.safetensors", + "language_model.model.layers.17.per_layer_input_gate.scales": "model.safetensors", + "language_model.model.layers.17.per_layer_input_gate.weight": "model.safetensors", + "language_model.model.layers.17.per_layer_projection.biases": "model.safetensors", + "language_model.model.layers.17.per_layer_projection.scales": "model.safetensors", + "language_model.model.layers.17.per_layer_projection.weight": "model.safetensors", + "language_model.model.layers.17.post_attention_layernorm.weight": "model.safetensors", + "language_model.model.layers.17.post_feedforward_layernorm.weight": "model.safetensors", + "language_model.model.layers.17.post_per_layer_input_norm.weight": "model.safetensors", + "language_model.model.layers.17.pre_feedforward_layernorm.weight": "model.safetensors", + "language_model.model.layers.17.self_attn.k_norm.weight": "model.safetensors", + "language_model.model.layers.17.self_attn.k_proj.biases": "model.safetensors", + "language_model.model.layers.17.self_attn.k_proj.scales": "model.safetensors", + "language_model.model.layers.17.self_attn.k_proj.weight": "model.safetensors", + "language_model.model.layers.17.self_attn.o_proj.biases": "model.safetensors", + "language_model.model.layers.17.self_attn.o_proj.scales": "model.safetensors", + "language_model.model.layers.17.self_attn.o_proj.weight": "model.safetensors", + "language_model.model.layers.17.self_attn.q_norm.weight": "model.safetensors", + "language_model.model.layers.17.self_attn.q_proj.biases": "model.safetensors", + "language_model.model.layers.17.self_attn.q_proj.scales": "model.safetensors", + "language_model.model.layers.17.self_attn.q_proj.weight": "model.safetensors", + "language_model.model.layers.17.self_attn.v_proj.biases": "model.safetensors", + "language_model.model.layers.17.self_attn.v_proj.scales": "model.safetensors", + "language_model.model.layers.17.self_attn.v_proj.weight": "model.safetensors", + "language_model.model.layers.18.input_layernorm.weight": "model.safetensors", + "language_model.model.layers.18.layer_scalar": "model.safetensors", + "language_model.model.layers.18.mlp.down_proj.biases": "model.safetensors", + "language_model.model.layers.18.mlp.down_proj.scales": "model.safetensors", + "language_model.model.layers.18.mlp.down_proj.weight": "model.safetensors", + "language_model.model.layers.18.mlp.gate_proj.biases": "model.safetensors", + "language_model.model.layers.18.mlp.gate_proj.scales": "model.safetensors", + "language_model.model.layers.18.mlp.gate_proj.weight": "model.safetensors", + "language_model.model.layers.18.mlp.up_proj.biases": "model.safetensors", + "language_model.model.layers.18.mlp.up_proj.scales": "model.safetensors", + "language_model.model.layers.18.mlp.up_proj.weight": "model.safetensors", + "language_model.model.layers.18.per_layer_input_gate.biases": "model.safetensors", + "language_model.model.layers.18.per_layer_input_gate.scales": "model.safetensors", + "language_model.model.layers.18.per_layer_input_gate.weight": "model.safetensors", + "language_model.model.layers.18.per_layer_projection.biases": "model.safetensors", + "language_model.model.layers.18.per_layer_projection.scales": "model.safetensors", + "language_model.model.layers.18.per_layer_projection.weight": "model.safetensors", + "language_model.model.layers.18.post_attention_layernorm.weight": "model.safetensors", + "language_model.model.layers.18.post_feedforward_layernorm.weight": "model.safetensors", + "language_model.model.layers.18.post_per_layer_input_norm.weight": "model.safetensors", + "language_model.model.layers.18.pre_feedforward_layernorm.weight": "model.safetensors", + "language_model.model.layers.18.self_attn.k_norm.weight": "model.safetensors", + "language_model.model.layers.18.self_attn.k_proj.biases": "model.safetensors", + "language_model.model.layers.18.self_attn.k_proj.scales": "model.safetensors", + "language_model.model.layers.18.self_attn.k_proj.weight": "model.safetensors", + "language_model.model.layers.18.self_attn.o_proj.biases": "model.safetensors", + "language_model.model.layers.18.self_attn.o_proj.scales": "model.safetensors", + "language_model.model.layers.18.self_attn.o_proj.weight": "model.safetensors", + "language_model.model.layers.18.self_attn.q_norm.weight": "model.safetensors", + "language_model.model.layers.18.self_attn.q_proj.biases": "model.safetensors", + "language_model.model.layers.18.self_attn.q_proj.scales": "model.safetensors", + "language_model.model.layers.18.self_attn.q_proj.weight": "model.safetensors", + "language_model.model.layers.18.self_attn.v_proj.biases": "model.safetensors", + "language_model.model.layers.18.self_attn.v_proj.scales": "model.safetensors", + "language_model.model.layers.18.self_attn.v_proj.weight": "model.safetensors", + "language_model.model.layers.19.input_layernorm.weight": "model.safetensors", + "language_model.model.layers.19.layer_scalar": "model.safetensors", + "language_model.model.layers.19.mlp.down_proj.biases": "model.safetensors", + "language_model.model.layers.19.mlp.down_proj.scales": "model.safetensors", + "language_model.model.layers.19.mlp.down_proj.weight": "model.safetensors", + "language_model.model.layers.19.mlp.gate_proj.biases": "model.safetensors", + "language_model.model.layers.19.mlp.gate_proj.scales": "model.safetensors", + "language_model.model.layers.19.mlp.gate_proj.weight": "model.safetensors", + "language_model.model.layers.19.mlp.up_proj.biases": "model.safetensors", + "language_model.model.layers.19.mlp.up_proj.scales": "model.safetensors", + "language_model.model.layers.19.mlp.up_proj.weight": "model.safetensors", + "language_model.model.layers.19.per_layer_input_gate.biases": "model.safetensors", + "language_model.model.layers.19.per_layer_input_gate.scales": "model.safetensors", + "language_model.model.layers.19.per_layer_input_gate.weight": "model.safetensors", + "language_model.model.layers.19.per_layer_projection.biases": "model.safetensors", + "language_model.model.layers.19.per_layer_projection.scales": "model.safetensors", + "language_model.model.layers.19.per_layer_projection.weight": "model.safetensors", + "language_model.model.layers.19.post_attention_layernorm.weight": "model.safetensors", + "language_model.model.layers.19.post_feedforward_layernorm.weight": "model.safetensors", + "language_model.model.layers.19.post_per_layer_input_norm.weight": "model.safetensors", + "language_model.model.layers.19.pre_feedforward_layernorm.weight": "model.safetensors", + "language_model.model.layers.19.self_attn.k_norm.weight": "model.safetensors", + "language_model.model.layers.19.self_attn.k_proj.biases": "model.safetensors", + "language_model.model.layers.19.self_attn.k_proj.scales": "model.safetensors", + "language_model.model.layers.19.self_attn.k_proj.weight": "model.safetensors", + "language_model.model.layers.19.self_attn.o_proj.biases": "model.safetensors", + "language_model.model.layers.19.self_attn.o_proj.scales": "model.safetensors", + "language_model.model.layers.19.self_attn.o_proj.weight": "model.safetensors", + "language_model.model.layers.19.self_attn.q_norm.weight": "model.safetensors", + "language_model.model.layers.19.self_attn.q_proj.biases": "model.safetensors", + "language_model.model.layers.19.self_attn.q_proj.scales": "model.safetensors", + "language_model.model.layers.19.self_attn.q_proj.weight": "model.safetensors", + "language_model.model.layers.19.self_attn.v_proj.biases": "model.safetensors", + "language_model.model.layers.19.self_attn.v_proj.scales": "model.safetensors", + "language_model.model.layers.19.self_attn.v_proj.weight": "model.safetensors", + "language_model.model.layers.2.input_layernorm.weight": "model.safetensors", + "language_model.model.layers.2.layer_scalar": "model.safetensors", + "language_model.model.layers.2.mlp.down_proj.biases": "model.safetensors", + "language_model.model.layers.2.mlp.down_proj.scales": "model.safetensors", + "language_model.model.layers.2.mlp.down_proj.weight": "model.safetensors", + "language_model.model.layers.2.mlp.gate_proj.biases": "model.safetensors", + "language_model.model.layers.2.mlp.gate_proj.scales": "model.safetensors", + "language_model.model.layers.2.mlp.gate_proj.weight": "model.safetensors", + "language_model.model.layers.2.mlp.up_proj.biases": "model.safetensors", + "language_model.model.layers.2.mlp.up_proj.scales": "model.safetensors", + "language_model.model.layers.2.mlp.up_proj.weight": "model.safetensors", + "language_model.model.layers.2.per_layer_input_gate.biases": "model.safetensors", + "language_model.model.layers.2.per_layer_input_gate.scales": "model.safetensors", + "language_model.model.layers.2.per_layer_input_gate.weight": "model.safetensors", + "language_model.model.layers.2.per_layer_projection.biases": "model.safetensors", + "language_model.model.layers.2.per_layer_projection.scales": "model.safetensors", + "language_model.model.layers.2.per_layer_projection.weight": "model.safetensors", + "language_model.model.layers.2.post_attention_layernorm.weight": "model.safetensors", + "language_model.model.layers.2.post_feedforward_layernorm.weight": "model.safetensors", + "language_model.model.layers.2.post_per_layer_input_norm.weight": "model.safetensors", + "language_model.model.layers.2.pre_feedforward_layernorm.weight": "model.safetensors", + "language_model.model.layers.2.self_attn.k_norm.weight": "model.safetensors", + "language_model.model.layers.2.self_attn.k_proj.biases": "model.safetensors", + "language_model.model.layers.2.self_attn.k_proj.scales": "model.safetensors", + "language_model.model.layers.2.self_attn.k_proj.weight": "model.safetensors", + "language_model.model.layers.2.self_attn.o_proj.biases": "model.safetensors", + "language_model.model.layers.2.self_attn.o_proj.scales": "model.safetensors", + "language_model.model.layers.2.self_attn.o_proj.weight": "model.safetensors", + "language_model.model.layers.2.self_attn.q_norm.weight": "model.safetensors", + "language_model.model.layers.2.self_attn.q_proj.biases": "model.safetensors", + "language_model.model.layers.2.self_attn.q_proj.scales": "model.safetensors", + "language_model.model.layers.2.self_attn.q_proj.weight": "model.safetensors", + "language_model.model.layers.2.self_attn.v_proj.biases": "model.safetensors", + "language_model.model.layers.2.self_attn.v_proj.scales": "model.safetensors", + "language_model.model.layers.2.self_attn.v_proj.weight": "model.safetensors", + "language_model.model.layers.20.input_layernorm.weight": "model.safetensors", + "language_model.model.layers.20.layer_scalar": "model.safetensors", + "language_model.model.layers.20.mlp.down_proj.biases": "model.safetensors", + "language_model.model.layers.20.mlp.down_proj.scales": "model.safetensors", + "language_model.model.layers.20.mlp.down_proj.weight": "model.safetensors", + "language_model.model.layers.20.mlp.gate_proj.biases": "model.safetensors", + "language_model.model.layers.20.mlp.gate_proj.scales": "model.safetensors", + "language_model.model.layers.20.mlp.gate_proj.weight": "model.safetensors", + "language_model.model.layers.20.mlp.up_proj.biases": "model.safetensors", + "language_model.model.layers.20.mlp.up_proj.scales": "model.safetensors", + "language_model.model.layers.20.mlp.up_proj.weight": "model.safetensors", + "language_model.model.layers.20.per_layer_input_gate.biases": "model.safetensors", + "language_model.model.layers.20.per_layer_input_gate.scales": "model.safetensors", + "language_model.model.layers.20.per_layer_input_gate.weight": "model.safetensors", + "language_model.model.layers.20.per_layer_projection.biases": "model.safetensors", + "language_model.model.layers.20.per_layer_projection.scales": "model.safetensors", + "language_model.model.layers.20.per_layer_projection.weight": "model.safetensors", + "language_model.model.layers.20.post_attention_layernorm.weight": "model.safetensors", + "language_model.model.layers.20.post_feedforward_layernorm.weight": "model.safetensors", + "language_model.model.layers.20.post_per_layer_input_norm.weight": "model.safetensors", + "language_model.model.layers.20.pre_feedforward_layernorm.weight": "model.safetensors", + "language_model.model.layers.20.self_attn.k_norm.weight": "model.safetensors", + "language_model.model.layers.20.self_attn.k_proj.biases": "model.safetensors", + "language_model.model.layers.20.self_attn.k_proj.scales": "model.safetensors", + "language_model.model.layers.20.self_attn.k_proj.weight": "model.safetensors", + "language_model.model.layers.20.self_attn.o_proj.biases": "model.safetensors", + "language_model.model.layers.20.self_attn.o_proj.scales": "model.safetensors", + "language_model.model.layers.20.self_attn.o_proj.weight": "model.safetensors", + "language_model.model.layers.20.self_attn.q_norm.weight": "model.safetensors", + "language_model.model.layers.20.self_attn.q_proj.biases": "model.safetensors", + "language_model.model.layers.20.self_attn.q_proj.scales": "model.safetensors", + "language_model.model.layers.20.self_attn.q_proj.weight": "model.safetensors", + "language_model.model.layers.20.self_attn.v_proj.biases": "model.safetensors", + "language_model.model.layers.20.self_attn.v_proj.scales": "model.safetensors", + "language_model.model.layers.20.self_attn.v_proj.weight": "model.safetensors", + "language_model.model.layers.21.input_layernorm.weight": "model.safetensors", + "language_model.model.layers.21.layer_scalar": "model.safetensors", + "language_model.model.layers.21.mlp.down_proj.biases": "model.safetensors", + "language_model.model.layers.21.mlp.down_proj.scales": "model.safetensors", + "language_model.model.layers.21.mlp.down_proj.weight": "model.safetensors", + "language_model.model.layers.21.mlp.gate_proj.biases": "model.safetensors", + "language_model.model.layers.21.mlp.gate_proj.scales": "model.safetensors", + "language_model.model.layers.21.mlp.gate_proj.weight": "model.safetensors", + "language_model.model.layers.21.mlp.up_proj.biases": "model.safetensors", + "language_model.model.layers.21.mlp.up_proj.scales": "model.safetensors", + "language_model.model.layers.21.mlp.up_proj.weight": "model.safetensors", + "language_model.model.layers.21.per_layer_input_gate.biases": "model.safetensors", + "language_model.model.layers.21.per_layer_input_gate.scales": "model.safetensors", + "language_model.model.layers.21.per_layer_input_gate.weight": "model.safetensors", + "language_model.model.layers.21.per_layer_projection.biases": "model.safetensors", + "language_model.model.layers.21.per_layer_projection.scales": "model.safetensors", + "language_model.model.layers.21.per_layer_projection.weight": "model.safetensors", + "language_model.model.layers.21.post_attention_layernorm.weight": "model.safetensors", + "language_model.model.layers.21.post_feedforward_layernorm.weight": "model.safetensors", + "language_model.model.layers.21.post_per_layer_input_norm.weight": "model.safetensors", + "language_model.model.layers.21.pre_feedforward_layernorm.weight": "model.safetensors", + "language_model.model.layers.21.self_attn.k_norm.weight": "model.safetensors", + "language_model.model.layers.21.self_attn.k_proj.biases": "model.safetensors", + "language_model.model.layers.21.self_attn.k_proj.scales": "model.safetensors", + "language_model.model.layers.21.self_attn.k_proj.weight": "model.safetensors", + "language_model.model.layers.21.self_attn.o_proj.biases": "model.safetensors", + "language_model.model.layers.21.self_attn.o_proj.scales": "model.safetensors", + "language_model.model.layers.21.self_attn.o_proj.weight": "model.safetensors", + "language_model.model.layers.21.self_attn.q_norm.weight": "model.safetensors", + "language_model.model.layers.21.self_attn.q_proj.biases": "model.safetensors", + "language_model.model.layers.21.self_attn.q_proj.scales": "model.safetensors", + "language_model.model.layers.21.self_attn.q_proj.weight": "model.safetensors", + "language_model.model.layers.21.self_attn.v_proj.biases": "model.safetensors", + "language_model.model.layers.21.self_attn.v_proj.scales": "model.safetensors", + "language_model.model.layers.21.self_attn.v_proj.weight": "model.safetensors", + "language_model.model.layers.22.input_layernorm.weight": "model.safetensors", + "language_model.model.layers.22.layer_scalar": "model.safetensors", + "language_model.model.layers.22.mlp.down_proj.biases": "model.safetensors", + "language_model.model.layers.22.mlp.down_proj.scales": "model.safetensors", + "language_model.model.layers.22.mlp.down_proj.weight": "model.safetensors", + "language_model.model.layers.22.mlp.gate_proj.biases": "model.safetensors", + "language_model.model.layers.22.mlp.gate_proj.scales": "model.safetensors", + "language_model.model.layers.22.mlp.gate_proj.weight": "model.safetensors", + "language_model.model.layers.22.mlp.up_proj.biases": "model.safetensors", + "language_model.model.layers.22.mlp.up_proj.scales": "model.safetensors", + "language_model.model.layers.22.mlp.up_proj.weight": "model.safetensors", + "language_model.model.layers.22.per_layer_input_gate.biases": "model.safetensors", + "language_model.model.layers.22.per_layer_input_gate.scales": "model.safetensors", + "language_model.model.layers.22.per_layer_input_gate.weight": "model.safetensors", + "language_model.model.layers.22.per_layer_projection.biases": "model.safetensors", + "language_model.model.layers.22.per_layer_projection.scales": "model.safetensors", + "language_model.model.layers.22.per_layer_projection.weight": "model.safetensors", + "language_model.model.layers.22.post_attention_layernorm.weight": "model.safetensors", + "language_model.model.layers.22.post_feedforward_layernorm.weight": "model.safetensors", + "language_model.model.layers.22.post_per_layer_input_norm.weight": "model.safetensors", + "language_model.model.layers.22.pre_feedforward_layernorm.weight": "model.safetensors", + "language_model.model.layers.22.self_attn.k_norm.weight": "model.safetensors", + "language_model.model.layers.22.self_attn.k_proj.biases": "model.safetensors", + "language_model.model.layers.22.self_attn.k_proj.scales": "model.safetensors", + "language_model.model.layers.22.self_attn.k_proj.weight": "model.safetensors", + "language_model.model.layers.22.self_attn.o_proj.biases": "model.safetensors", + "language_model.model.layers.22.self_attn.o_proj.scales": "model.safetensors", + "language_model.model.layers.22.self_attn.o_proj.weight": "model.safetensors", + "language_model.model.layers.22.self_attn.q_norm.weight": "model.safetensors", + "language_model.model.layers.22.self_attn.q_proj.biases": "model.safetensors", + "language_model.model.layers.22.self_attn.q_proj.scales": "model.safetensors", + "language_model.model.layers.22.self_attn.q_proj.weight": "model.safetensors", + "language_model.model.layers.22.self_attn.v_proj.biases": "model.safetensors", + "language_model.model.layers.22.self_attn.v_proj.scales": "model.safetensors", + "language_model.model.layers.22.self_attn.v_proj.weight": "model.safetensors", + "language_model.model.layers.23.input_layernorm.weight": "model.safetensors", + "language_model.model.layers.23.layer_scalar": "model.safetensors", + "language_model.model.layers.23.mlp.down_proj.biases": "model.safetensors", + "language_model.model.layers.23.mlp.down_proj.scales": "model.safetensors", + "language_model.model.layers.23.mlp.down_proj.weight": "model.safetensors", + "language_model.model.layers.23.mlp.gate_proj.biases": "model.safetensors", + "language_model.model.layers.23.mlp.gate_proj.scales": "model.safetensors", + "language_model.model.layers.23.mlp.gate_proj.weight": "model.safetensors", + "language_model.model.layers.23.mlp.up_proj.biases": "model.safetensors", + "language_model.model.layers.23.mlp.up_proj.scales": "model.safetensors", + "language_model.model.layers.23.mlp.up_proj.weight": "model.safetensors", + "language_model.model.layers.23.per_layer_input_gate.biases": "model.safetensors", + "language_model.model.layers.23.per_layer_input_gate.scales": "model.safetensors", + "language_model.model.layers.23.per_layer_input_gate.weight": "model.safetensors", + "language_model.model.layers.23.per_layer_projection.biases": "model.safetensors", + "language_model.model.layers.23.per_layer_projection.scales": "model.safetensors", + "language_model.model.layers.23.per_layer_projection.weight": "model.safetensors", + "language_model.model.layers.23.post_attention_layernorm.weight": "model.safetensors", + "language_model.model.layers.23.post_feedforward_layernorm.weight": "model.safetensors", + "language_model.model.layers.23.post_per_layer_input_norm.weight": "model.safetensors", + "language_model.model.layers.23.pre_feedforward_layernorm.weight": "model.safetensors", + "language_model.model.layers.23.self_attn.k_norm.weight": "model.safetensors", + "language_model.model.layers.23.self_attn.k_proj.biases": "model.safetensors", + "language_model.model.layers.23.self_attn.k_proj.scales": "model.safetensors", + "language_model.model.layers.23.self_attn.k_proj.weight": "model.safetensors", + "language_model.model.layers.23.self_attn.o_proj.biases": "model.safetensors", + "language_model.model.layers.23.self_attn.o_proj.scales": "model.safetensors", + "language_model.model.layers.23.self_attn.o_proj.weight": "model.safetensors", + "language_model.model.layers.23.self_attn.q_norm.weight": "model.safetensors", + "language_model.model.layers.23.self_attn.q_proj.biases": "model.safetensors", + "language_model.model.layers.23.self_attn.q_proj.scales": "model.safetensors", + "language_model.model.layers.23.self_attn.q_proj.weight": "model.safetensors", + "language_model.model.layers.23.self_attn.v_proj.biases": "model.safetensors", + "language_model.model.layers.23.self_attn.v_proj.scales": "model.safetensors", + "language_model.model.layers.23.self_attn.v_proj.weight": "model.safetensors", + "language_model.model.layers.24.input_layernorm.weight": "model.safetensors", + "language_model.model.layers.24.layer_scalar": "model.safetensors", + "language_model.model.layers.24.mlp.down_proj.biases": "model.safetensors", + "language_model.model.layers.24.mlp.down_proj.scales": "model.safetensors", + "language_model.model.layers.24.mlp.down_proj.weight": "model.safetensors", + "language_model.model.layers.24.mlp.gate_proj.biases": "model.safetensors", + "language_model.model.layers.24.mlp.gate_proj.scales": "model.safetensors", + "language_model.model.layers.24.mlp.gate_proj.weight": "model.safetensors", + "language_model.model.layers.24.mlp.up_proj.biases": "model.safetensors", + "language_model.model.layers.24.mlp.up_proj.scales": "model.safetensors", + "language_model.model.layers.24.mlp.up_proj.weight": "model.safetensors", + "language_model.model.layers.24.per_layer_input_gate.biases": "model.safetensors", + "language_model.model.layers.24.per_layer_input_gate.scales": "model.safetensors", + "language_model.model.layers.24.per_layer_input_gate.weight": "model.safetensors", + "language_model.model.layers.24.per_layer_projection.biases": "model.safetensors", + "language_model.model.layers.24.per_layer_projection.scales": "model.safetensors", + "language_model.model.layers.24.per_layer_projection.weight": "model.safetensors", + "language_model.model.layers.24.post_attention_layernorm.weight": "model.safetensors", + "language_model.model.layers.24.post_feedforward_layernorm.weight": "model.safetensors", + "language_model.model.layers.24.post_per_layer_input_norm.weight": "model.safetensors", + "language_model.model.layers.24.pre_feedforward_layernorm.weight": "model.safetensors", + "language_model.model.layers.24.self_attn.k_norm.weight": "model.safetensors", + "language_model.model.layers.24.self_attn.k_proj.biases": "model.safetensors", + "language_model.model.layers.24.self_attn.k_proj.scales": "model.safetensors", + "language_model.model.layers.24.self_attn.k_proj.weight": "model.safetensors", + "language_model.model.layers.24.self_attn.o_proj.biases": "model.safetensors", + "language_model.model.layers.24.self_attn.o_proj.scales": "model.safetensors", + "language_model.model.layers.24.self_attn.o_proj.weight": "model.safetensors", + "language_model.model.layers.24.self_attn.q_norm.weight": "model.safetensors", + "language_model.model.layers.24.self_attn.q_proj.biases": "model.safetensors", + "language_model.model.layers.24.self_attn.q_proj.scales": "model.safetensors", + "language_model.model.layers.24.self_attn.q_proj.weight": "model.safetensors", + "language_model.model.layers.24.self_attn.v_proj.biases": "model.safetensors", + "language_model.model.layers.24.self_attn.v_proj.scales": "model.safetensors", + "language_model.model.layers.24.self_attn.v_proj.weight": "model.safetensors", + "language_model.model.layers.25.input_layernorm.weight": "model.safetensors", + "language_model.model.layers.25.layer_scalar": "model.safetensors", + "language_model.model.layers.25.mlp.down_proj.biases": "model.safetensors", + "language_model.model.layers.25.mlp.down_proj.scales": "model.safetensors", + "language_model.model.layers.25.mlp.down_proj.weight": "model.safetensors", + "language_model.model.layers.25.mlp.gate_proj.biases": "model.safetensors", + "language_model.model.layers.25.mlp.gate_proj.scales": "model.safetensors", + "language_model.model.layers.25.mlp.gate_proj.weight": "model.safetensors", + "language_model.model.layers.25.mlp.up_proj.biases": "model.safetensors", + "language_model.model.layers.25.mlp.up_proj.scales": "model.safetensors", + "language_model.model.layers.25.mlp.up_proj.weight": "model.safetensors", + "language_model.model.layers.25.per_layer_input_gate.biases": "model.safetensors", + "language_model.model.layers.25.per_layer_input_gate.scales": "model.safetensors", + "language_model.model.layers.25.per_layer_input_gate.weight": "model.safetensors", + "language_model.model.layers.25.per_layer_projection.biases": "model.safetensors", + "language_model.model.layers.25.per_layer_projection.scales": "model.safetensors", + "language_model.model.layers.25.per_layer_projection.weight": "model.safetensors", + "language_model.model.layers.25.post_attention_layernorm.weight": "model.safetensors", + "language_model.model.layers.25.post_feedforward_layernorm.weight": "model.safetensors", + "language_model.model.layers.25.post_per_layer_input_norm.weight": "model.safetensors", + "language_model.model.layers.25.pre_feedforward_layernorm.weight": "model.safetensors", + "language_model.model.layers.25.self_attn.k_norm.weight": "model.safetensors", + "language_model.model.layers.25.self_attn.k_proj.biases": "model.safetensors", + "language_model.model.layers.25.self_attn.k_proj.scales": "model.safetensors", + "language_model.model.layers.25.self_attn.k_proj.weight": "model.safetensors", + "language_model.model.layers.25.self_attn.o_proj.biases": "model.safetensors", + "language_model.model.layers.25.self_attn.o_proj.scales": "model.safetensors", + "language_model.model.layers.25.self_attn.o_proj.weight": "model.safetensors", + "language_model.model.layers.25.self_attn.q_norm.weight": "model.safetensors", + "language_model.model.layers.25.self_attn.q_proj.biases": "model.safetensors", + "language_model.model.layers.25.self_attn.q_proj.scales": "model.safetensors", + "language_model.model.layers.25.self_attn.q_proj.weight": "model.safetensors", + "language_model.model.layers.25.self_attn.v_proj.biases": "model.safetensors", + "language_model.model.layers.25.self_attn.v_proj.scales": "model.safetensors", + "language_model.model.layers.25.self_attn.v_proj.weight": "model.safetensors", + "language_model.model.layers.26.input_layernorm.weight": "model.safetensors", + "language_model.model.layers.26.layer_scalar": "model.safetensors", + "language_model.model.layers.26.mlp.down_proj.biases": "model.safetensors", + "language_model.model.layers.26.mlp.down_proj.scales": "model.safetensors", + "language_model.model.layers.26.mlp.down_proj.weight": "model.safetensors", + "language_model.model.layers.26.mlp.gate_proj.biases": "model.safetensors", + "language_model.model.layers.26.mlp.gate_proj.scales": "model.safetensors", + "language_model.model.layers.26.mlp.gate_proj.weight": "model.safetensors", + "language_model.model.layers.26.mlp.up_proj.biases": "model.safetensors", + "language_model.model.layers.26.mlp.up_proj.scales": "model.safetensors", + "language_model.model.layers.26.mlp.up_proj.weight": "model.safetensors", + "language_model.model.layers.26.per_layer_input_gate.biases": "model.safetensors", + "language_model.model.layers.26.per_layer_input_gate.scales": "model.safetensors", + "language_model.model.layers.26.per_layer_input_gate.weight": "model.safetensors", + "language_model.model.layers.26.per_layer_projection.biases": "model.safetensors", + "language_model.model.layers.26.per_layer_projection.scales": "model.safetensors", + "language_model.model.layers.26.per_layer_projection.weight": "model.safetensors", + "language_model.model.layers.26.post_attention_layernorm.weight": "model.safetensors", + "language_model.model.layers.26.post_feedforward_layernorm.weight": "model.safetensors", + "language_model.model.layers.26.post_per_layer_input_norm.weight": "model.safetensors", + "language_model.model.layers.26.pre_feedforward_layernorm.weight": "model.safetensors", + "language_model.model.layers.26.self_attn.k_norm.weight": "model.safetensors", + "language_model.model.layers.26.self_attn.k_proj.biases": "model.safetensors", + "language_model.model.layers.26.self_attn.k_proj.scales": "model.safetensors", + "language_model.model.layers.26.self_attn.k_proj.weight": "model.safetensors", + "language_model.model.layers.26.self_attn.o_proj.biases": "model.safetensors", + "language_model.model.layers.26.self_attn.o_proj.scales": "model.safetensors", + "language_model.model.layers.26.self_attn.o_proj.weight": "model.safetensors", + "language_model.model.layers.26.self_attn.q_norm.weight": "model.safetensors", + "language_model.model.layers.26.self_attn.q_proj.biases": "model.safetensors", + "language_model.model.layers.26.self_attn.q_proj.scales": "model.safetensors", + "language_model.model.layers.26.self_attn.q_proj.weight": "model.safetensors", + "language_model.model.layers.26.self_attn.v_proj.biases": "model.safetensors", + "language_model.model.layers.26.self_attn.v_proj.scales": "model.safetensors", + "language_model.model.layers.26.self_attn.v_proj.weight": "model.safetensors", + "language_model.model.layers.27.input_layernorm.weight": "model.safetensors", + "language_model.model.layers.27.layer_scalar": "model.safetensors", + "language_model.model.layers.27.mlp.down_proj.biases": "model.safetensors", + "language_model.model.layers.27.mlp.down_proj.scales": "model.safetensors", + "language_model.model.layers.27.mlp.down_proj.weight": "model.safetensors", + "language_model.model.layers.27.mlp.gate_proj.biases": "model.safetensors", + "language_model.model.layers.27.mlp.gate_proj.scales": "model.safetensors", + "language_model.model.layers.27.mlp.gate_proj.weight": "model.safetensors", + "language_model.model.layers.27.mlp.up_proj.biases": "model.safetensors", + "language_model.model.layers.27.mlp.up_proj.scales": "model.safetensors", + "language_model.model.layers.27.mlp.up_proj.weight": "model.safetensors", + "language_model.model.layers.27.per_layer_input_gate.biases": "model.safetensors", + "language_model.model.layers.27.per_layer_input_gate.scales": "model.safetensors", + "language_model.model.layers.27.per_layer_input_gate.weight": "model.safetensors", + "language_model.model.layers.27.per_layer_projection.biases": "model.safetensors", + "language_model.model.layers.27.per_layer_projection.scales": "model.safetensors", + "language_model.model.layers.27.per_layer_projection.weight": "model.safetensors", + "language_model.model.layers.27.post_attention_layernorm.weight": "model.safetensors", + "language_model.model.layers.27.post_feedforward_layernorm.weight": "model.safetensors", + "language_model.model.layers.27.post_per_layer_input_norm.weight": "model.safetensors", + "language_model.model.layers.27.pre_feedforward_layernorm.weight": "model.safetensors", + "language_model.model.layers.27.self_attn.k_norm.weight": "model.safetensors", + "language_model.model.layers.27.self_attn.k_proj.biases": "model.safetensors", + "language_model.model.layers.27.self_attn.k_proj.scales": "model.safetensors", + "language_model.model.layers.27.self_attn.k_proj.weight": "model.safetensors", + "language_model.model.layers.27.self_attn.o_proj.biases": "model.safetensors", + "language_model.model.layers.27.self_attn.o_proj.scales": "model.safetensors", + "language_model.model.layers.27.self_attn.o_proj.weight": "model.safetensors", + "language_model.model.layers.27.self_attn.q_norm.weight": "model.safetensors", + "language_model.model.layers.27.self_attn.q_proj.biases": "model.safetensors", + "language_model.model.layers.27.self_attn.q_proj.scales": "model.safetensors", + "language_model.model.layers.27.self_attn.q_proj.weight": "model.safetensors", + "language_model.model.layers.27.self_attn.v_proj.biases": "model.safetensors", + "language_model.model.layers.27.self_attn.v_proj.scales": "model.safetensors", + "language_model.model.layers.27.self_attn.v_proj.weight": "model.safetensors", + "language_model.model.layers.28.input_layernorm.weight": "model.safetensors", + "language_model.model.layers.28.layer_scalar": "model.safetensors", + "language_model.model.layers.28.mlp.down_proj.biases": "model.safetensors", + "language_model.model.layers.28.mlp.down_proj.scales": "model.safetensors", + "language_model.model.layers.28.mlp.down_proj.weight": "model.safetensors", + "language_model.model.layers.28.mlp.gate_proj.biases": "model.safetensors", + "language_model.model.layers.28.mlp.gate_proj.scales": "model.safetensors", + "language_model.model.layers.28.mlp.gate_proj.weight": "model.safetensors", + "language_model.model.layers.28.mlp.up_proj.biases": "model.safetensors", + "language_model.model.layers.28.mlp.up_proj.scales": "model.safetensors", + "language_model.model.layers.28.mlp.up_proj.weight": "model.safetensors", + "language_model.model.layers.28.per_layer_input_gate.biases": "model.safetensors", + "language_model.model.layers.28.per_layer_input_gate.scales": "model.safetensors", + "language_model.model.layers.28.per_layer_input_gate.weight": "model.safetensors", + "language_model.model.layers.28.per_layer_projection.biases": "model.safetensors", + "language_model.model.layers.28.per_layer_projection.scales": "model.safetensors", + "language_model.model.layers.28.per_layer_projection.weight": "model.safetensors", + "language_model.model.layers.28.post_attention_layernorm.weight": "model.safetensors", + "language_model.model.layers.28.post_feedforward_layernorm.weight": "model.safetensors", + "language_model.model.layers.28.post_per_layer_input_norm.weight": "model.safetensors", + "language_model.model.layers.28.pre_feedforward_layernorm.weight": "model.safetensors", + "language_model.model.layers.28.self_attn.k_norm.weight": "model.safetensors", + "language_model.model.layers.28.self_attn.k_proj.biases": "model.safetensors", + "language_model.model.layers.28.self_attn.k_proj.scales": "model.safetensors", + "language_model.model.layers.28.self_attn.k_proj.weight": "model.safetensors", + "language_model.model.layers.28.self_attn.o_proj.biases": "model.safetensors", + "language_model.model.layers.28.self_attn.o_proj.scales": "model.safetensors", + "language_model.model.layers.28.self_attn.o_proj.weight": "model.safetensors", + "language_model.model.layers.28.self_attn.q_norm.weight": "model.safetensors", + "language_model.model.layers.28.self_attn.q_proj.biases": "model.safetensors", + "language_model.model.layers.28.self_attn.q_proj.scales": "model.safetensors", + "language_model.model.layers.28.self_attn.q_proj.weight": "model.safetensors", + "language_model.model.layers.28.self_attn.v_proj.biases": "model.safetensors", + "language_model.model.layers.28.self_attn.v_proj.scales": "model.safetensors", + "language_model.model.layers.28.self_attn.v_proj.weight": "model.safetensors", + "language_model.model.layers.29.input_layernorm.weight": "model.safetensors", + "language_model.model.layers.29.layer_scalar": "model.safetensors", + "language_model.model.layers.29.mlp.down_proj.biases": "model.safetensors", + "language_model.model.layers.29.mlp.down_proj.scales": "model.safetensors", + "language_model.model.layers.29.mlp.down_proj.weight": "model.safetensors", + "language_model.model.layers.29.mlp.gate_proj.biases": "model.safetensors", + "language_model.model.layers.29.mlp.gate_proj.scales": "model.safetensors", + "language_model.model.layers.29.mlp.gate_proj.weight": "model.safetensors", + "language_model.model.layers.29.mlp.up_proj.biases": "model.safetensors", + "language_model.model.layers.29.mlp.up_proj.scales": "model.safetensors", + "language_model.model.layers.29.mlp.up_proj.weight": "model.safetensors", + "language_model.model.layers.29.per_layer_input_gate.biases": "model.safetensors", + "language_model.model.layers.29.per_layer_input_gate.scales": "model.safetensors", + "language_model.model.layers.29.per_layer_input_gate.weight": "model.safetensors", + "language_model.model.layers.29.per_layer_projection.biases": "model.safetensors", + "language_model.model.layers.29.per_layer_projection.scales": "model.safetensors", + "language_model.model.layers.29.per_layer_projection.weight": "model.safetensors", + "language_model.model.layers.29.post_attention_layernorm.weight": "model.safetensors", + "language_model.model.layers.29.post_feedforward_layernorm.weight": "model.safetensors", + "language_model.model.layers.29.post_per_layer_input_norm.weight": "model.safetensors", + "language_model.model.layers.29.pre_feedforward_layernorm.weight": "model.safetensors", + "language_model.model.layers.29.self_attn.k_norm.weight": "model.safetensors", + "language_model.model.layers.29.self_attn.k_proj.biases": "model.safetensors", + "language_model.model.layers.29.self_attn.k_proj.scales": "model.safetensors", + "language_model.model.layers.29.self_attn.k_proj.weight": "model.safetensors", + "language_model.model.layers.29.self_attn.o_proj.biases": "model.safetensors", + "language_model.model.layers.29.self_attn.o_proj.scales": "model.safetensors", + "language_model.model.layers.29.self_attn.o_proj.weight": "model.safetensors", + "language_model.model.layers.29.self_attn.q_norm.weight": "model.safetensors", + "language_model.model.layers.29.self_attn.q_proj.biases": "model.safetensors", + "language_model.model.layers.29.self_attn.q_proj.scales": "model.safetensors", + "language_model.model.layers.29.self_attn.q_proj.weight": "model.safetensors", + "language_model.model.layers.29.self_attn.v_proj.biases": "model.safetensors", + "language_model.model.layers.29.self_attn.v_proj.scales": "model.safetensors", + "language_model.model.layers.29.self_attn.v_proj.weight": "model.safetensors", + "language_model.model.layers.3.input_layernorm.weight": "model.safetensors", + "language_model.model.layers.3.layer_scalar": "model.safetensors", + "language_model.model.layers.3.mlp.down_proj.biases": "model.safetensors", + "language_model.model.layers.3.mlp.down_proj.scales": "model.safetensors", + "language_model.model.layers.3.mlp.down_proj.weight": "model.safetensors", + "language_model.model.layers.3.mlp.gate_proj.biases": "model.safetensors", + "language_model.model.layers.3.mlp.gate_proj.scales": "model.safetensors", + "language_model.model.layers.3.mlp.gate_proj.weight": "model.safetensors", + "language_model.model.layers.3.mlp.up_proj.biases": "model.safetensors", + "language_model.model.layers.3.mlp.up_proj.scales": "model.safetensors", + "language_model.model.layers.3.mlp.up_proj.weight": "model.safetensors", + "language_model.model.layers.3.per_layer_input_gate.biases": "model.safetensors", + "language_model.model.layers.3.per_layer_input_gate.scales": "model.safetensors", + "language_model.model.layers.3.per_layer_input_gate.weight": "model.safetensors", + "language_model.model.layers.3.per_layer_projection.biases": "model.safetensors", + "language_model.model.layers.3.per_layer_projection.scales": "model.safetensors", + "language_model.model.layers.3.per_layer_projection.weight": "model.safetensors", + "language_model.model.layers.3.post_attention_layernorm.weight": "model.safetensors", + "language_model.model.layers.3.post_feedforward_layernorm.weight": "model.safetensors", + "language_model.model.layers.3.post_per_layer_input_norm.weight": "model.safetensors", + "language_model.model.layers.3.pre_feedforward_layernorm.weight": "model.safetensors", + "language_model.model.layers.3.self_attn.k_norm.weight": "model.safetensors", + "language_model.model.layers.3.self_attn.k_proj.biases": "model.safetensors", + "language_model.model.layers.3.self_attn.k_proj.scales": "model.safetensors", + "language_model.model.layers.3.self_attn.k_proj.weight": "model.safetensors", + "language_model.model.layers.3.self_attn.o_proj.biases": "model.safetensors", + "language_model.model.layers.3.self_attn.o_proj.scales": "model.safetensors", + "language_model.model.layers.3.self_attn.o_proj.weight": "model.safetensors", + "language_model.model.layers.3.self_attn.q_norm.weight": "model.safetensors", + "language_model.model.layers.3.self_attn.q_proj.biases": "model.safetensors", + "language_model.model.layers.3.self_attn.q_proj.scales": "model.safetensors", + "language_model.model.layers.3.self_attn.q_proj.weight": "model.safetensors", + "language_model.model.layers.3.self_attn.v_proj.biases": "model.safetensors", + "language_model.model.layers.3.self_attn.v_proj.scales": "model.safetensors", + "language_model.model.layers.3.self_attn.v_proj.weight": "model.safetensors", + "language_model.model.layers.30.input_layernorm.weight": "model.safetensors", + "language_model.model.layers.30.layer_scalar": "model.safetensors", + "language_model.model.layers.30.mlp.down_proj.biases": "model.safetensors", + "language_model.model.layers.30.mlp.down_proj.scales": "model.safetensors", + "language_model.model.layers.30.mlp.down_proj.weight": "model.safetensors", + "language_model.model.layers.30.mlp.gate_proj.biases": "model.safetensors", + "language_model.model.layers.30.mlp.gate_proj.scales": "model.safetensors", + "language_model.model.layers.30.mlp.gate_proj.weight": "model.safetensors", + "language_model.model.layers.30.mlp.up_proj.biases": "model.safetensors", + "language_model.model.layers.30.mlp.up_proj.scales": "model.safetensors", + "language_model.model.layers.30.mlp.up_proj.weight": "model.safetensors", + "language_model.model.layers.30.per_layer_input_gate.biases": "model.safetensors", + "language_model.model.layers.30.per_layer_input_gate.scales": "model.safetensors", + "language_model.model.layers.30.per_layer_input_gate.weight": "model.safetensors", + "language_model.model.layers.30.per_layer_projection.biases": "model.safetensors", + "language_model.model.layers.30.per_layer_projection.scales": "model.safetensors", + "language_model.model.layers.30.per_layer_projection.weight": "model.safetensors", + "language_model.model.layers.30.post_attention_layernorm.weight": "model.safetensors", + "language_model.model.layers.30.post_feedforward_layernorm.weight": "model.safetensors", + "language_model.model.layers.30.post_per_layer_input_norm.weight": "model.safetensors", + "language_model.model.layers.30.pre_feedforward_layernorm.weight": "model.safetensors", + "language_model.model.layers.30.self_attn.k_norm.weight": "model.safetensors", + "language_model.model.layers.30.self_attn.k_proj.biases": "model.safetensors", + "language_model.model.layers.30.self_attn.k_proj.scales": "model.safetensors", + "language_model.model.layers.30.self_attn.k_proj.weight": "model.safetensors", + "language_model.model.layers.30.self_attn.o_proj.biases": "model.safetensors", + "language_model.model.layers.30.self_attn.o_proj.scales": "model.safetensors", + "language_model.model.layers.30.self_attn.o_proj.weight": "model.safetensors", + "language_model.model.layers.30.self_attn.q_norm.weight": "model.safetensors", + "language_model.model.layers.30.self_attn.q_proj.biases": "model.safetensors", + "language_model.model.layers.30.self_attn.q_proj.scales": "model.safetensors", + "language_model.model.layers.30.self_attn.q_proj.weight": "model.safetensors", + "language_model.model.layers.30.self_attn.v_proj.biases": "model.safetensors", + "language_model.model.layers.30.self_attn.v_proj.scales": "model.safetensors", + "language_model.model.layers.30.self_attn.v_proj.weight": "model.safetensors", + "language_model.model.layers.31.input_layernorm.weight": "model.safetensors", + "language_model.model.layers.31.layer_scalar": "model.safetensors", + "language_model.model.layers.31.mlp.down_proj.biases": "model.safetensors", + "language_model.model.layers.31.mlp.down_proj.scales": "model.safetensors", + "language_model.model.layers.31.mlp.down_proj.weight": "model.safetensors", + "language_model.model.layers.31.mlp.gate_proj.biases": "model.safetensors", + "language_model.model.layers.31.mlp.gate_proj.scales": "model.safetensors", + "language_model.model.layers.31.mlp.gate_proj.weight": "model.safetensors", + "language_model.model.layers.31.mlp.up_proj.biases": "model.safetensors", + "language_model.model.layers.31.mlp.up_proj.scales": "model.safetensors", + "language_model.model.layers.31.mlp.up_proj.weight": "model.safetensors", + "language_model.model.layers.31.per_layer_input_gate.biases": "model.safetensors", + "language_model.model.layers.31.per_layer_input_gate.scales": "model.safetensors", + "language_model.model.layers.31.per_layer_input_gate.weight": "model.safetensors", + "language_model.model.layers.31.per_layer_projection.biases": "model.safetensors", + "language_model.model.layers.31.per_layer_projection.scales": "model.safetensors", + "language_model.model.layers.31.per_layer_projection.weight": "model.safetensors", + "language_model.model.layers.31.post_attention_layernorm.weight": "model.safetensors", + "language_model.model.layers.31.post_feedforward_layernorm.weight": "model.safetensors", + "language_model.model.layers.31.post_per_layer_input_norm.weight": "model.safetensors", + "language_model.model.layers.31.pre_feedforward_layernorm.weight": "model.safetensors", + "language_model.model.layers.31.self_attn.k_norm.weight": "model.safetensors", + "language_model.model.layers.31.self_attn.k_proj.biases": "model.safetensors", + "language_model.model.layers.31.self_attn.k_proj.scales": "model.safetensors", + "language_model.model.layers.31.self_attn.k_proj.weight": "model.safetensors", + "language_model.model.layers.31.self_attn.o_proj.biases": "model.safetensors", + "language_model.model.layers.31.self_attn.o_proj.scales": "model.safetensors", + "language_model.model.layers.31.self_attn.o_proj.weight": "model.safetensors", + "language_model.model.layers.31.self_attn.q_norm.weight": "model.safetensors", + "language_model.model.layers.31.self_attn.q_proj.biases": "model.safetensors", + "language_model.model.layers.31.self_attn.q_proj.scales": "model.safetensors", + "language_model.model.layers.31.self_attn.q_proj.weight": "model.safetensors", + "language_model.model.layers.31.self_attn.v_proj.biases": "model.safetensors", + "language_model.model.layers.31.self_attn.v_proj.scales": "model.safetensors", + "language_model.model.layers.31.self_attn.v_proj.weight": "model.safetensors", + "language_model.model.layers.32.input_layernorm.weight": "model.safetensors", + "language_model.model.layers.32.layer_scalar": "model.safetensors", + "language_model.model.layers.32.mlp.down_proj.biases": "model.safetensors", + "language_model.model.layers.32.mlp.down_proj.scales": "model.safetensors", + "language_model.model.layers.32.mlp.down_proj.weight": "model.safetensors", + "language_model.model.layers.32.mlp.gate_proj.biases": "model.safetensors", + "language_model.model.layers.32.mlp.gate_proj.scales": "model.safetensors", + "language_model.model.layers.32.mlp.gate_proj.weight": "model.safetensors", + "language_model.model.layers.32.mlp.up_proj.biases": "model.safetensors", + "language_model.model.layers.32.mlp.up_proj.scales": "model.safetensors", + "language_model.model.layers.32.mlp.up_proj.weight": "model.safetensors", + "language_model.model.layers.32.per_layer_input_gate.biases": "model.safetensors", + "language_model.model.layers.32.per_layer_input_gate.scales": "model.safetensors", + "language_model.model.layers.32.per_layer_input_gate.weight": "model.safetensors", + "language_model.model.layers.32.per_layer_projection.biases": "model.safetensors", + "language_model.model.layers.32.per_layer_projection.scales": "model.safetensors", + "language_model.model.layers.32.per_layer_projection.weight": "model.safetensors", + "language_model.model.layers.32.post_attention_layernorm.weight": "model.safetensors", + "language_model.model.layers.32.post_feedforward_layernorm.weight": "model.safetensors", + "language_model.model.layers.32.post_per_layer_input_norm.weight": "model.safetensors", + "language_model.model.layers.32.pre_feedforward_layernorm.weight": "model.safetensors", + "language_model.model.layers.32.self_attn.k_norm.weight": "model.safetensors", + "language_model.model.layers.32.self_attn.k_proj.biases": "model.safetensors", + "language_model.model.layers.32.self_attn.k_proj.scales": "model.safetensors", + "language_model.model.layers.32.self_attn.k_proj.weight": "model.safetensors", + "language_model.model.layers.32.self_attn.o_proj.biases": "model.safetensors", + "language_model.model.layers.32.self_attn.o_proj.scales": "model.safetensors", + "language_model.model.layers.32.self_attn.o_proj.weight": "model.safetensors", + "language_model.model.layers.32.self_attn.q_norm.weight": "model.safetensors", + "language_model.model.layers.32.self_attn.q_proj.biases": "model.safetensors", + "language_model.model.layers.32.self_attn.q_proj.scales": "model.safetensors", + "language_model.model.layers.32.self_attn.q_proj.weight": "model.safetensors", + "language_model.model.layers.32.self_attn.v_proj.biases": "model.safetensors", + "language_model.model.layers.32.self_attn.v_proj.scales": "model.safetensors", + "language_model.model.layers.32.self_attn.v_proj.weight": "model.safetensors", + "language_model.model.layers.33.input_layernorm.weight": "model.safetensors", + "language_model.model.layers.33.layer_scalar": "model.safetensors", + "language_model.model.layers.33.mlp.down_proj.biases": "model.safetensors", + "language_model.model.layers.33.mlp.down_proj.scales": "model.safetensors", + "language_model.model.layers.33.mlp.down_proj.weight": "model.safetensors", + "language_model.model.layers.33.mlp.gate_proj.biases": "model.safetensors", + "language_model.model.layers.33.mlp.gate_proj.scales": "model.safetensors", + "language_model.model.layers.33.mlp.gate_proj.weight": "model.safetensors", + "language_model.model.layers.33.mlp.up_proj.biases": "model.safetensors", + "language_model.model.layers.33.mlp.up_proj.scales": "model.safetensors", + "language_model.model.layers.33.mlp.up_proj.weight": "model.safetensors", + "language_model.model.layers.33.per_layer_input_gate.biases": "model.safetensors", + "language_model.model.layers.33.per_layer_input_gate.scales": "model.safetensors", + "language_model.model.layers.33.per_layer_input_gate.weight": "model.safetensors", + "language_model.model.layers.33.per_layer_projection.biases": "model.safetensors", + "language_model.model.layers.33.per_layer_projection.scales": "model.safetensors", + "language_model.model.layers.33.per_layer_projection.weight": "model.safetensors", + "language_model.model.layers.33.post_attention_layernorm.weight": "model.safetensors", + "language_model.model.layers.33.post_feedforward_layernorm.weight": "model.safetensors", + "language_model.model.layers.33.post_per_layer_input_norm.weight": "model.safetensors", + "language_model.model.layers.33.pre_feedforward_layernorm.weight": "model.safetensors", + "language_model.model.layers.33.self_attn.k_norm.weight": "model.safetensors", + "language_model.model.layers.33.self_attn.k_proj.biases": "model.safetensors", + "language_model.model.layers.33.self_attn.k_proj.scales": "model.safetensors", + "language_model.model.layers.33.self_attn.k_proj.weight": "model.safetensors", + "language_model.model.layers.33.self_attn.o_proj.biases": "model.safetensors", + "language_model.model.layers.33.self_attn.o_proj.scales": "model.safetensors", + "language_model.model.layers.33.self_attn.o_proj.weight": "model.safetensors", + "language_model.model.layers.33.self_attn.q_norm.weight": "model.safetensors", + "language_model.model.layers.33.self_attn.q_proj.biases": "model.safetensors", + "language_model.model.layers.33.self_attn.q_proj.scales": "model.safetensors", + "language_model.model.layers.33.self_attn.q_proj.weight": "model.safetensors", + "language_model.model.layers.33.self_attn.v_proj.biases": "model.safetensors", + "language_model.model.layers.33.self_attn.v_proj.scales": "model.safetensors", + "language_model.model.layers.33.self_attn.v_proj.weight": "model.safetensors", + "language_model.model.layers.34.input_layernorm.weight": "model.safetensors", + "language_model.model.layers.34.layer_scalar": "model.safetensors", + "language_model.model.layers.34.mlp.down_proj.biases": "model.safetensors", + "language_model.model.layers.34.mlp.down_proj.scales": "model.safetensors", + "language_model.model.layers.34.mlp.down_proj.weight": "model.safetensors", + "language_model.model.layers.34.mlp.gate_proj.biases": "model.safetensors", + "language_model.model.layers.34.mlp.gate_proj.scales": "model.safetensors", + "language_model.model.layers.34.mlp.gate_proj.weight": "model.safetensors", + "language_model.model.layers.34.mlp.up_proj.biases": "model.safetensors", + "language_model.model.layers.34.mlp.up_proj.scales": "model.safetensors", + "language_model.model.layers.34.mlp.up_proj.weight": "model.safetensors", + "language_model.model.layers.34.per_layer_input_gate.biases": "model.safetensors", + "language_model.model.layers.34.per_layer_input_gate.scales": "model.safetensors", + "language_model.model.layers.34.per_layer_input_gate.weight": "model.safetensors", + "language_model.model.layers.34.per_layer_projection.biases": "model.safetensors", + "language_model.model.layers.34.per_layer_projection.scales": "model.safetensors", + "language_model.model.layers.34.per_layer_projection.weight": "model.safetensors", + "language_model.model.layers.34.post_attention_layernorm.weight": "model.safetensors", + "language_model.model.layers.34.post_feedforward_layernorm.weight": "model.safetensors", + "language_model.model.layers.34.post_per_layer_input_norm.weight": "model.safetensors", + "language_model.model.layers.34.pre_feedforward_layernorm.weight": "model.safetensors", + "language_model.model.layers.34.self_attn.k_norm.weight": "model.safetensors", + "language_model.model.layers.34.self_attn.k_proj.biases": "model.safetensors", + "language_model.model.layers.34.self_attn.k_proj.scales": "model.safetensors", + "language_model.model.layers.34.self_attn.k_proj.weight": "model.safetensors", + "language_model.model.layers.34.self_attn.o_proj.biases": "model.safetensors", + "language_model.model.layers.34.self_attn.o_proj.scales": "model.safetensors", + "language_model.model.layers.34.self_attn.o_proj.weight": "model.safetensors", + "language_model.model.layers.34.self_attn.q_norm.weight": "model.safetensors", + "language_model.model.layers.34.self_attn.q_proj.biases": "model.safetensors", + "language_model.model.layers.34.self_attn.q_proj.scales": "model.safetensors", + "language_model.model.layers.34.self_attn.q_proj.weight": "model.safetensors", + "language_model.model.layers.34.self_attn.v_proj.biases": "model.safetensors", + "language_model.model.layers.34.self_attn.v_proj.scales": "model.safetensors", + "language_model.model.layers.34.self_attn.v_proj.weight": "model.safetensors", + "language_model.model.layers.35.input_layernorm.weight": "model.safetensors", + "language_model.model.layers.35.layer_scalar": "model.safetensors", + "language_model.model.layers.35.mlp.down_proj.biases": "model.safetensors", + "language_model.model.layers.35.mlp.down_proj.scales": "model.safetensors", + "language_model.model.layers.35.mlp.down_proj.weight": "model.safetensors", + "language_model.model.layers.35.mlp.gate_proj.biases": "model.safetensors", + "language_model.model.layers.35.mlp.gate_proj.scales": "model.safetensors", + "language_model.model.layers.35.mlp.gate_proj.weight": "model.safetensors", + "language_model.model.layers.35.mlp.up_proj.biases": "model.safetensors", + "language_model.model.layers.35.mlp.up_proj.scales": "model.safetensors", + "language_model.model.layers.35.mlp.up_proj.weight": "model.safetensors", + "language_model.model.layers.35.per_layer_input_gate.biases": "model.safetensors", + "language_model.model.layers.35.per_layer_input_gate.scales": "model.safetensors", + "language_model.model.layers.35.per_layer_input_gate.weight": "model.safetensors", + "language_model.model.layers.35.per_layer_projection.biases": "model.safetensors", + "language_model.model.layers.35.per_layer_projection.scales": "model.safetensors", + "language_model.model.layers.35.per_layer_projection.weight": "model.safetensors", + "language_model.model.layers.35.post_attention_layernorm.weight": "model.safetensors", + "language_model.model.layers.35.post_feedforward_layernorm.weight": "model.safetensors", + "language_model.model.layers.35.post_per_layer_input_norm.weight": "model.safetensors", + "language_model.model.layers.35.pre_feedforward_layernorm.weight": "model.safetensors", + "language_model.model.layers.35.self_attn.k_norm.weight": "model.safetensors", + "language_model.model.layers.35.self_attn.k_proj.biases": "model.safetensors", + "language_model.model.layers.35.self_attn.k_proj.scales": "model.safetensors", + "language_model.model.layers.35.self_attn.k_proj.weight": "model.safetensors", + "language_model.model.layers.35.self_attn.o_proj.biases": "model.safetensors", + "language_model.model.layers.35.self_attn.o_proj.scales": "model.safetensors", + "language_model.model.layers.35.self_attn.o_proj.weight": "model.safetensors", + "language_model.model.layers.35.self_attn.q_norm.weight": "model.safetensors", + "language_model.model.layers.35.self_attn.q_proj.biases": "model.safetensors", + "language_model.model.layers.35.self_attn.q_proj.scales": "model.safetensors", + "language_model.model.layers.35.self_attn.q_proj.weight": "model.safetensors", + "language_model.model.layers.35.self_attn.v_proj.biases": "model.safetensors", + "language_model.model.layers.35.self_attn.v_proj.scales": "model.safetensors", + "language_model.model.layers.35.self_attn.v_proj.weight": "model.safetensors", + "language_model.model.layers.36.input_layernorm.weight": "model.safetensors", + "language_model.model.layers.36.layer_scalar": "model.safetensors", + "language_model.model.layers.36.mlp.down_proj.biases": "model.safetensors", + "language_model.model.layers.36.mlp.down_proj.scales": "model.safetensors", + "language_model.model.layers.36.mlp.down_proj.weight": "model.safetensors", + "language_model.model.layers.36.mlp.gate_proj.biases": "model.safetensors", + "language_model.model.layers.36.mlp.gate_proj.scales": "model.safetensors", + "language_model.model.layers.36.mlp.gate_proj.weight": "model.safetensors", + "language_model.model.layers.36.mlp.up_proj.biases": "model.safetensors", + "language_model.model.layers.36.mlp.up_proj.scales": "model.safetensors", + "language_model.model.layers.36.mlp.up_proj.weight": "model.safetensors", + "language_model.model.layers.36.per_layer_input_gate.biases": "model.safetensors", + "language_model.model.layers.36.per_layer_input_gate.scales": "model.safetensors", + "language_model.model.layers.36.per_layer_input_gate.weight": "model.safetensors", + "language_model.model.layers.36.per_layer_projection.biases": "model.safetensors", + "language_model.model.layers.36.per_layer_projection.scales": "model.safetensors", + "language_model.model.layers.36.per_layer_projection.weight": "model.safetensors", + "language_model.model.layers.36.post_attention_layernorm.weight": "model.safetensors", + "language_model.model.layers.36.post_feedforward_layernorm.weight": "model.safetensors", + "language_model.model.layers.36.post_per_layer_input_norm.weight": "model.safetensors", + "language_model.model.layers.36.pre_feedforward_layernorm.weight": "model.safetensors", + "language_model.model.layers.36.self_attn.k_norm.weight": "model.safetensors", + "language_model.model.layers.36.self_attn.k_proj.biases": "model.safetensors", + "language_model.model.layers.36.self_attn.k_proj.scales": "model.safetensors", + "language_model.model.layers.36.self_attn.k_proj.weight": "model.safetensors", + "language_model.model.layers.36.self_attn.o_proj.biases": "model.safetensors", + "language_model.model.layers.36.self_attn.o_proj.scales": "model.safetensors", + "language_model.model.layers.36.self_attn.o_proj.weight": "model.safetensors", + "language_model.model.layers.36.self_attn.q_norm.weight": "model.safetensors", + "language_model.model.layers.36.self_attn.q_proj.biases": "model.safetensors", + "language_model.model.layers.36.self_attn.q_proj.scales": "model.safetensors", + "language_model.model.layers.36.self_attn.q_proj.weight": "model.safetensors", + "language_model.model.layers.36.self_attn.v_proj.biases": "model.safetensors", + "language_model.model.layers.36.self_attn.v_proj.scales": "model.safetensors", + "language_model.model.layers.36.self_attn.v_proj.weight": "model.safetensors", + "language_model.model.layers.37.input_layernorm.weight": "model.safetensors", + "language_model.model.layers.37.layer_scalar": "model.safetensors", + "language_model.model.layers.37.mlp.down_proj.biases": "model.safetensors", + "language_model.model.layers.37.mlp.down_proj.scales": "model.safetensors", + "language_model.model.layers.37.mlp.down_proj.weight": "model.safetensors", + "language_model.model.layers.37.mlp.gate_proj.biases": "model.safetensors", + "language_model.model.layers.37.mlp.gate_proj.scales": "model.safetensors", + "language_model.model.layers.37.mlp.gate_proj.weight": "model.safetensors", + "language_model.model.layers.37.mlp.up_proj.biases": "model.safetensors", + "language_model.model.layers.37.mlp.up_proj.scales": "model.safetensors", + "language_model.model.layers.37.mlp.up_proj.weight": "model.safetensors", + "language_model.model.layers.37.per_layer_input_gate.biases": "model.safetensors", + "language_model.model.layers.37.per_layer_input_gate.scales": "model.safetensors", + "language_model.model.layers.37.per_layer_input_gate.weight": "model.safetensors", + "language_model.model.layers.37.per_layer_projection.biases": "model.safetensors", + "language_model.model.layers.37.per_layer_projection.scales": "model.safetensors", + "language_model.model.layers.37.per_layer_projection.weight": "model.safetensors", + "language_model.model.layers.37.post_attention_layernorm.weight": "model.safetensors", + "language_model.model.layers.37.post_feedforward_layernorm.weight": "model.safetensors", + "language_model.model.layers.37.post_per_layer_input_norm.weight": "model.safetensors", + "language_model.model.layers.37.pre_feedforward_layernorm.weight": "model.safetensors", + "language_model.model.layers.37.self_attn.k_norm.weight": "model.safetensors", + "language_model.model.layers.37.self_attn.k_proj.biases": "model.safetensors", + "language_model.model.layers.37.self_attn.k_proj.scales": "model.safetensors", + "language_model.model.layers.37.self_attn.k_proj.weight": "model.safetensors", + "language_model.model.layers.37.self_attn.o_proj.biases": "model.safetensors", + "language_model.model.layers.37.self_attn.o_proj.scales": "model.safetensors", + "language_model.model.layers.37.self_attn.o_proj.weight": "model.safetensors", + "language_model.model.layers.37.self_attn.q_norm.weight": "model.safetensors", + "language_model.model.layers.37.self_attn.q_proj.biases": "model.safetensors", + "language_model.model.layers.37.self_attn.q_proj.scales": "model.safetensors", + "language_model.model.layers.37.self_attn.q_proj.weight": "model.safetensors", + "language_model.model.layers.37.self_attn.v_proj.biases": "model.safetensors", + "language_model.model.layers.37.self_attn.v_proj.scales": "model.safetensors", + "language_model.model.layers.37.self_attn.v_proj.weight": "model.safetensors", + "language_model.model.layers.38.input_layernorm.weight": "model.safetensors", + "language_model.model.layers.38.layer_scalar": "model.safetensors", + "language_model.model.layers.38.mlp.down_proj.biases": "model.safetensors", + "language_model.model.layers.38.mlp.down_proj.scales": "model.safetensors", + "language_model.model.layers.38.mlp.down_proj.weight": "model.safetensors", + "language_model.model.layers.38.mlp.gate_proj.biases": "model.safetensors", + "language_model.model.layers.38.mlp.gate_proj.scales": "model.safetensors", + "language_model.model.layers.38.mlp.gate_proj.weight": "model.safetensors", + "language_model.model.layers.38.mlp.up_proj.biases": "model.safetensors", + "language_model.model.layers.38.mlp.up_proj.scales": "model.safetensors", + "language_model.model.layers.38.mlp.up_proj.weight": "model.safetensors", + "language_model.model.layers.38.per_layer_input_gate.biases": "model.safetensors", + "language_model.model.layers.38.per_layer_input_gate.scales": "model.safetensors", + "language_model.model.layers.38.per_layer_input_gate.weight": "model.safetensors", + "language_model.model.layers.38.per_layer_projection.biases": "model.safetensors", + "language_model.model.layers.38.per_layer_projection.scales": "model.safetensors", + "language_model.model.layers.38.per_layer_projection.weight": "model.safetensors", + "language_model.model.layers.38.post_attention_layernorm.weight": "model.safetensors", + "language_model.model.layers.38.post_feedforward_layernorm.weight": "model.safetensors", + "language_model.model.layers.38.post_per_layer_input_norm.weight": "model.safetensors", + "language_model.model.layers.38.pre_feedforward_layernorm.weight": "model.safetensors", + "language_model.model.layers.38.self_attn.k_norm.weight": "model.safetensors", + "language_model.model.layers.38.self_attn.k_proj.biases": "model.safetensors", + "language_model.model.layers.38.self_attn.k_proj.scales": "model.safetensors", + "language_model.model.layers.38.self_attn.k_proj.weight": "model.safetensors", + "language_model.model.layers.38.self_attn.o_proj.biases": "model.safetensors", + "language_model.model.layers.38.self_attn.o_proj.scales": "model.safetensors", + "language_model.model.layers.38.self_attn.o_proj.weight": "model.safetensors", + "language_model.model.layers.38.self_attn.q_norm.weight": "model.safetensors", + "language_model.model.layers.38.self_attn.q_proj.biases": "model.safetensors", + "language_model.model.layers.38.self_attn.q_proj.scales": "model.safetensors", + "language_model.model.layers.38.self_attn.q_proj.weight": "model.safetensors", + "language_model.model.layers.38.self_attn.v_proj.biases": "model.safetensors", + "language_model.model.layers.38.self_attn.v_proj.scales": "model.safetensors", + "language_model.model.layers.38.self_attn.v_proj.weight": "model.safetensors", + "language_model.model.layers.39.input_layernorm.weight": "model.safetensors", + "language_model.model.layers.39.layer_scalar": "model.safetensors", + "language_model.model.layers.39.mlp.down_proj.biases": "model.safetensors", + "language_model.model.layers.39.mlp.down_proj.scales": "model.safetensors", + "language_model.model.layers.39.mlp.down_proj.weight": "model.safetensors", + "language_model.model.layers.39.mlp.gate_proj.biases": "model.safetensors", + "language_model.model.layers.39.mlp.gate_proj.scales": "model.safetensors", + "language_model.model.layers.39.mlp.gate_proj.weight": "model.safetensors", + "language_model.model.layers.39.mlp.up_proj.biases": "model.safetensors", + "language_model.model.layers.39.mlp.up_proj.scales": "model.safetensors", + "language_model.model.layers.39.mlp.up_proj.weight": "model.safetensors", + "language_model.model.layers.39.per_layer_input_gate.biases": "model.safetensors", + "language_model.model.layers.39.per_layer_input_gate.scales": "model.safetensors", + "language_model.model.layers.39.per_layer_input_gate.weight": "model.safetensors", + "language_model.model.layers.39.per_layer_projection.biases": "model.safetensors", + "language_model.model.layers.39.per_layer_projection.scales": "model.safetensors", + "language_model.model.layers.39.per_layer_projection.weight": "model.safetensors", + "language_model.model.layers.39.post_attention_layernorm.weight": "model.safetensors", + "language_model.model.layers.39.post_feedforward_layernorm.weight": "model.safetensors", + "language_model.model.layers.39.post_per_layer_input_norm.weight": "model.safetensors", + "language_model.model.layers.39.pre_feedforward_layernorm.weight": "model.safetensors", + "language_model.model.layers.39.self_attn.k_norm.weight": "model.safetensors", + "language_model.model.layers.39.self_attn.k_proj.biases": "model.safetensors", + "language_model.model.layers.39.self_attn.k_proj.scales": "model.safetensors", + "language_model.model.layers.39.self_attn.k_proj.weight": "model.safetensors", + "language_model.model.layers.39.self_attn.o_proj.biases": "model.safetensors", + "language_model.model.layers.39.self_attn.o_proj.scales": "model.safetensors", + "language_model.model.layers.39.self_attn.o_proj.weight": "model.safetensors", + "language_model.model.layers.39.self_attn.q_norm.weight": "model.safetensors", + "language_model.model.layers.39.self_attn.q_proj.biases": "model.safetensors", + "language_model.model.layers.39.self_attn.q_proj.scales": "model.safetensors", + "language_model.model.layers.39.self_attn.q_proj.weight": "model.safetensors", + "language_model.model.layers.39.self_attn.v_proj.biases": "model.safetensors", + "language_model.model.layers.39.self_attn.v_proj.scales": "model.safetensors", + "language_model.model.layers.39.self_attn.v_proj.weight": "model.safetensors", + "language_model.model.layers.4.input_layernorm.weight": "model.safetensors", + "language_model.model.layers.4.layer_scalar": "model.safetensors", + "language_model.model.layers.4.mlp.down_proj.biases": "model.safetensors", + "language_model.model.layers.4.mlp.down_proj.scales": "model.safetensors", + "language_model.model.layers.4.mlp.down_proj.weight": "model.safetensors", + "language_model.model.layers.4.mlp.gate_proj.biases": "model.safetensors", + "language_model.model.layers.4.mlp.gate_proj.scales": "model.safetensors", + "language_model.model.layers.4.mlp.gate_proj.weight": "model.safetensors", + "language_model.model.layers.4.mlp.up_proj.biases": "model.safetensors", + "language_model.model.layers.4.mlp.up_proj.scales": "model.safetensors", + "language_model.model.layers.4.mlp.up_proj.weight": "model.safetensors", + "language_model.model.layers.4.per_layer_input_gate.biases": "model.safetensors", + "language_model.model.layers.4.per_layer_input_gate.scales": "model.safetensors", + "language_model.model.layers.4.per_layer_input_gate.weight": "model.safetensors", + "language_model.model.layers.4.per_layer_projection.biases": "model.safetensors", + "language_model.model.layers.4.per_layer_projection.scales": "model.safetensors", + "language_model.model.layers.4.per_layer_projection.weight": "model.safetensors", + "language_model.model.layers.4.post_attention_layernorm.weight": "model.safetensors", + "language_model.model.layers.4.post_feedforward_layernorm.weight": "model.safetensors", + "language_model.model.layers.4.post_per_layer_input_norm.weight": "model.safetensors", + "language_model.model.layers.4.pre_feedforward_layernorm.weight": "model.safetensors", + "language_model.model.layers.4.self_attn.k_norm.weight": "model.safetensors", + "language_model.model.layers.4.self_attn.k_proj.biases": "model.safetensors", + "language_model.model.layers.4.self_attn.k_proj.scales": "model.safetensors", + "language_model.model.layers.4.self_attn.k_proj.weight": "model.safetensors", + "language_model.model.layers.4.self_attn.o_proj.biases": "model.safetensors", + "language_model.model.layers.4.self_attn.o_proj.scales": "model.safetensors", + "language_model.model.layers.4.self_attn.o_proj.weight": "model.safetensors", + "language_model.model.layers.4.self_attn.q_norm.weight": "model.safetensors", + "language_model.model.layers.4.self_attn.q_proj.biases": "model.safetensors", + "language_model.model.layers.4.self_attn.q_proj.scales": "model.safetensors", + "language_model.model.layers.4.self_attn.q_proj.weight": "model.safetensors", + "language_model.model.layers.4.self_attn.v_proj.biases": "model.safetensors", + "language_model.model.layers.4.self_attn.v_proj.scales": "model.safetensors", + "language_model.model.layers.4.self_attn.v_proj.weight": "model.safetensors", + "language_model.model.layers.40.input_layernorm.weight": "model.safetensors", + "language_model.model.layers.40.layer_scalar": "model.safetensors", + "language_model.model.layers.40.mlp.down_proj.biases": "model.safetensors", + "language_model.model.layers.40.mlp.down_proj.scales": "model.safetensors", + "language_model.model.layers.40.mlp.down_proj.weight": "model.safetensors", + "language_model.model.layers.40.mlp.gate_proj.biases": "model.safetensors", + "language_model.model.layers.40.mlp.gate_proj.scales": "model.safetensors", + "language_model.model.layers.40.mlp.gate_proj.weight": "model.safetensors", + "language_model.model.layers.40.mlp.up_proj.biases": "model.safetensors", + "language_model.model.layers.40.mlp.up_proj.scales": "model.safetensors", + "language_model.model.layers.40.mlp.up_proj.weight": "model.safetensors", + "language_model.model.layers.40.per_layer_input_gate.biases": "model.safetensors", + "language_model.model.layers.40.per_layer_input_gate.scales": "model.safetensors", + "language_model.model.layers.40.per_layer_input_gate.weight": "model.safetensors", + "language_model.model.layers.40.per_layer_projection.biases": "model.safetensors", + "language_model.model.layers.40.per_layer_projection.scales": "model.safetensors", + "language_model.model.layers.40.per_layer_projection.weight": "model.safetensors", + "language_model.model.layers.40.post_attention_layernorm.weight": "model.safetensors", + "language_model.model.layers.40.post_feedforward_layernorm.weight": "model.safetensors", + "language_model.model.layers.40.post_per_layer_input_norm.weight": "model.safetensors", + "language_model.model.layers.40.pre_feedforward_layernorm.weight": "model.safetensors", + "language_model.model.layers.40.self_attn.k_norm.weight": "model.safetensors", + "language_model.model.layers.40.self_attn.k_proj.biases": "model.safetensors", + "language_model.model.layers.40.self_attn.k_proj.scales": "model.safetensors", + "language_model.model.layers.40.self_attn.k_proj.weight": "model.safetensors", + "language_model.model.layers.40.self_attn.o_proj.biases": "model.safetensors", + "language_model.model.layers.40.self_attn.o_proj.scales": "model.safetensors", + "language_model.model.layers.40.self_attn.o_proj.weight": "model.safetensors", + "language_model.model.layers.40.self_attn.q_norm.weight": "model.safetensors", + "language_model.model.layers.40.self_attn.q_proj.biases": "model.safetensors", + "language_model.model.layers.40.self_attn.q_proj.scales": "model.safetensors", + "language_model.model.layers.40.self_attn.q_proj.weight": "model.safetensors", + "language_model.model.layers.40.self_attn.v_proj.biases": "model.safetensors", + "language_model.model.layers.40.self_attn.v_proj.scales": "model.safetensors", + "language_model.model.layers.40.self_attn.v_proj.weight": "model.safetensors", + "language_model.model.layers.41.input_layernorm.weight": "model.safetensors", + "language_model.model.layers.41.layer_scalar": "model.safetensors", + "language_model.model.layers.41.mlp.down_proj.biases": "model.safetensors", + "language_model.model.layers.41.mlp.down_proj.scales": "model.safetensors", + "language_model.model.layers.41.mlp.down_proj.weight": "model.safetensors", + "language_model.model.layers.41.mlp.gate_proj.biases": "model.safetensors", + "language_model.model.layers.41.mlp.gate_proj.scales": "model.safetensors", + "language_model.model.layers.41.mlp.gate_proj.weight": "model.safetensors", + "language_model.model.layers.41.mlp.up_proj.biases": "model.safetensors", + "language_model.model.layers.41.mlp.up_proj.scales": "model.safetensors", + "language_model.model.layers.41.mlp.up_proj.weight": "model.safetensors", + "language_model.model.layers.41.per_layer_input_gate.biases": "model.safetensors", + "language_model.model.layers.41.per_layer_input_gate.scales": "model.safetensors", + "language_model.model.layers.41.per_layer_input_gate.weight": "model.safetensors", + "language_model.model.layers.41.per_layer_projection.biases": "model.safetensors", + "language_model.model.layers.41.per_layer_projection.scales": "model.safetensors", + "language_model.model.layers.41.per_layer_projection.weight": "model.safetensors", + "language_model.model.layers.41.post_attention_layernorm.weight": "model.safetensors", + "language_model.model.layers.41.post_feedforward_layernorm.weight": "model.safetensors", + "language_model.model.layers.41.post_per_layer_input_norm.weight": "model.safetensors", + "language_model.model.layers.41.pre_feedforward_layernorm.weight": "model.safetensors", + "language_model.model.layers.41.self_attn.k_norm.weight": "model.safetensors", + "language_model.model.layers.41.self_attn.k_proj.biases": "model.safetensors", + "language_model.model.layers.41.self_attn.k_proj.scales": "model.safetensors", + "language_model.model.layers.41.self_attn.k_proj.weight": "model.safetensors", + "language_model.model.layers.41.self_attn.o_proj.biases": "model.safetensors", + "language_model.model.layers.41.self_attn.o_proj.scales": "model.safetensors", + "language_model.model.layers.41.self_attn.o_proj.weight": "model.safetensors", + "language_model.model.layers.41.self_attn.q_norm.weight": "model.safetensors", + "language_model.model.layers.41.self_attn.q_proj.biases": "model.safetensors", + "language_model.model.layers.41.self_attn.q_proj.scales": "model.safetensors", + "language_model.model.layers.41.self_attn.q_proj.weight": "model.safetensors", + "language_model.model.layers.41.self_attn.v_proj.biases": "model.safetensors", + "language_model.model.layers.41.self_attn.v_proj.scales": "model.safetensors", + "language_model.model.layers.41.self_attn.v_proj.weight": "model.safetensors", + "language_model.model.layers.5.input_layernorm.weight": "model.safetensors", + "language_model.model.layers.5.layer_scalar": "model.safetensors", + "language_model.model.layers.5.mlp.down_proj.biases": "model.safetensors", + "language_model.model.layers.5.mlp.down_proj.scales": "model.safetensors", + "language_model.model.layers.5.mlp.down_proj.weight": "model.safetensors", + "language_model.model.layers.5.mlp.gate_proj.biases": "model.safetensors", + "language_model.model.layers.5.mlp.gate_proj.scales": "model.safetensors", + "language_model.model.layers.5.mlp.gate_proj.weight": "model.safetensors", + "language_model.model.layers.5.mlp.up_proj.biases": "model.safetensors", + "language_model.model.layers.5.mlp.up_proj.scales": "model.safetensors", + "language_model.model.layers.5.mlp.up_proj.weight": "model.safetensors", + "language_model.model.layers.5.per_layer_input_gate.biases": "model.safetensors", + "language_model.model.layers.5.per_layer_input_gate.scales": "model.safetensors", + "language_model.model.layers.5.per_layer_input_gate.weight": "model.safetensors", + "language_model.model.layers.5.per_layer_projection.biases": "model.safetensors", + "language_model.model.layers.5.per_layer_projection.scales": "model.safetensors", + "language_model.model.layers.5.per_layer_projection.weight": "model.safetensors", + "language_model.model.layers.5.post_attention_layernorm.weight": "model.safetensors", + "language_model.model.layers.5.post_feedforward_layernorm.weight": "model.safetensors", + "language_model.model.layers.5.post_per_layer_input_norm.weight": "model.safetensors", + "language_model.model.layers.5.pre_feedforward_layernorm.weight": "model.safetensors", + "language_model.model.layers.5.self_attn.k_norm.weight": "model.safetensors", + "language_model.model.layers.5.self_attn.k_proj.biases": "model.safetensors", + "language_model.model.layers.5.self_attn.k_proj.scales": "model.safetensors", + "language_model.model.layers.5.self_attn.k_proj.weight": "model.safetensors", + "language_model.model.layers.5.self_attn.o_proj.biases": "model.safetensors", + "language_model.model.layers.5.self_attn.o_proj.scales": "model.safetensors", + "language_model.model.layers.5.self_attn.o_proj.weight": "model.safetensors", + "language_model.model.layers.5.self_attn.q_norm.weight": "model.safetensors", + "language_model.model.layers.5.self_attn.q_proj.biases": "model.safetensors", + "language_model.model.layers.5.self_attn.q_proj.scales": "model.safetensors", + "language_model.model.layers.5.self_attn.q_proj.weight": "model.safetensors", + "language_model.model.layers.5.self_attn.v_proj.biases": "model.safetensors", + "language_model.model.layers.5.self_attn.v_proj.scales": "model.safetensors", + "language_model.model.layers.5.self_attn.v_proj.weight": "model.safetensors", + "language_model.model.layers.6.input_layernorm.weight": "model.safetensors", + "language_model.model.layers.6.layer_scalar": "model.safetensors", + "language_model.model.layers.6.mlp.down_proj.biases": "model.safetensors", + "language_model.model.layers.6.mlp.down_proj.scales": "model.safetensors", + "language_model.model.layers.6.mlp.down_proj.weight": "model.safetensors", + "language_model.model.layers.6.mlp.gate_proj.biases": "model.safetensors", + "language_model.model.layers.6.mlp.gate_proj.scales": "model.safetensors", + "language_model.model.layers.6.mlp.gate_proj.weight": "model.safetensors", + "language_model.model.layers.6.mlp.up_proj.biases": "model.safetensors", + "language_model.model.layers.6.mlp.up_proj.scales": "model.safetensors", + "language_model.model.layers.6.mlp.up_proj.weight": "model.safetensors", + "language_model.model.layers.6.per_layer_input_gate.biases": "model.safetensors", + "language_model.model.layers.6.per_layer_input_gate.scales": "model.safetensors", + "language_model.model.layers.6.per_layer_input_gate.weight": "model.safetensors", + "language_model.model.layers.6.per_layer_projection.biases": "model.safetensors", + "language_model.model.layers.6.per_layer_projection.scales": "model.safetensors", + "language_model.model.layers.6.per_layer_projection.weight": "model.safetensors", + "language_model.model.layers.6.post_attention_layernorm.weight": "model.safetensors", + "language_model.model.layers.6.post_feedforward_layernorm.weight": "model.safetensors", + "language_model.model.layers.6.post_per_layer_input_norm.weight": "model.safetensors", + "language_model.model.layers.6.pre_feedforward_layernorm.weight": "model.safetensors", + "language_model.model.layers.6.self_attn.k_norm.weight": "model.safetensors", + "language_model.model.layers.6.self_attn.k_proj.biases": "model.safetensors", + "language_model.model.layers.6.self_attn.k_proj.scales": "model.safetensors", + "language_model.model.layers.6.self_attn.k_proj.weight": "model.safetensors", + "language_model.model.layers.6.self_attn.o_proj.biases": "model.safetensors", + "language_model.model.layers.6.self_attn.o_proj.scales": "model.safetensors", + "language_model.model.layers.6.self_attn.o_proj.weight": "model.safetensors", + "language_model.model.layers.6.self_attn.q_norm.weight": "model.safetensors", + "language_model.model.layers.6.self_attn.q_proj.biases": "model.safetensors", + "language_model.model.layers.6.self_attn.q_proj.scales": "model.safetensors", + "language_model.model.layers.6.self_attn.q_proj.weight": "model.safetensors", + "language_model.model.layers.6.self_attn.v_proj.biases": "model.safetensors", + "language_model.model.layers.6.self_attn.v_proj.scales": "model.safetensors", + "language_model.model.layers.6.self_attn.v_proj.weight": "model.safetensors", + "language_model.model.layers.7.input_layernorm.weight": "model.safetensors", + "language_model.model.layers.7.layer_scalar": "model.safetensors", + "language_model.model.layers.7.mlp.down_proj.biases": "model.safetensors", + "language_model.model.layers.7.mlp.down_proj.scales": "model.safetensors", + "language_model.model.layers.7.mlp.down_proj.weight": "model.safetensors", + "language_model.model.layers.7.mlp.gate_proj.biases": "model.safetensors", + "language_model.model.layers.7.mlp.gate_proj.scales": "model.safetensors", + "language_model.model.layers.7.mlp.gate_proj.weight": "model.safetensors", + "language_model.model.layers.7.mlp.up_proj.biases": "model.safetensors", + "language_model.model.layers.7.mlp.up_proj.scales": "model.safetensors", + "language_model.model.layers.7.mlp.up_proj.weight": "model.safetensors", + "language_model.model.layers.7.per_layer_input_gate.biases": "model.safetensors", + "language_model.model.layers.7.per_layer_input_gate.scales": "model.safetensors", + "language_model.model.layers.7.per_layer_input_gate.weight": "model.safetensors", + "language_model.model.layers.7.per_layer_projection.biases": "model.safetensors", + "language_model.model.layers.7.per_layer_projection.scales": "model.safetensors", + "language_model.model.layers.7.per_layer_projection.weight": "model.safetensors", + "language_model.model.layers.7.post_attention_layernorm.weight": "model.safetensors", + "language_model.model.layers.7.post_feedforward_layernorm.weight": "model.safetensors", + "language_model.model.layers.7.post_per_layer_input_norm.weight": "model.safetensors", + "language_model.model.layers.7.pre_feedforward_layernorm.weight": "model.safetensors", + "language_model.model.layers.7.self_attn.k_norm.weight": "model.safetensors", + "language_model.model.layers.7.self_attn.k_proj.biases": "model.safetensors", + "language_model.model.layers.7.self_attn.k_proj.scales": "model.safetensors", + "language_model.model.layers.7.self_attn.k_proj.weight": "model.safetensors", + "language_model.model.layers.7.self_attn.o_proj.biases": "model.safetensors", + "language_model.model.layers.7.self_attn.o_proj.scales": "model.safetensors", + "language_model.model.layers.7.self_attn.o_proj.weight": "model.safetensors", + "language_model.model.layers.7.self_attn.q_norm.weight": "model.safetensors", + "language_model.model.layers.7.self_attn.q_proj.biases": "model.safetensors", + "language_model.model.layers.7.self_attn.q_proj.scales": "model.safetensors", + "language_model.model.layers.7.self_attn.q_proj.weight": "model.safetensors", + "language_model.model.layers.7.self_attn.v_proj.biases": "model.safetensors", + "language_model.model.layers.7.self_attn.v_proj.scales": "model.safetensors", + "language_model.model.layers.7.self_attn.v_proj.weight": "model.safetensors", + "language_model.model.layers.8.input_layernorm.weight": "model.safetensors", + "language_model.model.layers.8.layer_scalar": "model.safetensors", + "language_model.model.layers.8.mlp.down_proj.biases": "model.safetensors", + "language_model.model.layers.8.mlp.down_proj.scales": "model.safetensors", + "language_model.model.layers.8.mlp.down_proj.weight": "model.safetensors", + "language_model.model.layers.8.mlp.gate_proj.biases": "model.safetensors", + "language_model.model.layers.8.mlp.gate_proj.scales": "model.safetensors", + "language_model.model.layers.8.mlp.gate_proj.weight": "model.safetensors", + "language_model.model.layers.8.mlp.up_proj.biases": "model.safetensors", + "language_model.model.layers.8.mlp.up_proj.scales": "model.safetensors", + "language_model.model.layers.8.mlp.up_proj.weight": "model.safetensors", + "language_model.model.layers.8.per_layer_input_gate.biases": "model.safetensors", + "language_model.model.layers.8.per_layer_input_gate.scales": "model.safetensors", + "language_model.model.layers.8.per_layer_input_gate.weight": "model.safetensors", + "language_model.model.layers.8.per_layer_projection.biases": "model.safetensors", + "language_model.model.layers.8.per_layer_projection.scales": "model.safetensors", + "language_model.model.layers.8.per_layer_projection.weight": "model.safetensors", + "language_model.model.layers.8.post_attention_layernorm.weight": "model.safetensors", + "language_model.model.layers.8.post_feedforward_layernorm.weight": "model.safetensors", + "language_model.model.layers.8.post_per_layer_input_norm.weight": "model.safetensors", + "language_model.model.layers.8.pre_feedforward_layernorm.weight": "model.safetensors", + "language_model.model.layers.8.self_attn.k_norm.weight": "model.safetensors", + "language_model.model.layers.8.self_attn.k_proj.biases": "model.safetensors", + "language_model.model.layers.8.self_attn.k_proj.scales": "model.safetensors", + "language_model.model.layers.8.self_attn.k_proj.weight": "model.safetensors", + "language_model.model.layers.8.self_attn.o_proj.biases": "model.safetensors", + "language_model.model.layers.8.self_attn.o_proj.scales": "model.safetensors", + "language_model.model.layers.8.self_attn.o_proj.weight": "model.safetensors", + "language_model.model.layers.8.self_attn.q_norm.weight": "model.safetensors", + "language_model.model.layers.8.self_attn.q_proj.biases": "model.safetensors", + "language_model.model.layers.8.self_attn.q_proj.scales": "model.safetensors", + "language_model.model.layers.8.self_attn.q_proj.weight": "model.safetensors", + "language_model.model.layers.8.self_attn.v_proj.biases": "model.safetensors", + "language_model.model.layers.8.self_attn.v_proj.scales": "model.safetensors", + "language_model.model.layers.8.self_attn.v_proj.weight": "model.safetensors", + "language_model.model.layers.9.input_layernorm.weight": "model.safetensors", + "language_model.model.layers.9.layer_scalar": "model.safetensors", + "language_model.model.layers.9.mlp.down_proj.biases": "model.safetensors", + "language_model.model.layers.9.mlp.down_proj.scales": "model.safetensors", + "language_model.model.layers.9.mlp.down_proj.weight": "model.safetensors", + "language_model.model.layers.9.mlp.gate_proj.biases": "model.safetensors", + "language_model.model.layers.9.mlp.gate_proj.scales": "model.safetensors", + "language_model.model.layers.9.mlp.gate_proj.weight": "model.safetensors", + "language_model.model.layers.9.mlp.up_proj.biases": "model.safetensors", + "language_model.model.layers.9.mlp.up_proj.scales": "model.safetensors", + "language_model.model.layers.9.mlp.up_proj.weight": "model.safetensors", + "language_model.model.layers.9.per_layer_input_gate.biases": "model.safetensors", + "language_model.model.layers.9.per_layer_input_gate.scales": "model.safetensors", + "language_model.model.layers.9.per_layer_input_gate.weight": "model.safetensors", + "language_model.model.layers.9.per_layer_projection.biases": "model.safetensors", + "language_model.model.layers.9.per_layer_projection.scales": "model.safetensors", + "language_model.model.layers.9.per_layer_projection.weight": "model.safetensors", + "language_model.model.layers.9.post_attention_layernorm.weight": "model.safetensors", + "language_model.model.layers.9.post_feedforward_layernorm.weight": "model.safetensors", + "language_model.model.layers.9.post_per_layer_input_norm.weight": "model.safetensors", + "language_model.model.layers.9.pre_feedforward_layernorm.weight": "model.safetensors", + "language_model.model.layers.9.self_attn.k_norm.weight": "model.safetensors", + "language_model.model.layers.9.self_attn.k_proj.biases": "model.safetensors", + "language_model.model.layers.9.self_attn.k_proj.scales": "model.safetensors", + "language_model.model.layers.9.self_attn.k_proj.weight": "model.safetensors", + "language_model.model.layers.9.self_attn.o_proj.biases": "model.safetensors", + "language_model.model.layers.9.self_attn.o_proj.scales": "model.safetensors", + "language_model.model.layers.9.self_attn.o_proj.weight": "model.safetensors", + "language_model.model.layers.9.self_attn.q_norm.weight": "model.safetensors", + "language_model.model.layers.9.self_attn.q_proj.biases": "model.safetensors", + "language_model.model.layers.9.self_attn.q_proj.scales": "model.safetensors", + "language_model.model.layers.9.self_attn.q_proj.weight": "model.safetensors", + "language_model.model.layers.9.self_attn.v_proj.biases": "model.safetensors", + "language_model.model.layers.9.self_attn.v_proj.scales": "model.safetensors", + "language_model.model.layers.9.self_attn.v_proj.weight": "model.safetensors", + "language_model.model.norm.weight": "model.safetensors", + "language_model.model.per_layer_model_projection.weight": "model.safetensors", + "language_model.model.per_layer_projection_norm.weight": "model.safetensors", + "vision_tower.encoder.layers.0.input_layernorm.weight": "model.safetensors", + "vision_tower.encoder.layers.0.mlp.down_proj.input_max": "model.safetensors", + "vision_tower.encoder.layers.0.mlp.down_proj.input_min": "model.safetensors", + "vision_tower.encoder.layers.0.mlp.down_proj.linear.weight": "model.safetensors", + "vision_tower.encoder.layers.0.mlp.down_proj.output_max": "model.safetensors", + "vision_tower.encoder.layers.0.mlp.down_proj.output_min": "model.safetensors", + "vision_tower.encoder.layers.0.mlp.gate_proj.input_max": "model.safetensors", + "vision_tower.encoder.layers.0.mlp.gate_proj.input_min": "model.safetensors", + "vision_tower.encoder.layers.0.mlp.gate_proj.linear.weight": "model.safetensors", + "vision_tower.encoder.layers.0.mlp.gate_proj.output_max": "model.safetensors", + "vision_tower.encoder.layers.0.mlp.gate_proj.output_min": "model.safetensors", + "vision_tower.encoder.layers.0.mlp.up_proj.input_max": "model.safetensors", + "vision_tower.encoder.layers.0.mlp.up_proj.input_min": "model.safetensors", + "vision_tower.encoder.layers.0.mlp.up_proj.linear.weight": "model.safetensors", + "vision_tower.encoder.layers.0.mlp.up_proj.output_max": "model.safetensors", + "vision_tower.encoder.layers.0.mlp.up_proj.output_min": "model.safetensors", + "vision_tower.encoder.layers.0.post_attention_layernorm.weight": "model.safetensors", + "vision_tower.encoder.layers.0.post_feedforward_layernorm.weight": "model.safetensors", + "vision_tower.encoder.layers.0.pre_feedforward_layernorm.weight": "model.safetensors", + "vision_tower.encoder.layers.0.self_attn.k_norm.weight": "model.safetensors", + "vision_tower.encoder.layers.0.self_attn.k_proj.input_max": "model.safetensors", + "vision_tower.encoder.layers.0.self_attn.k_proj.input_min": "model.safetensors", + "vision_tower.encoder.layers.0.self_attn.k_proj.linear.weight": "model.safetensors", + "vision_tower.encoder.layers.0.self_attn.k_proj.output_max": "model.safetensors", + "vision_tower.encoder.layers.0.self_attn.k_proj.output_min": "model.safetensors", + "vision_tower.encoder.layers.0.self_attn.o_proj.input_max": "model.safetensors", + "vision_tower.encoder.layers.0.self_attn.o_proj.input_min": "model.safetensors", + "vision_tower.encoder.layers.0.self_attn.o_proj.linear.weight": "model.safetensors", + "vision_tower.encoder.layers.0.self_attn.o_proj.output_max": "model.safetensors", + "vision_tower.encoder.layers.0.self_attn.o_proj.output_min": "model.safetensors", + "vision_tower.encoder.layers.0.self_attn.q_norm.weight": "model.safetensors", + "vision_tower.encoder.layers.0.self_attn.q_proj.input_max": "model.safetensors", + "vision_tower.encoder.layers.0.self_attn.q_proj.input_min": "model.safetensors", + "vision_tower.encoder.layers.0.self_attn.q_proj.linear.weight": "model.safetensors", + "vision_tower.encoder.layers.0.self_attn.q_proj.output_max": "model.safetensors", + "vision_tower.encoder.layers.0.self_attn.q_proj.output_min": "model.safetensors", + "vision_tower.encoder.layers.0.self_attn.v_proj.input_max": "model.safetensors", + "vision_tower.encoder.layers.0.self_attn.v_proj.input_min": "model.safetensors", + "vision_tower.encoder.layers.0.self_attn.v_proj.linear.weight": "model.safetensors", + "vision_tower.encoder.layers.0.self_attn.v_proj.output_max": "model.safetensors", + "vision_tower.encoder.layers.0.self_attn.v_proj.output_min": "model.safetensors", + "vision_tower.encoder.layers.1.input_layernorm.weight": "model.safetensors", + "vision_tower.encoder.layers.1.mlp.down_proj.input_max": "model.safetensors", + "vision_tower.encoder.layers.1.mlp.down_proj.input_min": "model.safetensors", + "vision_tower.encoder.layers.1.mlp.down_proj.linear.weight": "model.safetensors", + "vision_tower.encoder.layers.1.mlp.down_proj.output_max": "model.safetensors", + "vision_tower.encoder.layers.1.mlp.down_proj.output_min": "model.safetensors", + "vision_tower.encoder.layers.1.mlp.gate_proj.input_max": "model.safetensors", + "vision_tower.encoder.layers.1.mlp.gate_proj.input_min": "model.safetensors", + "vision_tower.encoder.layers.1.mlp.gate_proj.linear.weight": "model.safetensors", + "vision_tower.encoder.layers.1.mlp.gate_proj.output_max": "model.safetensors", + "vision_tower.encoder.layers.1.mlp.gate_proj.output_min": "model.safetensors", + "vision_tower.encoder.layers.1.mlp.up_proj.input_max": "model.safetensors", + "vision_tower.encoder.layers.1.mlp.up_proj.input_min": "model.safetensors", + "vision_tower.encoder.layers.1.mlp.up_proj.linear.weight": "model.safetensors", + "vision_tower.encoder.layers.1.mlp.up_proj.output_max": "model.safetensors", + "vision_tower.encoder.layers.1.mlp.up_proj.output_min": "model.safetensors", + "vision_tower.encoder.layers.1.post_attention_layernorm.weight": "model.safetensors", + "vision_tower.encoder.layers.1.post_feedforward_layernorm.weight": "model.safetensors", + "vision_tower.encoder.layers.1.pre_feedforward_layernorm.weight": "model.safetensors", + "vision_tower.encoder.layers.1.self_attn.k_norm.weight": "model.safetensors", + "vision_tower.encoder.layers.1.self_attn.k_proj.input_max": "model.safetensors", + "vision_tower.encoder.layers.1.self_attn.k_proj.input_min": "model.safetensors", + "vision_tower.encoder.layers.1.self_attn.k_proj.linear.weight": "model.safetensors", + "vision_tower.encoder.layers.1.self_attn.k_proj.output_max": "model.safetensors", + "vision_tower.encoder.layers.1.self_attn.k_proj.output_min": "model.safetensors", + "vision_tower.encoder.layers.1.self_attn.o_proj.input_max": "model.safetensors", + "vision_tower.encoder.layers.1.self_attn.o_proj.input_min": "model.safetensors", + "vision_tower.encoder.layers.1.self_attn.o_proj.linear.weight": "model.safetensors", + "vision_tower.encoder.layers.1.self_attn.o_proj.output_max": "model.safetensors", + "vision_tower.encoder.layers.1.self_attn.o_proj.output_min": "model.safetensors", + "vision_tower.encoder.layers.1.self_attn.q_norm.weight": "model.safetensors", + "vision_tower.encoder.layers.1.self_attn.q_proj.input_max": "model.safetensors", + "vision_tower.encoder.layers.1.self_attn.q_proj.input_min": "model.safetensors", + "vision_tower.encoder.layers.1.self_attn.q_proj.linear.weight": "model.safetensors", + "vision_tower.encoder.layers.1.self_attn.q_proj.output_max": "model.safetensors", + "vision_tower.encoder.layers.1.self_attn.q_proj.output_min": "model.safetensors", + "vision_tower.encoder.layers.1.self_attn.v_proj.input_max": "model.safetensors", + "vision_tower.encoder.layers.1.self_attn.v_proj.input_min": "model.safetensors", + "vision_tower.encoder.layers.1.self_attn.v_proj.linear.weight": "model.safetensors", + "vision_tower.encoder.layers.1.self_attn.v_proj.output_max": "model.safetensors", + "vision_tower.encoder.layers.1.self_attn.v_proj.output_min": "model.safetensors", + "vision_tower.encoder.layers.10.input_layernorm.weight": "model.safetensors", + "vision_tower.encoder.layers.10.mlp.down_proj.input_max": "model.safetensors", + "vision_tower.encoder.layers.10.mlp.down_proj.input_min": "model.safetensors", + "vision_tower.encoder.layers.10.mlp.down_proj.linear.weight": "model.safetensors", + "vision_tower.encoder.layers.10.mlp.down_proj.output_max": "model.safetensors", + "vision_tower.encoder.layers.10.mlp.down_proj.output_min": "model.safetensors", + "vision_tower.encoder.layers.10.mlp.gate_proj.input_max": "model.safetensors", + "vision_tower.encoder.layers.10.mlp.gate_proj.input_min": "model.safetensors", + "vision_tower.encoder.layers.10.mlp.gate_proj.linear.weight": "model.safetensors", + "vision_tower.encoder.layers.10.mlp.gate_proj.output_max": "model.safetensors", + "vision_tower.encoder.layers.10.mlp.gate_proj.output_min": "model.safetensors", + "vision_tower.encoder.layers.10.mlp.up_proj.input_max": "model.safetensors", + "vision_tower.encoder.layers.10.mlp.up_proj.input_min": "model.safetensors", + "vision_tower.encoder.layers.10.mlp.up_proj.linear.weight": "model.safetensors", + "vision_tower.encoder.layers.10.mlp.up_proj.output_max": "model.safetensors", + "vision_tower.encoder.layers.10.mlp.up_proj.output_min": "model.safetensors", + "vision_tower.encoder.layers.10.post_attention_layernorm.weight": "model.safetensors", + "vision_tower.encoder.layers.10.post_feedforward_layernorm.weight": "model.safetensors", + "vision_tower.encoder.layers.10.pre_feedforward_layernorm.weight": "model.safetensors", + "vision_tower.encoder.layers.10.self_attn.k_norm.weight": "model.safetensors", + "vision_tower.encoder.layers.10.self_attn.k_proj.input_max": "model.safetensors", + "vision_tower.encoder.layers.10.self_attn.k_proj.input_min": "model.safetensors", + "vision_tower.encoder.layers.10.self_attn.k_proj.linear.weight": "model.safetensors", + "vision_tower.encoder.layers.10.self_attn.k_proj.output_max": "model.safetensors", + "vision_tower.encoder.layers.10.self_attn.k_proj.output_min": "model.safetensors", + "vision_tower.encoder.layers.10.self_attn.o_proj.input_max": "model.safetensors", + "vision_tower.encoder.layers.10.self_attn.o_proj.input_min": "model.safetensors", + "vision_tower.encoder.layers.10.self_attn.o_proj.linear.weight": "model.safetensors", + "vision_tower.encoder.layers.10.self_attn.o_proj.output_max": "model.safetensors", + "vision_tower.encoder.layers.10.self_attn.o_proj.output_min": "model.safetensors", + "vision_tower.encoder.layers.10.self_attn.q_norm.weight": "model.safetensors", + "vision_tower.encoder.layers.10.self_attn.q_proj.input_max": "model.safetensors", + "vision_tower.encoder.layers.10.self_attn.q_proj.input_min": "model.safetensors", + "vision_tower.encoder.layers.10.self_attn.q_proj.linear.weight": "model.safetensors", + "vision_tower.encoder.layers.10.self_attn.q_proj.output_max": "model.safetensors", + "vision_tower.encoder.layers.10.self_attn.q_proj.output_min": "model.safetensors", + "vision_tower.encoder.layers.10.self_attn.v_proj.input_max": "model.safetensors", + "vision_tower.encoder.layers.10.self_attn.v_proj.input_min": "model.safetensors", + "vision_tower.encoder.layers.10.self_attn.v_proj.linear.weight": "model.safetensors", + "vision_tower.encoder.layers.10.self_attn.v_proj.output_max": "model.safetensors", + "vision_tower.encoder.layers.10.self_attn.v_proj.output_min": "model.safetensors", + "vision_tower.encoder.layers.11.input_layernorm.weight": "model.safetensors", + "vision_tower.encoder.layers.11.mlp.down_proj.input_max": "model.safetensors", + "vision_tower.encoder.layers.11.mlp.down_proj.input_min": "model.safetensors", + "vision_tower.encoder.layers.11.mlp.down_proj.linear.weight": "model.safetensors", + "vision_tower.encoder.layers.11.mlp.down_proj.output_max": "model.safetensors", + "vision_tower.encoder.layers.11.mlp.down_proj.output_min": "model.safetensors", + "vision_tower.encoder.layers.11.mlp.gate_proj.input_max": "model.safetensors", + "vision_tower.encoder.layers.11.mlp.gate_proj.input_min": "model.safetensors", + "vision_tower.encoder.layers.11.mlp.gate_proj.linear.weight": "model.safetensors", + "vision_tower.encoder.layers.11.mlp.gate_proj.output_max": "model.safetensors", + "vision_tower.encoder.layers.11.mlp.gate_proj.output_min": "model.safetensors", + "vision_tower.encoder.layers.11.mlp.up_proj.input_max": "model.safetensors", + "vision_tower.encoder.layers.11.mlp.up_proj.input_min": "model.safetensors", + "vision_tower.encoder.layers.11.mlp.up_proj.linear.weight": "model.safetensors", + "vision_tower.encoder.layers.11.mlp.up_proj.output_max": "model.safetensors", + "vision_tower.encoder.layers.11.mlp.up_proj.output_min": "model.safetensors", + "vision_tower.encoder.layers.11.post_attention_layernorm.weight": "model.safetensors", + "vision_tower.encoder.layers.11.post_feedforward_layernorm.weight": "model.safetensors", + "vision_tower.encoder.layers.11.pre_feedforward_layernorm.weight": "model.safetensors", + "vision_tower.encoder.layers.11.self_attn.k_norm.weight": "model.safetensors", + "vision_tower.encoder.layers.11.self_attn.k_proj.input_max": "model.safetensors", + "vision_tower.encoder.layers.11.self_attn.k_proj.input_min": "model.safetensors", + "vision_tower.encoder.layers.11.self_attn.k_proj.linear.weight": "model.safetensors", + "vision_tower.encoder.layers.11.self_attn.k_proj.output_max": "model.safetensors", + "vision_tower.encoder.layers.11.self_attn.k_proj.output_min": "model.safetensors", + "vision_tower.encoder.layers.11.self_attn.o_proj.input_max": "model.safetensors", + "vision_tower.encoder.layers.11.self_attn.o_proj.input_min": "model.safetensors", + "vision_tower.encoder.layers.11.self_attn.o_proj.linear.weight": "model.safetensors", + "vision_tower.encoder.layers.11.self_attn.o_proj.output_max": "model.safetensors", + "vision_tower.encoder.layers.11.self_attn.o_proj.output_min": "model.safetensors", + "vision_tower.encoder.layers.11.self_attn.q_norm.weight": "model.safetensors", + "vision_tower.encoder.layers.11.self_attn.q_proj.input_max": "model.safetensors", + "vision_tower.encoder.layers.11.self_attn.q_proj.input_min": "model.safetensors", + "vision_tower.encoder.layers.11.self_attn.q_proj.linear.weight": "model.safetensors", + "vision_tower.encoder.layers.11.self_attn.q_proj.output_max": "model.safetensors", + "vision_tower.encoder.layers.11.self_attn.q_proj.output_min": "model.safetensors", + "vision_tower.encoder.layers.11.self_attn.v_proj.input_max": "model.safetensors", + "vision_tower.encoder.layers.11.self_attn.v_proj.input_min": "model.safetensors", + "vision_tower.encoder.layers.11.self_attn.v_proj.linear.weight": "model.safetensors", + "vision_tower.encoder.layers.11.self_attn.v_proj.output_max": "model.safetensors", + "vision_tower.encoder.layers.11.self_attn.v_proj.output_min": "model.safetensors", + "vision_tower.encoder.layers.12.input_layernorm.weight": "model.safetensors", + "vision_tower.encoder.layers.12.mlp.down_proj.input_max": "model.safetensors", + "vision_tower.encoder.layers.12.mlp.down_proj.input_min": "model.safetensors", + "vision_tower.encoder.layers.12.mlp.down_proj.linear.weight": "model.safetensors", + "vision_tower.encoder.layers.12.mlp.down_proj.output_max": "model.safetensors", + "vision_tower.encoder.layers.12.mlp.down_proj.output_min": "model.safetensors", + "vision_tower.encoder.layers.12.mlp.gate_proj.input_max": "model.safetensors", + "vision_tower.encoder.layers.12.mlp.gate_proj.input_min": "model.safetensors", + "vision_tower.encoder.layers.12.mlp.gate_proj.linear.weight": "model.safetensors", + "vision_tower.encoder.layers.12.mlp.gate_proj.output_max": "model.safetensors", + "vision_tower.encoder.layers.12.mlp.gate_proj.output_min": "model.safetensors", + "vision_tower.encoder.layers.12.mlp.up_proj.input_max": "model.safetensors", + "vision_tower.encoder.layers.12.mlp.up_proj.input_min": "model.safetensors", + "vision_tower.encoder.layers.12.mlp.up_proj.linear.weight": "model.safetensors", + "vision_tower.encoder.layers.12.mlp.up_proj.output_max": "model.safetensors", + "vision_tower.encoder.layers.12.mlp.up_proj.output_min": "model.safetensors", + "vision_tower.encoder.layers.12.post_attention_layernorm.weight": "model.safetensors", + "vision_tower.encoder.layers.12.post_feedforward_layernorm.weight": "model.safetensors", + "vision_tower.encoder.layers.12.pre_feedforward_layernorm.weight": "model.safetensors", + "vision_tower.encoder.layers.12.self_attn.k_norm.weight": "model.safetensors", + "vision_tower.encoder.layers.12.self_attn.k_proj.input_max": "model.safetensors", + "vision_tower.encoder.layers.12.self_attn.k_proj.input_min": "model.safetensors", + "vision_tower.encoder.layers.12.self_attn.k_proj.linear.weight": "model.safetensors", + "vision_tower.encoder.layers.12.self_attn.k_proj.output_max": "model.safetensors", + "vision_tower.encoder.layers.12.self_attn.k_proj.output_min": "model.safetensors", + "vision_tower.encoder.layers.12.self_attn.o_proj.input_max": "model.safetensors", + "vision_tower.encoder.layers.12.self_attn.o_proj.input_min": "model.safetensors", + "vision_tower.encoder.layers.12.self_attn.o_proj.linear.weight": "model.safetensors", + "vision_tower.encoder.layers.12.self_attn.o_proj.output_max": "model.safetensors", + "vision_tower.encoder.layers.12.self_attn.o_proj.output_min": "model.safetensors", + "vision_tower.encoder.layers.12.self_attn.q_norm.weight": "model.safetensors", + "vision_tower.encoder.layers.12.self_attn.q_proj.input_max": "model.safetensors", + "vision_tower.encoder.layers.12.self_attn.q_proj.input_min": "model.safetensors", + "vision_tower.encoder.layers.12.self_attn.q_proj.linear.weight": "model.safetensors", + "vision_tower.encoder.layers.12.self_attn.q_proj.output_max": "model.safetensors", + "vision_tower.encoder.layers.12.self_attn.q_proj.output_min": "model.safetensors", + "vision_tower.encoder.layers.12.self_attn.v_proj.input_max": "model.safetensors", + "vision_tower.encoder.layers.12.self_attn.v_proj.input_min": "model.safetensors", + "vision_tower.encoder.layers.12.self_attn.v_proj.linear.weight": "model.safetensors", + "vision_tower.encoder.layers.12.self_attn.v_proj.output_max": "model.safetensors", + "vision_tower.encoder.layers.12.self_attn.v_proj.output_min": "model.safetensors", + "vision_tower.encoder.layers.13.input_layernorm.weight": "model.safetensors", + "vision_tower.encoder.layers.13.mlp.down_proj.input_max": "model.safetensors", + "vision_tower.encoder.layers.13.mlp.down_proj.input_min": "model.safetensors", + "vision_tower.encoder.layers.13.mlp.down_proj.linear.weight": "model.safetensors", + "vision_tower.encoder.layers.13.mlp.down_proj.output_max": "model.safetensors", + "vision_tower.encoder.layers.13.mlp.down_proj.output_min": "model.safetensors", + "vision_tower.encoder.layers.13.mlp.gate_proj.input_max": "model.safetensors", + "vision_tower.encoder.layers.13.mlp.gate_proj.input_min": "model.safetensors", + "vision_tower.encoder.layers.13.mlp.gate_proj.linear.weight": "model.safetensors", + "vision_tower.encoder.layers.13.mlp.gate_proj.output_max": "model.safetensors", + "vision_tower.encoder.layers.13.mlp.gate_proj.output_min": "model.safetensors", + "vision_tower.encoder.layers.13.mlp.up_proj.input_max": "model.safetensors", + "vision_tower.encoder.layers.13.mlp.up_proj.input_min": "model.safetensors", + "vision_tower.encoder.layers.13.mlp.up_proj.linear.weight": "model.safetensors", + "vision_tower.encoder.layers.13.mlp.up_proj.output_max": "model.safetensors", + "vision_tower.encoder.layers.13.mlp.up_proj.output_min": "model.safetensors", + "vision_tower.encoder.layers.13.post_attention_layernorm.weight": "model.safetensors", + "vision_tower.encoder.layers.13.post_feedforward_layernorm.weight": "model.safetensors", + "vision_tower.encoder.layers.13.pre_feedforward_layernorm.weight": "model.safetensors", + "vision_tower.encoder.layers.13.self_attn.k_norm.weight": "model.safetensors", + "vision_tower.encoder.layers.13.self_attn.k_proj.input_max": "model.safetensors", + "vision_tower.encoder.layers.13.self_attn.k_proj.input_min": "model.safetensors", + "vision_tower.encoder.layers.13.self_attn.k_proj.linear.weight": "model.safetensors", + "vision_tower.encoder.layers.13.self_attn.k_proj.output_max": "model.safetensors", + "vision_tower.encoder.layers.13.self_attn.k_proj.output_min": "model.safetensors", + "vision_tower.encoder.layers.13.self_attn.o_proj.input_max": "model.safetensors", + "vision_tower.encoder.layers.13.self_attn.o_proj.input_min": "model.safetensors", + "vision_tower.encoder.layers.13.self_attn.o_proj.linear.weight": "model.safetensors", + "vision_tower.encoder.layers.13.self_attn.o_proj.output_max": "model.safetensors", + "vision_tower.encoder.layers.13.self_attn.o_proj.output_min": "model.safetensors", + "vision_tower.encoder.layers.13.self_attn.q_norm.weight": "model.safetensors", + "vision_tower.encoder.layers.13.self_attn.q_proj.input_max": "model.safetensors", + "vision_tower.encoder.layers.13.self_attn.q_proj.input_min": "model.safetensors", + "vision_tower.encoder.layers.13.self_attn.q_proj.linear.weight": "model.safetensors", + "vision_tower.encoder.layers.13.self_attn.q_proj.output_max": "model.safetensors", + "vision_tower.encoder.layers.13.self_attn.q_proj.output_min": "model.safetensors", + "vision_tower.encoder.layers.13.self_attn.v_proj.input_max": "model.safetensors", + "vision_tower.encoder.layers.13.self_attn.v_proj.input_min": "model.safetensors", + "vision_tower.encoder.layers.13.self_attn.v_proj.linear.weight": "model.safetensors", + "vision_tower.encoder.layers.13.self_attn.v_proj.output_max": "model.safetensors", + "vision_tower.encoder.layers.13.self_attn.v_proj.output_min": "model.safetensors", + "vision_tower.encoder.layers.14.input_layernorm.weight": "model.safetensors", + "vision_tower.encoder.layers.14.mlp.down_proj.input_max": "model.safetensors", + "vision_tower.encoder.layers.14.mlp.down_proj.input_min": "model.safetensors", + "vision_tower.encoder.layers.14.mlp.down_proj.linear.weight": "model.safetensors", + "vision_tower.encoder.layers.14.mlp.down_proj.output_max": "model.safetensors", + "vision_tower.encoder.layers.14.mlp.down_proj.output_min": "model.safetensors", + "vision_tower.encoder.layers.14.mlp.gate_proj.input_max": "model.safetensors", + "vision_tower.encoder.layers.14.mlp.gate_proj.input_min": "model.safetensors", + "vision_tower.encoder.layers.14.mlp.gate_proj.linear.weight": "model.safetensors", + "vision_tower.encoder.layers.14.mlp.gate_proj.output_max": "model.safetensors", + "vision_tower.encoder.layers.14.mlp.gate_proj.output_min": "model.safetensors", + "vision_tower.encoder.layers.14.mlp.up_proj.input_max": "model.safetensors", + "vision_tower.encoder.layers.14.mlp.up_proj.input_min": "model.safetensors", + "vision_tower.encoder.layers.14.mlp.up_proj.linear.weight": "model.safetensors", + "vision_tower.encoder.layers.14.mlp.up_proj.output_max": "model.safetensors", + "vision_tower.encoder.layers.14.mlp.up_proj.output_min": "model.safetensors", + "vision_tower.encoder.layers.14.post_attention_layernorm.weight": "model.safetensors", + "vision_tower.encoder.layers.14.post_feedforward_layernorm.weight": "model.safetensors", + "vision_tower.encoder.layers.14.pre_feedforward_layernorm.weight": "model.safetensors", + "vision_tower.encoder.layers.14.self_attn.k_norm.weight": "model.safetensors", + "vision_tower.encoder.layers.14.self_attn.k_proj.input_max": "model.safetensors", + "vision_tower.encoder.layers.14.self_attn.k_proj.input_min": "model.safetensors", + "vision_tower.encoder.layers.14.self_attn.k_proj.linear.weight": "model.safetensors", + "vision_tower.encoder.layers.14.self_attn.k_proj.output_max": "model.safetensors", + "vision_tower.encoder.layers.14.self_attn.k_proj.output_min": "model.safetensors", + "vision_tower.encoder.layers.14.self_attn.o_proj.input_max": "model.safetensors", + "vision_tower.encoder.layers.14.self_attn.o_proj.input_min": "model.safetensors", + "vision_tower.encoder.layers.14.self_attn.o_proj.linear.weight": "model.safetensors", + "vision_tower.encoder.layers.14.self_attn.o_proj.output_max": "model.safetensors", + "vision_tower.encoder.layers.14.self_attn.o_proj.output_min": "model.safetensors", + "vision_tower.encoder.layers.14.self_attn.q_norm.weight": "model.safetensors", + "vision_tower.encoder.layers.14.self_attn.q_proj.input_max": "model.safetensors", + "vision_tower.encoder.layers.14.self_attn.q_proj.input_min": "model.safetensors", + "vision_tower.encoder.layers.14.self_attn.q_proj.linear.weight": "model.safetensors", + "vision_tower.encoder.layers.14.self_attn.q_proj.output_max": "model.safetensors", + "vision_tower.encoder.layers.14.self_attn.q_proj.output_min": "model.safetensors", + "vision_tower.encoder.layers.14.self_attn.v_proj.input_max": "model.safetensors", + "vision_tower.encoder.layers.14.self_attn.v_proj.input_min": "model.safetensors", + "vision_tower.encoder.layers.14.self_attn.v_proj.linear.weight": "model.safetensors", + "vision_tower.encoder.layers.14.self_attn.v_proj.output_max": "model.safetensors", + "vision_tower.encoder.layers.14.self_attn.v_proj.output_min": "model.safetensors", + "vision_tower.encoder.layers.15.input_layernorm.weight": "model.safetensors", + "vision_tower.encoder.layers.15.mlp.down_proj.input_max": "model.safetensors", + "vision_tower.encoder.layers.15.mlp.down_proj.input_min": "model.safetensors", + "vision_tower.encoder.layers.15.mlp.down_proj.linear.weight": "model.safetensors", + "vision_tower.encoder.layers.15.mlp.down_proj.output_max": "model.safetensors", + "vision_tower.encoder.layers.15.mlp.down_proj.output_min": "model.safetensors", + "vision_tower.encoder.layers.15.mlp.gate_proj.input_max": "model.safetensors", + "vision_tower.encoder.layers.15.mlp.gate_proj.input_min": "model.safetensors", + "vision_tower.encoder.layers.15.mlp.gate_proj.linear.weight": "model.safetensors", + "vision_tower.encoder.layers.15.mlp.gate_proj.output_max": "model.safetensors", + "vision_tower.encoder.layers.15.mlp.gate_proj.output_min": "model.safetensors", + "vision_tower.encoder.layers.15.mlp.up_proj.input_max": "model.safetensors", + "vision_tower.encoder.layers.15.mlp.up_proj.input_min": "model.safetensors", + "vision_tower.encoder.layers.15.mlp.up_proj.linear.weight": "model.safetensors", + "vision_tower.encoder.layers.15.mlp.up_proj.output_max": "model.safetensors", + "vision_tower.encoder.layers.15.mlp.up_proj.output_min": "model.safetensors", + "vision_tower.encoder.layers.15.post_attention_layernorm.weight": "model.safetensors", + "vision_tower.encoder.layers.15.post_feedforward_layernorm.weight": "model.safetensors", + "vision_tower.encoder.layers.15.pre_feedforward_layernorm.weight": "model.safetensors", + "vision_tower.encoder.layers.15.self_attn.k_norm.weight": "model.safetensors", + "vision_tower.encoder.layers.15.self_attn.k_proj.input_max": "model.safetensors", + "vision_tower.encoder.layers.15.self_attn.k_proj.input_min": "model.safetensors", + "vision_tower.encoder.layers.15.self_attn.k_proj.linear.weight": "model.safetensors", + "vision_tower.encoder.layers.15.self_attn.k_proj.output_max": "model.safetensors", + "vision_tower.encoder.layers.15.self_attn.k_proj.output_min": "model.safetensors", + "vision_tower.encoder.layers.15.self_attn.o_proj.input_max": "model.safetensors", + "vision_tower.encoder.layers.15.self_attn.o_proj.input_min": "model.safetensors", + "vision_tower.encoder.layers.15.self_attn.o_proj.linear.weight": "model.safetensors", + "vision_tower.encoder.layers.15.self_attn.o_proj.output_max": "model.safetensors", + "vision_tower.encoder.layers.15.self_attn.o_proj.output_min": "model.safetensors", + "vision_tower.encoder.layers.15.self_attn.q_norm.weight": "model.safetensors", + "vision_tower.encoder.layers.15.self_attn.q_proj.input_max": "model.safetensors", + "vision_tower.encoder.layers.15.self_attn.q_proj.input_min": "model.safetensors", + "vision_tower.encoder.layers.15.self_attn.q_proj.linear.weight": "model.safetensors", + "vision_tower.encoder.layers.15.self_attn.q_proj.output_max": "model.safetensors", + "vision_tower.encoder.layers.15.self_attn.q_proj.output_min": "model.safetensors", + "vision_tower.encoder.layers.15.self_attn.v_proj.input_max": "model.safetensors", + "vision_tower.encoder.layers.15.self_attn.v_proj.input_min": "model.safetensors", + "vision_tower.encoder.layers.15.self_attn.v_proj.linear.weight": "model.safetensors", + "vision_tower.encoder.layers.15.self_attn.v_proj.output_max": "model.safetensors", + "vision_tower.encoder.layers.15.self_attn.v_proj.output_min": "model.safetensors", + "vision_tower.encoder.layers.2.input_layernorm.weight": "model.safetensors", + "vision_tower.encoder.layers.2.mlp.down_proj.input_max": "model.safetensors", + "vision_tower.encoder.layers.2.mlp.down_proj.input_min": "model.safetensors", + "vision_tower.encoder.layers.2.mlp.down_proj.linear.weight": "model.safetensors", + "vision_tower.encoder.layers.2.mlp.down_proj.output_max": "model.safetensors", + "vision_tower.encoder.layers.2.mlp.down_proj.output_min": "model.safetensors", + "vision_tower.encoder.layers.2.mlp.gate_proj.input_max": "model.safetensors", + "vision_tower.encoder.layers.2.mlp.gate_proj.input_min": "model.safetensors", + "vision_tower.encoder.layers.2.mlp.gate_proj.linear.weight": "model.safetensors", + "vision_tower.encoder.layers.2.mlp.gate_proj.output_max": "model.safetensors", + "vision_tower.encoder.layers.2.mlp.gate_proj.output_min": "model.safetensors", + "vision_tower.encoder.layers.2.mlp.up_proj.input_max": "model.safetensors", + "vision_tower.encoder.layers.2.mlp.up_proj.input_min": "model.safetensors", + "vision_tower.encoder.layers.2.mlp.up_proj.linear.weight": "model.safetensors", + "vision_tower.encoder.layers.2.mlp.up_proj.output_max": "model.safetensors", + "vision_tower.encoder.layers.2.mlp.up_proj.output_min": "model.safetensors", + "vision_tower.encoder.layers.2.post_attention_layernorm.weight": "model.safetensors", + "vision_tower.encoder.layers.2.post_feedforward_layernorm.weight": "model.safetensors", + "vision_tower.encoder.layers.2.pre_feedforward_layernorm.weight": "model.safetensors", + "vision_tower.encoder.layers.2.self_attn.k_norm.weight": "model.safetensors", + "vision_tower.encoder.layers.2.self_attn.k_proj.input_max": "model.safetensors", + "vision_tower.encoder.layers.2.self_attn.k_proj.input_min": "model.safetensors", + "vision_tower.encoder.layers.2.self_attn.k_proj.linear.weight": "model.safetensors", + "vision_tower.encoder.layers.2.self_attn.k_proj.output_max": "model.safetensors", + "vision_tower.encoder.layers.2.self_attn.k_proj.output_min": "model.safetensors", + "vision_tower.encoder.layers.2.self_attn.o_proj.input_max": "model.safetensors", + "vision_tower.encoder.layers.2.self_attn.o_proj.input_min": "model.safetensors", + "vision_tower.encoder.layers.2.self_attn.o_proj.linear.weight": "model.safetensors", + "vision_tower.encoder.layers.2.self_attn.o_proj.output_max": "model.safetensors", + "vision_tower.encoder.layers.2.self_attn.o_proj.output_min": "model.safetensors", + "vision_tower.encoder.layers.2.self_attn.q_norm.weight": "model.safetensors", + "vision_tower.encoder.layers.2.self_attn.q_proj.input_max": "model.safetensors", + "vision_tower.encoder.layers.2.self_attn.q_proj.input_min": "model.safetensors", + "vision_tower.encoder.layers.2.self_attn.q_proj.linear.weight": "model.safetensors", + "vision_tower.encoder.layers.2.self_attn.q_proj.output_max": "model.safetensors", + "vision_tower.encoder.layers.2.self_attn.q_proj.output_min": "model.safetensors", + "vision_tower.encoder.layers.2.self_attn.v_proj.input_max": "model.safetensors", + "vision_tower.encoder.layers.2.self_attn.v_proj.input_min": "model.safetensors", + "vision_tower.encoder.layers.2.self_attn.v_proj.linear.weight": "model.safetensors", + "vision_tower.encoder.layers.2.self_attn.v_proj.output_max": "model.safetensors", + "vision_tower.encoder.layers.2.self_attn.v_proj.output_min": "model.safetensors", + "vision_tower.encoder.layers.3.input_layernorm.weight": "model.safetensors", + "vision_tower.encoder.layers.3.mlp.down_proj.input_max": "model.safetensors", + "vision_tower.encoder.layers.3.mlp.down_proj.input_min": "model.safetensors", + "vision_tower.encoder.layers.3.mlp.down_proj.linear.weight": "model.safetensors", + "vision_tower.encoder.layers.3.mlp.down_proj.output_max": "model.safetensors", + "vision_tower.encoder.layers.3.mlp.down_proj.output_min": "model.safetensors", + "vision_tower.encoder.layers.3.mlp.gate_proj.input_max": "model.safetensors", + "vision_tower.encoder.layers.3.mlp.gate_proj.input_min": "model.safetensors", + "vision_tower.encoder.layers.3.mlp.gate_proj.linear.weight": "model.safetensors", + "vision_tower.encoder.layers.3.mlp.gate_proj.output_max": "model.safetensors", + "vision_tower.encoder.layers.3.mlp.gate_proj.output_min": "model.safetensors", + "vision_tower.encoder.layers.3.mlp.up_proj.input_max": "model.safetensors", + "vision_tower.encoder.layers.3.mlp.up_proj.input_min": "model.safetensors", + "vision_tower.encoder.layers.3.mlp.up_proj.linear.weight": "model.safetensors", + "vision_tower.encoder.layers.3.mlp.up_proj.output_max": "model.safetensors", + "vision_tower.encoder.layers.3.mlp.up_proj.output_min": "model.safetensors", + "vision_tower.encoder.layers.3.post_attention_layernorm.weight": "model.safetensors", + "vision_tower.encoder.layers.3.post_feedforward_layernorm.weight": "model.safetensors", + "vision_tower.encoder.layers.3.pre_feedforward_layernorm.weight": "model.safetensors", + "vision_tower.encoder.layers.3.self_attn.k_norm.weight": "model.safetensors", + "vision_tower.encoder.layers.3.self_attn.k_proj.input_max": "model.safetensors", + "vision_tower.encoder.layers.3.self_attn.k_proj.input_min": "model.safetensors", + "vision_tower.encoder.layers.3.self_attn.k_proj.linear.weight": "model.safetensors", + "vision_tower.encoder.layers.3.self_attn.k_proj.output_max": "model.safetensors", + "vision_tower.encoder.layers.3.self_attn.k_proj.output_min": "model.safetensors", + "vision_tower.encoder.layers.3.self_attn.o_proj.input_max": "model.safetensors", + "vision_tower.encoder.layers.3.self_attn.o_proj.input_min": "model.safetensors", + "vision_tower.encoder.layers.3.self_attn.o_proj.linear.weight": "model.safetensors", + "vision_tower.encoder.layers.3.self_attn.o_proj.output_max": "model.safetensors", + "vision_tower.encoder.layers.3.self_attn.o_proj.output_min": "model.safetensors", + "vision_tower.encoder.layers.3.self_attn.q_norm.weight": "model.safetensors", + "vision_tower.encoder.layers.3.self_attn.q_proj.input_max": "model.safetensors", + "vision_tower.encoder.layers.3.self_attn.q_proj.input_min": "model.safetensors", + "vision_tower.encoder.layers.3.self_attn.q_proj.linear.weight": "model.safetensors", + "vision_tower.encoder.layers.3.self_attn.q_proj.output_max": "model.safetensors", + "vision_tower.encoder.layers.3.self_attn.q_proj.output_min": "model.safetensors", + "vision_tower.encoder.layers.3.self_attn.v_proj.input_max": "model.safetensors", + "vision_tower.encoder.layers.3.self_attn.v_proj.input_min": "model.safetensors", + "vision_tower.encoder.layers.3.self_attn.v_proj.linear.weight": "model.safetensors", + "vision_tower.encoder.layers.3.self_attn.v_proj.output_max": "model.safetensors", + "vision_tower.encoder.layers.3.self_attn.v_proj.output_min": "model.safetensors", + "vision_tower.encoder.layers.4.input_layernorm.weight": "model.safetensors", + "vision_tower.encoder.layers.4.mlp.down_proj.input_max": "model.safetensors", + "vision_tower.encoder.layers.4.mlp.down_proj.input_min": "model.safetensors", + "vision_tower.encoder.layers.4.mlp.down_proj.linear.weight": "model.safetensors", + "vision_tower.encoder.layers.4.mlp.down_proj.output_max": "model.safetensors", + "vision_tower.encoder.layers.4.mlp.down_proj.output_min": "model.safetensors", + "vision_tower.encoder.layers.4.mlp.gate_proj.input_max": "model.safetensors", + "vision_tower.encoder.layers.4.mlp.gate_proj.input_min": "model.safetensors", + "vision_tower.encoder.layers.4.mlp.gate_proj.linear.weight": "model.safetensors", + "vision_tower.encoder.layers.4.mlp.gate_proj.output_max": "model.safetensors", + "vision_tower.encoder.layers.4.mlp.gate_proj.output_min": "model.safetensors", + "vision_tower.encoder.layers.4.mlp.up_proj.input_max": "model.safetensors", + "vision_tower.encoder.layers.4.mlp.up_proj.input_min": "model.safetensors", + "vision_tower.encoder.layers.4.mlp.up_proj.linear.weight": "model.safetensors", + "vision_tower.encoder.layers.4.mlp.up_proj.output_max": "model.safetensors", + "vision_tower.encoder.layers.4.mlp.up_proj.output_min": "model.safetensors", + "vision_tower.encoder.layers.4.post_attention_layernorm.weight": "model.safetensors", + "vision_tower.encoder.layers.4.post_feedforward_layernorm.weight": "model.safetensors", + "vision_tower.encoder.layers.4.pre_feedforward_layernorm.weight": "model.safetensors", + "vision_tower.encoder.layers.4.self_attn.k_norm.weight": "model.safetensors", + "vision_tower.encoder.layers.4.self_attn.k_proj.input_max": "model.safetensors", + "vision_tower.encoder.layers.4.self_attn.k_proj.input_min": "model.safetensors", + "vision_tower.encoder.layers.4.self_attn.k_proj.linear.weight": "model.safetensors", + "vision_tower.encoder.layers.4.self_attn.k_proj.output_max": "model.safetensors", + "vision_tower.encoder.layers.4.self_attn.k_proj.output_min": "model.safetensors", + "vision_tower.encoder.layers.4.self_attn.o_proj.input_max": "model.safetensors", + "vision_tower.encoder.layers.4.self_attn.o_proj.input_min": "model.safetensors", + "vision_tower.encoder.layers.4.self_attn.o_proj.linear.weight": "model.safetensors", + "vision_tower.encoder.layers.4.self_attn.o_proj.output_max": "model.safetensors", + "vision_tower.encoder.layers.4.self_attn.o_proj.output_min": "model.safetensors", + "vision_tower.encoder.layers.4.self_attn.q_norm.weight": "model.safetensors", + "vision_tower.encoder.layers.4.self_attn.q_proj.input_max": "model.safetensors", + "vision_tower.encoder.layers.4.self_attn.q_proj.input_min": "model.safetensors", + "vision_tower.encoder.layers.4.self_attn.q_proj.linear.weight": "model.safetensors", + "vision_tower.encoder.layers.4.self_attn.q_proj.output_max": "model.safetensors", + "vision_tower.encoder.layers.4.self_attn.q_proj.output_min": "model.safetensors", + "vision_tower.encoder.layers.4.self_attn.v_proj.input_max": "model.safetensors", + "vision_tower.encoder.layers.4.self_attn.v_proj.input_min": "model.safetensors", + "vision_tower.encoder.layers.4.self_attn.v_proj.linear.weight": "model.safetensors", + "vision_tower.encoder.layers.4.self_attn.v_proj.output_max": "model.safetensors", + "vision_tower.encoder.layers.4.self_attn.v_proj.output_min": "model.safetensors", + "vision_tower.encoder.layers.5.input_layernorm.weight": "model.safetensors", + "vision_tower.encoder.layers.5.mlp.down_proj.input_max": "model.safetensors", + "vision_tower.encoder.layers.5.mlp.down_proj.input_min": "model.safetensors", + "vision_tower.encoder.layers.5.mlp.down_proj.linear.weight": "model.safetensors", + "vision_tower.encoder.layers.5.mlp.down_proj.output_max": "model.safetensors", + "vision_tower.encoder.layers.5.mlp.down_proj.output_min": "model.safetensors", + "vision_tower.encoder.layers.5.mlp.gate_proj.input_max": "model.safetensors", + "vision_tower.encoder.layers.5.mlp.gate_proj.input_min": "model.safetensors", + "vision_tower.encoder.layers.5.mlp.gate_proj.linear.weight": "model.safetensors", + "vision_tower.encoder.layers.5.mlp.gate_proj.output_max": "model.safetensors", + "vision_tower.encoder.layers.5.mlp.gate_proj.output_min": "model.safetensors", + "vision_tower.encoder.layers.5.mlp.up_proj.input_max": "model.safetensors", + "vision_tower.encoder.layers.5.mlp.up_proj.input_min": "model.safetensors", + "vision_tower.encoder.layers.5.mlp.up_proj.linear.weight": "model.safetensors", + "vision_tower.encoder.layers.5.mlp.up_proj.output_max": "model.safetensors", + "vision_tower.encoder.layers.5.mlp.up_proj.output_min": "model.safetensors", + "vision_tower.encoder.layers.5.post_attention_layernorm.weight": "model.safetensors", + "vision_tower.encoder.layers.5.post_feedforward_layernorm.weight": "model.safetensors", + "vision_tower.encoder.layers.5.pre_feedforward_layernorm.weight": "model.safetensors", + "vision_tower.encoder.layers.5.self_attn.k_norm.weight": "model.safetensors", + "vision_tower.encoder.layers.5.self_attn.k_proj.input_max": "model.safetensors", + "vision_tower.encoder.layers.5.self_attn.k_proj.input_min": "model.safetensors", + "vision_tower.encoder.layers.5.self_attn.k_proj.linear.weight": "model.safetensors", + "vision_tower.encoder.layers.5.self_attn.k_proj.output_max": "model.safetensors", + "vision_tower.encoder.layers.5.self_attn.k_proj.output_min": "model.safetensors", + "vision_tower.encoder.layers.5.self_attn.o_proj.input_max": "model.safetensors", + "vision_tower.encoder.layers.5.self_attn.o_proj.input_min": "model.safetensors", + "vision_tower.encoder.layers.5.self_attn.o_proj.linear.weight": "model.safetensors", + "vision_tower.encoder.layers.5.self_attn.o_proj.output_max": "model.safetensors", + "vision_tower.encoder.layers.5.self_attn.o_proj.output_min": "model.safetensors", + "vision_tower.encoder.layers.5.self_attn.q_norm.weight": "model.safetensors", + "vision_tower.encoder.layers.5.self_attn.q_proj.input_max": "model.safetensors", + "vision_tower.encoder.layers.5.self_attn.q_proj.input_min": "model.safetensors", + "vision_tower.encoder.layers.5.self_attn.q_proj.linear.weight": "model.safetensors", + "vision_tower.encoder.layers.5.self_attn.q_proj.output_max": "model.safetensors", + "vision_tower.encoder.layers.5.self_attn.q_proj.output_min": "model.safetensors", + "vision_tower.encoder.layers.5.self_attn.v_proj.input_max": "model.safetensors", + "vision_tower.encoder.layers.5.self_attn.v_proj.input_min": "model.safetensors", + "vision_tower.encoder.layers.5.self_attn.v_proj.linear.weight": "model.safetensors", + "vision_tower.encoder.layers.5.self_attn.v_proj.output_max": "model.safetensors", + "vision_tower.encoder.layers.5.self_attn.v_proj.output_min": "model.safetensors", + "vision_tower.encoder.layers.6.input_layernorm.weight": "model.safetensors", + "vision_tower.encoder.layers.6.mlp.down_proj.input_max": "model.safetensors", + "vision_tower.encoder.layers.6.mlp.down_proj.input_min": "model.safetensors", + "vision_tower.encoder.layers.6.mlp.down_proj.linear.weight": "model.safetensors", + "vision_tower.encoder.layers.6.mlp.down_proj.output_max": "model.safetensors", + "vision_tower.encoder.layers.6.mlp.down_proj.output_min": "model.safetensors", + "vision_tower.encoder.layers.6.mlp.gate_proj.input_max": "model.safetensors", + "vision_tower.encoder.layers.6.mlp.gate_proj.input_min": "model.safetensors", + "vision_tower.encoder.layers.6.mlp.gate_proj.linear.weight": "model.safetensors", + "vision_tower.encoder.layers.6.mlp.gate_proj.output_max": "model.safetensors", + "vision_tower.encoder.layers.6.mlp.gate_proj.output_min": "model.safetensors", + "vision_tower.encoder.layers.6.mlp.up_proj.input_max": "model.safetensors", + "vision_tower.encoder.layers.6.mlp.up_proj.input_min": "model.safetensors", + "vision_tower.encoder.layers.6.mlp.up_proj.linear.weight": "model.safetensors", + "vision_tower.encoder.layers.6.mlp.up_proj.output_max": "model.safetensors", + "vision_tower.encoder.layers.6.mlp.up_proj.output_min": "model.safetensors", + "vision_tower.encoder.layers.6.post_attention_layernorm.weight": "model.safetensors", + "vision_tower.encoder.layers.6.post_feedforward_layernorm.weight": "model.safetensors", + "vision_tower.encoder.layers.6.pre_feedforward_layernorm.weight": "model.safetensors", + "vision_tower.encoder.layers.6.self_attn.k_norm.weight": "model.safetensors", + "vision_tower.encoder.layers.6.self_attn.k_proj.input_max": "model.safetensors", + "vision_tower.encoder.layers.6.self_attn.k_proj.input_min": "model.safetensors", + "vision_tower.encoder.layers.6.self_attn.k_proj.linear.weight": "model.safetensors", + "vision_tower.encoder.layers.6.self_attn.k_proj.output_max": "model.safetensors", + "vision_tower.encoder.layers.6.self_attn.k_proj.output_min": "model.safetensors", + "vision_tower.encoder.layers.6.self_attn.o_proj.input_max": "model.safetensors", + "vision_tower.encoder.layers.6.self_attn.o_proj.input_min": "model.safetensors", + "vision_tower.encoder.layers.6.self_attn.o_proj.linear.weight": "model.safetensors", + "vision_tower.encoder.layers.6.self_attn.o_proj.output_max": "model.safetensors", + "vision_tower.encoder.layers.6.self_attn.o_proj.output_min": "model.safetensors", + "vision_tower.encoder.layers.6.self_attn.q_norm.weight": "model.safetensors", + "vision_tower.encoder.layers.6.self_attn.q_proj.input_max": "model.safetensors", + "vision_tower.encoder.layers.6.self_attn.q_proj.input_min": "model.safetensors", + "vision_tower.encoder.layers.6.self_attn.q_proj.linear.weight": "model.safetensors", + "vision_tower.encoder.layers.6.self_attn.q_proj.output_max": "model.safetensors", + "vision_tower.encoder.layers.6.self_attn.q_proj.output_min": "model.safetensors", + "vision_tower.encoder.layers.6.self_attn.v_proj.input_max": "model.safetensors", + "vision_tower.encoder.layers.6.self_attn.v_proj.input_min": "model.safetensors", + "vision_tower.encoder.layers.6.self_attn.v_proj.linear.weight": "model.safetensors", + "vision_tower.encoder.layers.6.self_attn.v_proj.output_max": "model.safetensors", + "vision_tower.encoder.layers.6.self_attn.v_proj.output_min": "model.safetensors", + "vision_tower.encoder.layers.7.input_layernorm.weight": "model.safetensors", + "vision_tower.encoder.layers.7.mlp.down_proj.input_max": "model.safetensors", + "vision_tower.encoder.layers.7.mlp.down_proj.input_min": "model.safetensors", + "vision_tower.encoder.layers.7.mlp.down_proj.linear.weight": "model.safetensors", + "vision_tower.encoder.layers.7.mlp.down_proj.output_max": "model.safetensors", + "vision_tower.encoder.layers.7.mlp.down_proj.output_min": "model.safetensors", + "vision_tower.encoder.layers.7.mlp.gate_proj.input_max": "model.safetensors", + "vision_tower.encoder.layers.7.mlp.gate_proj.input_min": "model.safetensors", + "vision_tower.encoder.layers.7.mlp.gate_proj.linear.weight": "model.safetensors", + "vision_tower.encoder.layers.7.mlp.gate_proj.output_max": "model.safetensors", + "vision_tower.encoder.layers.7.mlp.gate_proj.output_min": "model.safetensors", + "vision_tower.encoder.layers.7.mlp.up_proj.input_max": "model.safetensors", + "vision_tower.encoder.layers.7.mlp.up_proj.input_min": "model.safetensors", + "vision_tower.encoder.layers.7.mlp.up_proj.linear.weight": "model.safetensors", + "vision_tower.encoder.layers.7.mlp.up_proj.output_max": "model.safetensors", + "vision_tower.encoder.layers.7.mlp.up_proj.output_min": "model.safetensors", + "vision_tower.encoder.layers.7.post_attention_layernorm.weight": "model.safetensors", + "vision_tower.encoder.layers.7.post_feedforward_layernorm.weight": "model.safetensors", + "vision_tower.encoder.layers.7.pre_feedforward_layernorm.weight": "model.safetensors", + "vision_tower.encoder.layers.7.self_attn.k_norm.weight": "model.safetensors", + "vision_tower.encoder.layers.7.self_attn.k_proj.input_max": "model.safetensors", + "vision_tower.encoder.layers.7.self_attn.k_proj.input_min": "model.safetensors", + "vision_tower.encoder.layers.7.self_attn.k_proj.linear.weight": "model.safetensors", + "vision_tower.encoder.layers.7.self_attn.k_proj.output_max": "model.safetensors", + "vision_tower.encoder.layers.7.self_attn.k_proj.output_min": "model.safetensors", + "vision_tower.encoder.layers.7.self_attn.o_proj.input_max": "model.safetensors", + "vision_tower.encoder.layers.7.self_attn.o_proj.input_min": "model.safetensors", + "vision_tower.encoder.layers.7.self_attn.o_proj.linear.weight": "model.safetensors", + "vision_tower.encoder.layers.7.self_attn.o_proj.output_max": "model.safetensors", + "vision_tower.encoder.layers.7.self_attn.o_proj.output_min": "model.safetensors", + "vision_tower.encoder.layers.7.self_attn.q_norm.weight": "model.safetensors", + "vision_tower.encoder.layers.7.self_attn.q_proj.input_max": "model.safetensors", + "vision_tower.encoder.layers.7.self_attn.q_proj.input_min": "model.safetensors", + "vision_tower.encoder.layers.7.self_attn.q_proj.linear.weight": "model.safetensors", + "vision_tower.encoder.layers.7.self_attn.q_proj.output_max": "model.safetensors", + "vision_tower.encoder.layers.7.self_attn.q_proj.output_min": "model.safetensors", + "vision_tower.encoder.layers.7.self_attn.v_proj.input_max": "model.safetensors", + "vision_tower.encoder.layers.7.self_attn.v_proj.input_min": "model.safetensors", + "vision_tower.encoder.layers.7.self_attn.v_proj.linear.weight": "model.safetensors", + "vision_tower.encoder.layers.7.self_attn.v_proj.output_max": "model.safetensors", + "vision_tower.encoder.layers.7.self_attn.v_proj.output_min": "model.safetensors", + "vision_tower.encoder.layers.8.input_layernorm.weight": "model.safetensors", + "vision_tower.encoder.layers.8.mlp.down_proj.input_max": "model.safetensors", + "vision_tower.encoder.layers.8.mlp.down_proj.input_min": "model.safetensors", + "vision_tower.encoder.layers.8.mlp.down_proj.linear.weight": "model.safetensors", + "vision_tower.encoder.layers.8.mlp.down_proj.output_max": "model.safetensors", + "vision_tower.encoder.layers.8.mlp.down_proj.output_min": "model.safetensors", + "vision_tower.encoder.layers.8.mlp.gate_proj.input_max": "model.safetensors", + "vision_tower.encoder.layers.8.mlp.gate_proj.input_min": "model.safetensors", + "vision_tower.encoder.layers.8.mlp.gate_proj.linear.weight": "model.safetensors", + "vision_tower.encoder.layers.8.mlp.gate_proj.output_max": "model.safetensors", + "vision_tower.encoder.layers.8.mlp.gate_proj.output_min": "model.safetensors", + "vision_tower.encoder.layers.8.mlp.up_proj.input_max": "model.safetensors", + "vision_tower.encoder.layers.8.mlp.up_proj.input_min": "model.safetensors", + "vision_tower.encoder.layers.8.mlp.up_proj.linear.weight": "model.safetensors", + "vision_tower.encoder.layers.8.mlp.up_proj.output_max": "model.safetensors", + "vision_tower.encoder.layers.8.mlp.up_proj.output_min": "model.safetensors", + "vision_tower.encoder.layers.8.post_attention_layernorm.weight": "model.safetensors", + "vision_tower.encoder.layers.8.post_feedforward_layernorm.weight": "model.safetensors", + "vision_tower.encoder.layers.8.pre_feedforward_layernorm.weight": "model.safetensors", + "vision_tower.encoder.layers.8.self_attn.k_norm.weight": "model.safetensors", + "vision_tower.encoder.layers.8.self_attn.k_proj.input_max": "model.safetensors", + "vision_tower.encoder.layers.8.self_attn.k_proj.input_min": "model.safetensors", + "vision_tower.encoder.layers.8.self_attn.k_proj.linear.weight": "model.safetensors", + "vision_tower.encoder.layers.8.self_attn.k_proj.output_max": "model.safetensors", + "vision_tower.encoder.layers.8.self_attn.k_proj.output_min": "model.safetensors", + "vision_tower.encoder.layers.8.self_attn.o_proj.input_max": "model.safetensors", + "vision_tower.encoder.layers.8.self_attn.o_proj.input_min": "model.safetensors", + "vision_tower.encoder.layers.8.self_attn.o_proj.linear.weight": "model.safetensors", + "vision_tower.encoder.layers.8.self_attn.o_proj.output_max": "model.safetensors", + "vision_tower.encoder.layers.8.self_attn.o_proj.output_min": "model.safetensors", + "vision_tower.encoder.layers.8.self_attn.q_norm.weight": "model.safetensors", + "vision_tower.encoder.layers.8.self_attn.q_proj.input_max": "model.safetensors", + "vision_tower.encoder.layers.8.self_attn.q_proj.input_min": "model.safetensors", + "vision_tower.encoder.layers.8.self_attn.q_proj.linear.weight": "model.safetensors", + "vision_tower.encoder.layers.8.self_attn.q_proj.output_max": "model.safetensors", + "vision_tower.encoder.layers.8.self_attn.q_proj.output_min": "model.safetensors", + "vision_tower.encoder.layers.8.self_attn.v_proj.input_max": "model.safetensors", + "vision_tower.encoder.layers.8.self_attn.v_proj.input_min": "model.safetensors", + "vision_tower.encoder.layers.8.self_attn.v_proj.linear.weight": "model.safetensors", + "vision_tower.encoder.layers.8.self_attn.v_proj.output_max": "model.safetensors", + "vision_tower.encoder.layers.8.self_attn.v_proj.output_min": "model.safetensors", + "vision_tower.encoder.layers.9.input_layernorm.weight": "model.safetensors", + "vision_tower.encoder.layers.9.mlp.down_proj.input_max": "model.safetensors", + "vision_tower.encoder.layers.9.mlp.down_proj.input_min": "model.safetensors", + "vision_tower.encoder.layers.9.mlp.down_proj.linear.weight": "model.safetensors", + "vision_tower.encoder.layers.9.mlp.down_proj.output_max": "model.safetensors", + "vision_tower.encoder.layers.9.mlp.down_proj.output_min": "model.safetensors", + "vision_tower.encoder.layers.9.mlp.gate_proj.input_max": "model.safetensors", + "vision_tower.encoder.layers.9.mlp.gate_proj.input_min": "model.safetensors", + "vision_tower.encoder.layers.9.mlp.gate_proj.linear.weight": "model.safetensors", + "vision_tower.encoder.layers.9.mlp.gate_proj.output_max": "model.safetensors", + "vision_tower.encoder.layers.9.mlp.gate_proj.output_min": "model.safetensors", + "vision_tower.encoder.layers.9.mlp.up_proj.input_max": "model.safetensors", + "vision_tower.encoder.layers.9.mlp.up_proj.input_min": "model.safetensors", + "vision_tower.encoder.layers.9.mlp.up_proj.linear.weight": "model.safetensors", + "vision_tower.encoder.layers.9.mlp.up_proj.output_max": "model.safetensors", + "vision_tower.encoder.layers.9.mlp.up_proj.output_min": "model.safetensors", + "vision_tower.encoder.layers.9.post_attention_layernorm.weight": "model.safetensors", + "vision_tower.encoder.layers.9.post_feedforward_layernorm.weight": "model.safetensors", + "vision_tower.encoder.layers.9.pre_feedforward_layernorm.weight": "model.safetensors", + "vision_tower.encoder.layers.9.self_attn.k_norm.weight": "model.safetensors", + "vision_tower.encoder.layers.9.self_attn.k_proj.input_max": "model.safetensors", + "vision_tower.encoder.layers.9.self_attn.k_proj.input_min": "model.safetensors", + "vision_tower.encoder.layers.9.self_attn.k_proj.linear.weight": "model.safetensors", + "vision_tower.encoder.layers.9.self_attn.k_proj.output_max": "model.safetensors", + "vision_tower.encoder.layers.9.self_attn.k_proj.output_min": "model.safetensors", + "vision_tower.encoder.layers.9.self_attn.o_proj.input_max": "model.safetensors", + "vision_tower.encoder.layers.9.self_attn.o_proj.input_min": "model.safetensors", + "vision_tower.encoder.layers.9.self_attn.o_proj.linear.weight": "model.safetensors", + "vision_tower.encoder.layers.9.self_attn.o_proj.output_max": "model.safetensors", + "vision_tower.encoder.layers.9.self_attn.o_proj.output_min": "model.safetensors", + "vision_tower.encoder.layers.9.self_attn.q_norm.weight": "model.safetensors", + "vision_tower.encoder.layers.9.self_attn.q_proj.input_max": "model.safetensors", + "vision_tower.encoder.layers.9.self_attn.q_proj.input_min": "model.safetensors", + "vision_tower.encoder.layers.9.self_attn.q_proj.linear.weight": "model.safetensors", + "vision_tower.encoder.layers.9.self_attn.q_proj.output_max": "model.safetensors", + "vision_tower.encoder.layers.9.self_attn.q_proj.output_min": "model.safetensors", + "vision_tower.encoder.layers.9.self_attn.v_proj.input_max": "model.safetensors", + "vision_tower.encoder.layers.9.self_attn.v_proj.input_min": "model.safetensors", + "vision_tower.encoder.layers.9.self_attn.v_proj.linear.weight": "model.safetensors", + "vision_tower.encoder.layers.9.self_attn.v_proj.output_max": "model.safetensors", + "vision_tower.encoder.layers.9.self_attn.v_proj.output_min": "model.safetensors", + "vision_tower.patch_embedder.input_proj.weight": "model.safetensors", + "vision_tower.patch_embedder.position_embedding_table": "model.safetensors" + } +} \ No newline at end of file diff --git a/chat/mlx/mlx-community/gemma-4-e4b-it-4bit/processor_config.json b/chat/mlx/mlx-community/gemma-4-e4b-it-4bit/processor_config.json new file mode 100644 index 0000000..13e92a4 --- /dev/null +++ b/chat/mlx/mlx-community/gemma-4-e4b-it-4bit/processor_config.json @@ -0,0 +1,42 @@ +{ + "audio_seq_length": 750, + "image_processor": { + "do_convert_rgb": true, + "do_normalize": false, + "do_rescale": true, + "do_resize": true, + "image_mean": [ + 0.0, + 0.0, + 0.0 + ], + "image_processor_type": "Gemma4ImageProcessor", + "image_seq_length": 280, + "image_std": [ + 1.0, + 1.0, + 1.0 + ], + "max_soft_tokens": 280, + "patch_size": 16, + "pooling_kernel_size": 3, + "resample": 3, + "rescale_factor": 0.00392156862745098, + "size": { + "height": 224, + "width": 224 + } + }, + "image_seq_length": 280, + "processor_class": "Gemma4Processor", + "feature_extractor": { + "feature_extractor_type": "Gemma4AudioFeatureExtractor", + "sampling_rate": 16000, + "num_mel_filters": 128, + "fft_length": 512, + "hop_length": 160, + "chunk_duration": 8.0, + "overlap_duration": 1.0 + }, + "audio_ms_per_token": 40 +} \ No newline at end of file diff --git a/chat/mlx/mlx-community/gemma-4-e4b-it-4bit/tokenizer.json b/chat/mlx/mlx-community/gemma-4-e4b-it-4bit/tokenizer.json new file mode 100644 index 0000000..1ff9f3e --- /dev/null +++ b/chat/mlx/mlx-community/gemma-4-e4b-it-4bit/tokenizer.json @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:cc8d3a0ce36466ccc1278bf987df5f71db1719b9ca6b4118264f45cb627bfe0f +size 32169626 diff --git a/chat/mlx/mlx-community/gemma-4-e4b-it-4bit/tokenizer_config.json b/chat/mlx/mlx-community/gemma-4-e4b-it-4bit/tokenizer_config.json new file mode 100644 index 0000000..375b25d --- /dev/null +++ b/chat/mlx/mlx-community/gemma-4-e4b-it-4bit/tokenizer_config.json @@ -0,0 +1,74 @@ +{ + "audio_token": "<|audio|>", + "backend": "tokenizers", + "boa_token": "<|audio>", + "boi_token": "<|image>", + "bos_token": "", + "eoa_token": "", + "eoc_token": "", + "eoi_token": "", + "eos_token": "", + "eot_token": "", + "escape_token": "<|\"|>", + "etc_token": "", + "etd_token": "", + "etr_token": "", + "extra_special_tokens": [ + "<|video|>" + ], + "image_token": "<|image|>", + "mask_token": "", + "model_max_length": 1000000000000000019884624838656, + "pad_token": "", + "padding_side": "left", + "processor_class": "Gemma4Processor", + "response_schema": { + "type": "object", + "properties": { + "role": { + "const": "assistant" + }, + "thinking": { + "type": "string" + }, + "content": { + "type": "string" + }, + "tool_calls": { + "x-regex-iterator": "<\\|tool_call>(.*?)", + "type": "array", + "items": { + "type": "object", + "properties": { + "type": { + "const": "function" + }, + "function": { + "type": "object", + "x-regex": "call\\:(?P\\w+)(?P\\{.*\\})", + "properties": { + "name": { + "type": "string" + }, + "arguments": { + "type": "object", + "x-parser": "gemma4-tool-call", + "additionalProperties": {} + } + } + } + } + } + } + }, + "x-regex": "(\\<\\|channel\\>thought\\n(?P.*?)\\)?(?P\\<\\|tool_call\\>.*\\)?(?P(?:(?!\\)(?!\\<\\|tool_response\\>).)+)?(?:\\|\\<\\|tool_response\\>)?" + }, + "soc_token": "<|channel>", + "sot_token": "<|turn>", + "stc_token": "<|tool_call>", + "std_token": "<|tool>", + "str_token": "<|tool_response>", + "think_token": "<|think|>", + "tokenizer_class": "GemmaTokenizer", + "unk_token": "" +} diff --git a/image/gemlite/prism-ml/bonsai-image-binary-4B-gemlite-1bit/.gitattributes b/image/gemlite/prism-ml/bonsai-image-binary-4B-gemlite-1bit/.gitattributes new file mode 100644 index 0000000..6ae3e2f --- /dev/null +++ b/image/gemlite/prism-ml/bonsai-image-binary-4B-gemlite-1bit/.gitattributes @@ -0,0 +1,36 @@ +*.7z filter=lfs diff=lfs merge=lfs -text +*.arrow filter=lfs diff=lfs merge=lfs -text +*.bin filter=lfs diff=lfs merge=lfs -text +*.bz2 filter=lfs diff=lfs merge=lfs -text +*.ckpt filter=lfs diff=lfs merge=lfs -text +*.ftz filter=lfs diff=lfs merge=lfs -text +*.gz filter=lfs diff=lfs merge=lfs -text +*.h5 filter=lfs diff=lfs merge=lfs -text +*.joblib filter=lfs diff=lfs merge=lfs -text +*.lfs.* filter=lfs diff=lfs merge=lfs -text +*.mlmodel filter=lfs diff=lfs merge=lfs -text +*.model filter=lfs diff=lfs merge=lfs -text +*.msgpack filter=lfs diff=lfs merge=lfs -text +*.npy filter=lfs diff=lfs merge=lfs -text +*.npz filter=lfs diff=lfs merge=lfs -text +*.onnx filter=lfs diff=lfs merge=lfs -text +*.ot filter=lfs diff=lfs merge=lfs -text +*.parquet filter=lfs diff=lfs merge=lfs -text +*.pb filter=lfs diff=lfs merge=lfs -text +*.pickle filter=lfs diff=lfs merge=lfs -text +*.pkl filter=lfs diff=lfs merge=lfs -text +*.pt filter=lfs diff=lfs merge=lfs -text +*.pth filter=lfs diff=lfs merge=lfs -text +*.rar filter=lfs diff=lfs merge=lfs -text +*.safetensors filter=lfs diff=lfs merge=lfs -text +saved_model/**/* filter=lfs diff=lfs merge=lfs -text +*.tar.* filter=lfs diff=lfs merge=lfs -text +*.tar filter=lfs diff=lfs merge=lfs -text +*.tflite filter=lfs diff=lfs merge=lfs -text +*.tgz filter=lfs diff=lfs merge=lfs -text +*.wasm filter=lfs diff=lfs merge=lfs -text +*.xz filter=lfs diff=lfs merge=lfs -text +*.zip filter=lfs diff=lfs merge=lfs -text +*.zst filter=lfs diff=lfs merge=lfs -text +*tfevents* filter=lfs diff=lfs merge=lfs -text +text_encoder-hqq-4bit/tokenizer/tokenizer.json filter=lfs diff=lfs merge=lfs -text diff --git a/image/gemlite/prism-ml/bonsai-image-binary-4B-gemlite-1bit/LICENSE b/image/gemlite/prism-ml/bonsai-image-binary-4B-gemlite-1bit/LICENSE new file mode 100644 index 0000000..66a27ec --- /dev/null +++ b/image/gemlite/prism-ml/bonsai-image-binary-4B-gemlite-1bit/LICENSE @@ -0,0 +1,177 @@ + Apache License + Version 2.0, January 2004 + http://www.apache.org/licenses/ + + TERMS AND CONDITIONS FOR USE, REPRODUCTION, AND DISTRIBUTION + + 1. Definitions. + + "License" shall mean the terms and conditions for use, reproduction, + and distribution as defined by Sections 1 through 9 of this document. + + "Licensor" shall mean the copyright owner or entity authorized by + the copyright owner that is granting the License. + + "Legal Entity" shall mean the union of the acting entity and all + other entities that control, are controlled by, or are under common + control with that entity. For the purposes of this definition, + "control" means (i) the power, direct or indirect, to cause the + direction or management of such entity, whether by contract or + otherwise, or (ii) ownership of fifty percent (50%) or more of the + outstanding shares, or (iii) beneficial ownership of such entity. + + "You" (or "Your") shall mean an individual or Legal Entity + exercising permissions granted by this License. + + "Source" form shall mean the preferred form for making modifications, + including but not limited to software source code, documentation + source, and configuration files. + + "Object" form shall mean any form resulting from mechanical + transformation or translation of a Source form, including but + not limited to compiled object code, generated documentation, + and conversions to other media types. + + "Work" shall mean the work of authorship, whether in Source or + Object form, made available under the License, as indicated by a + copyright notice that is included in or attached to the work + (an example is provided in the Appendix below). + + "Derivative Works" shall mean any work, whether in Source or Object + form, that is based on (or derived from) the Work and for which the + editorial revisions, annotations, elaborations, or other modifications + represent, as a whole, an original work of authorship. For the purposes + of this License, Derivative Works shall not include works that remain + separable from, or merely link (or bind by name) to the interfaces of, + the Work and Derivative Works thereof. + + "Contribution" shall mean any work of authorship, including + the original version of the Work and any modifications or additions + to that Work or Derivative Works thereof, that is intentionally + submitted to Licensor for inclusion in the Work by the copyright owner + or by an individual or Legal Entity authorized to submit on behalf of + the copyright owner. For the purposes of this definition, "submitted" + means any form of electronic, verbal, or written communication sent + to the Licensor or its representatives, including but not limited to + communication on electronic mailing lists, source code control systems, + and issue tracking systems that are managed by, or on behalf of, the + Licensor for the purpose of discussing and improving the Work, but + excluding communication that is conspicuously marked or otherwise + designated in writing by the copyright owner as "Not a Contribution." + + "Contributor" shall mean Licensor and any individual or Legal Entity + on behalf of whom a Contribution has been received by Licensor and + subsequently incorporated within the Work. + + 2. Grant of Copyright License. Subject to the terms and conditions of + this License, each Contributor hereby grants to You a perpetual, + worldwide, non-exclusive, no-charge, royalty-free, irrevocable + copyright license to reproduce, prepare Derivative Works of, + publicly display, publicly perform, sublicense, and distribute the + Work and such Derivative Works in Source or Object form. + + 3. Grant of Patent License. Subject to the terms and conditions of + this License, each Contributor hereby grants to You a perpetual, + worldwide, non-exclusive, no-charge, royalty-free, irrevocable + (except as stated in this section) patent license to make, have made, + use, offer to sell, sell, import, and otherwise transfer the Work, + where such license applies only to those patent claims licensable + by such Contributor that are necessarily infringed by their + Contribution(s) alone or by combination of their Contribution(s) + with the Work to which such Contribution(s) was submitted. If You + institute patent litigation against any entity (including a + cross-claim or counterclaim in a lawsuit) alleging that the Work + or a Contribution incorporated within the Work constitutes direct + or contributory patent infringement, then any patent licenses + granted to You under this License for that Work shall terminate + as of the date such litigation is filed. + + 4. Redistribution. You may reproduce and distribute copies of the + Work or Derivative Works thereof in any medium, with or without + modifications, and in Source or Object form, provided that You + meet the following conditions: + + (a) You must give any other recipients of the Work or + Derivative Works a copy of this License; and + + (b) You must cause any modified files to carry prominent notices + stating that You changed the files; and + + (c) You must retain, in the Source form of any Derivative Works + that You distribute, all copyright, patent, trademark, and + attribution notices from the Source form of the Work, + excluding those notices that do not pertain to any part of + the Derivative Works; and + + (d) If the Work includes a "NOTICE" text file as part of its + distribution, then any Derivative Works that You distribute must + include a readable copy of the attribution notices contained + within such NOTICE file, excluding those notices that do not + pertain to any part of the Derivative Works, in at least one + of the following places: within a NOTICE text file distributed + as part of the Derivative Works; within the Source form or + documentation, if provided along with the Derivative Works; or, + within a display generated by the Derivative Works, if and + wherever such third-party notices normally appear. The contents + of the NOTICE file are for informational purposes only and + do not modify the License. You may add Your own attribution + notices within Derivative Works that You distribute, alongside + or as an addendum to the NOTICE text from the Work, provided + that such additional attribution notices cannot be construed + as modifying the License. + + You may add Your own copyright statement to Your modifications and + may provide additional or different license terms and conditions + for use, reproduction, or distribution of Your modifications, or + for any such Derivative Works as a whole, provided Your use, + reproduction, and distribution of the Work otherwise complies with + the conditions stated in this License. + + 5. Submission of Contributions. Unless You explicitly state otherwise, + any Contribution intentionally submitted for inclusion in the Work + by You to the Licensor shall be under the terms and conditions of + this License, without any additional terms or conditions. + Notwithstanding the above, nothing herein shall supersede or modify + the terms of any separate license agreement you may have executed + with Licensor regarding such Contributions. + + 6. Trademarks. This License does not grant permission to use the trade + names, trademarks, service marks, or product names of the Licensor, + except as required for reasonable and customary use in describing the + origin of the Work and reproducing the content of the NOTICE file. + + 7. Disclaimer of Warranty. Unless required by applicable law or + agreed to in writing, Licensor provides the Work (and each + Contributor provides its Contributions) on an "AS IS" BASIS, + WITHOUT WARRANTIES OR CONDITIONS OF ANY KIND, either express or + implied, including, without limitation, any warranties or conditions + of TITLE, NON-INFRINGEMENT, MERCHANTABILITY, or FITNESS FOR A + PARTICULAR PURPOSE. You are solely responsible for determining the + appropriateness of using or redistributing the Work and assume any + risks associated with Your exercise of permissions under this License. + + 8. Limitation of Liability. In no event and under no legal theory, + whether in tort (including negligence), contract, or otherwise, + unless required by applicable law (such as deliberate and grossly + negligent acts) or agreed to in writing, shall any Contributor be + liable to You for damages, including any direct, indirect, special, + incidental, or consequential damages of any character arising as a + result of this License or out of the use or inability to use the + Work (including but not limited to damages for loss of goodwill, + work stoppage, computer failure or malfunction, or any and all + other commercial damages or losses), even if such Contributor + has been advised of the possibility of such damages. + + 9. Accepting Warranty or Additional Liability. While redistributing + the Work or Derivative Works thereof, You may choose to offer, + and charge a fee for, acceptance of support, warranty, indemnity, + or other liability obligations and/or rights consistent with this + License. However, in accepting such obligations, You may act only + on Your own behalf and on Your sole responsibility, not on behalf + of any other Contributor, and only if You agree to indemnify, + defend, and hold each Contributor harmless for any liability + incurred by, or claims asserted against, such Contributor by reason + of your accepting any such warranty or additional liability. + + END OF TERMS AND CONDITIONS + diff --git a/image/gemlite/prism-ml/bonsai-image-binary-4B-gemlite-1bit/NOTICE.md b/image/gemlite/prism-ml/bonsai-image-binary-4B-gemlite-1bit/NOTICE.md new file mode 100644 index 0000000..ef55b08 --- /dev/null +++ b/image/gemlite/prism-ml/bonsai-image-binary-4B-gemlite-1bit/NOTICE.md @@ -0,0 +1,6 @@ +This software is copyright 2026-present Prism ML, Inc. It is available under the Apache 2.0 license. +If you publicly deploy or redistribute this software, we would appreciate attribution such as: "Created using Bonsai Image by Prism ML." + +This software is built from FLUX.2 [klein] 4B, Copyright 2026 Black Forest Labs, which is available under the Apache 2.0 License: https://huggingface.co/black-forest-labs/FLUX.2-klein-4B/blob/main/LICENSE.md + +The text encoder is built from Qwen3-4B, Copyright 2024 Alibaba Cloud, which is available under the Apache 2.0 License: https://huggingface.co/Qwen/Qwen3-4B/blob/main/LICENSE diff --git a/image/gemlite/prism-ml/bonsai-image-binary-4B-gemlite-1bit/README.md b/image/gemlite/prism-ml/bonsai-image-binary-4B-gemlite-1bit/README.md new file mode 100644 index 0000000..f2582de --- /dev/null +++ b/image/gemlite/prism-ml/bonsai-image-binary-4B-gemlite-1bit/README.md @@ -0,0 +1,223 @@ +--- +license: apache-2.0 +pipeline_tag: text-to-image +tags: +- 1-bit +- gemlite +- hqq +- cuda +- text-to-image +- diffusion +- flux +- prismml +- bonsai +base_model: +- prism-ml/bonsai-image-binary-4B-unpacked +--- + +

+ Bonsai Image +

+ +

+ Prism ML Website  |  + Whitepaper  |  + Demo & Examples  |  + Discord +

+ +# bonsai-image-binary-4B-gemlite-1bit + +Binary weight (1-bit) text-to-image diffusion transformer deployment for NVIDIA GPUs + +> **0.93 GB transformer** | **8.3×** smaller than FP16 | **4.5 s / 1024²** on RTX 3080 | **2.7 s / 1024²** on A100 | runs natively on Linux and Windows + +## Highlights + +- **0.93 GB** diffusion transformer, down from **7.75 GB** for the FP16 FLUX.2 Klein 4B transformer +- Binary {-1, +1} transformer weights with FP16 group-wise scaling in the matrix-heavy transformer layers (Q/K/V projections, output projections, MLP weights) +- 4.09 GB CUDA deployment payload including the 4-bit text encoder and FP16 VAE — text encoder is offloaded after prompt encode, so the denoising loop only keeps the compact transformer and VAE resident +- 4-step FlowMatch-Euler sampler with guidance = 1.0 and shift = 3.0 — no CFG, no negative prompts needed +- Gemlite low-bit GEMM path for NVIDIA GPUs, with HQQ used for the compressed text encoder +- Runs on Linux and Windows natively through the same CUDA / Gemlite deployment stack +- Cross-platform companion: also available as [MLX 1-bit](https://huggingface.co/prism-ml/bonsai-image-binary-4B-mlx-1bit) for Apple Silicon + +## Resources + +- **[Whitepaper](https://github.com/PrismML-Eng/Bonsai-Image-Demo/blob/main/bonsai-image-4b-whitepaper.pdf)** — full benchmarks, kernels, and memory analysis +- **[Demo repo](https://github.com/PrismML-Eng/Bonsai-Image-Demo)** — one-command setup for Mac / Linux / Windows +- **[Discord](https://discord.gg/prismml)** — community + support +- **Kernels**: [gemlite](https://github.com/mobiusml/gemlite) (fused low-bit GEMM) · [HQQ](https://github.com/mobiusml/hqq) (low-bit quantization runtime) · [triton-windows](https://github.com/triton-lang/triton-windows) (Windows path) + +## Model Overview + +| Item | Specification | +| :-------------------- | :----------------------------------------------------------------------------------------------| +| Base architecture | FLUX.2 Klein 4B (MMDiT diffusion transformer) | +| Parameters | ~4.0B (transformer trunk) | +| Blocks | 25 MMDiT blocks: 5 double-stream + 20 single-stream | +| Sampler | FlowMatchEuler, **4 steps**, guidance = 1.0, shift = 3.0 | +| Text encoder | Qwen3-4B at 4-bit HQQ (≈ 2.84 GB CUDA payload, offloaded after prompt encode) | +| VAE | Flux2 32-channel latent, tiled decode (128 px tiles) | +| Native resolution | 1024×1024 (also supports 512×512 and arbitrary multiples of 32) | +| Weight format | Gemlite INT1 pack, binary values + FP16 group-wise scales | +| **Transformer size** | **0.93 GB** model-level Bonsai representation; **1.08 GB** CUDA packed deployment size | +| Total payload | **4.09 GB** CUDA deployment payload (transformer + 4-bit text encoder + FP16 VAE) | +| 1-bit coverage | All 100 matmul-heavy linears in the 25 MMDiT blocks | +| Platforms | Linux x86_64 + Windows native on NVIDIA GPUs | +| License | Apache 2.0 | + +## Binary Weight Representation: 1-bit g128 + +Each binary weight takes a value from {−1, +1} with one shared FP16 scale per group of 128 weights: + +```text +w_i = scale_g * b_i, b_i in {−1, +1} +``` + +Binary values carry exactly 1 bit of information per weight. With one FP16 scale per group of 128, the effective storage is + +```text +b_eff ≈ 1 + 16/128 ≈ 1.125 bits/weight +``` + +This gives an idealized **14.2× reduction** relative to FP16 for the binary transformer layers. A small set of precision-sensitive supporting tensors remains in FP16, so the final 1-bit Bonsai Image 4B diffusion transformer is **0.93 GB**, an 8.3x reduction from the 7.75 GB FP16 FLUX.2 Klein 4B transformer. + +The binary representation is applied to the matrix-heavy transformer layers, including Q / K / V projections, output projections, MLP linears, and the double-stream add-K / Q / V linears. Supporting tensors (less than 5% of the total parameters) such as modulation streams, embedders, output norm, and output projection remain FP16 for image quality and stability. + +The CUDA deployment uses a Gemlite INT1 packed format. The model-level Bonsai representation is **0.93 GB**; the deployed CUDA pack is **1.08 GB** on disk due to runtime packing and alignment overhead in the current Gemlite path. + +### Memory + +| Format | Transformer size | Reduction | Ratio | +| :------------------------------ | ---------------: | --------: | -------: | +| FP16 FLUX.2 Klein 4B | 7.75 GB | — | 1.0× | +| **1-bit Bonsai Image 4B** | **0.93 GB** | **88.0%** | **8.3×** | + +CUDA deployment: + +| Component | Size | +| :------------------------------ | ------: | +| Gemlite INT1 diffusion transformer | 1.08 GB | +| HQQ 4-bit text encoder | 2.84 GB | +| FP16 VAE | 0.17 GB | +| **Total payload** | **4.09 GB** | + +At runtime, the text encoder is offloaded after prompt encoding. During denoising, the repeated image-generation loop is dominated by the compact binary diffusion transformer and active image-generation components rather than the full payload. + +Peak HBM at 1024² on RTX 3080 is ~6.4 GiB end-to-end (transformer + VAE + activation memory). + +## Best Practices + +- Sampler: FlowMatchEuler-discrete with 4 steps, guidance = 1.0, shift = 3.0. The model is designed for 4 steps; running more steps does not improve quality significantly and can introduce artifacts. +- Resolution: native 1024² is the design target. 512² works for quick previews. +- Aspect ratios: multiples of 32 are supported, including 832x1248 and 1248x832. +- Prompting: natural-language prompts. Negative prompts are not required. +- Runtime memory: the text encoder is offloaded after prompt encoding, so the denoising loop is memory-light. + +## Quickstart + +### Bonsai Studio (Linux / Windows) + +The simplest path is the [Bonsai Image Demo repo](https://github.com/PrismML-Eng/Bonsai-Image-Demo), which sets up the full Bonsai Studio (FastAPI backend + Next.js frontend) and selects gemlite automatically on Linux / Windows: + +```bash +git clone https://github.com/PrismML-Eng/Bonsai-Image-Demo.git +cd Bonsai-Image-Demo +./setup.sh +BONSAI_VARIANT=binary ./scripts/download_model.sh +BONSAI_VARIANT=binary ./scripts/serve.sh +``` + +On Windows (PowerShell): + +```powershell +Set-ExecutionPolicy -Scope CurrentUser RemoteSigned # one-time +.\setup.ps1 +$env:BONSAI_VARIANT = 'binary' +.\scripts\download_model.ps1 +.\scripts\serve.ps1 +``` + +### Python API (backend_gpu) + +For inference without the studio frontend: + +```python +from backend_gpu.server import build_pipeline + +pipe = build_pipeline(model_id="prism-ml/bonsai-image-binary-4B-gemlite-1bit") +image = pipe( + prompt="A bonsai tree in a quiet ceramic studio, soft morning light", + num_inference_steps=4, + guidance_scale=1.0, + height=1024, + width=1024, +).images[0] +image.save("bonsai.png") +``` + +## Throughput (CUDA / gemlite) + +Warmed wall-clock per image, 4 sampler steps, guidance = 1.0, same prompts as the Mac and iPhone measurements. Linux + locally built gemlite kernels except where noted. + +| Platform | 512² (s) | 1024² (s) | Notes | +| :------------------------ | -------: | --------: | :------------------------------------------ | +| **A100** (Colab) | 1.0 | **2.7** | Ampere datacenter (40 GB) | +| **RTX PRO 6000 Blackwell** (Colab) | 1.0 | **1.8** | NVIDIA Blackwell, 96 GB VRAM | +| **RTX 3080** 10 GB | 1.5 | **4.5** | Ampere consumer; 6.4 GiB peak HBM at 1024² | +| **RTX 3060** 6 GB (laptop)| 4.4 | 24.8 | Ampere mobile; memory-bound at 1024² | + +The sub-2-bit pack is what keeps generation viable on commodity GPUs at 1024² — the consumer RTX 3080 reaches 4.5 s/image while the 6 GB laptop 3060 is the slow tail (memory-pressure limited). + +## Benchmarks + +Evaluated with matched generation settings across the comparison set on H100. GenEval uses the official 512x512 protocol. For HPSv3 and DPG-Bench, larger-backbone rows are evaluated at 1024x1024, while smaller-backbone rows are evaluated at their native 512x512 setting. Higher is better for all three benchmarks. + +| Model | Transformer (GB) | GenEval | HPSv3 | DPG-Bench | +| :-------------------------- | ---------------: | ------: | -----: | --------: | +| **Bonsai Image · Binary 4B** | **0.93** | **0.671** | **11.15** | **0.822** | +| **Bonsai Image · Ternary 4B**| **1.21** | **0.723** | **12.22** | **0.851** | +| FLUX.2 Klein 4B | 7.75 | 0.819 | 12.84 | 0.853 | +| FLUX.1-schnell | 23.8 | 0.716 | 12.67 | 0.848 | +| SDXL | 5.14 | 0.300 | 10.05 | 0.740 | +| PixArt-Σ XL 2 | 1.20 | 0.541 | 11.93 | 0.769 | +| Stable Diffusion 1.5 | 1.72 | 0.396 | 4.20 | 0.601 | +| BK-SDM-Small | 0.98 | 0.297 | 3.05 | 0.559 | + +The benchmark results show the intended quality-footprint trade-off. 1-bit Bonsai Image 4B is the footprint-oriented variant: it reduces the diffusion transformer below 1 GB while still delivering strong GenEval, HPSv3, and DPG-Bench results. The ternary companion is the quality-oriented variant, using a slightly larger representation to achieve very close visual quality and prompt fidelity to the original FLUX.2 Klein 4B model. + +Together, the Bonsai Image variants move the quality-footprint frontier: they bring modern diffusion-transformer behavior into a memory range previously occupied by much smaller, lower-capability models. + +## Use Cases + +- **Local creative tooling**: image generation directly on CUDA-equipped workstations and consumer GPUs +- **Private generation**: prompts and generated assets can remain in local or controlled environments +- **Rapid iteration**: lower local latency and no remote queue for iterative creative workflows +- **Commodity-GPU serving**: lower transformer footprint and reduced memory pressure for serving on NVIDIA GPUs +- **Windows and Linux deployment**: native paths through the same Gemlite deployment stack +- **Enterprise and controlled inference**: local or private environments for data residency and compliance-sensitive workflows + +## Limitations + +- 1-bit Bonsai Image 4B is not bit-identical to the FP16 FLUX.2 Klein 4B model; it is a compact binary-weight deployment designed to deliver similar practical behavior at much smaller size. +- Image-generation quality remains prompt- and workflow-dependent. Small text, fine details, object counts, and strict compositional constraints should be evaluated for the target use case. +- Current commodity inference stacks do not yet expose fully native binary execution as a standard hardware path. This release uses practical Gemlite low-bit GEMM kernels on CUDA. +- After the diffusion transformer is made compact, other components such as the VAE can become more visible memory bottlenecks. The runtime mitigates this with text-encoder offload and tiled VAE decoding. + + +## Citation + +```bibtex +@techreport{bonsaiimage4b, + title = {Bonsai Image 4B: Low-Bit Diffusion on Apple Silicon and Consumer GPUs}, + author = {Prism ML}, + year = {2026}, + month = {May}, + url = {https://prismml.com} +} +``` + +## Contact + +For questions, feedback, or collaboration inquiries: **contact@prismml.com** diff --git a/image/gemlite/prism-ml/bonsai-image-binary-4B-gemlite-1bit/assets/bonsai-logo.svg b/image/gemlite/prism-ml/bonsai-image-binary-4B-gemlite-1bit/assets/bonsai-logo.svg new file mode 100644 index 0000000..2cfef2b --- /dev/null +++ b/image/gemlite/prism-ml/bonsai-image-binary-4B-gemlite-1bit/assets/bonsai-logo.svg @@ -0,0 +1 @@ + diff --git a/image/gemlite/prism-ml/bonsai-image-binary-4B-gemlite-1bit/manifest.json b/image/gemlite/prism-ml/bonsai-image-binary-4B-gemlite-1bit/manifest.json new file mode 100644 index 0000000..b63fd5f --- /dev/null +++ b/image/gemlite/prism-ml/bonsai-image-binary-4B-gemlite-1bit/manifest.json @@ -0,0 +1,101 @@ +{ + "model_version": "binary g128 (gemlite-int1 deployment for CUDA inference)", + "total_bytes": 4087241554, + "files": [ + { + "remote_path": "model_index.json", + "size": 81, + "sha256": "ecb4735e37691a8733f62957fd6c548f841af40624905bb24fa639756153c8a1" + }, + { + "remote_path": "LICENSE", + "size": 10174, + "sha256": "69849221bfb90053de2134ef5e6d540287b4b98062326492f1f96f5da685524b" + }, + { + "remote_path": "NOTICE.md", + "size": 623, + "sha256": "bbefa4a26b836efc040c1a0f155a425d1d833eae1b2534ffc414b1eada3cd922" + }, + { + "remote_path": "README.md", + "size": 12848, + "sha256": "67bfdf7a92d94e0ee759a54aa472d61a9d6aff79e262a2508d68f5a66056d961" + }, + { + "remote_path": "text_encoder-hqq-4bit/config.json", + "size": 1535, + "sha256": "979b4d6b42dfae3c6dece91da5fe139926dee4a1a244a1cf129d2025c2a60064" + }, + { + "remote_path": "text_encoder-hqq-4bit/qmodel.pt", + "size": 2822340711, + "sha256": "57ecb803e88313f896b24f2f6fedddcb2966c174801f8d89115f4fbae99be48a" + }, + { + "remote_path": "text_encoder-hqq-4bit/tokenizer/added_tokens.json", + "size": 707, + "sha256": "c0284b582e14987fbd3d5a2cb2bd139084371ed9acbae488829a1c900833c680" + }, + { + "remote_path": "text_encoder-hqq-4bit/tokenizer/chat_template.jinja", + "size": 4168, + "sha256": "a55ee1b1660128b7098723e0abcd92caa0788061051c62d51cbe87d9cf1974d8" + }, + { + "remote_path": "text_encoder-hqq-4bit/tokenizer/merges.txt", + "size": 1671853, + "sha256": "8831e4f1a044471340f7c0a83d7bd71306a5b867e95fd870f74d0c5308a904d5" + }, + { + "remote_path": "text_encoder-hqq-4bit/tokenizer/special_tokens_map.json", + "size": 613, + "sha256": "76862e765266b85aa9459767e33cbaf13970f327a0e88d1c65846c2ddd3a1ecd" + }, + { + "remote_path": "text_encoder-hqq-4bit/tokenizer/tokenizer.json", + "size": 11422654, + "sha256": "aeb13307a71acd8fe81861d94ad54ab689df773318809eed3cbe794b4492dae4" + }, + { + "remote_path": "text_encoder-hqq-4bit/tokenizer/tokenizer_config.json", + "size": 5404, + "sha256": "443bfa629eb16387a12edbf92a76f6a6f10b2af3b53d87ba1550adfcf45f7fa0" + }, + { + "remote_path": "text_encoder-hqq-4bit/tokenizer/vocab.json", + "size": 2776833, + "sha256": "ca10d7e9fb3ed18575dd1e277a2579c16d108e32f27439684afa0e10b1440910" + }, + { + "remote_path": "transformer-gemlite-int1/config.json", + "size": 620, + "sha256": "f4c11e406efb84b36ada1a4287423d4aff2092d74bf15774455f88a7e4888a02" + }, + { + "remote_path": "transformer-gemlite-int1/gemlite_autotune.json", + "size": 470216, + "sha256": "a70e0f3fd1eeaf6836a8be431ee27ae143543cb28349a0298b135e713600288d" + }, + { + "remote_path": "transformer-gemlite-int1/quantization_config.json", + "size": 6010, + "sha256": "8e0bd42f7fdf4af5b513da3c69681a37d881945c644f34b4543788cfa9f6c4f4" + }, + { + "remote_path": "transformer-gemlite-int1/state_dict.pt", + "size": 1080394762, + "sha256": "d5b455b11958fc92ed8dd7558072252d6ca8d1acb4fcc69281fb61b771f7c8e0" + }, + { + "remote_path": "vae/config.json", + "size": 864, + "sha256": "a1cb2ba54a569913eca375d9ee3afe683ba680bd9f64a49d86ec2bd14f304409" + }, + { + "remote_path": "vae/diffusion_pytorch_model.safetensors", + "size": 168120878, + "sha256": "ca70d2202afe6415bdbcb8793ba8cd99fd159cfe6192381504d6c4d3036e0f04" + } + ] +} diff --git a/image/gemlite/prism-ml/bonsai-image-binary-4B-gemlite-1bit/model_index.json b/image/gemlite/prism-ml/bonsai-image-binary-4B-gemlite-1bit/model_index.json new file mode 100644 index 0000000..23fc542 --- /dev/null +++ b/image/gemlite/prism-ml/bonsai-image-binary-4B-gemlite-1bit/model_index.json @@ -0,0 +1,4 @@ +{ + "_class_name": "Flux2KleinPipeline", + "_diffusers_version": "0.37.0.dev0" +} diff --git a/image/gemlite/prism-ml/bonsai-image-binary-4B-gemlite-1bit/text_encoder-hqq-4bit/config.json b/image/gemlite/prism-ml/bonsai-image-binary-4B-gemlite-1bit/text_encoder-hqq-4bit/config.json new file mode 100644 index 0000000..161d1cf --- /dev/null +++ b/image/gemlite/prism-ml/bonsai-image-binary-4B-gemlite-1bit/text_encoder-hqq-4bit/config.json @@ -0,0 +1,68 @@ +{ + "architectures": [ + "Qwen3ForCausalLM" + ], + "attention_bias": false, + "attention_dropout": 0.0, + "bos_token_id": 151643, + "dtype": "float16", + "eos_token_id": 151645, + "head_dim": 128, + "hidden_act": "silu", + "hidden_size": 2560, + "initializer_range": 0.02, + "intermediate_size": 9728, + "layer_types": [ + "full_attention", + "full_attention", + "full_attention", + "full_attention", + "full_attention", + "full_attention", + "full_attention", + "full_attention", + "full_attention", + "full_attention", + "full_attention", + "full_attention", + "full_attention", + "full_attention", + "full_attention", + "full_attention", + "full_attention", + "full_attention", + "full_attention", + "full_attention", + "full_attention", + "full_attention", + "full_attention", + "full_attention", + "full_attention", + "full_attention", + "full_attention", + "full_attention", + "full_attention", + "full_attention", + "full_attention", + "full_attention", + "full_attention", + "full_attention", + "full_attention", + "full_attention" + ], + "max_position_embeddings": 40960, + "max_window_layers": 36, + "model_type": "qwen3", + "num_attention_heads": 32, + "num_hidden_layers": 36, + "num_key_value_heads": 8, + "rms_norm_eps": 1e-06, + "rope_scaling": null, + "rope_theta": 1000000, + "sliding_window": null, + "tie_word_embeddings": true, + "transformers_version": "4.57.6", + "use_cache": true, + "use_sliding_window": false, + "vocab_size": 151936 +} diff --git a/image/gemlite/prism-ml/bonsai-image-binary-4B-gemlite-1bit/text_encoder-hqq-4bit/qmodel.pt b/image/gemlite/prism-ml/bonsai-image-binary-4B-gemlite-1bit/text_encoder-hqq-4bit/qmodel.pt new file mode 100644 index 0000000..eb8c85b --- /dev/null +++ b/image/gemlite/prism-ml/bonsai-image-binary-4B-gemlite-1bit/text_encoder-hqq-4bit/qmodel.pt @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:57ecb803e88313f896b24f2f6fedddcb2966c174801f8d89115f4fbae99be48a +size 2822340711 diff --git a/image/gemlite/prism-ml/bonsai-image-binary-4B-gemlite-1bit/text_encoder-hqq-4bit/tokenizer/added_tokens.json b/image/gemlite/prism-ml/bonsai-image-binary-4B-gemlite-1bit/text_encoder-hqq-4bit/tokenizer/added_tokens.json new file mode 100644 index 0000000..b54f913 --- /dev/null +++ b/image/gemlite/prism-ml/bonsai-image-binary-4B-gemlite-1bit/text_encoder-hqq-4bit/tokenizer/added_tokens.json @@ -0,0 +1,28 @@ +{ + "
": 151668, + "
": 151658, + "": 151666, + "": 151667, + "": 151657, + "": 151665, + "<|box_end|>": 151649, + "<|box_start|>": 151648, + "<|endoftext|>": 151643, + "<|file_sep|>": 151664, + "<|fim_middle|>": 151660, + "<|fim_pad|>": 151662, + "<|fim_prefix|>": 151659, + "<|fim_suffix|>": 151661, + "<|im_end|>": 151645, + "<|im_start|>": 151644, + "<|image_pad|>": 151655, + "<|object_ref_end|>": 151647, + "<|object_ref_start|>": 151646, + "<|quad_end|>": 151651, + "<|quad_start|>": 151650, + "<|repo_name|>": 151663, + "<|video_pad|>": 151656, + "<|vision_end|>": 151653, + "<|vision_pad|>": 151654, + "<|vision_start|>": 151652 +} diff --git a/image/gemlite/prism-ml/bonsai-image-binary-4B-gemlite-1bit/text_encoder-hqq-4bit/tokenizer/chat_template.jinja b/image/gemlite/prism-ml/bonsai-image-binary-4B-gemlite-1bit/text_encoder-hqq-4bit/tokenizer/chat_template.jinja new file mode 100644 index 0000000..01be9b3 --- /dev/null +++ b/image/gemlite/prism-ml/bonsai-image-binary-4B-gemlite-1bit/text_encoder-hqq-4bit/tokenizer/chat_template.jinja @@ -0,0 +1,89 @@ +{%- if tools %} + {{- '<|im_start|>system\n' }} + {%- if messages[0].role == 'system' %} + {{- messages[0].content + '\n\n' }} + {%- endif %} + {{- "# Tools\n\nYou may call one or more functions to assist with the user query.\n\nYou are provided with function signatures within XML tags:\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n\n\nFor each function call, return a json object with function name and arguments within XML tags:\n\n{\"name\": , \"arguments\": }\n<|im_end|>\n" }} +{%- else %} + {%- if messages[0].role == 'system' %} + {{- '<|im_start|>system\n' + messages[0].content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" and message.content is string and not(message.content.startswith('') and message.content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} +{%- endfor %} +{%- for message in messages %} + {%- if message.content is string %} + {%- set content = message.content %} + {%- else %} + {%- set content = '' %} + {%- endif %} + {%- if (message.role == "user") or (message.role == "system" and not loop.first) %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- if loop.index0 > ns.last_query_index %} + {%- if loop.last or (not loop.last and reasoning_content) %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content.strip('\n') + '\n\n\n' + content.lstrip('\n') }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls %} + {%- for tool_call in message.tool_calls %} + {%- if (loop.first and content) or (not loop.first) %} + {{- '\n' }} + {%- endif %} + {%- if tool_call.function %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {{- '\n{"name": "' }} + {{- tool_call.name }} + {{- '", "arguments": ' }} + {%- if tool_call.arguments is string %} + {{- tool_call.arguments }} + {%- else %} + {{- tool_call.arguments | tojson }} + {%- endif %} + {{- '}\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.first or (messages[loop.index0 - 1].role != "tool") %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if loop.last or (messages[loop.index0 + 1].role != "tool") %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/image/gemlite/prism-ml/bonsai-image-binary-4B-gemlite-1bit/text_encoder-hqq-4bit/tokenizer/merges.txt b/image/gemlite/prism-ml/bonsai-image-binary-4B-gemlite-1bit/text_encoder-hqq-4bit/tokenizer/merges.txt new file mode 100644 index 0000000..80c1a19 --- /dev/null +++ b/image/gemlite/prism-ml/bonsai-image-binary-4B-gemlite-1bit/text_encoder-hqq-4bit/tokenizer/merges.txt @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:8831e4f1a044471340f7c0a83d7bd71306a5b867e95fd870f74d0c5308a904d5 +size 1671853 diff --git a/image/gemlite/prism-ml/bonsai-image-binary-4B-gemlite-1bit/text_encoder-hqq-4bit/tokenizer/special_tokens_map.json b/image/gemlite/prism-ml/bonsai-image-binary-4B-gemlite-1bit/text_encoder-hqq-4bit/tokenizer/special_tokens_map.json new file mode 100644 index 0000000..ac23c0a --- /dev/null +++ b/image/gemlite/prism-ml/bonsai-image-binary-4B-gemlite-1bit/text_encoder-hqq-4bit/tokenizer/special_tokens_map.json @@ -0,0 +1,31 @@ +{ + "additional_special_tokens": [ + "<|im_start|>", + "<|im_end|>", + "<|object_ref_start|>", + "<|object_ref_end|>", + "<|box_start|>", + "<|box_end|>", + "<|quad_start|>", + "<|quad_end|>", + "<|vision_start|>", + "<|vision_end|>", + "<|vision_pad|>", + "<|image_pad|>", + "<|video_pad|>" + ], + "eos_token": { + "content": "<|im_end|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false + }, + "pad_token": { + "content": "<|endoftext|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false + } +} diff --git a/image/gemlite/prism-ml/bonsai-image-binary-4B-gemlite-1bit/text_encoder-hqq-4bit/tokenizer/tokenizer.json b/image/gemlite/prism-ml/bonsai-image-binary-4B-gemlite-1bit/text_encoder-hqq-4bit/tokenizer/tokenizer.json new file mode 100644 index 0000000..cd71f61 --- /dev/null +++ b/image/gemlite/prism-ml/bonsai-image-binary-4B-gemlite-1bit/text_encoder-hqq-4bit/tokenizer/tokenizer.json @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:aeb13307a71acd8fe81861d94ad54ab689df773318809eed3cbe794b4492dae4 +size 11422654 diff --git a/image/gemlite/prism-ml/bonsai-image-binary-4B-gemlite-1bit/text_encoder-hqq-4bit/tokenizer/tokenizer_config.json b/image/gemlite/prism-ml/bonsai-image-binary-4B-gemlite-1bit/text_encoder-hqq-4bit/tokenizer/tokenizer_config.json new file mode 100644 index 0000000..ddaf698 --- /dev/null +++ b/image/gemlite/prism-ml/bonsai-image-binary-4B-gemlite-1bit/text_encoder-hqq-4bit/tokenizer/tokenizer_config.json @@ -0,0 +1,239 @@ +{ + "add_bos_token": false, + "add_prefix_space": false, + "added_tokens_decoder": { + "151643": { + "content": "<|endoftext|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "151644": { + "content": "<|im_start|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "151645": { + "content": "<|im_end|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "151646": { + "content": "<|object_ref_start|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "151647": { + "content": "<|object_ref_end|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "151648": { + "content": "<|box_start|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "151649": { + "content": "<|box_end|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "151650": { + "content": "<|quad_start|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "151651": { + "content": "<|quad_end|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "151652": { + "content": "<|vision_start|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "151653": { + "content": "<|vision_end|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "151654": { + "content": "<|vision_pad|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "151655": { + "content": "<|image_pad|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "151656": { + "content": "<|video_pad|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "151657": { + "content": "", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": false + }, + "151658": { + "content": "", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": false + }, + "151659": { + "content": "<|fim_prefix|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": false + }, + "151660": { + "content": "<|fim_middle|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": false + }, + "151661": { + "content": "<|fim_suffix|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": false + }, + "151662": { + "content": "<|fim_pad|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": false + }, + "151663": { + "content": "<|repo_name|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": false + }, + "151664": { + "content": "<|file_sep|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": false + }, + "151665": { + "content": "", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": false + }, + "151666": { + "content": "", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": false + }, + "151667": { + "content": "", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": false + }, + "151668": { + "content": "", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": false + } + }, + "additional_special_tokens": [ + "<|im_start|>", + "<|im_end|>", + "<|object_ref_start|>", + "<|object_ref_end|>", + "<|box_start|>", + "<|box_end|>", + "<|quad_start|>", + "<|quad_end|>", + "<|vision_start|>", + "<|vision_end|>", + "<|vision_pad|>", + "<|image_pad|>", + "<|video_pad|>" + ], + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|im_end|>", + "errors": "replace", + "extra_special_tokens": {}, + "model_max_length": 131072, + "pad_token": "<|endoftext|>", + "split_special_tokens": false, + "tokenizer_class": "Qwen2Tokenizer", + "unk_token": null +} diff --git a/image/gemlite/prism-ml/bonsai-image-binary-4B-gemlite-1bit/text_encoder-hqq-4bit/tokenizer/vocab.json b/image/gemlite/prism-ml/bonsai-image-binary-4B-gemlite-1bit/text_encoder-hqq-4bit/tokenizer/vocab.json new file mode 100644 index 0000000..6c49fc6 --- /dev/null +++ b/image/gemlite/prism-ml/bonsai-image-binary-4B-gemlite-1bit/text_encoder-hqq-4bit/tokenizer/vocab.json @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:ca10d7e9fb3ed18575dd1e277a2579c16d108e32f27439684afa0e10b1440910 +size 2776833 diff --git a/image/gemlite/prism-ml/bonsai-image-binary-4B-gemlite-1bit/transformer-gemlite-int1/config.json b/image/gemlite/prism-ml/bonsai-image-binary-4B-gemlite-1bit/transformer-gemlite-int1/config.json new file mode 100644 index 0000000..2051cb8 --- /dev/null +++ b/image/gemlite/prism-ml/bonsai-image-binary-4B-gemlite-1bit/transformer-gemlite-int1/config.json @@ -0,0 +1,27 @@ +{ + "_class_name": "Flux2Transformer2DModel", + "_diffusers_version": "0.37.1", + "_name_or_path": "black-forest-labs/FLUX.2-klein-4B", + "attention_head_dim": 128, + "axes_dims_rope": [ + 32, + 32, + 32, + 32 + ], + "enable_time_sign_embed": false, + "eps": 1e-06, + "guidance_embeds": false, + "in_channels": 128, + "joint_attention_dim": 7680, + "mlp_ratio": 3.0, + "musubi_block_swap_device": "cpu", + "musubi_blocks_to_swap": 0, + "num_attention_heads": 24, + "num_layers": 5, + "num_single_layers": 20, + "out_channels": null, + "patch_size": 1, + "rope_theta": 2000, + "timestep_guidance_channels": 256 +} diff --git a/image/gemlite/prism-ml/bonsai-image-binary-4B-gemlite-1bit/transformer-gemlite-int1/gemlite_autotune.json b/image/gemlite/prism-ml/bonsai-image-binary-4B-gemlite-1bit/transformer-gemlite-int1/gemlite_autotune.json new file mode 100644 index 0000000..ebad19a --- /dev/null +++ b/image/gemlite/prism-ml/bonsai-image-binary-4B-gemlite-1bit/transformer-gemlite-int1/gemlite_autotune.json @@ -0,0 +1 @@ +{"GEMV": {}, "GEMV_REVSPLITK": {"(1, 4096, 4096, 64, 8, 104)": {"BLOCK_SIZE_M": 1, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 8, "A_load_order": 1, "dot_prod_mode": 0, "num_warps": 1, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1, 4096, 4096, 128, 8, 104)": {"BLOCK_SIZE_M": 1, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 8, "A_load_order": 0, "dot_prod_mode": 0, "num_warps": 1, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1, 6144, 4096, 64, 8, 104)": {"BLOCK_SIZE_M": 1, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 8, "A_load_order": 0, "dot_prod_mode": 0, "num_warps": 2, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1, 6144, 4096, 128, 8, 104)": {"BLOCK_SIZE_M": 1, "BLOCK_SIZE_N": 512, "BLOCK_SIZE_K": 8, "A_load_order": 0, "dot_prod_mode": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 2, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1, 4096, 14336, 64, 8, 104)": {"BLOCK_SIZE_M": 1, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 8, "A_load_order": 0, "dot_prod_mode": 0, "num_warps": 2, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1, 4096, 14336, 128, 8, 104)": {"BLOCK_SIZE_M": 1, "BLOCK_SIZE_N": 512, "BLOCK_SIZE_K": 8, "A_load_order": 0, "dot_prod_mode": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 2, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1, 28672, 4096, 64, 8, 104)": {"BLOCK_SIZE_M": 1, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 8, "A_load_order": 1, "dot_prod_mode": 0, "num_warps": 2, "num_ctas": 1, "num_stages": 2, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1, 28672, 4096, 128, 8, 104)": {"BLOCK_SIZE_M": 1, "BLOCK_SIZE_N": 512, "BLOCK_SIZE_K": 8, "A_load_order": 0, "dot_prod_mode": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1, 3584, 3584, 64, 8, 104)": {"BLOCK_SIZE_M": 1, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 16, "A_load_order": 0, "dot_prod_mode": 0, "num_warps": 2, "num_ctas": 1, "num_stages": 2, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1, 3584, 3584, 128, 8, 104)": {"BLOCK_SIZE_M": 1, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 8, "A_load_order": 0, "dot_prod_mode": 0, "num_warps": 1, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1, 4608, 3584, 64, 8, 104)": {"BLOCK_SIZE_M": 1, "BLOCK_SIZE_N": 512, "BLOCK_SIZE_K": 8, "A_load_order": 0, "dot_prod_mode": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1, 4608, 3584, 128, 8, 104)": {"BLOCK_SIZE_M": 1, "BLOCK_SIZE_N": 512, "BLOCK_SIZE_K": 8, "A_load_order": 1, "dot_prod_mode": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 2, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1, 3584, 18944, 64, 8, 104)": {"BLOCK_SIZE_M": 1, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 16, "A_load_order": 1, "dot_prod_mode": 0, "num_warps": 1, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1, 3584, 18944, 128, 8, 104)": {"BLOCK_SIZE_M": 1, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 8, "A_load_order": 0, "dot_prod_mode": 0, "num_warps": 2, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1, 37888, 3584, 64, 8, 104)": {"BLOCK_SIZE_M": 1, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 8, "A_load_order": 0, "dot_prod_mode": 0, "num_warps": 2, "num_ctas": 1, "num_stages": 2, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1, 37888, 3584, 128, 8, 104)": {"BLOCK_SIZE_M": 1, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 8, "A_load_order": 1, "dot_prod_mode": 0, "num_warps": 2, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1, 3072, 3072, 64, 8, 104)": {"BLOCK_SIZE_M": 1, "BLOCK_SIZE_N": 512, "BLOCK_SIZE_K": 8, "A_load_order": 0, "dot_prod_mode": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1, 3072, 3072, 128, 8, 104)": {"BLOCK_SIZE_M": 1, "BLOCK_SIZE_N": 512, "BLOCK_SIZE_K": 8, "A_load_order": 0, "dot_prod_mode": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1, 1024, 4096, 64, 8, 104)": {"BLOCK_SIZE_M": 1, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 16, "A_load_order": 0, "dot_prod_mode": 0, "num_warps": 2, "num_ctas": 1, "num_stages": 2, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1, 1024, 4096, 128, 8, 104)": {"BLOCK_SIZE_M": 1, "BLOCK_SIZE_N": 512, "BLOCK_SIZE_K": 16, "A_load_order": 0, "dot_prod_mode": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 2, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1, 14336, 4096, 64, 8, 104)": {"BLOCK_SIZE_M": 1, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 8, "A_load_order": 0, "dot_prod_mode": 0, "num_warps": 2, "num_ctas": 1, "num_stages": 2, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1, 14336, 4096, 128, 8, 104)": {"BLOCK_SIZE_M": 1, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 8, "A_load_order": 0, "dot_prod_mode": 0, "num_warps": 2, "num_ctas": 1, "num_stages": 2, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1, 512, 3584, 64, 8, 104)": {"BLOCK_SIZE_M": 1, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 16, "A_load_order": 0, "dot_prod_mode": 0, "num_warps": 1, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1, 512, 3584, 128, 8, 104)": {"BLOCK_SIZE_M": 1, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 16, "A_load_order": 0, "dot_prod_mode": 0, "num_warps": 1, "num_ctas": 1, "num_stages": 2, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1, 18944, 3584, 64, 8, 104)": {"BLOCK_SIZE_M": 1, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 8, "A_load_order": 0, "dot_prod_mode": 0, "num_warps": 2, "num_ctas": 1, "num_stages": 2, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1, 18944, 3584, 128, 8, 104)": {"BLOCK_SIZE_M": 1, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 8, "A_load_order": 1, "dot_prod_mode": 0, "num_warps": 2, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1, 5120, 3072, 64, 8, 104)": {"BLOCK_SIZE_M": 1, "BLOCK_SIZE_N": 512, "BLOCK_SIZE_K": 8, "A_load_order": 1, "dot_prod_mode": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 2, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1, 5120, 3072, 128, 8, 104)": {"BLOCK_SIZE_M": 1, "BLOCK_SIZE_N": 512, "BLOCK_SIZE_K": 8, "A_load_order": 0, "dot_prod_mode": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 2, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1, 3072, 8192, 64, 8, 104)": {"BLOCK_SIZE_M": 1, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 16, "A_load_order": 1, "dot_prod_mode": 0, "num_warps": 1, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1, 3072, 8192, 128, 8, 104)": {"BLOCK_SIZE_M": 1, "BLOCK_SIZE_N": 512, "BLOCK_SIZE_K": 16, "A_load_order": 1, "dot_prod_mode": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 2, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1, 16384, 3072, 64, 8, 104)": {"BLOCK_SIZE_M": 1, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 8, "A_load_order": 0, "dot_prod_mode": 0, "num_warps": 2, "num_ctas": 1, "num_stages": 2, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1, 16384, 3072, 128, 8, 104)": {"BLOCK_SIZE_M": 1, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 8, "A_load_order": 1, "dot_prod_mode": 0, "num_warps": 2, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1, 2048, 2048, 64, 8, 104)": {"BLOCK_SIZE_M": 1, "BLOCK_SIZE_N": 512, "BLOCK_SIZE_K": 8, "A_load_order": 0, "dot_prod_mode": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1, 2048, 2048, 128, 8, 104)": {"BLOCK_SIZE_M": 1, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 8, "A_load_order": 0, "dot_prod_mode": 0, "num_warps": 1, "num_ctas": 1, "num_stages": 2, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1, 2560, 2048, 64, 8, 104)": {"BLOCK_SIZE_M": 1, "BLOCK_SIZE_N": 512, "BLOCK_SIZE_K": 8, "A_load_order": 0, "dot_prod_mode": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1, 2560, 2048, 128, 8, 104)": {"BLOCK_SIZE_M": 1, "BLOCK_SIZE_N": 512, "BLOCK_SIZE_K": 8, "A_load_order": 1, "dot_prod_mode": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 2, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1, 2048, 11008, 64, 8, 104)": {"BLOCK_SIZE_M": 1, "BLOCK_SIZE_N": 512, "BLOCK_SIZE_K": 16, "A_load_order": 1, "dot_prod_mode": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1, 2048, 11008, 128, 8, 104)": {"BLOCK_SIZE_M": 1, "BLOCK_SIZE_N": 512, "BLOCK_SIZE_K": 16, "A_load_order": 0, "dot_prod_mode": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1, 22016, 2048, 64, 8, 104)": {"BLOCK_SIZE_M": 1, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 8, "A_load_order": 0, "dot_prod_mode": 0, "num_warps": 2, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1, 22016, 2048, 128, 8, 104)": {"BLOCK_SIZE_M": 1, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 8, "A_load_order": 0, "dot_prod_mode": 0, "num_warps": 2, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1, 5120, 5120, 64, 8, 104)": {"BLOCK_SIZE_M": 1, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 8, "A_load_order": 0, "dot_prod_mode": 0, "num_warps": 2, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1, 5120, 5120, 128, 8, 104)": {"BLOCK_SIZE_M": 1, "BLOCK_SIZE_N": 512, "BLOCK_SIZE_K": 8, "A_load_order": 1, "dot_prod_mode": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1, 7168, 5120, 64, 8, 104)": {"BLOCK_SIZE_M": 1, "BLOCK_SIZE_N": 512, "BLOCK_SIZE_K": 8, "A_load_order": 0, "dot_prod_mode": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 2, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1, 7168, 5120, 128, 8, 104)": {"BLOCK_SIZE_M": 1, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 8, "A_load_order": 0, "dot_prod_mode": 0, "num_warps": 2, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1, 5120, 13824, 64, 8, 104)": {"BLOCK_SIZE_M": 1, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 8, "A_load_order": 1, "dot_prod_mode": 0, "num_warps": 2, "num_ctas": 1, "num_stages": 2, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1, 5120, 13824, 128, 8, 104)": {"BLOCK_SIZE_M": 1, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 8, "A_load_order": 1, "dot_prod_mode": 0, "num_warps": 2, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1, 27648, 5120, 64, 8, 104)": {"BLOCK_SIZE_M": 1, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 8, "A_load_order": 0, "dot_prod_mode": 0, "num_warps": 2, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1, 27648, 5120, 128, 8, 104)": {"BLOCK_SIZE_M": 1, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 8, "A_load_order": 1, "dot_prod_mode": 0, "num_warps": 2, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1, 2048, 3840, 64, 8, 104)": {"BLOCK_SIZE_M": 1, "BLOCK_SIZE_N": 512, "BLOCK_SIZE_K": 16, "A_load_order": 1, "dot_prod_mode": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 2, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1, 4096, 3840, 64, 8, 104)": {"BLOCK_SIZE_M": 1, "BLOCK_SIZE_N": 512, "BLOCK_SIZE_K": 8, "A_load_order": 1, "dot_prod_mode": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1, 8192, 3840, 64, 8, 104)": {"BLOCK_SIZE_M": 1, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 8, "A_load_order": 0, "dot_prod_mode": 0, "num_warps": 2, "num_ctas": 1, "num_stages": 2, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1, 3840, 4096, 64, 8, 104)": {"BLOCK_SIZE_M": 1, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 8, "A_load_order": 1, "dot_prod_mode": 0, "num_warps": 2, "num_ctas": 1, "num_stages": 2, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1, 3840, 15360, 64, 8, 104)": {"BLOCK_SIZE_M": 1, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 8, "A_load_order": 0, "dot_prod_mode": 0, "num_warps": 1, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1, 30720, 3840, 64, 8, 104)": {"BLOCK_SIZE_M": 1, "BLOCK_SIZE_N": 512, "BLOCK_SIZE_K": 8, "A_load_order": 1, "dot_prod_mode": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}}, "GEMV_SPLITK": {"(1, 4096, 4096, 4096, 1, 408)": {"BLOCK_SIZE_M": 1, "BLOCK_SIZE_N": 8, "BLOCK_SIZE_K": 1024, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 0, "dot_prod_mode": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 2, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1, 6144, 4096, 4096, 1, 408)": {"BLOCK_SIZE_M": 1, "BLOCK_SIZE_N": 8, "BLOCK_SIZE_K": 512, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 0, "dot_prod_mode": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1, 4096, 14336, 14336, 1, 408)": {"BLOCK_SIZE_M": 1, "BLOCK_SIZE_N": 1, "BLOCK_SIZE_K": 1024, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 0, "dot_prod_mode": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 2, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1, 28672, 4096, 4096, 1, 408)": {"BLOCK_SIZE_M": 1, "BLOCK_SIZE_N": 1, "BLOCK_SIZE_K": 1024, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 1, "dot_prod_mode": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 2, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1, 3584, 3584, 3584, 1, 408)": {"BLOCK_SIZE_M": 1, "BLOCK_SIZE_N": 8, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 0, "dot_prod_mode": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1, 4608, 3584, 3584, 1, 408)": {"BLOCK_SIZE_M": 1, "BLOCK_SIZE_N": 8, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 0, "dot_prod_mode": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1, 3584, 18944, 18944, 1, 408)": {"BLOCK_SIZE_M": 1, "BLOCK_SIZE_N": 8, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 0, "dot_prod_mode": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 2, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1, 37888, 3584, 3584, 1, 408)": {"BLOCK_SIZE_M": 1, "BLOCK_SIZE_N": 8, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 0, "dot_prod_mode": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1, 3072, 3072, 3072, 1, 408)": {"BLOCK_SIZE_M": 1, "BLOCK_SIZE_N": 4, "BLOCK_SIZE_K": 1024, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 0, "dot_prod_mode": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 2, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1, 5120, 3072, 3072, 1, 408)": {"BLOCK_SIZE_M": 1, "BLOCK_SIZE_N": 8, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 1, "dot_prod_mode": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 2, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1, 3072, 8192, 8192, 1, 408)": {"BLOCK_SIZE_M": 1, "BLOCK_SIZE_N": 8, "BLOCK_SIZE_K": 1024, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 0, "dot_prod_mode": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1, 16384, 3072, 3072, 1, 408)": {"BLOCK_SIZE_M": 1, "BLOCK_SIZE_N": 8, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 0, "dot_prod_mode": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1, 2048, 2048, 2048, 1, 408)": {"BLOCK_SIZE_M": 1, "BLOCK_SIZE_N": 2, "BLOCK_SIZE_K": 2048, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 0, "dot_prod_mode": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1, 2560, 2048, 2048, 1, 408)": {"BLOCK_SIZE_M": 1, "BLOCK_SIZE_N": 4, "BLOCK_SIZE_K": 1024, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 0, "dot_prod_mode": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1, 2048, 11008, 11008, 1, 408)": {"BLOCK_SIZE_M": 1, "BLOCK_SIZE_N": 8, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 0, "dot_prod_mode": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 2, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1, 22016, 2048, 2048, 1, 408)": {"BLOCK_SIZE_M": 1, "BLOCK_SIZE_N": 8, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 0, "dot_prod_mode": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1, 1024, 4096, 4096, 1, 408)": {"BLOCK_SIZE_M": 1, "BLOCK_SIZE_N": 1, "BLOCK_SIZE_K": 2048, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 0, "dot_prod_mode": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 2, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1, 14336, 4096, 4096, 1, 408)": {"BLOCK_SIZE_M": 1, "BLOCK_SIZE_N": 1, "BLOCK_SIZE_K": 1024, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 0, "dot_prod_mode": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1, 512, 3584, 3584, 1, 408)": {"BLOCK_SIZE_M": 1, "BLOCK_SIZE_N": 8, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 0, "dot_prod_mode": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 2, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1, 18944, 3584, 3584, 1, 408)": {"BLOCK_SIZE_M": 1, "BLOCK_SIZE_N": 8, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 0, "dot_prod_mode": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 2, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1, 5120, 5120, 5120, 1, 408)": {"BLOCK_SIZE_M": 1, "BLOCK_SIZE_N": 8, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 1, "dot_prod_mode": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 2, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1, 7168, 5120, 5120, 1, 408)": {"BLOCK_SIZE_M": 1, "BLOCK_SIZE_N": 8, "BLOCK_SIZE_K": 512, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 0, "dot_prod_mode": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 2, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1, 5120, 13824, 13824, 1, 408)": {"BLOCK_SIZE_M": 1, "BLOCK_SIZE_N": 8, "BLOCK_SIZE_K": 512, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 0, "dot_prod_mode": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1, 27648, 5120, 5120, 1, 408)": {"BLOCK_SIZE_M": 1, "BLOCK_SIZE_N": 1, "BLOCK_SIZE_K": 1024, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 0, "dot_prod_mode": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1, 2048, 3840, 3840, 1, 408)": {"BLOCK_SIZE_M": 1, "BLOCK_SIZE_N": 8, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 0, "dot_prod_mode": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 2, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1, 4096, 3840, 3840, 1, 408)": {"BLOCK_SIZE_M": 1, "BLOCK_SIZE_N": 8, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 0, "dot_prod_mode": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 2, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1, 8192, 3840, 3840, 1, 408)": {"BLOCK_SIZE_M": 1, "BLOCK_SIZE_N": 8, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 0, "dot_prod_mode": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 2, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1, 3840, 4096, 4096, 1, 408)": {"BLOCK_SIZE_M": 1, "BLOCK_SIZE_N": 8, "BLOCK_SIZE_K": 1024, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 0, "dot_prod_mode": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 2, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1, 3840, 15360, 15360, 1, 408)": {"BLOCK_SIZE_M": 1, "BLOCK_SIZE_N": 8, "BLOCK_SIZE_K": 1024, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 0, "dot_prod_mode": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 2, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1, 30720, 3840, 3840, 1, 408)": {"BLOCK_SIZE_M": 1, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 0, "dot_prod_mode": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}}, "GEMM_SPLITK": {"(64, 4096, 4096, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(48, 4096, 4096, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(32, 4096, 4096, 64, 8, 104)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(24, 4096, 4096, 64, 8, 104)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(16, 4096, 4096, 64, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(8, 4096, 4096, 64, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4, 4096, 4096, 64, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2, 4096, 4096, 64, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(64, 4096, 4096, 4096, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(48, 4096, 4096, 4096, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(32, 4096, 4096, 4096, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 512, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(24, 4096, 4096, 4096, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 512, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(16, 4096, 4096, 4096, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 512, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(8, 4096, 4096, 4096, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 512, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4, 4096, 4096, 4096, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2, 4096, 4096, 4096, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(64, 4096, 4096, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(48, 4096, 4096, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(32, 4096, 4096, 128, 8, 104)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(24, 4096, 4096, 128, 8, 104)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(16, 4096, 4096, 128, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(8, 4096, 4096, 128, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4, 4096, 4096, 128, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2, 4096, 4096, 128, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(64, 6144, 4096, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 4, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(48, 6144, 4096, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 4, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(32, 6144, 4096, 64, 8, 104)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(24, 6144, 4096, 64, 8, 104)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 512, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(16, 6144, 4096, 64, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(8, 6144, 4096, 64, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4, 6144, 4096, 64, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2, 6144, 4096, 64, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(64, 6144, 4096, 4096, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(48, 6144, 4096, 4096, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(32, 6144, 4096, 4096, 1, 408)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(24, 6144, 4096, 4096, 1, 408)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(16, 6144, 4096, 4096, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(8, 6144, 4096, 4096, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4, 6144, 4096, 4096, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2, 6144, 4096, 4096, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(64, 6144, 4096, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "SPLIT_K": 4, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(48, 6144, 4096, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "SPLIT_K": 4, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(32, 6144, 4096, 128, 8, 104)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(24, 6144, 4096, 128, 8, 104)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(16, 6144, 4096, 128, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(8, 6144, 4096, 128, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4, 6144, 4096, 128, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2, 6144, 4096, 128, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(64, 4096, 14336, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(48, 4096, 14336, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(32, 4096, 14336, 64, 8, 104)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(24, 4096, 14336, 64, 8, 104)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(16, 4096, 14336, 64, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(8, 4096, 14336, 64, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4, 4096, 14336, 64, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2, 4096, 14336, 64, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(64, 4096, 14336, 14336, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 512, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(48, 4096, 14336, 14336, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 512, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(32, 4096, 14336, 14336, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 512, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(24, 4096, 14336, 14336, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 512, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(16, 4096, 14336, 14336, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 512, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(8, 4096, 14336, 14336, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 512, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4, 4096, 14336, 14336, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 512, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2, 4096, 14336, 14336, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 512, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(64, 4096, 14336, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(48, 4096, 14336, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(32, 4096, 14336, 128, 8, 104)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(24, 4096, 14336, 128, 8, 104)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(16, 4096, 14336, 128, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(8, 4096, 14336, 128, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4, 4096, 14336, 128, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2, 4096, 14336, 128, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(64, 28672, 4096, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(48, 28672, 4096, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(32, 28672, 4096, 64, 8, 104)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 512, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 4, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(24, 28672, 4096, 64, 8, 104)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 512, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(16, 28672, 4096, 64, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 512, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(8, 28672, 4096, 64, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 512, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4, 28672, 4096, 64, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 512, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2, 28672, 4096, 64, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 512, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(64, 28672, 4096, 4096, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 2, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(48, 28672, 4096, 4096, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 2, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(32, 28672, 4096, 4096, 1, 408)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 2, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(24, 28672, 4096, 4096, 1, 408)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 2, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(16, 28672, 4096, 4096, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 2, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(8, 28672, 4096, 4096, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 2, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4, 28672, 4096, 4096, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 2, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2, 28672, 4096, 4096, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 2, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(64, 28672, 4096, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(48, 28672, 4096, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(32, 28672, 4096, 128, 8, 104)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 512, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 4, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(24, 28672, 4096, 128, 8, 104)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 512, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(16, 28672, 4096, 128, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 512, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(8, 28672, 4096, 128, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 512, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4, 28672, 4096, 128, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 512, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2, 28672, 4096, 128, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 512, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(64, 3584, 3584, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(48, 3584, 3584, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(32, 3584, 3584, 64, 8, 104)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(24, 3584, 3584, 64, 8, 104)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(16, 3584, 3584, 64, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(8, 3584, 3584, 64, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4, 3584, 3584, 64, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2, 3584, 3584, 64, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(64, 3584, 3584, 3584, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(48, 3584, 3584, 3584, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 512, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(32, 3584, 3584, 3584, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 512, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(24, 3584, 3584, 3584, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 512, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(16, 3584, 3584, 3584, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 512, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(8, 3584, 3584, 3584, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 512, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4, 3584, 3584, 3584, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 512, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2, 3584, 3584, 3584, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 512, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(64, 3584, 3584, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(48, 3584, 3584, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(32, 3584, 3584, 128, 8, 104)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(24, 3584, 3584, 128, 8, 104)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(16, 3584, 3584, 128, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(8, 3584, 3584, 128, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4, 3584, 3584, 128, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2, 3584, 3584, 128, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(64, 4608, 3584, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(48, 4608, 3584, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(32, 4608, 3584, 64, 8, 104)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(24, 4608, 3584, 64, 8, 104)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(16, 4608, 3584, 64, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(8, 4608, 3584, 64, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4, 4608, 3584, 64, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2, 4608, 3584, 64, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(64, 4608, 3584, 3584, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(48, 4608, 3584, 3584, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(32, 4608, 3584, 3584, 1, 408)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(24, 4608, 3584, 3584, 1, 408)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(16, 4608, 3584, 3584, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 512, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(8, 4608, 3584, 3584, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 512, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4, 4608, 3584, 3584, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 512, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2, 4608, 3584, 3584, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 512, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(64, 4608, 3584, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(48, 4608, 3584, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(32, 4608, 3584, 128, 8, 104)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(24, 4608, 3584, 128, 8, 104)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(16, 4608, 3584, 128, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(8, 4608, 3584, 128, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4, 4608, 3584, 128, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2, 4608, 3584, 128, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(64, 3584, 18944, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(48, 3584, 18944, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(32, 3584, 18944, 64, 8, 104)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(24, 3584, 18944, 64, 8, 104)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(16, 3584, 18944, 64, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(8, 3584, 18944, 64, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4, 3584, 18944, 64, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2, 3584, 18944, 64, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(64, 3584, 18944, 18944, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 512, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(48, 3584, 18944, 18944, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 512, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(32, 3584, 18944, 18944, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 512, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(24, 3584, 18944, 18944, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 512, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(16, 3584, 18944, 18944, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 512, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(8, 3584, 18944, 18944, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 512, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4, 3584, 18944, 18944, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 512, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2, 3584, 18944, 18944, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 512, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(64, 3584, 18944, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(48, 3584, 18944, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(32, 3584, 18944, 128, 8, 104)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(24, 3584, 18944, 128, 8, 104)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(16, 3584, 18944, 128, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(8, 3584, 18944, 128, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4, 3584, 18944, 128, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2, 3584, 18944, 128, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(64, 37888, 3584, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 4, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(48, 37888, 3584, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 4, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(32, 37888, 3584, 64, 8, 104)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 512, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(24, 37888, 3584, 64, 8, 104)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 512, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(16, 37888, 3584, 64, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 512, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(8, 37888, 3584, 64, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 512, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4, 37888, 3584, 64, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 512, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2, 37888, 3584, 64, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 512, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(64, 37888, 3584, 3584, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(48, 37888, 3584, 3584, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(32, 37888, 3584, 3584, 1, 408)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 2, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(24, 37888, 3584, 3584, 1, 408)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 2, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(16, 37888, 3584, 3584, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 2, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(8, 37888, 3584, 3584, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 2, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4, 37888, 3584, 3584, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 2, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2, 37888, 3584, 3584, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 2, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(64, 37888, 3584, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 4, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(48, 37888, 3584, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 4, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(32, 37888, 3584, 128, 8, 104)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 512, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(24, 37888, 3584, 128, 8, 104)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 512, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(16, 37888, 3584, 128, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 512, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(8, 37888, 3584, 128, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "SPLIT_K": 2, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4, 37888, 3584, 128, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "SPLIT_K": 2, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2, 37888, 3584, 128, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "SPLIT_K": 2, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(64, 3072, 3072, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(48, 3072, 3072, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(32, 3072, 3072, 64, 8, 104)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(24, 3072, 3072, 64, 8, 104)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(16, 3072, 3072, 64, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(8, 3072, 3072, 64, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4, 3072, 3072, 64, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2, 3072, 3072, 64, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(64, 3072, 3072, 3072, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(48, 3072, 3072, 3072, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(32, 3072, 3072, 3072, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 512, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(24, 3072, 3072, 3072, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 512, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(16, 3072, 3072, 3072, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 512, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(8, 3072, 3072, 3072, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 512, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4, 3072, 3072, 3072, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 512, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2, 3072, 3072, 3072, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 512, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(64, 3072, 3072, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(48, 3072, 3072, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(32, 3072, 3072, 128, 8, 104)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(24, 3072, 3072, 128, 8, 104)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(16, 3072, 3072, 128, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(8, 3072, 3072, 128, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4, 3072, 3072, 128, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2, 3072, 3072, 128, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(64, 1024, 4096, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(48, 1024, 4096, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(32, 1024, 4096, 64, 8, 104)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(24, 1024, 4096, 64, 8, 104)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(16, 1024, 4096, 64, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(8, 1024, 4096, 64, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4, 1024, 4096, 64, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2, 1024, 4096, 64, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(64, 1024, 4096, 4096, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(48, 1024, 4096, 4096, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(32, 1024, 4096, 4096, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 512, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(24, 1024, 4096, 4096, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 512, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(16, 1024, 4096, 4096, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 2, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(8, 1024, 4096, 4096, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 2, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4, 1024, 4096, 4096, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 2, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2, 1024, 4096, 4096, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 2, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(64, 1024, 4096, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(48, 1024, 4096, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(32, 1024, 4096, 128, 8, 104)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(24, 1024, 4096, 128, 8, 104)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(16, 1024, 4096, 128, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(8, 1024, 4096, 128, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4, 1024, 4096, 128, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2, 1024, 4096, 128, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(64, 14336, 4096, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(48, 14336, 4096, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(32, 14336, 4096, 64, 8, 104)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 512, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(24, 14336, 4096, 64, 8, 104)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 512, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(16, 14336, 4096, 64, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 512, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(8, 14336, 4096, 64, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 512, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4, 14336, 4096, 64, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 512, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2, 14336, 4096, 64, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 512, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(64, 14336, 4096, 4096, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(48, 14336, 4096, 4096, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(32, 14336, 4096, 4096, 1, 408)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(24, 14336, 4096, 4096, 1, 408)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(16, 14336, 4096, 4096, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(8, 14336, 4096, 4096, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4, 14336, 4096, 4096, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2, 14336, 4096, 4096, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(64, 14336, 4096, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(48, 14336, 4096, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(32, 14336, 4096, 128, 8, 104)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 512, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(24, 14336, 4096, 128, 8, 104)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 512, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(16, 14336, 4096, 128, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 512, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(8, 14336, 4096, 128, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 512, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4, 14336, 4096, 128, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 512, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2, 14336, 4096, 128, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 512, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(64, 512, 3584, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(48, 512, 3584, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(32, 512, 3584, 64, 8, 104)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(24, 512, 3584, 64, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(16, 512, 3584, 64, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(8, 512, 3584, 64, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4, 512, 3584, 64, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2, 512, 3584, 64, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(64, 512, 3584, 3584, 1, 408)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(48, 512, 3584, 3584, 1, 408)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(32, 512, 3584, 3584, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 512, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(24, 512, 3584, 3584, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 512, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(16, 512, 3584, 3584, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 512, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(8, 512, 3584, 3584, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 512, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4, 512, 3584, 3584, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 512, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2, 512, 3584, 3584, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(64, 512, 3584, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(48, 512, 3584, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(32, 512, 3584, 128, 8, 104)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(24, 512, 3584, 128, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(16, 512, 3584, 128, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(8, 512, 3584, 128, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4, 512, 3584, 128, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2, 512, 3584, 128, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(64, 18944, 3584, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(48, 18944, 3584, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(32, 18944, 3584, 64, 8, 104)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(24, 18944, 3584, 64, 8, 104)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(16, 18944, 3584, 64, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "SPLIT_K": 4, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(8, 18944, 3584, 64, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "SPLIT_K": 4, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4, 18944, 3584, 64, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "SPLIT_K": 4, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2, 18944, 3584, 64, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "SPLIT_K": 4, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(64, 18944, 3584, 3584, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(48, 18944, 3584, 3584, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(32, 18944, 3584, 3584, 1, 408)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 512, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 2, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(24, 18944, 3584, 3584, 1, 408)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(16, 18944, 3584, 3584, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 512, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 2, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(8, 18944, 3584, 3584, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 512, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 2, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4, 18944, 3584, 3584, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 512, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 2, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2, 18944, 3584, 3584, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(64, 18944, 3584, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(48, 18944, 3584, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(32, 18944, 3584, 128, 8, 104)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(24, 18944, 3584, 128, 8, 104)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(16, 18944, 3584, 128, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "SPLIT_K": 4, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(8, 18944, 3584, 128, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "SPLIT_K": 4, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4, 18944, 3584, 128, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "SPLIT_K": 4, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2, 18944, 3584, 128, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "SPLIT_K": 4, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(64, 5120, 3072, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(48, 5120, 3072, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(32, 5120, 3072, 64, 8, 104)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(24, 5120, 3072, 64, 8, 104)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(16, 5120, 3072, 64, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(8, 5120, 3072, 64, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4, 5120, 3072, 64, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2, 5120, 3072, 64, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(64, 5120, 3072, 3072, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(48, 5120, 3072, 3072, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(32, 5120, 3072, 3072, 1, 408)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(24, 5120, 3072, 3072, 1, 408)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(16, 5120, 3072, 3072, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(8, 5120, 3072, 3072, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4, 5120, 3072, 3072, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2, 5120, 3072, 3072, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(64, 5120, 3072, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(48, 5120, 3072, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(32, 5120, 3072, 128, 8, 104)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(24, 5120, 3072, 128, 8, 104)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(16, 5120, 3072, 128, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(8, 5120, 3072, 128, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4, 5120, 3072, 128, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2, 5120, 3072, 128, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(64, 3072, 8192, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(48, 3072, 8192, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(32, 3072, 8192, 64, 8, 104)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(24, 3072, 8192, 64, 8, 104)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(16, 3072, 8192, 64, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(8, 3072, 8192, 64, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4, 3072, 8192, 64, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2, 3072, 8192, 64, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(64, 3072, 8192, 8192, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 512, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(48, 3072, 8192, 8192, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 512, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(32, 3072, 8192, 8192, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 512, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(24, 3072, 8192, 8192, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 512, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(16, 3072, 8192, 8192, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 512, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(8, 3072, 8192, 8192, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 512, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4, 3072, 8192, 8192, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 512, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2, 3072, 8192, 8192, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 512, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(64, 3072, 8192, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(48, 3072, 8192, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(32, 3072, 8192, 128, 8, 104)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(24, 3072, 8192, 128, 8, 104)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(16, 3072, 8192, 128, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(8, 3072, 8192, 128, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4, 3072, 8192, 128, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2, 3072, 8192, 128, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(64, 16384, 3072, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 2, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(48, 16384, 3072, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 2, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(32, 16384, 3072, 64, 8, 104)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 512, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(24, 16384, 3072, 64, 8, 104)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 512, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(16, 16384, 3072, 64, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 512, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(8, 16384, 3072, 64, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 512, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4, 16384, 3072, 64, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 512, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2, 16384, 3072, 64, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 512, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(64, 16384, 3072, 3072, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(48, 16384, 3072, 3072, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(32, 16384, 3072, 3072, 1, 408)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(24, 16384, 3072, 3072, 1, 408)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(16, 16384, 3072, 3072, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 512, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 2, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(8, 16384, 3072, 3072, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 512, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 2, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4, 16384, 3072, 3072, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 512, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 2, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2, 16384, 3072, 3072, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 512, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 2, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(64, 16384, 3072, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 2, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(48, 16384, 3072, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 2, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(32, 16384, 3072, 128, 8, 104)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 512, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(24, 16384, 3072, 128, 8, 104)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 512, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(16, 16384, 3072, 128, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 512, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(8, 16384, 3072, 128, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 512, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4, 16384, 3072, 128, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 512, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2, 16384, 3072, 128, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 512, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(64, 2048, 2048, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(48, 2048, 2048, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(32, 2048, 2048, 64, 8, 104)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(24, 2048, 2048, 64, 8, 104)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(16, 2048, 2048, 64, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(8, 2048, 2048, 64, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4, 2048, 2048, 64, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2, 2048, 2048, 64, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(64, 2048, 2048, 2048, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(48, 2048, 2048, 2048, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(32, 2048, 2048, 2048, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(24, 2048, 2048, 2048, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(16, 2048, 2048, 2048, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(8, 2048, 2048, 2048, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4, 2048, 2048, 2048, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2, 2048, 2048, 2048, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(64, 2048, 2048, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(48, 2048, 2048, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(32, 2048, 2048, 128, 8, 104)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(24, 2048, 2048, 128, 8, 104)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(16, 2048, 2048, 128, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(8, 2048, 2048, 128, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4, 2048, 2048, 128, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2, 2048, 2048, 128, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(64, 2560, 2048, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(48, 2560, 2048, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(32, 2560, 2048, 64, 8, 104)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(24, 2560, 2048, 64, 8, 104)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(16, 2560, 2048, 64, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(8, 2560, 2048, 64, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4, 2560, 2048, 64, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2, 2560, 2048, 64, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(64, 2560, 2048, 2048, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(48, 2560, 2048, 2048, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(32, 2560, 2048, 2048, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 512, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(24, 2560, 2048, 2048, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 512, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(16, 2560, 2048, 2048, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(8, 2560, 2048, 2048, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4, 2560, 2048, 2048, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2, 2560, 2048, 2048, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(64, 2560, 2048, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(48, 2560, 2048, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(32, 2560, 2048, 128, 8, 104)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(24, 2560, 2048, 128, 8, 104)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(16, 2560, 2048, 128, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(8, 2560, 2048, 128, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4, 2560, 2048, 128, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2, 2560, 2048, 128, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(64, 2048, 11008, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(48, 2048, 11008, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(32, 2048, 11008, 64, 8, 104)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(24, 2048, 11008, 64, 8, 104)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(16, 2048, 11008, 64, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(8, 2048, 11008, 64, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4, 2048, 11008, 64, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2, 2048, 11008, 64, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(64, 2048, 11008, 11008, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 512, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(48, 2048, 11008, 11008, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 512, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(32, 2048, 11008, 11008, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 512, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(24, 2048, 11008, 11008, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 512, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(16, 2048, 11008, 11008, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 512, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(8, 2048, 11008, 11008, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 512, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4, 2048, 11008, 11008, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 512, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2, 2048, 11008, 11008, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 512, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(64, 2048, 11008, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(48, 2048, 11008, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(32, 2048, 11008, 128, 8, 104)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(24, 2048, 11008, 128, 8, 104)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(16, 2048, 11008, 128, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(8, 2048, 11008, 128, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4, 2048, 11008, 128, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2, 2048, 11008, 128, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(64, 22016, 2048, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 4, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(48, 22016, 2048, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 4, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(32, 22016, 2048, 64, 8, 104)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 512, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(24, 22016, 2048, 64, 8, 104)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 512, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(16, 22016, 2048, 64, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 512, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(8, 22016, 2048, 64, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 512, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4, 22016, 2048, 64, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 512, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2, 22016, 2048, 64, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 512, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(64, 22016, 2048, 2048, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(48, 22016, 2048, 2048, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(32, 22016, 2048, 2048, 1, 408)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 2, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(24, 22016, 2048, 2048, 1, 408)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 2, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(16, 22016, 2048, 2048, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 512, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 2, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(8, 22016, 2048, 2048, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 512, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 2, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4, 22016, 2048, 2048, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 512, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 2, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2, 22016, 2048, 2048, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 512, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 2, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(64, 22016, 2048, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 4, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(48, 22016, 2048, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 4, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(32, 22016, 2048, 128, 8, 104)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 512, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(24, 22016, 2048, 128, 8, 104)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 512, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(16, 22016, 2048, 128, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 512, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(8, 22016, 2048, 128, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 512, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4, 22016, 2048, 128, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 512, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2, 22016, 2048, 128, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 512, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(64, 5120, 5120, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(48, 5120, 5120, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(32, 5120, 5120, 64, 8, 104)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(24, 5120, 5120, 64, 8, 104)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(16, 5120, 5120, 64, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(8, 5120, 5120, 64, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4, 5120, 5120, 64, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2, 5120, 5120, 64, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(64, 5120, 5120, 5120, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(48, 5120, 5120, 5120, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(32, 5120, 5120, 5120, 1, 408)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(24, 5120, 5120, 5120, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(16, 5120, 5120, 5120, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 512, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(8, 5120, 5120, 5120, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 512, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4, 5120, 5120, 5120, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 512, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2, 5120, 5120, 5120, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 512, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(64, 5120, 5120, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(48, 5120, 5120, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(32, 5120, 5120, 128, 8, 104)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(24, 5120, 5120, 128, 8, 104)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(16, 5120, 5120, 128, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(8, 5120, 5120, 128, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4, 5120, 5120, 128, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2, 5120, 5120, 128, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(64, 7168, 5120, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(48, 7168, 5120, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(32, 7168, 5120, 64, 8, 104)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(24, 7168, 5120, 64, 8, 104)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 512, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(16, 7168, 5120, 64, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 512, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(8, 7168, 5120, 64, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 512, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4, 7168, 5120, 64, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 512, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2, 7168, 5120, 64, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 512, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(64, 7168, 5120, 5120, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(48, 7168, 5120, 5120, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(32, 7168, 5120, 5120, 1, 408)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(24, 7168, 5120, 5120, 1, 408)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(16, 7168, 5120, 5120, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(8, 7168, 5120, 5120, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4, 7168, 5120, 5120, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2, 7168, 5120, 5120, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(64, 7168, 5120, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(48, 7168, 5120, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(32, 7168, 5120, 128, 8, 104)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(24, 7168, 5120, 128, 8, 104)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 512, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(16, 7168, 5120, 128, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 512, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(8, 7168, 5120, 128, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 512, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4, 7168, 5120, 128, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 512, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2, 7168, 5120, 128, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 512, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(64, 5120, 13824, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(48, 5120, 13824, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(32, 5120, 13824, 64, 8, 104)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(24, 5120, 13824, 64, 8, 104)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(16, 5120, 13824, 64, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(8, 5120, 13824, 64, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4, 5120, 13824, 64, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2, 5120, 13824, 64, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(64, 5120, 13824, 13824, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(48, 5120, 13824, 13824, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(32, 5120, 13824, 13824, 1, 408)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 512, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(24, 5120, 13824, 13824, 1, 408)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 512, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(16, 5120, 13824, 13824, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 512, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(8, 5120, 13824, 13824, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 512, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4, 5120, 13824, 13824, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 512, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2, 5120, 13824, 13824, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 512, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(64, 5120, 13824, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(48, 5120, 13824, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(32, 5120, 13824, 128, 8, 104)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(24, 5120, 13824, 128, 8, 104)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(16, 5120, 13824, 128, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(8, 5120, 13824, 128, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4, 5120, 13824, 128, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2, 5120, 13824, 128, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(64, 27648, 5120, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(48, 27648, 5120, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(32, 27648, 5120, 64, 8, 104)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 512, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 4, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(24, 27648, 5120, 64, 8, 104)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 512, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(16, 27648, 5120, 64, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 512, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(8, 27648, 5120, 64, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 512, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4, 27648, 5120, 64, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 512, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2, 27648, 5120, 64, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 512, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(64, 27648, 5120, 5120, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 2, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(48, 27648, 5120, 5120, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 2, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(32, 27648, 5120, 5120, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 2, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(24, 27648, 5120, 5120, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 2, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(16, 27648, 5120, 5120, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 2, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(8, 27648, 5120, 5120, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 2, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4, 27648, 5120, 5120, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 2, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2, 27648, 5120, 5120, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 2, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(64, 27648, 5120, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(48, 27648, 5120, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(32, 27648, 5120, 128, 8, 104)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 512, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 4, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(24, 27648, 5120, 128, 8, 104)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 512, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(16, 27648, 5120, 128, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 512, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(8, 27648, 5120, 128, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 512, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4, 27648, 5120, 128, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 512, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2, 27648, 5120, 128, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 512, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(64, 2048, 3840, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(48, 2048, 3840, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(32, 2048, 3840, 64, 8, 104)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(24, 2048, 3840, 64, 8, 104)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(16, 2048, 3840, 64, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(8, 2048, 3840, 64, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4, 2048, 3840, 64, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2, 2048, 3840, 64, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(64, 2048, 3840, 3840, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(48, 2048, 3840, 3840, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(32, 2048, 3840, 3840, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(24, 2048, 3840, 3840, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(16, 2048, 3840, 3840, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(8, 2048, 3840, 3840, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4, 2048, 3840, 3840, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 512, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2, 2048, 3840, 3840, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(64, 4096, 3840, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(32, 4096, 3840, 64, 8, 104)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 4, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(16, 4096, 3840, 64, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(8, 4096, 3840, 64, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(64, 4096, 3840, 3840, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(32, 4096, 3840, 3840, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(16, 4096, 3840, 3840, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(8, 4096, 3840, 3840, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(64, 8192, 3840, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 4, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(32, 8192, 3840, 64, 8, 104)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 4, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(16, 8192, 3840, 64, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(8, 8192, 3840, 64, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(64, 8192, 3840, 3840, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(32, 8192, 3840, 3840, 1, 408)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(16, 8192, 3840, 3840, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(8, 8192, 3840, 3840, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(64, 3840, 4096, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(32, 3840, 4096, 64, 8, 104)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(16, 3840, 4096, 64, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(8, 3840, 4096, 64, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(64, 3840, 4096, 4096, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(32, 3840, 4096, 4096, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 512, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(16, 3840, 4096, 4096, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 512, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(8, 3840, 4096, 4096, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 512, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(64, 3840, 15360, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(32, 3840, 15360, 64, 8, 104)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(16, 3840, 15360, 64, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(8, 3840, 15360, 64, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(64, 3840, 15360, 15360, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 512, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(32, 3840, 15360, 15360, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 512, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(16, 3840, 15360, 15360, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 512, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(8, 3840, 15360, 15360, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 512, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(64, 30720, 3840, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(32, 30720, 3840, 64, 8, 104)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 512, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 4, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(16, 30720, 3840, 64, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 512, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 4, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(8, 30720, 3840, 64, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 512, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 4, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(64, 30720, 3840, 3840, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 2, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(32, 30720, 3840, 3840, 1, 408)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 2, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(16, 30720, 3840, 3840, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 2, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(8, 30720, 3840, 3840, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 2, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}}, "GEMM": {"(4096, 4096, 4096, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(3072, 4096, 4096, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2048, 4096, 4096, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1536, 4096, 4096, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1024, 4096, 4096, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(768, 4096, 4096, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(512, 4096, 4096, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(384, 4096, 4096, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(256, 4096, 4096, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(192, 4096, 4096, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(128, 4096, 4096, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(96, 4096, 4096, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4096, 4096, 4096, 4096, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(3072, 4096, 4096, 4096, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2048, 4096, 4096, 4096, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1536, 4096, 4096, 4096, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1024, 4096, 4096, 4096, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(768, 4096, 4096, 4096, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(512, 4096, 4096, 4096, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(384, 4096, 4096, 4096, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(256, 4096, 4096, 4096, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(192, 4096, 4096, 4096, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(128, 4096, 4096, 4096, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(96, 4096, 4096, 4096, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4096, 4096, 4096, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(3072, 4096, 4096, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2048, 4096, 4096, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1536, 4096, 4096, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1024, 4096, 4096, 128, 8, 104)": {"BLOCK_SIZE_M": 256, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(768, 4096, 4096, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(512, 4096, 4096, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(384, 4096, 4096, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(256, 4096, 4096, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(192, 4096, 4096, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(128, 4096, 4096, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(96, 4096, 4096, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4096, 6144, 4096, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(3072, 6144, 4096, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2048, 6144, 4096, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1536, 6144, 4096, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1024, 6144, 4096, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(768, 6144, 4096, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(512, 6144, 4096, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(384, 6144, 4096, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(256, 6144, 4096, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(192, 6144, 4096, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(128, 6144, 4096, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(96, 6144, 4096, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4096, 6144, 4096, 4096, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(3072, 6144, 4096, 4096, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2048, 6144, 4096, 4096, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1536, 6144, 4096, 4096, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1024, 6144, 4096, 4096, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(768, 6144, 4096, 4096, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(512, 6144, 4096, 4096, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(384, 6144, 4096, 4096, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(256, 6144, 4096, 4096, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(192, 6144, 4096, 4096, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(128, 6144, 4096, 4096, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(96, 6144, 4096, 4096, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4096, 6144, 4096, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(3072, 6144, 4096, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2048, 6144, 4096, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1536, 6144, 4096, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1024, 6144, 4096, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(768, 6144, 4096, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(512, 6144, 4096, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(384, 6144, 4096, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(256, 6144, 4096, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(192, 6144, 4096, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(128, 6144, 4096, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(96, 6144, 4096, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4096, 4096, 14336, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(3072, 4096, 14336, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2048, 4096, 14336, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1536, 4096, 14336, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1024, 4096, 14336, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(768, 4096, 14336, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(512, 4096, 14336, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(384, 4096, 14336, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(256, 4096, 14336, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(192, 4096, 14336, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(128, 4096, 14336, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(96, 4096, 14336, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4096, 4096, 14336, 14336, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(3072, 4096, 14336, 14336, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2048, 4096, 14336, 14336, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1536, 4096, 14336, 14336, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1024, 4096, 14336, 14336, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(768, 4096, 14336, 14336, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(512, 4096, 14336, 14336, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(384, 4096, 14336, 14336, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(256, 4096, 14336, 14336, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(192, 4096, 14336, 14336, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(128, 4096, 14336, 14336, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(96, 4096, 14336, 14336, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4096, 4096, 14336, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(3072, 4096, 14336, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2048, 4096, 14336, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1536, 4096, 14336, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1024, 4096, 14336, 128, 8, 104)": {"BLOCK_SIZE_M": 256, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(768, 4096, 14336, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(512, 4096, 14336, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(384, 4096, 14336, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(256, 4096, 14336, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(192, 4096, 14336, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(128, 4096, 14336, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(96, 4096, 14336, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4096, 28672, 4096, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(3072, 28672, 4096, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2048, 28672, 4096, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1536, 28672, 4096, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1024, 28672, 4096, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(768, 28672, 4096, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(512, 28672, 4096, 64, 8, 104)": {"BLOCK_SIZE_M": 256, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(384, 28672, 4096, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(256, 28672, 4096, 64, 8, 104)": {"BLOCK_SIZE_M": 256, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(192, 28672, 4096, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(128, 28672, 4096, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(96, 28672, 4096, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4096, 28672, 4096, 4096, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(3072, 28672, 4096, 4096, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2048, 28672, 4096, 4096, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1536, 28672, 4096, 4096, 1, 408)": {"BLOCK_SIZE_M": 256, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1024, 28672, 4096, 4096, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(768, 28672, 4096, 4096, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(512, 28672, 4096, 4096, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(384, 28672, 4096, 4096, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(256, 28672, 4096, 4096, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(192, 28672, 4096, 4096, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(128, 28672, 4096, 4096, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 512, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 3, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(96, 28672, 4096, 4096, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 512, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 3, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4096, 28672, 4096, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(3072, 28672, 4096, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2048, 28672, 4096, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1536, 28672, 4096, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1024, 28672, 4096, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(768, 28672, 4096, 128, 8, 104)": {"BLOCK_SIZE_M": 256, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(512, 28672, 4096, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(384, 28672, 4096, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(256, 28672, 4096, 128, 8, 104)": {"BLOCK_SIZE_M": 256, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(192, 28672, 4096, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(128, 28672, 4096, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(96, 28672, 4096, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4096, 3584, 3584, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(3072, 3584, 3584, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2048, 3584, 3584, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1536, 3584, 3584, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1024, 3584, 3584, 64, 8, 104)": {"BLOCK_SIZE_M": 256, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(768, 3584, 3584, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(512, 3584, 3584, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(384, 3584, 3584, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(256, 3584, 3584, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(192, 3584, 3584, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(128, 3584, 3584, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(96, 3584, 3584, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4096, 3584, 3584, 3584, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(3072, 3584, 3584, 3584, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2048, 3584, 3584, 3584, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1536, 3584, 3584, 3584, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1024, 3584, 3584, 3584, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(768, 3584, 3584, 3584, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(512, 3584, 3584, 3584, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(384, 3584, 3584, 3584, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(256, 3584, 3584, 3584, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(192, 3584, 3584, 3584, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(128, 3584, 3584, 3584, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(96, 3584, 3584, 3584, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4096, 3584, 3584, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(3072, 3584, 3584, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2048, 3584, 3584, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1536, 3584, 3584, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1024, 3584, 3584, 128, 8, 104)": {"BLOCK_SIZE_M": 256, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(768, 3584, 3584, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(512, 3584, 3584, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(384, 3584, 3584, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(256, 3584, 3584, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(192, 3584, 3584, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(128, 3584, 3584, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(96, 3584, 3584, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4096, 4608, 3584, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(3072, 4608, 3584, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2048, 4608, 3584, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1536, 4608, 3584, 64, 8, 104)": {"BLOCK_SIZE_M": 256, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1024, 4608, 3584, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(768, 4608, 3584, 64, 8, 104)": {"BLOCK_SIZE_M": 256, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(512, 4608, 3584, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(384, 4608, 3584, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(256, 4608, 3584, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(192, 4608, 3584, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(128, 4608, 3584, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(96, 4608, 3584, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4096, 4608, 3584, 3584, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(3072, 4608, 3584, 3584, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2048, 4608, 3584, 3584, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1536, 4608, 3584, 3584, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1024, 4608, 3584, 3584, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(768, 4608, 3584, 3584, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(512, 4608, 3584, 3584, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(384, 4608, 3584, 3584, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(256, 4608, 3584, 3584, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(192, 4608, 3584, 3584, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(128, 4608, 3584, 3584, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(96, 4608, 3584, 3584, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4096, 4608, 3584, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(3072, 4608, 3584, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2048, 4608, 3584, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1536, 4608, 3584, 128, 8, 104)": {"BLOCK_SIZE_M": 256, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1024, 4608, 3584, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(768, 4608, 3584, 128, 8, 104)": {"BLOCK_SIZE_M": 256, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(512, 4608, 3584, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(384, 4608, 3584, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(256, 4608, 3584, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(192, 4608, 3584, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(128, 4608, 3584, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(96, 4608, 3584, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4096, 3584, 18944, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(3072, 3584, 18944, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2048, 3584, 18944, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1536, 3584, 18944, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1024, 3584, 18944, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(768, 3584, 18944, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(512, 3584, 18944, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(384, 3584, 18944, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(256, 3584, 18944, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(192, 3584, 18944, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(128, 3584, 18944, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(96, 3584, 18944, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4096, 3584, 18944, 18944, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(3072, 3584, 18944, 18944, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2048, 3584, 18944, 18944, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1536, 3584, 18944, 18944, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1024, 3584, 18944, 18944, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(768, 3584, 18944, 18944, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(512, 3584, 18944, 18944, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(384, 3584, 18944, 18944, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(256, 3584, 18944, 18944, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(192, 3584, 18944, 18944, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(128, 3584, 18944, 18944, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(96, 3584, 18944, 18944, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4096, 3584, 18944, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(3072, 3584, 18944, 128, 8, 104)": {"BLOCK_SIZE_M": 256, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2048, 3584, 18944, 128, 8, 104)": {"BLOCK_SIZE_M": 256, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1536, 3584, 18944, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1024, 3584, 18944, 128, 8, 104)": {"BLOCK_SIZE_M": 256, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(768, 3584, 18944, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(512, 3584, 18944, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(384, 3584, 18944, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(256, 3584, 18944, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(192, 3584, 18944, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(128, 3584, 18944, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(96, 3584, 18944, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4096, 37888, 3584, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(3072, 37888, 3584, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2048, 37888, 3584, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1536, 37888, 3584, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1024, 37888, 3584, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(768, 37888, 3584, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(512, 37888, 3584, 64, 8, 104)": {"BLOCK_SIZE_M": 256, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(384, 37888, 3584, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(256, 37888, 3584, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(192, 37888, 3584, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(128, 37888, 3584, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(96, 37888, 3584, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4096, 37888, 3584, 3584, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(3072, 37888, 3584, 3584, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2048, 37888, 3584, 3584, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1536, 37888, 3584, 3584, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1024, 37888, 3584, 3584, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(768, 37888, 3584, 3584, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(512, 37888, 3584, 3584, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(384, 37888, 3584, 3584, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(256, 37888, 3584, 3584, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(192, 37888, 3584, 3584, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(128, 37888, 3584, 3584, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(96, 37888, 3584, 3584, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4096, 37888, 3584, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(3072, 37888, 3584, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2048, 37888, 3584, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1536, 37888, 3584, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1024, 37888, 3584, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(768, 37888, 3584, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(512, 37888, 3584, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(384, 37888, 3584, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(256, 37888, 3584, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(192, 37888, 3584, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(128, 37888, 3584, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(96, 37888, 3584, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4096, 3072, 3072, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(3072, 3072, 3072, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2048, 3072, 3072, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1536, 3072, 3072, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1024, 3072, 3072, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(768, 3072, 3072, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(512, 3072, 3072, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(384, 3072, 3072, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(256, 3072, 3072, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(192, 3072, 3072, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(128, 3072, 3072, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(96, 3072, 3072, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4096, 3072, 3072, 3072, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(3072, 3072, 3072, 3072, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2048, 3072, 3072, 3072, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1536, 3072, 3072, 3072, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1024, 3072, 3072, 3072, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(768, 3072, 3072, 3072, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(512, 3072, 3072, 3072, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(384, 3072, 3072, 3072, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(256, 3072, 3072, 3072, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(192, 3072, 3072, 3072, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(128, 3072, 3072, 3072, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(96, 3072, 3072, 3072, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4096, 3072, 3072, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(3072, 3072, 3072, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2048, 3072, 3072, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1536, 3072, 3072, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1024, 3072, 3072, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(768, 3072, 3072, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(512, 3072, 3072, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(384, 3072, 3072, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(256, 3072, 3072, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(192, 3072, 3072, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(128, 3072, 3072, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(96, 3072, 3072, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4096, 5120, 3072, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(3072, 5120, 3072, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2048, 5120, 3072, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1536, 5120, 3072, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1024, 5120, 3072, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(768, 5120, 3072, 64, 8, 104)": {"BLOCK_SIZE_M": 256, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(512, 5120, 3072, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(384, 5120, 3072, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(256, 5120, 3072, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(192, 5120, 3072, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(128, 5120, 3072, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(96, 5120, 3072, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4096, 1024, 4096, 64, 8, 104)": {"BLOCK_SIZE_M": 256, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(3072, 1024, 4096, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2048, 1024, 4096, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1536, 1024, 4096, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1024, 1024, 4096, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(768, 1024, 4096, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(512, 1024, 4096, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(384, 1024, 4096, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(256, 1024, 4096, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(192, 1024, 4096, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(128, 1024, 4096, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(96, 1024, 4096, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4096, 1024, 4096, 4096, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(3072, 1024, 4096, 4096, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2048, 1024, 4096, 4096, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1536, 1024, 4096, 4096, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1024, 1024, 4096, 4096, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(768, 1024, 4096, 4096, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(512, 1024, 4096, 4096, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(384, 1024, 4096, 4096, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(256, 1024, 4096, 4096, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(192, 1024, 4096, 4096, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(128, 1024, 4096, 4096, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(96, 1024, 4096, 4096, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4096, 1024, 4096, 128, 8, 104)": {"BLOCK_SIZE_M": 256, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(3072, 1024, 4096, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2048, 1024, 4096, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1536, 1024, 4096, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1024, 1024, 4096, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(768, 1024, 4096, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(512, 1024, 4096, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(384, 1024, 4096, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(256, 1024, 4096, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(192, 1024, 4096, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(128, 1024, 4096, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(96, 1024, 4096, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4096, 14336, 4096, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(3072, 14336, 4096, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2048, 14336, 4096, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1536, 14336, 4096, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1024, 14336, 4096, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(768, 14336, 4096, 64, 8, 104)": {"BLOCK_SIZE_M": 256, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(512, 14336, 4096, 64, 8, 104)": {"BLOCK_SIZE_M": 256, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(384, 14336, 4096, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(256, 14336, 4096, 64, 8, 104)": {"BLOCK_SIZE_M": 256, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(192, 14336, 4096, 64, 8, 104)": {"BLOCK_SIZE_M": 256, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(128, 14336, 4096, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(96, 14336, 4096, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4096, 14336, 4096, 4096, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(3072, 14336, 4096, 4096, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2048, 14336, 4096, 4096, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1536, 14336, 4096, 4096, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1024, 14336, 4096, 4096, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(768, 14336, 4096, 4096, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(512, 14336, 4096, 4096, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(384, 14336, 4096, 4096, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(256, 14336, 4096, 4096, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(192, 14336, 4096, 4096, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(128, 14336, 4096, 4096, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(96, 14336, 4096, 4096, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4096, 14336, 4096, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(3072, 14336, 4096, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2048, 14336, 4096, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1536, 14336, 4096, 128, 8, 104)": {"BLOCK_SIZE_M": 256, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1024, 14336, 4096, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(768, 14336, 4096, 128, 8, 104)": {"BLOCK_SIZE_M": 256, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(512, 14336, 4096, 128, 8, 104)": {"BLOCK_SIZE_M": 256, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(384, 14336, 4096, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(256, 14336, 4096, 128, 8, 104)": {"BLOCK_SIZE_M": 256, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(192, 14336, 4096, 128, 8, 104)": {"BLOCK_SIZE_M": 256, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(128, 14336, 4096, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(96, 14336, 4096, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4096, 512, 3584, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(3072, 512, 3584, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2048, 512, 3584, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1536, 512, 3584, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1024, 512, 3584, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(768, 512, 3584, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(512, 512, 3584, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(384, 512, 3584, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(256, 512, 3584, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(192, 512, 3584, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(128, 512, 3584, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(96, 512, 3584, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4096, 512, 3584, 3584, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(3072, 512, 3584, 3584, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2048, 512, 3584, 3584, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1536, 512, 3584, 3584, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1024, 512, 3584, 3584, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(768, 512, 3584, 3584, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(512, 512, 3584, 3584, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(384, 512, 3584, 3584, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(256, 512, 3584, 3584, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(192, 512, 3584, 3584, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(128, 512, 3584, 3584, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(96, 512, 3584, 3584, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4096, 512, 3584, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(3072, 512, 3584, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2048, 512, 3584, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1536, 512, 3584, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1024, 512, 3584, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(768, 512, 3584, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(512, 512, 3584, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(384, 512, 3584, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(256, 512, 3584, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(192, 512, 3584, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(128, 512, 3584, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(96, 512, 3584, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4096, 18944, 3584, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(3072, 18944, 3584, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2048, 18944, 3584, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1536, 18944, 3584, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1024, 18944, 3584, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(768, 18944, 3584, 64, 8, 104)": {"BLOCK_SIZE_M": 256, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(512, 18944, 3584, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(384, 18944, 3584, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(256, 18944, 3584, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(192, 18944, 3584, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(128, 18944, 3584, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(96, 18944, 3584, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4096, 18944, 3584, 3584, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(3072, 18944, 3584, 3584, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2048, 18944, 3584, 3584, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1536, 18944, 3584, 3584, 1, 408)": {"BLOCK_SIZE_M": 256, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1024, 18944, 3584, 3584, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(768, 18944, 3584, 3584, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(512, 18944, 3584, 3584, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(384, 18944, 3584, 3584, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(256, 18944, 3584, 3584, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(192, 18944, 3584, 3584, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(128, 18944, 3584, 3584, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(96, 18944, 3584, 3584, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4096, 18944, 3584, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(3072, 18944, 3584, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2048, 18944, 3584, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1536, 18944, 3584, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1024, 18944, 3584, 128, 8, 104)": {"BLOCK_SIZE_M": 256, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(768, 18944, 3584, 128, 8, 104)": {"BLOCK_SIZE_M": 256, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(512, 18944, 3584, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(384, 18944, 3584, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(256, 18944, 3584, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(192, 18944, 3584, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(128, 18944, 3584, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(96, 18944, 3584, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4096, 5120, 3072, 3072, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(3072, 5120, 3072, 3072, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2048, 5120, 3072, 3072, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1536, 5120, 3072, 3072, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1024, 5120, 3072, 3072, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(768, 5120, 3072, 3072, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(512, 5120, 3072, 3072, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(384, 5120, 3072, 3072, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(256, 5120, 3072, 3072, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(192, 5120, 3072, 3072, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(128, 5120, 3072, 3072, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(96, 5120, 3072, 3072, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4096, 5120, 3072, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(3072, 5120, 3072, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2048, 5120, 3072, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1536, 5120, 3072, 128, 8, 104)": {"BLOCK_SIZE_M": 256, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1024, 5120, 3072, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(768, 5120, 3072, 128, 8, 104)": {"BLOCK_SIZE_M": 256, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(512, 5120, 3072, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(384, 5120, 3072, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(256, 5120, 3072, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(192, 5120, 3072, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(128, 5120, 3072, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(96, 5120, 3072, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4096, 3072, 8192, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(3072, 3072, 8192, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2048, 3072, 8192, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1536, 3072, 8192, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1024, 3072, 8192, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(768, 3072, 8192, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(512, 3072, 8192, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(384, 3072, 8192, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(256, 3072, 8192, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(192, 3072, 8192, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(128, 3072, 8192, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(96, 3072, 8192, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4096, 3072, 8192, 8192, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(3072, 3072, 8192, 8192, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2048, 3072, 8192, 8192, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1536, 3072, 8192, 8192, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1024, 3072, 8192, 8192, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(768, 3072, 8192, 8192, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(512, 3072, 8192, 8192, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(384, 3072, 8192, 8192, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(256, 3072, 8192, 8192, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(192, 3072, 8192, 8192, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(128, 3072, 8192, 8192, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(96, 3072, 8192, 8192, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4096, 3072, 8192, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(3072, 3072, 8192, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2048, 3072, 8192, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1536, 3072, 8192, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1024, 3072, 8192, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(768, 3072, 8192, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(512, 3072, 8192, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(384, 3072, 8192, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(256, 3072, 8192, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(192, 3072, 8192, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(128, 3072, 8192, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(96, 3072, 8192, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4096, 16384, 3072, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(3072, 16384, 3072, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2048, 16384, 3072, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1536, 16384, 3072, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1024, 16384, 3072, 64, 8, 104)": {"BLOCK_SIZE_M": 256, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(768, 16384, 3072, 64, 8, 104)": {"BLOCK_SIZE_M": 256, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(512, 16384, 3072, 64, 8, 104)": {"BLOCK_SIZE_M": 256, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(384, 16384, 3072, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(256, 16384, 3072, 64, 8, 104)": {"BLOCK_SIZE_M": 256, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(192, 16384, 3072, 64, 8, 104)": {"BLOCK_SIZE_M": 256, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(128, 16384, 3072, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(96, 16384, 3072, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4096, 16384, 3072, 3072, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(3072, 16384, 3072, 3072, 1, 408)": {"BLOCK_SIZE_M": 256, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2048, 16384, 3072, 3072, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1536, 16384, 3072, 3072, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1024, 16384, 3072, 3072, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(768, 16384, 3072, 3072, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(512, 16384, 3072, 3072, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(384, 16384, 3072, 3072, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(256, 16384, 3072, 3072, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(192, 16384, 3072, 3072, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(128, 16384, 3072, 3072, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(96, 16384, 3072, 3072, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4096, 16384, 3072, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(3072, 16384, 3072, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2048, 16384, 3072, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1536, 16384, 3072, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1024, 16384, 3072, 128, 8, 104)": {"BLOCK_SIZE_M": 256, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(768, 16384, 3072, 128, 8, 104)": {"BLOCK_SIZE_M": 256, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(512, 16384, 3072, 128, 8, 104)": {"BLOCK_SIZE_M": 256, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(384, 16384, 3072, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(256, 16384, 3072, 128, 8, 104)": {"BLOCK_SIZE_M": 256, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(192, 16384, 3072, 128, 8, 104)": {"BLOCK_SIZE_M": 256, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(128, 16384, 3072, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(96, 16384, 3072, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4096, 2048, 2048, 64, 8, 104)": {"BLOCK_SIZE_M": 256, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(3072, 2048, 2048, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2048, 2048, 2048, 64, 8, 104)": {"BLOCK_SIZE_M": 256, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1536, 2048, 2048, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1024, 2048, 2048, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(768, 2048, 2048, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(512, 2048, 2048, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(384, 2048, 2048, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(256, 2048, 2048, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(192, 2048, 2048, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(128, 2048, 2048, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(96, 2048, 2048, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4096, 2048, 2048, 2048, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(3072, 2048, 2048, 2048, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2048, 2048, 2048, 2048, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1536, 2048, 2048, 2048, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1024, 2048, 2048, 2048, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(768, 2048, 2048, 2048, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(512, 2048, 2048, 2048, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(384, 2048, 2048, 2048, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(256, 2048, 2048, 2048, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(192, 2048, 2048, 2048, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(128, 2048, 2048, 2048, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(96, 2048, 2048, 2048, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4096, 2048, 2048, 128, 8, 104)": {"BLOCK_SIZE_M": 256, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(3072, 2048, 2048, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2048, 2048, 2048, 128, 8, 104)": {"BLOCK_SIZE_M": 256, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1536, 2048, 2048, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1024, 2048, 2048, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(768, 2048, 2048, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(512, 2048, 2048, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(384, 2048, 2048, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(256, 2048, 2048, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(192, 2048, 2048, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(128, 2048, 2048, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(96, 2048, 2048, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4096, 2560, 2048, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(3072, 2560, 2048, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2048, 2560, 2048, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1536, 2560, 2048, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1024, 2560, 2048, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(768, 2560, 2048, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(512, 2560, 2048, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(384, 2560, 2048, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(256, 2560, 2048, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(192, 2560, 2048, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(128, 2560, 2048, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(96, 2560, 2048, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4096, 2560, 2048, 2048, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(3072, 2560, 2048, 2048, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2048, 2560, 2048, 2048, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1536, 2560, 2048, 2048, 1, 408)": {"BLOCK_SIZE_M": 256, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1024, 2560, 2048, 2048, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(768, 2560, 2048, 2048, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(512, 2560, 2048, 2048, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(384, 2560, 2048, 2048, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(256, 2560, 2048, 2048, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(192, 2560, 2048, 2048, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(128, 2560, 2048, 2048, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(96, 2560, 2048, 2048, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4096, 2560, 2048, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(3072, 2560, 2048, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2048, 2560, 2048, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1536, 2560, 2048, 128, 8, 104)": {"BLOCK_SIZE_M": 256, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1024, 2560, 2048, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(768, 2560, 2048, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(512, 2560, 2048, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(384, 2560, 2048, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(256, 2560, 2048, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(192, 2560, 2048, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(128, 2560, 2048, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(96, 2560, 2048, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4096, 2048, 11008, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(3072, 2048, 11008, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2048, 2048, 11008, 64, 8, 104)": {"BLOCK_SIZE_M": 256, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1536, 2048, 11008, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1024, 2048, 11008, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(768, 2048, 11008, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(512, 2048, 11008, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(384, 2048, 11008, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(256, 2048, 11008, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(192, 2048, 11008, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(128, 2048, 11008, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(96, 2048, 11008, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4096, 2048, 11008, 11008, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(3072, 2048, 11008, 11008, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2048, 2048, 11008, 11008, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1536, 2048, 11008, 11008, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1024, 2048, 11008, 11008, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(768, 2048, 11008, 11008, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(512, 2048, 11008, 11008, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(384, 2048, 11008, 11008, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(256, 2048, 11008, 11008, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(192, 2048, 11008, 11008, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(128, 2048, 11008, 11008, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 512, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(96, 2048, 11008, 11008, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 512, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4096, 2048, 11008, 128, 8, 104)": {"BLOCK_SIZE_M": 256, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(3072, 2048, 11008, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2048, 2048, 11008, 128, 8, 104)": {"BLOCK_SIZE_M": 256, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1536, 2048, 11008, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1024, 2048, 11008, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(768, 2048, 11008, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(512, 2048, 11008, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(384, 2048, 11008, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(256, 2048, 11008, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(192, 2048, 11008, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(128, 2048, 11008, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(96, 2048, 11008, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4096, 22016, 2048, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(3072, 22016, 2048, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2048, 22016, 2048, 64, 8, 104)": {"BLOCK_SIZE_M": 256, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1536, 22016, 2048, 64, 8, 104)": {"BLOCK_SIZE_M": 256, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1024, 22016, 2048, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(768, 22016, 2048, 64, 8, 104)": {"BLOCK_SIZE_M": 256, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(512, 22016, 2048, 64, 8, 104)": {"BLOCK_SIZE_M": 256, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(384, 22016, 2048, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(256, 22016, 2048, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(192, 22016, 2048, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(128, 22016, 2048, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(96, 22016, 2048, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4096, 22016, 2048, 2048, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(3072, 22016, 2048, 2048, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2048, 22016, 2048, 2048, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1536, 22016, 2048, 2048, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1024, 22016, 2048, 2048, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(768, 22016, 2048, 2048, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(512, 22016, 2048, 2048, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(384, 22016, 2048, 2048, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(256, 22016, 2048, 2048, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(192, 22016, 2048, 2048, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 512, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 3, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(128, 22016, 2048, 2048, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(96, 22016, 2048, 2048, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4096, 22016, 2048, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(3072, 22016, 2048, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2048, 22016, 2048, 128, 8, 104)": {"BLOCK_SIZE_M": 256, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1536, 22016, 2048, 128, 8, 104)": {"BLOCK_SIZE_M": 256, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1024, 22016, 2048, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(768, 22016, 2048, 128, 8, 104)": {"BLOCK_SIZE_M": 256, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(512, 22016, 2048, 128, 8, 104)": {"BLOCK_SIZE_M": 256, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(384, 22016, 2048, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(256, 22016, 2048, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(192, 22016, 2048, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(128, 22016, 2048, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(96, 22016, 2048, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4096, 5120, 5120, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(3072, 5120, 5120, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2048, 5120, 5120, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1536, 5120, 5120, 64, 8, 104)": {"BLOCK_SIZE_M": 256, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1024, 5120, 5120, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(768, 5120, 5120, 64, 8, 104)": {"BLOCK_SIZE_M": 256, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(512, 5120, 5120, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(384, 5120, 5120, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(256, 5120, 5120, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(192, 5120, 5120, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(128, 5120, 5120, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(96, 5120, 5120, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4096, 5120, 5120, 5120, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(3072, 5120, 5120, 5120, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2048, 5120, 5120, 5120, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1536, 5120, 5120, 5120, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1024, 5120, 5120, 5120, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(768, 5120, 5120, 5120, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(512, 5120, 5120, 5120, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(384, 5120, 5120, 5120, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(256, 5120, 5120, 5120, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(192, 5120, 5120, 5120, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(128, 5120, 5120, 5120, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(96, 5120, 5120, 5120, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4096, 5120, 5120, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(3072, 5120, 5120, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2048, 5120, 5120, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1536, 5120, 5120, 128, 8, 104)": {"BLOCK_SIZE_M": 256, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1024, 5120, 5120, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(768, 5120, 5120, 128, 8, 104)": {"BLOCK_SIZE_M": 256, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(512, 5120, 5120, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(384, 5120, 5120, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(256, 5120, 5120, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(192, 5120, 5120, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(128, 5120, 5120, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(96, 5120, 5120, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4096, 7168, 5120, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(3072, 7168, 5120, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2048, 7168, 5120, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1536, 7168, 5120, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1024, 7168, 5120, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(768, 7168, 5120, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(512, 7168, 5120, 64, 8, 104)": {"BLOCK_SIZE_M": 256, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(384, 7168, 5120, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(256, 7168, 5120, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(192, 7168, 5120, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(128, 7168, 5120, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(96, 7168, 5120, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4096, 7168, 5120, 5120, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(3072, 7168, 5120, 5120, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2048, 7168, 5120, 5120, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1536, 7168, 5120, 5120, 1, 408)": {"BLOCK_SIZE_M": 256, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1024, 7168, 5120, 5120, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(768, 7168, 5120, 5120, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(512, 7168, 5120, 5120, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(384, 7168, 5120, 5120, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(256, 7168, 5120, 5120, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(192, 7168, 5120, 5120, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(128, 7168, 5120, 5120, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(96, 7168, 5120, 5120, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4096, 7168, 5120, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(3072, 7168, 5120, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2048, 7168, 5120, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1536, 7168, 5120, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1024, 7168, 5120, 128, 8, 104)": {"BLOCK_SIZE_M": 256, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(768, 7168, 5120, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(512, 7168, 5120, 128, 8, 104)": {"BLOCK_SIZE_M": 256, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(384, 7168, 5120, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(256, 7168, 5120, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(192, 7168, 5120, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(128, 7168, 5120, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(96, 7168, 5120, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4096, 5120, 13824, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(3072, 5120, 13824, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2048, 5120, 13824, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1536, 5120, 13824, 64, 8, 104)": {"BLOCK_SIZE_M": 256, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1024, 5120, 13824, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(768, 5120, 13824, 64, 8, 104)": {"BLOCK_SIZE_M": 256, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(512, 5120, 13824, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(384, 5120, 13824, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(256, 5120, 13824, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(192, 5120, 13824, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(128, 5120, 13824, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(96, 5120, 13824, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4096, 5120, 13824, 13824, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(3072, 5120, 13824, 13824, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2048, 5120, 13824, 13824, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1536, 5120, 13824, 13824, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1024, 5120, 13824, 13824, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(768, 5120, 13824, 13824, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(512, 5120, 13824, 13824, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(384, 5120, 13824, 13824, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(256, 5120, 13824, 13824, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(192, 5120, 13824, 13824, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(128, 5120, 13824, 13824, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(96, 5120, 13824, 13824, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4096, 5120, 13824, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(3072, 5120, 13824, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2048, 5120, 13824, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1536, 5120, 13824, 128, 8, 104)": {"BLOCK_SIZE_M": 256, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1024, 5120, 13824, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(768, 5120, 13824, 128, 8, 104)": {"BLOCK_SIZE_M": 256, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(512, 5120, 13824, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(384, 5120, 13824, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(256, 5120, 13824, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(192, 5120, 13824, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(128, 5120, 13824, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(96, 5120, 13824, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4096, 27648, 5120, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(3072, 27648, 5120, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2048, 27648, 5120, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1536, 27648, 5120, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1024, 27648, 5120, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(768, 27648, 5120, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(512, 27648, 5120, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(384, 27648, 5120, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(256, 27648, 5120, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(192, 27648, 5120, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(128, 27648, 5120, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(96, 27648, 5120, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4096, 27648, 5120, 5120, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(3072, 27648, 5120, 5120, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2048, 27648, 5120, 5120, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1536, 27648, 5120, 5120, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1024, 27648, 5120, 5120, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(768, 27648, 5120, 5120, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(512, 27648, 5120, 5120, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(384, 27648, 5120, 5120, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(256, 27648, 5120, 5120, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(192, 27648, 5120, 5120, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(128, 27648, 5120, 5120, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 512, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 3, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(96, 27648, 5120, 5120, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 512, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 3, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4096, 27648, 5120, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(3072, 27648, 5120, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2048, 27648, 5120, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1536, 27648, 5120, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1024, 27648, 5120, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(768, 27648, 5120, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(512, 27648, 5120, 128, 8, 104)": {"BLOCK_SIZE_M": 256, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(384, 27648, 5120, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(256, 27648, 5120, 128, 8, 104)": {"BLOCK_SIZE_M": 256, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(192, 27648, 5120, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(128, 27648, 5120, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(96, 27648, 5120, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4096, 2048, 3840, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(3072, 2048, 3840, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2048, 2048, 3840, 64, 8, 104)": {"BLOCK_SIZE_M": 256, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1536, 2048, 3840, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1024, 2048, 3840, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(768, 2048, 3840, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(512, 2048, 3840, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(384, 2048, 3840, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(256, 2048, 3840, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(192, 2048, 3840, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(128, 2048, 3840, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(96, 2048, 3840, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4096, 2048, 3840, 3840, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(3072, 2048, 3840, 3840, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2048, 2048, 3840, 3840, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1536, 2048, 3840, 3840, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1024, 2048, 3840, 3840, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(768, 2048, 3840, 3840, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(512, 2048, 3840, 3840, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(384, 2048, 3840, 3840, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(256, 2048, 3840, 3840, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(192, 2048, 3840, 3840, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(128, 2048, 3840, 3840, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(96, 2048, 3840, 3840, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(512, 4096, 3840, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(128, 4096, 3840, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(512, 4096, 3840, 3840, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(128, 4096, 3840, 3840, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(512, 8192, 3840, 64, 8, 104)": {"BLOCK_SIZE_M": 256, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(128, 8192, 3840, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(512, 8192, 3840, 3840, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(128, 8192, 3840, 3840, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(512, 3840, 4096, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(128, 3840, 4096, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(512, 3840, 4096, 4096, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(128, 3840, 4096, 4096, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(512, 3840, 15360, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(128, 3840, 15360, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(512, 3840, 15360, 15360, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(128, 3840, 15360, 15360, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(512, 30720, 3840, 64, 8, 104)": {"BLOCK_SIZE_M": 256, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(128, 30720, 3840, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(512, 30720, 3840, 3840, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(128, 30720, 3840, 3840, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 512, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 3, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(512, 3072, 3072, 128, 8, 101)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "NUM_STAGES": 4, "num_warps": 4, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}}} \ No newline at end of file diff --git a/image/gemlite/prism-ml/bonsai-image-binary-4B-gemlite-1bit/transformer-gemlite-int1/quantization_config.json b/image/gemlite/prism-ml/bonsai-image-binary-4B-gemlite-1bit/transformer-gemlite-int1/quantization_config.json new file mode 100644 index 0000000..21dec65 --- /dev/null +++ b/image/gemlite/prism-ml/bonsai-image-binary-4B-gemlite-1bit/transformer-gemlite-int1/quantization_config.json @@ -0,0 +1,162 @@ +{ + "format": "gemlite-int1-g128", + "bits": 1, + "group_size": 128, + "packing_bitwidth": 8, + "input_dtype": "fp16", + "output_dtype": "fp16", + "skip_patterns": [ + "proj_out", + "x_embedder", + "context_embedder", + "time_text_embed", + "time_guidance_embed", + "norm_out", + "double_stream_modulation_img", + "double_stream_modulation_txt", + "single_stream_modulation" + ], + "quantized_count": 100, + "skipped_count": 9, + "quantized_fqns": [ + "transformer_blocks.0.attn.to_q", + "transformer_blocks.0.attn.to_k", + "transformer_blocks.0.attn.to_v", + "transformer_blocks.0.attn.add_q_proj", + "transformer_blocks.0.attn.add_k_proj", + "transformer_blocks.0.attn.add_v_proj", + "transformer_blocks.0.attn.to_add_out", + "transformer_blocks.0.attn.to_out.0", + "transformer_blocks.0.ff.linear_in", + "transformer_blocks.0.ff.linear_out", + "transformer_blocks.0.ff_context.linear_in", + "transformer_blocks.0.ff_context.linear_out", + "transformer_blocks.1.attn.to_q", + "transformer_blocks.1.attn.to_k", + "transformer_blocks.1.attn.to_v", + "transformer_blocks.1.attn.add_q_proj", + "transformer_blocks.1.attn.add_k_proj", + "transformer_blocks.1.attn.add_v_proj", + "transformer_blocks.1.attn.to_add_out", + "transformer_blocks.1.attn.to_out.0", + "transformer_blocks.1.ff.linear_in", + "transformer_blocks.1.ff.linear_out", + "transformer_blocks.1.ff_context.linear_in", + "transformer_blocks.1.ff_context.linear_out", + "transformer_blocks.2.attn.to_q", + "transformer_blocks.2.attn.to_k", + "transformer_blocks.2.attn.to_v", + "transformer_blocks.2.attn.add_q_proj", + "transformer_blocks.2.attn.add_k_proj", + "transformer_blocks.2.attn.add_v_proj", + "transformer_blocks.2.attn.to_add_out", + "transformer_blocks.2.attn.to_out.0", + "transformer_blocks.2.ff.linear_in", + "transformer_blocks.2.ff.linear_out", + "transformer_blocks.2.ff_context.linear_in", + "transformer_blocks.2.ff_context.linear_out", + "transformer_blocks.3.attn.to_q", + "transformer_blocks.3.attn.to_k", + "transformer_blocks.3.attn.to_v", + "transformer_blocks.3.attn.add_q_proj", + "transformer_blocks.3.attn.add_k_proj", + "transformer_blocks.3.attn.add_v_proj", + "transformer_blocks.3.attn.to_add_out", + "transformer_blocks.3.attn.to_out.0", + "transformer_blocks.3.ff.linear_in", + "transformer_blocks.3.ff.linear_out", + "transformer_blocks.3.ff_context.linear_in", + "transformer_blocks.3.ff_context.linear_out", + "transformer_blocks.4.attn.to_q", + "transformer_blocks.4.attn.to_k", + "transformer_blocks.4.attn.to_v", + "transformer_blocks.4.attn.add_q_proj", + "transformer_blocks.4.attn.add_k_proj", + "transformer_blocks.4.attn.add_v_proj", + "transformer_blocks.4.attn.to_add_out", + "transformer_blocks.4.attn.to_out.0", + "transformer_blocks.4.ff.linear_in", + "transformer_blocks.4.ff.linear_out", + "transformer_blocks.4.ff_context.linear_in", + "transformer_blocks.4.ff_context.linear_out", + "single_transformer_blocks.0.attn.to_qkv_mlp_proj", + "single_transformer_blocks.0.attn.to_out", + "single_transformer_blocks.1.attn.to_qkv_mlp_proj", + "single_transformer_blocks.1.attn.to_out", + "single_transformer_blocks.2.attn.to_qkv_mlp_proj", + "single_transformer_blocks.2.attn.to_out", + "single_transformer_blocks.3.attn.to_qkv_mlp_proj", + "single_transformer_blocks.3.attn.to_out", + "single_transformer_blocks.4.attn.to_qkv_mlp_proj", + "single_transformer_blocks.4.attn.to_out", + "single_transformer_blocks.5.attn.to_qkv_mlp_proj", + "single_transformer_blocks.5.attn.to_out", + "single_transformer_blocks.6.attn.to_qkv_mlp_proj", + "single_transformer_blocks.6.attn.to_out", + "single_transformer_blocks.7.attn.to_qkv_mlp_proj", + "single_transformer_blocks.7.attn.to_out", + "single_transformer_blocks.8.attn.to_qkv_mlp_proj", + "single_transformer_blocks.8.attn.to_out", + "single_transformer_blocks.9.attn.to_qkv_mlp_proj", + "single_transformer_blocks.9.attn.to_out", + "single_transformer_blocks.10.attn.to_qkv_mlp_proj", + "single_transformer_blocks.10.attn.to_out", + "single_transformer_blocks.11.attn.to_qkv_mlp_proj", + "single_transformer_blocks.11.attn.to_out", + "single_transformer_blocks.12.attn.to_qkv_mlp_proj", + "single_transformer_blocks.12.attn.to_out", + "single_transformer_blocks.13.attn.to_qkv_mlp_proj", + "single_transformer_blocks.13.attn.to_out", + "single_transformer_blocks.14.attn.to_qkv_mlp_proj", + "single_transformer_blocks.14.attn.to_out", + "single_transformer_blocks.15.attn.to_qkv_mlp_proj", + "single_transformer_blocks.15.attn.to_out", + "single_transformer_blocks.16.attn.to_qkv_mlp_proj", + "single_transformer_blocks.16.attn.to_out", + "single_transformer_blocks.17.attn.to_qkv_mlp_proj", + "single_transformer_blocks.17.attn.to_out", + "single_transformer_blocks.18.attn.to_qkv_mlp_proj", + "single_transformer_blocks.18.attn.to_out", + "single_transformer_blocks.19.attn.to_qkv_mlp_proj", + "single_transformer_blocks.19.attn.to_out" + ], + "skipped": [ + { + "fqn": "x_embedder", + "reason": "x_embedder" + }, + { + "fqn": "context_embedder", + "reason": "context_embedder" + }, + { + "fqn": "proj_out", + "reason": "proj_out" + }, + { + "fqn": "time_guidance_embed.timestep_embedder.linear_1", + "reason": "time_guidance_embed" + }, + { + "fqn": "time_guidance_embed.timestep_embedder.linear_2", + "reason": "time_guidance_embed" + }, + { + "fqn": "double_stream_modulation_img.linear", + "reason": "double_stream_modulation_img" + }, + { + "fqn": "double_stream_modulation_txt.linear", + "reason": "double_stream_modulation_txt" + }, + { + "fqn": "single_stream_modulation.linear", + "reason": "single_stream_modulation" + }, + { + "fqn": "norm_out.linear", + "reason": "norm_out" + } + ], + "pack_seconds": 128.37 +} \ No newline at end of file diff --git a/image/gemlite/prism-ml/bonsai-image-binary-4B-gemlite-1bit/transformer-gemlite-int1/state_dict.pt b/image/gemlite/prism-ml/bonsai-image-binary-4B-gemlite-1bit/transformer-gemlite-int1/state_dict.pt new file mode 100644 index 0000000..9161a37 --- /dev/null +++ b/image/gemlite/prism-ml/bonsai-image-binary-4B-gemlite-1bit/transformer-gemlite-int1/state_dict.pt @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:d5b455b11958fc92ed8dd7558072252d6ca8d1acb4fcc69281fb61b771f7c8e0 +size 1080394762 diff --git a/image/gemlite/prism-ml/bonsai-image-binary-4B-gemlite-1bit/vae/config.json b/image/gemlite/prism-ml/bonsai-image-binary-4B-gemlite-1bit/vae/config.json new file mode 100644 index 0000000..2f6c253 --- /dev/null +++ b/image/gemlite/prism-ml/bonsai-image-binary-4B-gemlite-1bit/vae/config.json @@ -0,0 +1,41 @@ +{ + "_class_name": "AutoencoderKLFlux2", + "_diffusers_version": "0.37.1", + "_name_or_path": "black-forest-labs/FLUX.2-klein-base-4B", + "act_fn": "silu", + "batch_norm_eps": 0.0001, + "batch_norm_momentum": 0.1, + "block_out_channels": [ + 128, + 256, + 512, + 512 + ], + "decoder_block_out_channels": null, + "down_block_types": [ + "DownEncoderBlock2D", + "DownEncoderBlock2D", + "DownEncoderBlock2D", + "DownEncoderBlock2D" + ], + "force_upcast": true, + "in_channels": 3, + "latent_channels": 32, + "layers_per_block": 2, + "mid_block_add_attention": true, + "norm_num_groups": 32, + "out_channels": 3, + "patch_size": [ + 2, + 2 + ], + "sample_size": 1024, + "up_block_types": [ + "UpDecoderBlock2D", + "UpDecoderBlock2D", + "UpDecoderBlock2D", + "UpDecoderBlock2D" + ], + "use_post_quant_conv": true, + "use_quant_conv": true +} diff --git a/image/gemlite/prism-ml/bonsai-image-binary-4B-gemlite-1bit/vae/diffusion_pytorch_model.safetensors b/image/gemlite/prism-ml/bonsai-image-binary-4B-gemlite-1bit/vae/diffusion_pytorch_model.safetensors new file mode 100644 index 0000000..0654e17 --- /dev/null +++ b/image/gemlite/prism-ml/bonsai-image-binary-4B-gemlite-1bit/vae/diffusion_pytorch_model.safetensors @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:ca70d2202afe6415bdbcb8793ba8cd99fd159cfe6192381504d6c4d3036e0f04 +size 168120878 diff --git a/image/gemlite/prism-ml/bonsai-image-ternary-4B-gemlite-2bit/.gitattributes b/image/gemlite/prism-ml/bonsai-image-ternary-4B-gemlite-2bit/.gitattributes new file mode 100644 index 0000000..6ae3e2f --- /dev/null +++ b/image/gemlite/prism-ml/bonsai-image-ternary-4B-gemlite-2bit/.gitattributes @@ -0,0 +1,36 @@ +*.7z filter=lfs diff=lfs merge=lfs -text +*.arrow filter=lfs diff=lfs merge=lfs -text +*.bin filter=lfs diff=lfs merge=lfs -text +*.bz2 filter=lfs diff=lfs merge=lfs -text +*.ckpt filter=lfs diff=lfs merge=lfs -text +*.ftz filter=lfs diff=lfs merge=lfs -text +*.gz filter=lfs diff=lfs merge=lfs -text +*.h5 filter=lfs diff=lfs merge=lfs -text +*.joblib filter=lfs diff=lfs merge=lfs -text +*.lfs.* filter=lfs diff=lfs merge=lfs -text +*.mlmodel filter=lfs diff=lfs merge=lfs -text +*.model filter=lfs diff=lfs merge=lfs -text +*.msgpack filter=lfs diff=lfs merge=lfs -text +*.npy filter=lfs diff=lfs merge=lfs -text +*.npz filter=lfs diff=lfs merge=lfs -text +*.onnx filter=lfs diff=lfs merge=lfs -text +*.ot filter=lfs diff=lfs merge=lfs -text +*.parquet filter=lfs diff=lfs merge=lfs -text +*.pb filter=lfs diff=lfs merge=lfs -text +*.pickle filter=lfs diff=lfs merge=lfs -text +*.pkl filter=lfs diff=lfs merge=lfs -text +*.pt filter=lfs diff=lfs merge=lfs -text +*.pth filter=lfs diff=lfs merge=lfs -text +*.rar filter=lfs diff=lfs merge=lfs -text +*.safetensors filter=lfs diff=lfs merge=lfs -text +saved_model/**/* filter=lfs diff=lfs merge=lfs -text +*.tar.* filter=lfs diff=lfs merge=lfs -text +*.tar filter=lfs diff=lfs merge=lfs -text +*.tflite filter=lfs diff=lfs merge=lfs -text +*.tgz filter=lfs diff=lfs merge=lfs -text +*.wasm filter=lfs diff=lfs merge=lfs -text +*.xz filter=lfs diff=lfs merge=lfs -text +*.zip filter=lfs diff=lfs merge=lfs -text +*.zst filter=lfs diff=lfs merge=lfs -text +*tfevents* filter=lfs diff=lfs merge=lfs -text +text_encoder-hqq-4bit/tokenizer/tokenizer.json filter=lfs diff=lfs merge=lfs -text diff --git a/image/gemlite/prism-ml/bonsai-image-ternary-4B-gemlite-2bit/LICENSE b/image/gemlite/prism-ml/bonsai-image-ternary-4B-gemlite-2bit/LICENSE new file mode 100644 index 0000000..66a27ec --- /dev/null +++ b/image/gemlite/prism-ml/bonsai-image-ternary-4B-gemlite-2bit/LICENSE @@ -0,0 +1,177 @@ + Apache License + Version 2.0, January 2004 + http://www.apache.org/licenses/ + + TERMS AND CONDITIONS FOR USE, REPRODUCTION, AND DISTRIBUTION + + 1. Definitions. + + "License" shall mean the terms and conditions for use, reproduction, + and distribution as defined by Sections 1 through 9 of this document. + + "Licensor" shall mean the copyright owner or entity authorized by + the copyright owner that is granting the License. + + "Legal Entity" shall mean the union of the acting entity and all + other entities that control, are controlled by, or are under common + control with that entity. For the purposes of this definition, + "control" means (i) the power, direct or indirect, to cause the + direction or management of such entity, whether by contract or + otherwise, or (ii) ownership of fifty percent (50%) or more of the + outstanding shares, or (iii) beneficial ownership of such entity. + + "You" (or "Your") shall mean an individual or Legal Entity + exercising permissions granted by this License. + + "Source" form shall mean the preferred form for making modifications, + including but not limited to software source code, documentation + source, and configuration files. + + "Object" form shall mean any form resulting from mechanical + transformation or translation of a Source form, including but + not limited to compiled object code, generated documentation, + and conversions to other media types. + + "Work" shall mean the work of authorship, whether in Source or + Object form, made available under the License, as indicated by a + copyright notice that is included in or attached to the work + (an example is provided in the Appendix below). + + "Derivative Works" shall mean any work, whether in Source or Object + form, that is based on (or derived from) the Work and for which the + editorial revisions, annotations, elaborations, or other modifications + represent, as a whole, an original work of authorship. For the purposes + of this License, Derivative Works shall not include works that remain + separable from, or merely link (or bind by name) to the interfaces of, + the Work and Derivative Works thereof. + + "Contribution" shall mean any work of authorship, including + the original version of the Work and any modifications or additions + to that Work or Derivative Works thereof, that is intentionally + submitted to Licensor for inclusion in the Work by the copyright owner + or by an individual or Legal Entity authorized to submit on behalf of + the copyright owner. For the purposes of this definition, "submitted" + means any form of electronic, verbal, or written communication sent + to the Licensor or its representatives, including but not limited to + communication on electronic mailing lists, source code control systems, + and issue tracking systems that are managed by, or on behalf of, the + Licensor for the purpose of discussing and improving the Work, but + excluding communication that is conspicuously marked or otherwise + designated in writing by the copyright owner as "Not a Contribution." + + "Contributor" shall mean Licensor and any individual or Legal Entity + on behalf of whom a Contribution has been received by Licensor and + subsequently incorporated within the Work. + + 2. Grant of Copyright License. Subject to the terms and conditions of + this License, each Contributor hereby grants to You a perpetual, + worldwide, non-exclusive, no-charge, royalty-free, irrevocable + copyright license to reproduce, prepare Derivative Works of, + publicly display, publicly perform, sublicense, and distribute the + Work and such Derivative Works in Source or Object form. + + 3. Grant of Patent License. Subject to the terms and conditions of + this License, each Contributor hereby grants to You a perpetual, + worldwide, non-exclusive, no-charge, royalty-free, irrevocable + (except as stated in this section) patent license to make, have made, + use, offer to sell, sell, import, and otherwise transfer the Work, + where such license applies only to those patent claims licensable + by such Contributor that are necessarily infringed by their + Contribution(s) alone or by combination of their Contribution(s) + with the Work to which such Contribution(s) was submitted. If You + institute patent litigation against any entity (including a + cross-claim or counterclaim in a lawsuit) alleging that the Work + or a Contribution incorporated within the Work constitutes direct + or contributory patent infringement, then any patent licenses + granted to You under this License for that Work shall terminate + as of the date such litigation is filed. + + 4. Redistribution. You may reproduce and distribute copies of the + Work or Derivative Works thereof in any medium, with or without + modifications, and in Source or Object form, provided that You + meet the following conditions: + + (a) You must give any other recipients of the Work or + Derivative Works a copy of this License; and + + (b) You must cause any modified files to carry prominent notices + stating that You changed the files; and + + (c) You must retain, in the Source form of any Derivative Works + that You distribute, all copyright, patent, trademark, and + attribution notices from the Source form of the Work, + excluding those notices that do not pertain to any part of + the Derivative Works; and + + (d) If the Work includes a "NOTICE" text file as part of its + distribution, then any Derivative Works that You distribute must + include a readable copy of the attribution notices contained + within such NOTICE file, excluding those notices that do not + pertain to any part of the Derivative Works, in at least one + of the following places: within a NOTICE text file distributed + as part of the Derivative Works; within the Source form or + documentation, if provided along with the Derivative Works; or, + within a display generated by the Derivative Works, if and + wherever such third-party notices normally appear. The contents + of the NOTICE file are for informational purposes only and + do not modify the License. You may add Your own attribution + notices within Derivative Works that You distribute, alongside + or as an addendum to the NOTICE text from the Work, provided + that such additional attribution notices cannot be construed + as modifying the License. + + You may add Your own copyright statement to Your modifications and + may provide additional or different license terms and conditions + for use, reproduction, or distribution of Your modifications, or + for any such Derivative Works as a whole, provided Your use, + reproduction, and distribution of the Work otherwise complies with + the conditions stated in this License. + + 5. Submission of Contributions. Unless You explicitly state otherwise, + any Contribution intentionally submitted for inclusion in the Work + by You to the Licensor shall be under the terms and conditions of + this License, without any additional terms or conditions. + Notwithstanding the above, nothing herein shall supersede or modify + the terms of any separate license agreement you may have executed + with Licensor regarding such Contributions. + + 6. Trademarks. This License does not grant permission to use the trade + names, trademarks, service marks, or product names of the Licensor, + except as required for reasonable and customary use in describing the + origin of the Work and reproducing the content of the NOTICE file. + + 7. Disclaimer of Warranty. Unless required by applicable law or + agreed to in writing, Licensor provides the Work (and each + Contributor provides its Contributions) on an "AS IS" BASIS, + WITHOUT WARRANTIES OR CONDITIONS OF ANY KIND, either express or + implied, including, without limitation, any warranties or conditions + of TITLE, NON-INFRINGEMENT, MERCHANTABILITY, or FITNESS FOR A + PARTICULAR PURPOSE. You are solely responsible for determining the + appropriateness of using or redistributing the Work and assume any + risks associated with Your exercise of permissions under this License. + + 8. Limitation of Liability. In no event and under no legal theory, + whether in tort (including negligence), contract, or otherwise, + unless required by applicable law (such as deliberate and grossly + negligent acts) or agreed to in writing, shall any Contributor be + liable to You for damages, including any direct, indirect, special, + incidental, or consequential damages of any character arising as a + result of this License or out of the use or inability to use the + Work (including but not limited to damages for loss of goodwill, + work stoppage, computer failure or malfunction, or any and all + other commercial damages or losses), even if such Contributor + has been advised of the possibility of such damages. + + 9. Accepting Warranty or Additional Liability. While redistributing + the Work or Derivative Works thereof, You may choose to offer, + and charge a fee for, acceptance of support, warranty, indemnity, + or other liability obligations and/or rights consistent with this + License. However, in accepting such obligations, You may act only + on Your own behalf and on Your sole responsibility, not on behalf + of any other Contributor, and only if You agree to indemnify, + defend, and hold each Contributor harmless for any liability + incurred by, or claims asserted against, such Contributor by reason + of your accepting any such warranty or additional liability. + + END OF TERMS AND CONDITIONS + diff --git a/image/gemlite/prism-ml/bonsai-image-ternary-4B-gemlite-2bit/NOTICE.md b/image/gemlite/prism-ml/bonsai-image-ternary-4B-gemlite-2bit/NOTICE.md new file mode 100644 index 0000000..ef55b08 --- /dev/null +++ b/image/gemlite/prism-ml/bonsai-image-ternary-4B-gemlite-2bit/NOTICE.md @@ -0,0 +1,6 @@ +This software is copyright 2026-present Prism ML, Inc. It is available under the Apache 2.0 license. +If you publicly deploy or redistribute this software, we would appreciate attribution such as: "Created using Bonsai Image by Prism ML." + +This software is built from FLUX.2 [klein] 4B, Copyright 2026 Black Forest Labs, which is available under the Apache 2.0 License: https://huggingface.co/black-forest-labs/FLUX.2-klein-4B/blob/main/LICENSE.md + +The text encoder is built from Qwen3-4B, Copyright 2024 Alibaba Cloud, which is available under the Apache 2.0 License: https://huggingface.co/Qwen/Qwen3-4B/blob/main/LICENSE diff --git a/image/gemlite/prism-ml/bonsai-image-ternary-4B-gemlite-2bit/README.md b/image/gemlite/prism-ml/bonsai-image-ternary-4B-gemlite-2bit/README.md new file mode 100644 index 0000000..1b7c3f1 --- /dev/null +++ b/image/gemlite/prism-ml/bonsai-image-ternary-4B-gemlite-2bit/README.md @@ -0,0 +1,224 @@ +--- +license: apache-2.0 +pipeline_tag: text-to-image +tags: +- ternary +- 1.58-bit +- gemlite +- hqq +- cuda +- text-to-image +- diffusion +- flux +- prismml +- bonsai +base_model: +- prism-ml/bonsai-image-ternary-4B-unpacked +--- + +

+ Bonsai Image +

+ +

+ Prism ML Website  |  + White Paper  |  + Demo & Examples  |  + Discord +

+ +# bonsai-image-ternary-4B-gemlite-2bit + +Ternary weight (1.58-bit) text-to-image diffusion transformer deployment for NVIDIA GPUs + +> **1.21 GB transformer** | **6.4×** smaller than FP16 | **4.5 s / 1024²** on RTX 3080 | **2.8 s / 1024²** on A100 | runs natively on Linux and Windows + +## Highlights + +- **1.21 GB** diffusion transformer, down from **7.75 GB** for the FP16 FLUX.2 Klein 4B transformer +- Ternary {-1, 0, +1} transformer weights with FP16 group-wise scaling in the matrix-heavy transformer layers (Q/K/V projections, output projections, MLP weights) +- Quality-oriented Bonsai Image variant: the additional zero state improves visual quality and prompt fidelity while keeping the transformer compact +- 4.55 GB CUDA deployment payload including the 4-bit text encoder and FP16 VAE — text encoder is offloaded after prompt encode, so the denoising loop only keeps the compact transformer and VAE resident +- 4-step FlowMatch-Euler sampler with guidance = 1.0 and shift = 3.0 — no CFG, no negative prompts needed +- Gemlite low-bit GEMM path for NVIDIA GPUs, with HQQ used for the compressed text encoder +- Runs on Linux and Windows natively through the same CUDA / Gemlite deployment stack +- Cross-platform companion: also available as [MLX 2-bit](https://huggingface.co/prism-ml/bonsai-image-ternary-4B-mlx-2bit) for Apple Silicon + +## Resources + +- **[White Paper](https://github.com/PrismML-Eng/Bonsai-Image-Demo/blob/main/bonsai-image-4b-whitepaper.pdf)** — full benchmarks, kernels, and memory analysis +- **[Demo repo](https://github.com/PrismML-Eng/Bonsai-Image-Demo)** — one-command setup for Mac / Linux / Windows +- **[Discord](https://discord.gg/prismml)** — community + support +- **Kernels**: [gemlite](https://github.com/mobiusml/gemlite) (fused low-bit GEMM) · [HQQ](https://github.com/mobiusml/hqq) (low-bit quantization runtime) · [triton-windows](https://github.com/triton-lang/triton-windows) (Windows path) + +## Model Overview + +| Item | Specification | +| :-------------------- | :----------------------------------------------------------------------------------------------| +| Base architecture | FLUX.2 Klein 4B (MMDiT diffusion transformer) | +| Parameters | ~4.0B (transformer trunk) | +| Blocks | 25 MMDiT blocks: 5 double-stream + 20 single-stream | +| Sampler | FlowMatchEuler, **4 steps**, guidance = 1.0, shift = 3.0 | +| Text encoder | Qwen3-4B at 4-bit HQQ (≈ 2.84 GB CUDA payload, offloaded after prompt encode) | +| VAE | Flux2 32-channel latent, tiled decode (128 px tiles) | +| Native resolution | 1024×1024 (also supports 512×512 and arbitrary multiples of 32) | +| Weight format | Gemlite INT2 pack, ternary values + FP16 group-wise scales | +| **Transformer size** | **1.21 GB** model-level Bonsai representation; **1.54 GB** CUDA packed deployment size | +| Total payload | **4.55 GB** CUDA deployment payload (transformer + 4-bit text encoder + FP16 VAE) | +| Ternary coverage | All 100 matmul-heavy linears in the 25 MMDiT blocks | +| Platforms | Linux x86_64 + Windows native on NVIDIA GPUs | +| License | Apache 2.0 | + +## Ternary Weight Representation: 1.58-bit g128 + +Each ternary weight takes a value from {−1, 0, +1} with one shared FP16 scale per group of 128 weights: + +```text +w_i = scale_g * t_i, t_i in {−1, 0, +1} +``` + +Ternary values carry log₂(3) ≈ 1.585 bits of information per weight. With one FP16 scale per group of 128, the effective storage is: + +```text +b_eff ≈ log2(3) + 16/128 ≈ 1.585 + 0.125 ≈ 1.71 bits/weight +``` + +This gives an idealized **9.4× reduction** relative to FP16 for the ternary transformer layers. A small set of precision-sensitive supporting tensors remains in FP16, so the final Ternary Bonsai Image 4B diffusion transformer is **1.21 GB**, a 6.4x reduction from the 7.75 GB FP16 FLUX.2 Klein 4B transformer. + +The ternary representation is applied to the matrix-heavy transformer layers, including Q / K / V projections, output projections, MLP linears, and the double-stream add-K / Q / V linears. Supporting tensors (less than 5% of the total parameters) such as modulation streams, embedders, output norm, and output projection remain FP16 for image quality and stability. + +The CUDA deployment uses a Gemlite INT2 packed format. Ternary values are stored in 2-bit slots, with the fourth code unused. The model-level Bonsai representation is **1.21 GB**; the deployed CUDA pack is **1.54 GB** on disk due to runtime packing and alignment overhead in the current Gemlite path. + +### Memory + +| Format | Transformer size | Reduction | Ratio | +| :------------------------------ | ---------------: | --------: | -------: | +| FP16 FLUX.2 Klein 4B | 7.75 GB | — | 1.0× | +| **Ternary Bonsai Image 4B** | **1.21 GB** | **84.4%** | **6.4×** | + +CUDA deployment: + +| Component | Size | +| :--------------------------------- | ------: | +| Gemlite INT2 diffusion transformer | 1.54 GB | +| HQQ 4-bit text encoder | 2.84 GB | +| FP16 VAE | 0.17 GB | +| **Total payload** | **4.55 GB** | + +At runtime, the text encoder is offloaded after prompt encoding. During denoising, the repeated image-generation loop is dominated by the compact ternary diffusion transformer and active image-generation components rather than the full payload. + +Peak HBM at 1024² on RTX 3080 is ~6.8 GiB end-to-end (transformer + VAE + activation memory). + +## Best Practices + +- Sampler: FlowMatchEuler-discrete with 4 steps, guidance = 1.0, shift = 3.0. The model is designed for 4 steps; running more steps does not improve quality significantly and can introduce artifacts. +- Resolution: native 1024² is the design target. 512² works for quick previews. +- Aspect ratios: multiples of 32 are supported, including 832x1248 and 1248x832. +- Prompting: natural-language prompts. Negative prompts are not required. +- Runtime memory: the text encoder is offloaded after prompt encoding, so the denoising loop is memory-light. + +## Quickstart + +### Bonsai Studio (Linux / Windows) + +The simplest path is the [Bonsai Image Demo repo](https://github.com/PrismML-Eng/Bonsai-Image-Demo), which sets up the full Bonsai Studio (FastAPI backend + Next.js frontend) and selects gemlite automatically on Linux / Windows: + +```bash +git clone https://github.com/PrismML-Eng/Bonsai-Image-Demo.git +cd Bonsai-Image-Demo +./setup.sh +./scripts/download_model.sh # ternary is the default +./scripts/serve.sh +``` + +On Windows (PowerShell): + +```powershell +Set-ExecutionPolicy -Scope CurrentUser RemoteSigned # one-time +.\setup.ps1 +.\scripts\download_model.ps1 +.\scripts\serve.ps1 +``` + +### Python API (backend_gpu) + +For inference without the studio frontend: + +```python +from backend_gpu.server import build_pipeline + +pipe = build_pipeline(model_id="prism-ml/bonsai-image-ternary-4B-gemlite-2bit") +image = pipe( + prompt="A bonsai tree in a quiet ceramic studio, soft morning light", + num_inference_steps=4, + guidance_scale=1.0, + height=1024, + width=1024, +).images[0] +image.save("bonsai.png") +``` + +## Throughput (CUDA / gemlite) + +Warmed wall-clock per image, 4 denoising steps, guidance = 1.0, matched prompts and sampler settings. + +| Platform | 512² (s) | 1024² (s) | Notes | +| :------------------------ | -------: | --------: | :------------------------------------------ | +| **A100** (Colab) | 1.1 | **2.8** | Ampere datacenter (40 GB) | +| **RTX PRO 6000 Blackwell** (Colab) | 1.0 | **2.1** | NVIDIA Blackwell, 96 GB VRAM | +| **RTX 3080** 10 GB | 1.4 | **4.5** | Ampere consumer; 6.8 GiB peak HBM at 1024² | +| **RTX 3060** 6 GB (laptop)| 3.3 | 17.5 | Ampere mobile; memory-bound at 1024² | + +The sub-2-bit pack keeps generation viable on commodity GPUs at 1024². The RTX 3080 10 GB reaches 4.5 s/image, while the 6 GB laptop RTX 3060 is the memory-constrained tail. + +## Benchmarks + +Evaluated with matched generation settings across the comparison set on H100. GenEval uses the official 512x512 protocol. For HPSv3 and DPG-Bench, larger-backbone rows are evaluated at 1024x1024, while smaller-backbone rows are evaluated at their native 512x512 setting. Higher is better for all three benchmarks. + +| Model | Transformer (GB) | GenEval | HPSv3 | DPG-Bench | +| :--------------------------- | ---------------: | ------: | -----: | --------: | +| **Bonsai Image · Ternary 4B**| **1.21** | **0.723** | **12.22** | **0.851** | +| **Bonsai Image · Binary 4B** | **0.93** | **0.671** | **11.15** | **0.822** | +| FLUX.2 Klein 4B | 7.75 | 0.819 | 12.84 | 0.853 | +| FLUX.1-schnell | 23.8 | 0.716 | 12.67 | 0.848 | +| SDXL | 5.14 | 0.300 | 10.05 | 0.740 | +| PixArt-Σ XL 2 | 1.20 | 0.541 | 11.93 | 0.769 | +| Stable Diffusion 1.5 | 1.72 | 0.396 | 4.20 | 0.601 | +| BK-SDM-Small | 0.98 | 0.297 | 3.05 | 0.559 | + +The benchmark results show the intended quality-footprint trade-off. Ternary Bonsai Image 4B is the quality-oriented variant: at 1.21 GB, it sits very close to FLUX.2 Klein 4B across GenEval, HPSv3, and DPG-Bench while reducing the diffusion transformer footprint by 6.4x. The binary companion is the footprint-oriented variant, reducing the diffusion transformer below 1 GB while still delivering strong benchmark results. + +Together, the Bonsai Image variants move the quality-footprint frontier: they bring modern diffusion-transformer behavior into a memory range previously occupied by much smaller, lower-capability models. + +## Use Cases + +- **Local creative tooling**: image generation directly on CUDA-equipped workstations and consumer GPUs +- **Private generation**: prompts and generated assets can remain in local or controlled environments +- **Rapid iteration**: lower local latency and no remote queue for iterative creative workflows +- **Commodity-GPU serving**: lower transformer footprint and reduced memory pressure for serving on NVIDIA GPUs +- **Windows and Linux deployment**: native paths through the same Gemlite deployment stack +- **Enterprise and controlled inference**: local or private environments for data residency and compliance-sensitive workflows + +## Limitations + +- Ternary Bonsai Image 4B is not bit-identical to the FP16 FLUX.2 Klein 4B model; it is a compact ternary-weight deployment designed to deliver similar practical behavior at much smaller size. +- Image-generation quality remains prompt- and workflow-dependent. Small text, fine details, object counts, and strict compositional constraints should be evaluated for the target use case. +- Current commodity inference stacks do not yet expose fully native ternary execution as a standard hardware path. This release uses practical Gemlite low-bit GEMM kernels on CUDA. +- After the diffusion transformer is made compact, other components such as the VAE can become more visible memory bottlenecks. The runtime mitigates this with text-encoder offload and tiled VAE decoding. + + +## Citation + +```bibtex +@techreport{bonsaiimage4b, + title = {Bonsai Image 4B: Low-Bit Diffusion on Apple Silicon and Consumer GPUs}, + author = {Prism ML}, + year = {2026}, + month = {May}, + url = {https://prismml.com} +} +``` + +## Contact + +For questions, feedback, or collaboration inquiries: **contact@prismml.com** diff --git a/image/gemlite/prism-ml/bonsai-image-ternary-4B-gemlite-2bit/assets/bonsai-logo.svg b/image/gemlite/prism-ml/bonsai-image-ternary-4B-gemlite-2bit/assets/bonsai-logo.svg new file mode 100644 index 0000000..2cfef2b --- /dev/null +++ b/image/gemlite/prism-ml/bonsai-image-ternary-4B-gemlite-2bit/assets/bonsai-logo.svg @@ -0,0 +1 @@ + diff --git a/image/gemlite/prism-ml/bonsai-image-ternary-4B-gemlite-2bit/manifest.json b/image/gemlite/prism-ml/bonsai-image-ternary-4B-gemlite-2bit/manifest.json new file mode 100644 index 0000000..edf9c99 --- /dev/null +++ b/image/gemlite/prism-ml/bonsai-image-ternary-4B-gemlite-2bit/manifest.json @@ -0,0 +1,101 @@ +{ + "model_version": "ternary g128 (gemlite-int2 deployment for CUDA inference)", + "total_bytes": 4547304490, + "files": [ + { + "remote_path": "model_index.json", + "size": 81, + "sha256": "ecb4735e37691a8733f62957fd6c548f841af40624905bb24fa639756153c8a1" + }, + { + "remote_path": "LICENSE", + "size": 10174, + "sha256": "69849221bfb90053de2134ef5e6d540287b4b98062326492f1f96f5da685524b" + }, + { + "remote_path": "NOTICE.md", + "size": 623, + "sha256": "bbefa4a26b836efc040c1a0f155a425d1d833eae1b2534ffc414b1eada3cd922" + }, + { + "remote_path": "README.md", + "size": 13033, + "sha256": "742dbbcc4ecb979e11f8377bdadfb312a2b1437c5b4950d7a3fb155f71c82f20" + }, + { + "remote_path": "text_encoder-hqq-4bit/config.json", + "size": 1535, + "sha256": "979b4d6b42dfae3c6dece91da5fe139926dee4a1a244a1cf129d2025c2a60064" + }, + { + "remote_path": "text_encoder-hqq-4bit/qmodel.pt", + "size": 2822340711, + "sha256": "57ecb803e88313f896b24f2f6fedddcb2966c174801f8d89115f4fbae99be48a" + }, + { + "remote_path": "text_encoder-hqq-4bit/tokenizer/added_tokens.json", + "size": 707, + "sha256": "c0284b582e14987fbd3d5a2cb2bd139084371ed9acbae488829a1c900833c680" + }, + { + "remote_path": "text_encoder-hqq-4bit/tokenizer/chat_template.jinja", + "size": 4168, + "sha256": "a55ee1b1660128b7098723e0abcd92caa0788061051c62d51cbe87d9cf1974d8" + }, + { + "remote_path": "text_encoder-hqq-4bit/tokenizer/merges.txt", + "size": 1671853, + "sha256": "8831e4f1a044471340f7c0a83d7bd71306a5b867e95fd870f74d0c5308a904d5" + }, + { + "remote_path": "text_encoder-hqq-4bit/tokenizer/special_tokens_map.json", + "size": 613, + "sha256": "76862e765266b85aa9459767e33cbaf13970f327a0e88d1c65846c2ddd3a1ecd" + }, + { + "remote_path": "text_encoder-hqq-4bit/tokenizer/tokenizer.json", + "size": 11422654, + "sha256": "aeb13307a71acd8fe81861d94ad54ab689df773318809eed3cbe794b4492dae4" + }, + { + "remote_path": "text_encoder-hqq-4bit/tokenizer/tokenizer_config.json", + "size": 5404, + "sha256": "443bfa629eb16387a12edbf92a76f6a6f10b2af3b53d87ba1550adfcf45f7fa0" + }, + { + "remote_path": "text_encoder-hqq-4bit/tokenizer/vocab.json", + "size": 2776833, + "sha256": "ca10d7e9fb3ed18575dd1e277a2579c16d108e32f27439684afa0e10b1440910" + }, + { + "remote_path": "transformer-gemlite-int2/config.json", + "size": 620, + "sha256": "f4c11e406efb84b36ada1a4287423d4aff2092d74bf15774455f88a7e4888a02" + }, + { + "remote_path": "transformer-gemlite-int2/gemlite_autotune.json", + "size": 470215, + "sha256": "6847ecb93765973c0f4c28baee6f265dc66405be3401d1fd5b28496c0aeb0037" + }, + { + "remote_path": "transformer-gemlite-int2/quantization_config.json", + "size": 6042, + "sha256": "889c48a7f55a1630ec97ea5e050fd81df32c8a4a31c44434377a44f449a471fa" + }, + { + "remote_path": "transformer-gemlite-int2/state_dict.pt", + "size": 1540457482, + "sha256": "a3a7df8a90374fea24afce3b36f00b4c728d0254717143d61f912a7b3070e7ac" + }, + { + "remote_path": "vae/config.json", + "size": 864, + "sha256": "a1cb2ba54a569913eca375d9ee3afe683ba680bd9f64a49d86ec2bd14f304409" + }, + { + "remote_path": "vae/diffusion_pytorch_model.safetensors", + "size": 168120878, + "sha256": "ca70d2202afe6415bdbcb8793ba8cd99fd159cfe6192381504d6c4d3036e0f04" + } + ] +} diff --git a/image/gemlite/prism-ml/bonsai-image-ternary-4B-gemlite-2bit/model_index.json b/image/gemlite/prism-ml/bonsai-image-ternary-4B-gemlite-2bit/model_index.json new file mode 100644 index 0000000..23fc542 --- /dev/null +++ b/image/gemlite/prism-ml/bonsai-image-ternary-4B-gemlite-2bit/model_index.json @@ -0,0 +1,4 @@ +{ + "_class_name": "Flux2KleinPipeline", + "_diffusers_version": "0.37.0.dev0" +} diff --git a/image/gemlite/prism-ml/bonsai-image-ternary-4B-gemlite-2bit/text_encoder-hqq-4bit/config.json b/image/gemlite/prism-ml/bonsai-image-ternary-4B-gemlite-2bit/text_encoder-hqq-4bit/config.json new file mode 100644 index 0000000..161d1cf --- /dev/null +++ b/image/gemlite/prism-ml/bonsai-image-ternary-4B-gemlite-2bit/text_encoder-hqq-4bit/config.json @@ -0,0 +1,68 @@ +{ + "architectures": [ + "Qwen3ForCausalLM" + ], + "attention_bias": false, + "attention_dropout": 0.0, + "bos_token_id": 151643, + "dtype": "float16", + "eos_token_id": 151645, + "head_dim": 128, + "hidden_act": "silu", + "hidden_size": 2560, + "initializer_range": 0.02, + "intermediate_size": 9728, + "layer_types": [ + "full_attention", + "full_attention", + "full_attention", + "full_attention", + "full_attention", + "full_attention", + "full_attention", + "full_attention", + "full_attention", + "full_attention", + "full_attention", + "full_attention", + "full_attention", + "full_attention", + "full_attention", + "full_attention", + "full_attention", + "full_attention", + "full_attention", + "full_attention", + "full_attention", + "full_attention", + "full_attention", + "full_attention", + "full_attention", + "full_attention", + "full_attention", + "full_attention", + "full_attention", + "full_attention", + "full_attention", + "full_attention", + "full_attention", + "full_attention", + "full_attention", + "full_attention" + ], + "max_position_embeddings": 40960, + "max_window_layers": 36, + "model_type": "qwen3", + "num_attention_heads": 32, + "num_hidden_layers": 36, + "num_key_value_heads": 8, + "rms_norm_eps": 1e-06, + "rope_scaling": null, + "rope_theta": 1000000, + "sliding_window": null, + "tie_word_embeddings": true, + "transformers_version": "4.57.6", + "use_cache": true, + "use_sliding_window": false, + "vocab_size": 151936 +} diff --git a/image/gemlite/prism-ml/bonsai-image-ternary-4B-gemlite-2bit/text_encoder-hqq-4bit/qmodel.pt b/image/gemlite/prism-ml/bonsai-image-ternary-4B-gemlite-2bit/text_encoder-hqq-4bit/qmodel.pt new file mode 100644 index 0000000..eb8c85b --- /dev/null +++ b/image/gemlite/prism-ml/bonsai-image-ternary-4B-gemlite-2bit/text_encoder-hqq-4bit/qmodel.pt @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:57ecb803e88313f896b24f2f6fedddcb2966c174801f8d89115f4fbae99be48a +size 2822340711 diff --git a/image/gemlite/prism-ml/bonsai-image-ternary-4B-gemlite-2bit/text_encoder-hqq-4bit/tokenizer/added_tokens.json b/image/gemlite/prism-ml/bonsai-image-ternary-4B-gemlite-2bit/text_encoder-hqq-4bit/tokenizer/added_tokens.json new file mode 100644 index 0000000..b54f913 --- /dev/null +++ b/image/gemlite/prism-ml/bonsai-image-ternary-4B-gemlite-2bit/text_encoder-hqq-4bit/tokenizer/added_tokens.json @@ -0,0 +1,28 @@ +{ + "": 151668, + "
": 151658, + "": 151666, + "": 151667, + "": 151657, + "": 151665, + "<|box_end|>": 151649, + "<|box_start|>": 151648, + "<|endoftext|>": 151643, + "<|file_sep|>": 151664, + "<|fim_middle|>": 151660, + "<|fim_pad|>": 151662, + "<|fim_prefix|>": 151659, + "<|fim_suffix|>": 151661, + "<|im_end|>": 151645, + "<|im_start|>": 151644, + "<|image_pad|>": 151655, + "<|object_ref_end|>": 151647, + "<|object_ref_start|>": 151646, + "<|quad_end|>": 151651, + "<|quad_start|>": 151650, + "<|repo_name|>": 151663, + "<|video_pad|>": 151656, + "<|vision_end|>": 151653, + "<|vision_pad|>": 151654, + "<|vision_start|>": 151652 +} diff --git a/image/gemlite/prism-ml/bonsai-image-ternary-4B-gemlite-2bit/text_encoder-hqq-4bit/tokenizer/chat_template.jinja b/image/gemlite/prism-ml/bonsai-image-ternary-4B-gemlite-2bit/text_encoder-hqq-4bit/tokenizer/chat_template.jinja new file mode 100644 index 0000000..01be9b3 --- /dev/null +++ b/image/gemlite/prism-ml/bonsai-image-ternary-4B-gemlite-2bit/text_encoder-hqq-4bit/tokenizer/chat_template.jinja @@ -0,0 +1,89 @@ +{%- if tools %} + {{- '<|im_start|>system\n' }} + {%- if messages[0].role == 'system' %} + {{- messages[0].content + '\n\n' }} + {%- endif %} + {{- "# Tools\n\nYou may call one or more functions to assist with the user query.\n\nYou are provided with function signatures within XML tags:\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n\n\nFor each function call, return a json object with function name and arguments within XML tags:\n\n{\"name\": , \"arguments\": }\n<|im_end|>\n" }} +{%- else %} + {%- if messages[0].role == 'system' %} + {{- '<|im_start|>system\n' + messages[0].content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" and message.content is string and not(message.content.startswith('') and message.content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} +{%- endfor %} +{%- for message in messages %} + {%- if message.content is string %} + {%- set content = message.content %} + {%- else %} + {%- set content = '' %} + {%- endif %} + {%- if (message.role == "user") or (message.role == "system" and not loop.first) %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- if loop.index0 > ns.last_query_index %} + {%- if loop.last or (not loop.last and reasoning_content) %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content.strip('\n') + '\n\n\n' + content.lstrip('\n') }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls %} + {%- for tool_call in message.tool_calls %} + {%- if (loop.first and content) or (not loop.first) %} + {{- '\n' }} + {%- endif %} + {%- if tool_call.function %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {{- '\n{"name": "' }} + {{- tool_call.name }} + {{- '", "arguments": ' }} + {%- if tool_call.arguments is string %} + {{- tool_call.arguments }} + {%- else %} + {{- tool_call.arguments | tojson }} + {%- endif %} + {{- '}\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.first or (messages[loop.index0 - 1].role != "tool") %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if loop.last or (messages[loop.index0 + 1].role != "tool") %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/image/gemlite/prism-ml/bonsai-image-ternary-4B-gemlite-2bit/text_encoder-hqq-4bit/tokenizer/merges.txt b/image/gemlite/prism-ml/bonsai-image-ternary-4B-gemlite-2bit/text_encoder-hqq-4bit/tokenizer/merges.txt new file mode 100644 index 0000000..80c1a19 --- /dev/null +++ b/image/gemlite/prism-ml/bonsai-image-ternary-4B-gemlite-2bit/text_encoder-hqq-4bit/tokenizer/merges.txt @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:8831e4f1a044471340f7c0a83d7bd71306a5b867e95fd870f74d0c5308a904d5 +size 1671853 diff --git a/image/gemlite/prism-ml/bonsai-image-ternary-4B-gemlite-2bit/text_encoder-hqq-4bit/tokenizer/special_tokens_map.json b/image/gemlite/prism-ml/bonsai-image-ternary-4B-gemlite-2bit/text_encoder-hqq-4bit/tokenizer/special_tokens_map.json new file mode 100644 index 0000000..ac23c0a --- /dev/null +++ b/image/gemlite/prism-ml/bonsai-image-ternary-4B-gemlite-2bit/text_encoder-hqq-4bit/tokenizer/special_tokens_map.json @@ -0,0 +1,31 @@ +{ + "additional_special_tokens": [ + "<|im_start|>", + "<|im_end|>", + "<|object_ref_start|>", + "<|object_ref_end|>", + "<|box_start|>", + "<|box_end|>", + "<|quad_start|>", + "<|quad_end|>", + "<|vision_start|>", + "<|vision_end|>", + "<|vision_pad|>", + "<|image_pad|>", + "<|video_pad|>" + ], + "eos_token": { + "content": "<|im_end|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false + }, + "pad_token": { + "content": "<|endoftext|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false + } +} diff --git a/image/gemlite/prism-ml/bonsai-image-ternary-4B-gemlite-2bit/text_encoder-hqq-4bit/tokenizer/tokenizer.json b/image/gemlite/prism-ml/bonsai-image-ternary-4B-gemlite-2bit/text_encoder-hqq-4bit/tokenizer/tokenizer.json new file mode 100644 index 0000000..cd71f61 --- /dev/null +++ b/image/gemlite/prism-ml/bonsai-image-ternary-4B-gemlite-2bit/text_encoder-hqq-4bit/tokenizer/tokenizer.json @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:aeb13307a71acd8fe81861d94ad54ab689df773318809eed3cbe794b4492dae4 +size 11422654 diff --git a/image/gemlite/prism-ml/bonsai-image-ternary-4B-gemlite-2bit/text_encoder-hqq-4bit/tokenizer/tokenizer_config.json b/image/gemlite/prism-ml/bonsai-image-ternary-4B-gemlite-2bit/text_encoder-hqq-4bit/tokenizer/tokenizer_config.json new file mode 100644 index 0000000..ddaf698 --- /dev/null +++ b/image/gemlite/prism-ml/bonsai-image-ternary-4B-gemlite-2bit/text_encoder-hqq-4bit/tokenizer/tokenizer_config.json @@ -0,0 +1,239 @@ +{ + "add_bos_token": false, + "add_prefix_space": false, + "added_tokens_decoder": { + "151643": { + "content": "<|endoftext|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "151644": { + "content": "<|im_start|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "151645": { + "content": "<|im_end|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "151646": { + "content": "<|object_ref_start|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "151647": { + "content": "<|object_ref_end|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "151648": { + "content": "<|box_start|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "151649": { + "content": "<|box_end|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "151650": { + "content": "<|quad_start|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "151651": { + "content": "<|quad_end|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "151652": { + "content": "<|vision_start|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "151653": { + "content": "<|vision_end|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "151654": { + "content": "<|vision_pad|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "151655": { + "content": "<|image_pad|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "151656": { + "content": "<|video_pad|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "151657": { + "content": "", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": false + }, + "151658": { + "content": "", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": false + }, + "151659": { + "content": "<|fim_prefix|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": false + }, + "151660": { + "content": "<|fim_middle|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": false + }, + "151661": { + "content": "<|fim_suffix|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": false + }, + "151662": { + "content": "<|fim_pad|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": false + }, + "151663": { + "content": "<|repo_name|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": false + }, + "151664": { + "content": "<|file_sep|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": false + }, + "151665": { + "content": "", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": false + }, + "151666": { + "content": "", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": false + }, + "151667": { + "content": "", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": false + }, + "151668": { + "content": "", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": false + } + }, + "additional_special_tokens": [ + "<|im_start|>", + "<|im_end|>", + "<|object_ref_start|>", + "<|object_ref_end|>", + "<|box_start|>", + "<|box_end|>", + "<|quad_start|>", + "<|quad_end|>", + "<|vision_start|>", + "<|vision_end|>", + "<|vision_pad|>", + "<|image_pad|>", + "<|video_pad|>" + ], + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|im_end|>", + "errors": "replace", + "extra_special_tokens": {}, + "model_max_length": 131072, + "pad_token": "<|endoftext|>", + "split_special_tokens": false, + "tokenizer_class": "Qwen2Tokenizer", + "unk_token": null +} diff --git a/image/gemlite/prism-ml/bonsai-image-ternary-4B-gemlite-2bit/text_encoder-hqq-4bit/tokenizer/vocab.json b/image/gemlite/prism-ml/bonsai-image-ternary-4B-gemlite-2bit/text_encoder-hqq-4bit/tokenizer/vocab.json new file mode 100644 index 0000000..6c49fc6 --- /dev/null +++ b/image/gemlite/prism-ml/bonsai-image-ternary-4B-gemlite-2bit/text_encoder-hqq-4bit/tokenizer/vocab.json @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:ca10d7e9fb3ed18575dd1e277a2579c16d108e32f27439684afa0e10b1440910 +size 2776833 diff --git a/image/gemlite/prism-ml/bonsai-image-ternary-4B-gemlite-2bit/transformer-gemlite-int2/config.json b/image/gemlite/prism-ml/bonsai-image-ternary-4B-gemlite-2bit/transformer-gemlite-int2/config.json new file mode 100644 index 0000000..2051cb8 --- /dev/null +++ b/image/gemlite/prism-ml/bonsai-image-ternary-4B-gemlite-2bit/transformer-gemlite-int2/config.json @@ -0,0 +1,27 @@ +{ + "_class_name": "Flux2Transformer2DModel", + "_diffusers_version": "0.37.1", + "_name_or_path": "black-forest-labs/FLUX.2-klein-4B", + "attention_head_dim": 128, + "axes_dims_rope": [ + 32, + 32, + 32, + 32 + ], + "enable_time_sign_embed": false, + "eps": 1e-06, + "guidance_embeds": false, + "in_channels": 128, + "joint_attention_dim": 7680, + "mlp_ratio": 3.0, + "musubi_block_swap_device": "cpu", + "musubi_blocks_to_swap": 0, + "num_attention_heads": 24, + "num_layers": 5, + "num_single_layers": 20, + "out_channels": null, + "patch_size": 1, + "rope_theta": 2000, + "timestep_guidance_channels": 256 +} diff --git a/image/gemlite/prism-ml/bonsai-image-ternary-4B-gemlite-2bit/transformer-gemlite-int2/gemlite_autotune.json b/image/gemlite/prism-ml/bonsai-image-ternary-4B-gemlite-2bit/transformer-gemlite-int2/gemlite_autotune.json new file mode 100644 index 0000000..86da694 --- /dev/null +++ b/image/gemlite/prism-ml/bonsai-image-ternary-4B-gemlite-2bit/transformer-gemlite-int2/gemlite_autotune.json @@ -0,0 +1 @@ +{"GEMV": {}, "GEMV_REVSPLITK": {"(1, 4096, 4096, 64, 8, 104)": {"BLOCK_SIZE_M": 1, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 8, "A_load_order": 1, "dot_prod_mode": 0, "num_warps": 1, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1, 4096, 4096, 128, 8, 104)": {"BLOCK_SIZE_M": 1, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 8, "A_load_order": 0, "dot_prod_mode": 0, "num_warps": 1, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1, 6144, 4096, 64, 8, 104)": {"BLOCK_SIZE_M": 1, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 8, "A_load_order": 0, "dot_prod_mode": 0, "num_warps": 2, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1, 6144, 4096, 128, 8, 104)": {"BLOCK_SIZE_M": 1, "BLOCK_SIZE_N": 512, "BLOCK_SIZE_K": 8, "A_load_order": 0, "dot_prod_mode": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 2, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1, 4096, 14336, 64, 8, 104)": {"BLOCK_SIZE_M": 1, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 8, "A_load_order": 0, "dot_prod_mode": 0, "num_warps": 2, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1, 4096, 14336, 128, 8, 104)": {"BLOCK_SIZE_M": 1, "BLOCK_SIZE_N": 512, "BLOCK_SIZE_K": 8, "A_load_order": 0, "dot_prod_mode": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 2, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1, 28672, 4096, 64, 8, 104)": {"BLOCK_SIZE_M": 1, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 8, "A_load_order": 1, "dot_prod_mode": 0, "num_warps": 2, "num_ctas": 1, "num_stages": 2, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1, 28672, 4096, 128, 8, 104)": {"BLOCK_SIZE_M": 1, "BLOCK_SIZE_N": 512, "BLOCK_SIZE_K": 8, "A_load_order": 0, "dot_prod_mode": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1, 3584, 3584, 64, 8, 104)": {"BLOCK_SIZE_M": 1, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 16, "A_load_order": 0, "dot_prod_mode": 0, "num_warps": 2, "num_ctas": 1, "num_stages": 2, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1, 3584, 3584, 128, 8, 104)": {"BLOCK_SIZE_M": 1, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 8, "A_load_order": 0, "dot_prod_mode": 0, "num_warps": 1, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1, 4608, 3584, 64, 8, 104)": {"BLOCK_SIZE_M": 1, "BLOCK_SIZE_N": 512, "BLOCK_SIZE_K": 8, "A_load_order": 0, "dot_prod_mode": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1, 4608, 3584, 128, 8, 104)": {"BLOCK_SIZE_M": 1, "BLOCK_SIZE_N": 512, "BLOCK_SIZE_K": 8, "A_load_order": 1, "dot_prod_mode": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 2, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1, 3584, 18944, 64, 8, 104)": {"BLOCK_SIZE_M": 1, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 16, "A_load_order": 1, "dot_prod_mode": 0, "num_warps": 1, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1, 3584, 18944, 128, 8, 104)": {"BLOCK_SIZE_M": 1, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 8, "A_load_order": 0, "dot_prod_mode": 0, "num_warps": 2, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1, 37888, 3584, 64, 8, 104)": {"BLOCK_SIZE_M": 1, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 8, "A_load_order": 0, "dot_prod_mode": 0, "num_warps": 2, "num_ctas": 1, "num_stages": 2, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1, 37888, 3584, 128, 8, 104)": {"BLOCK_SIZE_M": 1, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 8, "A_load_order": 1, "dot_prod_mode": 0, "num_warps": 2, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1, 3072, 3072, 64, 8, 104)": {"BLOCK_SIZE_M": 1, "BLOCK_SIZE_N": 512, "BLOCK_SIZE_K": 8, "A_load_order": 0, "dot_prod_mode": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1, 3072, 3072, 128, 8, 104)": {"BLOCK_SIZE_M": 1, "BLOCK_SIZE_N": 512, "BLOCK_SIZE_K": 8, "A_load_order": 0, "dot_prod_mode": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1, 1024, 4096, 64, 8, 104)": {"BLOCK_SIZE_M": 1, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 16, "A_load_order": 0, "dot_prod_mode": 0, "num_warps": 2, "num_ctas": 1, "num_stages": 2, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1, 1024, 4096, 128, 8, 104)": {"BLOCK_SIZE_M": 1, "BLOCK_SIZE_N": 512, "BLOCK_SIZE_K": 16, "A_load_order": 0, "dot_prod_mode": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 2, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1, 14336, 4096, 64, 8, 104)": {"BLOCK_SIZE_M": 1, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 8, "A_load_order": 0, "dot_prod_mode": 0, "num_warps": 2, "num_ctas": 1, "num_stages": 2, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1, 14336, 4096, 128, 8, 104)": {"BLOCK_SIZE_M": 1, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 8, "A_load_order": 0, "dot_prod_mode": 0, "num_warps": 2, "num_ctas": 1, "num_stages": 2, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1, 512, 3584, 64, 8, 104)": {"BLOCK_SIZE_M": 1, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 16, "A_load_order": 0, "dot_prod_mode": 0, "num_warps": 1, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1, 512, 3584, 128, 8, 104)": {"BLOCK_SIZE_M": 1, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 16, "A_load_order": 0, "dot_prod_mode": 0, "num_warps": 1, "num_ctas": 1, "num_stages": 2, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1, 18944, 3584, 64, 8, 104)": {"BLOCK_SIZE_M": 1, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 8, "A_load_order": 0, "dot_prod_mode": 0, "num_warps": 2, "num_ctas": 1, "num_stages": 2, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1, 18944, 3584, 128, 8, 104)": {"BLOCK_SIZE_M": 1, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 8, "A_load_order": 1, "dot_prod_mode": 0, "num_warps": 2, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1, 5120, 3072, 64, 8, 104)": {"BLOCK_SIZE_M": 1, "BLOCK_SIZE_N": 512, "BLOCK_SIZE_K": 8, "A_load_order": 1, "dot_prod_mode": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 2, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1, 5120, 3072, 128, 8, 104)": {"BLOCK_SIZE_M": 1, "BLOCK_SIZE_N": 512, "BLOCK_SIZE_K": 8, "A_load_order": 0, "dot_prod_mode": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 2, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1, 3072, 8192, 64, 8, 104)": {"BLOCK_SIZE_M": 1, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 16, "A_load_order": 1, "dot_prod_mode": 0, "num_warps": 1, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1, 3072, 8192, 128, 8, 104)": {"BLOCK_SIZE_M": 1, "BLOCK_SIZE_N": 512, "BLOCK_SIZE_K": 16, "A_load_order": 1, "dot_prod_mode": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 2, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1, 16384, 3072, 64, 8, 104)": {"BLOCK_SIZE_M": 1, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 8, "A_load_order": 0, "dot_prod_mode": 0, "num_warps": 2, "num_ctas": 1, "num_stages": 2, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1, 16384, 3072, 128, 8, 104)": {"BLOCK_SIZE_M": 1, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 8, "A_load_order": 1, "dot_prod_mode": 0, "num_warps": 2, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1, 2048, 2048, 64, 8, 104)": {"BLOCK_SIZE_M": 1, "BLOCK_SIZE_N": 512, "BLOCK_SIZE_K": 8, "A_load_order": 0, "dot_prod_mode": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1, 2048, 2048, 128, 8, 104)": {"BLOCK_SIZE_M": 1, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 8, "A_load_order": 0, "dot_prod_mode": 0, "num_warps": 1, "num_ctas": 1, "num_stages": 2, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1, 2560, 2048, 64, 8, 104)": {"BLOCK_SIZE_M": 1, "BLOCK_SIZE_N": 512, "BLOCK_SIZE_K": 8, "A_load_order": 0, "dot_prod_mode": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1, 2560, 2048, 128, 8, 104)": {"BLOCK_SIZE_M": 1, "BLOCK_SIZE_N": 512, "BLOCK_SIZE_K": 8, "A_load_order": 1, "dot_prod_mode": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 2, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1, 2048, 11008, 64, 8, 104)": {"BLOCK_SIZE_M": 1, "BLOCK_SIZE_N": 512, "BLOCK_SIZE_K": 16, "A_load_order": 1, "dot_prod_mode": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1, 2048, 11008, 128, 8, 104)": {"BLOCK_SIZE_M": 1, "BLOCK_SIZE_N": 512, "BLOCK_SIZE_K": 16, "A_load_order": 0, "dot_prod_mode": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1, 22016, 2048, 64, 8, 104)": {"BLOCK_SIZE_M": 1, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 8, "A_load_order": 0, "dot_prod_mode": 0, "num_warps": 2, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1, 22016, 2048, 128, 8, 104)": {"BLOCK_SIZE_M": 1, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 8, "A_load_order": 0, "dot_prod_mode": 0, "num_warps": 2, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1, 5120, 5120, 64, 8, 104)": {"BLOCK_SIZE_M": 1, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 8, "A_load_order": 0, "dot_prod_mode": 0, "num_warps": 2, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1, 5120, 5120, 128, 8, 104)": {"BLOCK_SIZE_M": 1, "BLOCK_SIZE_N": 512, "BLOCK_SIZE_K": 8, "A_load_order": 1, "dot_prod_mode": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1, 7168, 5120, 64, 8, 104)": {"BLOCK_SIZE_M": 1, "BLOCK_SIZE_N": 512, "BLOCK_SIZE_K": 8, "A_load_order": 0, "dot_prod_mode": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 2, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1, 7168, 5120, 128, 8, 104)": {"BLOCK_SIZE_M": 1, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 8, "A_load_order": 0, "dot_prod_mode": 0, "num_warps": 2, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1, 5120, 13824, 64, 8, 104)": {"BLOCK_SIZE_M": 1, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 8, "A_load_order": 1, "dot_prod_mode": 0, "num_warps": 2, "num_ctas": 1, "num_stages": 2, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1, 5120, 13824, 128, 8, 104)": {"BLOCK_SIZE_M": 1, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 8, "A_load_order": 1, "dot_prod_mode": 0, "num_warps": 2, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1, 27648, 5120, 64, 8, 104)": {"BLOCK_SIZE_M": 1, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 8, "A_load_order": 0, "dot_prod_mode": 0, "num_warps": 2, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1, 27648, 5120, 128, 8, 104)": {"BLOCK_SIZE_M": 1, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 8, "A_load_order": 1, "dot_prod_mode": 0, "num_warps": 2, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1, 2048, 3840, 64, 8, 104)": {"BLOCK_SIZE_M": 1, "BLOCK_SIZE_N": 512, "BLOCK_SIZE_K": 16, "A_load_order": 1, "dot_prod_mode": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 2, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1, 4096, 3840, 64, 8, 104)": {"BLOCK_SIZE_M": 1, "BLOCK_SIZE_N": 512, "BLOCK_SIZE_K": 8, "A_load_order": 1, "dot_prod_mode": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1, 8192, 3840, 64, 8, 104)": {"BLOCK_SIZE_M": 1, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 8, "A_load_order": 0, "dot_prod_mode": 0, "num_warps": 2, "num_ctas": 1, "num_stages": 2, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1, 3840, 4096, 64, 8, 104)": {"BLOCK_SIZE_M": 1, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 8, "A_load_order": 1, "dot_prod_mode": 0, "num_warps": 2, "num_ctas": 1, "num_stages": 2, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1, 3840, 15360, 64, 8, 104)": {"BLOCK_SIZE_M": 1, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 8, "A_load_order": 0, "dot_prod_mode": 0, "num_warps": 1, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1, 30720, 3840, 64, 8, 104)": {"BLOCK_SIZE_M": 1, "BLOCK_SIZE_N": 512, "BLOCK_SIZE_K": 8, "A_load_order": 1, "dot_prod_mode": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}}, "GEMV_SPLITK": {"(1, 4096, 4096, 4096, 1, 408)": {"BLOCK_SIZE_M": 1, "BLOCK_SIZE_N": 8, "BLOCK_SIZE_K": 1024, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 0, "dot_prod_mode": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 2, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1, 6144, 4096, 4096, 1, 408)": {"BLOCK_SIZE_M": 1, "BLOCK_SIZE_N": 8, "BLOCK_SIZE_K": 512, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 0, "dot_prod_mode": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1, 4096, 14336, 14336, 1, 408)": {"BLOCK_SIZE_M": 1, "BLOCK_SIZE_N": 1, "BLOCK_SIZE_K": 1024, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 0, "dot_prod_mode": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 2, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1, 28672, 4096, 4096, 1, 408)": {"BLOCK_SIZE_M": 1, "BLOCK_SIZE_N": 1, "BLOCK_SIZE_K": 1024, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 1, "dot_prod_mode": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 2, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1, 3584, 3584, 3584, 1, 408)": {"BLOCK_SIZE_M": 1, "BLOCK_SIZE_N": 8, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 0, "dot_prod_mode": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1, 4608, 3584, 3584, 1, 408)": {"BLOCK_SIZE_M": 1, "BLOCK_SIZE_N": 8, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 0, "dot_prod_mode": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1, 3584, 18944, 18944, 1, 408)": {"BLOCK_SIZE_M": 1, "BLOCK_SIZE_N": 8, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 0, "dot_prod_mode": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 2, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1, 37888, 3584, 3584, 1, 408)": {"BLOCK_SIZE_M": 1, "BLOCK_SIZE_N": 8, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 0, "dot_prod_mode": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1, 3072, 3072, 3072, 1, 408)": {"BLOCK_SIZE_M": 1, "BLOCK_SIZE_N": 4, "BLOCK_SIZE_K": 1024, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 0, "dot_prod_mode": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 2, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1, 5120, 3072, 3072, 1, 408)": {"BLOCK_SIZE_M": 1, "BLOCK_SIZE_N": 8, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 1, "dot_prod_mode": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 2, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1, 3072, 8192, 8192, 1, 408)": {"BLOCK_SIZE_M": 1, "BLOCK_SIZE_N": 8, "BLOCK_SIZE_K": 1024, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 0, "dot_prod_mode": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1, 16384, 3072, 3072, 1, 408)": {"BLOCK_SIZE_M": 1, "BLOCK_SIZE_N": 8, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 0, "dot_prod_mode": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1, 2048, 2048, 2048, 1, 408)": {"BLOCK_SIZE_M": 1, "BLOCK_SIZE_N": 2, "BLOCK_SIZE_K": 2048, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 0, "dot_prod_mode": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1, 2560, 2048, 2048, 1, 408)": {"BLOCK_SIZE_M": 1, "BLOCK_SIZE_N": 4, "BLOCK_SIZE_K": 1024, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 0, "dot_prod_mode": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1, 2048, 11008, 11008, 1, 408)": {"BLOCK_SIZE_M": 1, "BLOCK_SIZE_N": 8, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 0, "dot_prod_mode": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 2, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1, 22016, 2048, 2048, 1, 408)": {"BLOCK_SIZE_M": 1, "BLOCK_SIZE_N": 8, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 0, "dot_prod_mode": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1, 1024, 4096, 4096, 1, 408)": {"BLOCK_SIZE_M": 1, "BLOCK_SIZE_N": 1, "BLOCK_SIZE_K": 2048, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 0, "dot_prod_mode": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 2, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1, 14336, 4096, 4096, 1, 408)": {"BLOCK_SIZE_M": 1, "BLOCK_SIZE_N": 1, "BLOCK_SIZE_K": 1024, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 0, "dot_prod_mode": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1, 512, 3584, 3584, 1, 408)": {"BLOCK_SIZE_M": 1, "BLOCK_SIZE_N": 8, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 0, "dot_prod_mode": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 2, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1, 18944, 3584, 3584, 1, 408)": {"BLOCK_SIZE_M": 1, "BLOCK_SIZE_N": 8, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 0, "dot_prod_mode": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 2, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1, 5120, 5120, 5120, 1, 408)": {"BLOCK_SIZE_M": 1, "BLOCK_SIZE_N": 8, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 1, "dot_prod_mode": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 2, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1, 7168, 5120, 5120, 1, 408)": {"BLOCK_SIZE_M": 1, "BLOCK_SIZE_N": 8, "BLOCK_SIZE_K": 512, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 0, "dot_prod_mode": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 2, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1, 5120, 13824, 13824, 1, 408)": {"BLOCK_SIZE_M": 1, "BLOCK_SIZE_N": 8, "BLOCK_SIZE_K": 512, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 0, "dot_prod_mode": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1, 27648, 5120, 5120, 1, 408)": {"BLOCK_SIZE_M": 1, "BLOCK_SIZE_N": 1, "BLOCK_SIZE_K": 1024, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 0, "dot_prod_mode": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1, 2048, 3840, 3840, 1, 408)": {"BLOCK_SIZE_M": 1, "BLOCK_SIZE_N": 8, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 0, "dot_prod_mode": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 2, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1, 4096, 3840, 3840, 1, 408)": {"BLOCK_SIZE_M": 1, "BLOCK_SIZE_N": 8, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 0, "dot_prod_mode": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 2, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1, 8192, 3840, 3840, 1, 408)": {"BLOCK_SIZE_M": 1, "BLOCK_SIZE_N": 8, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 0, "dot_prod_mode": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 2, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1, 3840, 4096, 4096, 1, 408)": {"BLOCK_SIZE_M": 1, "BLOCK_SIZE_N": 8, "BLOCK_SIZE_K": 1024, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 0, "dot_prod_mode": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 2, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1, 3840, 15360, 15360, 1, 408)": {"BLOCK_SIZE_M": 1, "BLOCK_SIZE_N": 8, "BLOCK_SIZE_K": 1024, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 0, "dot_prod_mode": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 2, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1, 30720, 3840, 3840, 1, 408)": {"BLOCK_SIZE_M": 1, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 0, "dot_prod_mode": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}}, "GEMM_SPLITK": {"(64, 4096, 4096, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(48, 4096, 4096, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(32, 4096, 4096, 64, 8, 104)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(24, 4096, 4096, 64, 8, 104)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(16, 4096, 4096, 64, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(8, 4096, 4096, 64, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4, 4096, 4096, 64, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2, 4096, 4096, 64, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(64, 4096, 4096, 4096, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(48, 4096, 4096, 4096, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(32, 4096, 4096, 4096, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 512, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(24, 4096, 4096, 4096, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 512, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(16, 4096, 4096, 4096, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 512, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(8, 4096, 4096, 4096, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 512, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4, 4096, 4096, 4096, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2, 4096, 4096, 4096, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(64, 4096, 4096, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(48, 4096, 4096, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(32, 4096, 4096, 128, 8, 104)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(24, 4096, 4096, 128, 8, 104)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(16, 4096, 4096, 128, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(8, 4096, 4096, 128, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4, 4096, 4096, 128, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2, 4096, 4096, 128, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(64, 6144, 4096, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 4, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(48, 6144, 4096, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 4, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(32, 6144, 4096, 64, 8, 104)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(24, 6144, 4096, 64, 8, 104)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 512, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(16, 6144, 4096, 64, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(8, 6144, 4096, 64, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4, 6144, 4096, 64, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2, 6144, 4096, 64, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(64, 6144, 4096, 4096, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(48, 6144, 4096, 4096, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(32, 6144, 4096, 4096, 1, 408)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(24, 6144, 4096, 4096, 1, 408)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(16, 6144, 4096, 4096, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(8, 6144, 4096, 4096, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4, 6144, 4096, 4096, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2, 6144, 4096, 4096, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(64, 6144, 4096, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "SPLIT_K": 4, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(48, 6144, 4096, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "SPLIT_K": 4, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(32, 6144, 4096, 128, 8, 104)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(24, 6144, 4096, 128, 8, 104)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(16, 6144, 4096, 128, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(8, 6144, 4096, 128, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4, 6144, 4096, 128, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2, 6144, 4096, 128, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(64, 4096, 14336, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(48, 4096, 14336, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(32, 4096, 14336, 64, 8, 104)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(24, 4096, 14336, 64, 8, 104)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(16, 4096, 14336, 64, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(8, 4096, 14336, 64, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4, 4096, 14336, 64, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2, 4096, 14336, 64, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(64, 4096, 14336, 14336, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 512, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(48, 4096, 14336, 14336, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 512, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(32, 4096, 14336, 14336, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 512, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(24, 4096, 14336, 14336, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 512, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(16, 4096, 14336, 14336, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 512, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(8, 4096, 14336, 14336, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 512, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4, 4096, 14336, 14336, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 512, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2, 4096, 14336, 14336, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 512, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(64, 4096, 14336, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(48, 4096, 14336, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(32, 4096, 14336, 128, 8, 104)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(24, 4096, 14336, 128, 8, 104)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(16, 4096, 14336, 128, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(8, 4096, 14336, 128, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4, 4096, 14336, 128, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2, 4096, 14336, 128, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(64, 28672, 4096, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(48, 28672, 4096, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(32, 28672, 4096, 64, 8, 104)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 512, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 4, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(24, 28672, 4096, 64, 8, 104)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 512, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(16, 28672, 4096, 64, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 512, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(8, 28672, 4096, 64, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 512, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4, 28672, 4096, 64, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 512, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2, 28672, 4096, 64, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 512, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(64, 28672, 4096, 4096, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 2, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(48, 28672, 4096, 4096, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 2, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(32, 28672, 4096, 4096, 1, 408)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 2, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(24, 28672, 4096, 4096, 1, 408)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 2, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(16, 28672, 4096, 4096, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 2, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(8, 28672, 4096, 4096, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 2, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4, 28672, 4096, 4096, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 2, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2, 28672, 4096, 4096, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 2, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(64, 28672, 4096, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(48, 28672, 4096, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(32, 28672, 4096, 128, 8, 104)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 512, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 4, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(24, 28672, 4096, 128, 8, 104)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 512, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(16, 28672, 4096, 128, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 512, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(8, 28672, 4096, 128, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 512, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4, 28672, 4096, 128, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 512, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2, 28672, 4096, 128, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 512, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(64, 3584, 3584, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(48, 3584, 3584, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(32, 3584, 3584, 64, 8, 104)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(24, 3584, 3584, 64, 8, 104)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(16, 3584, 3584, 64, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(8, 3584, 3584, 64, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4, 3584, 3584, 64, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2, 3584, 3584, 64, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(64, 3584, 3584, 3584, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(48, 3584, 3584, 3584, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 512, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(32, 3584, 3584, 3584, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 512, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(24, 3584, 3584, 3584, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 512, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(16, 3584, 3584, 3584, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 512, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(8, 3584, 3584, 3584, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 512, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4, 3584, 3584, 3584, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 512, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2, 3584, 3584, 3584, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 512, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(64, 3584, 3584, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(48, 3584, 3584, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(32, 3584, 3584, 128, 8, 104)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(24, 3584, 3584, 128, 8, 104)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(16, 3584, 3584, 128, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(8, 3584, 3584, 128, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4, 3584, 3584, 128, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2, 3584, 3584, 128, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(64, 4608, 3584, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(48, 4608, 3584, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(32, 4608, 3584, 64, 8, 104)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(24, 4608, 3584, 64, 8, 104)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(16, 4608, 3584, 64, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(8, 4608, 3584, 64, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4, 4608, 3584, 64, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2, 4608, 3584, 64, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(64, 4608, 3584, 3584, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(48, 4608, 3584, 3584, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(32, 4608, 3584, 3584, 1, 408)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(24, 4608, 3584, 3584, 1, 408)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(16, 4608, 3584, 3584, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 512, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(8, 4608, 3584, 3584, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 512, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4, 4608, 3584, 3584, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 512, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2, 4608, 3584, 3584, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 512, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(64, 4608, 3584, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(48, 4608, 3584, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(32, 4608, 3584, 128, 8, 104)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(24, 4608, 3584, 128, 8, 104)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(16, 4608, 3584, 128, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(8, 4608, 3584, 128, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4, 4608, 3584, 128, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2, 4608, 3584, 128, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(64, 3584, 18944, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(48, 3584, 18944, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(32, 3584, 18944, 64, 8, 104)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(24, 3584, 18944, 64, 8, 104)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(16, 3584, 18944, 64, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(8, 3584, 18944, 64, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4, 3584, 18944, 64, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2, 3584, 18944, 64, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(64, 3584, 18944, 18944, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 512, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(48, 3584, 18944, 18944, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 512, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(32, 3584, 18944, 18944, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 512, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(24, 3584, 18944, 18944, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 512, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(16, 3584, 18944, 18944, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 512, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(8, 3584, 18944, 18944, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 512, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4, 3584, 18944, 18944, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 512, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2, 3584, 18944, 18944, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 512, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(64, 3584, 18944, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(48, 3584, 18944, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(32, 3584, 18944, 128, 8, 104)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(24, 3584, 18944, 128, 8, 104)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(16, 3584, 18944, 128, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(8, 3584, 18944, 128, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4, 3584, 18944, 128, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2, 3584, 18944, 128, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(64, 37888, 3584, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 4, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(48, 37888, 3584, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 4, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(32, 37888, 3584, 64, 8, 104)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 512, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(24, 37888, 3584, 64, 8, 104)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 512, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(16, 37888, 3584, 64, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 512, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(8, 37888, 3584, 64, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 512, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4, 37888, 3584, 64, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 512, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2, 37888, 3584, 64, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 512, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(64, 37888, 3584, 3584, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(48, 37888, 3584, 3584, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(32, 37888, 3584, 3584, 1, 408)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 2, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(24, 37888, 3584, 3584, 1, 408)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 2, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(16, 37888, 3584, 3584, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 2, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(8, 37888, 3584, 3584, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 2, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4, 37888, 3584, 3584, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 2, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2, 37888, 3584, 3584, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 2, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(64, 37888, 3584, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 4, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(48, 37888, 3584, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 4, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(32, 37888, 3584, 128, 8, 104)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 512, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(24, 37888, 3584, 128, 8, 104)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 512, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(16, 37888, 3584, 128, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 512, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(8, 37888, 3584, 128, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "SPLIT_K": 2, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4, 37888, 3584, 128, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "SPLIT_K": 2, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2, 37888, 3584, 128, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "SPLIT_K": 2, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(64, 3072, 3072, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(48, 3072, 3072, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(32, 3072, 3072, 64, 8, 104)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(24, 3072, 3072, 64, 8, 104)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(16, 3072, 3072, 64, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(8, 3072, 3072, 64, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4, 3072, 3072, 64, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2, 3072, 3072, 64, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(64, 3072, 3072, 3072, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(48, 3072, 3072, 3072, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(32, 3072, 3072, 3072, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 512, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(24, 3072, 3072, 3072, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 512, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(16, 3072, 3072, 3072, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 512, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(8, 3072, 3072, 3072, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 512, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4, 3072, 3072, 3072, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 512, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2, 3072, 3072, 3072, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 512, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(64, 3072, 3072, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(48, 3072, 3072, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(32, 3072, 3072, 128, 8, 104)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(24, 3072, 3072, 128, 8, 104)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(16, 3072, 3072, 128, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(8, 3072, 3072, 128, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4, 3072, 3072, 128, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2, 3072, 3072, 128, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(64, 1024, 4096, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(48, 1024, 4096, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(32, 1024, 4096, 64, 8, 104)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(24, 1024, 4096, 64, 8, 104)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(16, 1024, 4096, 64, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(8, 1024, 4096, 64, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4, 1024, 4096, 64, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2, 1024, 4096, 64, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(64, 1024, 4096, 4096, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(48, 1024, 4096, 4096, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(32, 1024, 4096, 4096, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 512, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(24, 1024, 4096, 4096, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 512, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(16, 1024, 4096, 4096, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 2, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(8, 1024, 4096, 4096, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 2, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4, 1024, 4096, 4096, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 2, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2, 1024, 4096, 4096, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 2, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(64, 1024, 4096, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(48, 1024, 4096, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(32, 1024, 4096, 128, 8, 104)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(24, 1024, 4096, 128, 8, 104)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(16, 1024, 4096, 128, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(8, 1024, 4096, 128, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4, 1024, 4096, 128, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2, 1024, 4096, 128, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(64, 14336, 4096, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(48, 14336, 4096, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(32, 14336, 4096, 64, 8, 104)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 512, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(24, 14336, 4096, 64, 8, 104)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 512, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(16, 14336, 4096, 64, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 512, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(8, 14336, 4096, 64, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 512, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4, 14336, 4096, 64, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 512, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2, 14336, 4096, 64, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 512, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(64, 14336, 4096, 4096, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(48, 14336, 4096, 4096, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(32, 14336, 4096, 4096, 1, 408)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(24, 14336, 4096, 4096, 1, 408)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(16, 14336, 4096, 4096, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(8, 14336, 4096, 4096, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4, 14336, 4096, 4096, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2, 14336, 4096, 4096, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(64, 14336, 4096, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(48, 14336, 4096, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(32, 14336, 4096, 128, 8, 104)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 512, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(24, 14336, 4096, 128, 8, 104)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 512, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(16, 14336, 4096, 128, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 512, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(8, 14336, 4096, 128, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 512, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4, 14336, 4096, 128, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 512, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2, 14336, 4096, 128, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 512, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(64, 512, 3584, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(48, 512, 3584, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(32, 512, 3584, 64, 8, 104)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(24, 512, 3584, 64, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(16, 512, 3584, 64, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(8, 512, 3584, 64, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4, 512, 3584, 64, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2, 512, 3584, 64, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(64, 512, 3584, 3584, 1, 408)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(48, 512, 3584, 3584, 1, 408)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(32, 512, 3584, 3584, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 512, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(24, 512, 3584, 3584, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 512, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(16, 512, 3584, 3584, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 512, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(8, 512, 3584, 3584, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 512, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4, 512, 3584, 3584, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 512, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2, 512, 3584, 3584, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(64, 512, 3584, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(48, 512, 3584, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(32, 512, 3584, 128, 8, 104)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(24, 512, 3584, 128, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(16, 512, 3584, 128, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(8, 512, 3584, 128, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4, 512, 3584, 128, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2, 512, 3584, 128, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(64, 18944, 3584, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(48, 18944, 3584, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(32, 18944, 3584, 64, 8, 104)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(24, 18944, 3584, 64, 8, 104)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(16, 18944, 3584, 64, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "SPLIT_K": 4, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(8, 18944, 3584, 64, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "SPLIT_K": 4, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4, 18944, 3584, 64, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "SPLIT_K": 4, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2, 18944, 3584, 64, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "SPLIT_K": 4, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(64, 18944, 3584, 3584, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(48, 18944, 3584, 3584, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(32, 18944, 3584, 3584, 1, 408)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 512, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 2, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(24, 18944, 3584, 3584, 1, 408)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(16, 18944, 3584, 3584, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 512, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 2, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(8, 18944, 3584, 3584, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 512, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 2, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4, 18944, 3584, 3584, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 512, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 2, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2, 18944, 3584, 3584, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(64, 18944, 3584, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(48, 18944, 3584, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(32, 18944, 3584, 128, 8, 104)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(24, 18944, 3584, 128, 8, 104)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(16, 18944, 3584, 128, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "SPLIT_K": 4, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(8, 18944, 3584, 128, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "SPLIT_K": 4, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4, 18944, 3584, 128, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "SPLIT_K": 4, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2, 18944, 3584, 128, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "SPLIT_K": 4, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(64, 5120, 3072, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(48, 5120, 3072, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(32, 5120, 3072, 64, 8, 104)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(24, 5120, 3072, 64, 8, 104)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(16, 5120, 3072, 64, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(8, 5120, 3072, 64, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4, 5120, 3072, 64, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2, 5120, 3072, 64, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(64, 5120, 3072, 3072, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(48, 5120, 3072, 3072, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(32, 5120, 3072, 3072, 1, 408)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(24, 5120, 3072, 3072, 1, 408)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(16, 5120, 3072, 3072, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(8, 5120, 3072, 3072, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4, 5120, 3072, 3072, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2, 5120, 3072, 3072, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(64, 5120, 3072, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(48, 5120, 3072, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(32, 5120, 3072, 128, 8, 104)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(24, 5120, 3072, 128, 8, 104)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(16, 5120, 3072, 128, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(8, 5120, 3072, 128, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4, 5120, 3072, 128, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2, 5120, 3072, 128, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(64, 3072, 8192, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(48, 3072, 8192, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(32, 3072, 8192, 64, 8, 104)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(24, 3072, 8192, 64, 8, 104)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(16, 3072, 8192, 64, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(8, 3072, 8192, 64, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4, 3072, 8192, 64, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2, 3072, 8192, 64, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(64, 3072, 8192, 8192, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 512, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(48, 3072, 8192, 8192, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 512, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(32, 3072, 8192, 8192, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 512, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(24, 3072, 8192, 8192, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 512, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(16, 3072, 8192, 8192, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 512, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(8, 3072, 8192, 8192, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 512, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4, 3072, 8192, 8192, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 512, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2, 3072, 8192, 8192, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 512, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(64, 3072, 8192, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(48, 3072, 8192, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(32, 3072, 8192, 128, 8, 104)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(24, 3072, 8192, 128, 8, 104)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(16, 3072, 8192, 128, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(8, 3072, 8192, 128, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4, 3072, 8192, 128, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2, 3072, 8192, 128, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(64, 16384, 3072, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 2, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(48, 16384, 3072, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 2, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(32, 16384, 3072, 64, 8, 104)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 512, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(24, 16384, 3072, 64, 8, 104)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 512, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(16, 16384, 3072, 64, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 512, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(8, 16384, 3072, 64, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 512, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4, 16384, 3072, 64, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 512, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2, 16384, 3072, 64, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 512, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(64, 16384, 3072, 3072, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(48, 16384, 3072, 3072, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(32, 16384, 3072, 3072, 1, 408)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(24, 16384, 3072, 3072, 1, 408)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(16, 16384, 3072, 3072, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 512, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 2, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(8, 16384, 3072, 3072, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 512, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 2, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4, 16384, 3072, 3072, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 512, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 2, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2, 16384, 3072, 3072, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 512, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 2, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(64, 16384, 3072, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 2, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(48, 16384, 3072, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 2, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(32, 16384, 3072, 128, 8, 104)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 512, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(24, 16384, 3072, 128, 8, 104)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 512, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(16, 16384, 3072, 128, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 512, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(8, 16384, 3072, 128, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 512, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4, 16384, 3072, 128, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 512, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2, 16384, 3072, 128, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 512, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(64, 2048, 2048, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(48, 2048, 2048, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(32, 2048, 2048, 64, 8, 104)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(24, 2048, 2048, 64, 8, 104)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(16, 2048, 2048, 64, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(8, 2048, 2048, 64, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4, 2048, 2048, 64, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2, 2048, 2048, 64, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(64, 2048, 2048, 2048, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(48, 2048, 2048, 2048, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(32, 2048, 2048, 2048, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(24, 2048, 2048, 2048, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(16, 2048, 2048, 2048, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(8, 2048, 2048, 2048, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4, 2048, 2048, 2048, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2, 2048, 2048, 2048, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(64, 2048, 2048, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(48, 2048, 2048, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(32, 2048, 2048, 128, 8, 104)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(24, 2048, 2048, 128, 8, 104)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(16, 2048, 2048, 128, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(8, 2048, 2048, 128, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4, 2048, 2048, 128, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2, 2048, 2048, 128, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(64, 2560, 2048, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(48, 2560, 2048, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(32, 2560, 2048, 64, 8, 104)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(24, 2560, 2048, 64, 8, 104)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(16, 2560, 2048, 64, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(8, 2560, 2048, 64, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4, 2560, 2048, 64, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2, 2560, 2048, 64, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(64, 2560, 2048, 2048, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(48, 2560, 2048, 2048, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(32, 2560, 2048, 2048, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 512, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(24, 2560, 2048, 2048, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 512, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(16, 2560, 2048, 2048, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(8, 2560, 2048, 2048, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4, 2560, 2048, 2048, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2, 2560, 2048, 2048, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(64, 2560, 2048, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(48, 2560, 2048, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(32, 2560, 2048, 128, 8, 104)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(24, 2560, 2048, 128, 8, 104)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(16, 2560, 2048, 128, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(8, 2560, 2048, 128, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4, 2560, 2048, 128, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2, 2560, 2048, 128, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(64, 2048, 11008, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(48, 2048, 11008, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(32, 2048, 11008, 64, 8, 104)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(24, 2048, 11008, 64, 8, 104)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(16, 2048, 11008, 64, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(8, 2048, 11008, 64, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4, 2048, 11008, 64, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2, 2048, 11008, 64, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(64, 2048, 11008, 11008, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 512, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(48, 2048, 11008, 11008, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 512, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(32, 2048, 11008, 11008, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 512, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(24, 2048, 11008, 11008, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 512, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(16, 2048, 11008, 11008, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 512, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(8, 2048, 11008, 11008, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 512, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4, 2048, 11008, 11008, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 512, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2, 2048, 11008, 11008, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 512, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(64, 2048, 11008, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(48, 2048, 11008, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(32, 2048, 11008, 128, 8, 104)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(24, 2048, 11008, 128, 8, 104)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(16, 2048, 11008, 128, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(8, 2048, 11008, 128, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4, 2048, 11008, 128, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2, 2048, 11008, 128, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(64, 22016, 2048, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 4, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(48, 22016, 2048, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 4, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(32, 22016, 2048, 64, 8, 104)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 512, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(24, 22016, 2048, 64, 8, 104)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 512, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(16, 22016, 2048, 64, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 512, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(8, 22016, 2048, 64, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 512, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4, 22016, 2048, 64, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 512, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2, 22016, 2048, 64, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 512, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(64, 22016, 2048, 2048, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(48, 22016, 2048, 2048, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(32, 22016, 2048, 2048, 1, 408)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 2, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(24, 22016, 2048, 2048, 1, 408)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 2, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(16, 22016, 2048, 2048, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 512, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 2, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(8, 22016, 2048, 2048, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 512, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 2, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4, 22016, 2048, 2048, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 512, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 2, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2, 22016, 2048, 2048, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 512, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 2, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(64, 22016, 2048, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 4, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(48, 22016, 2048, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 4, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(32, 22016, 2048, 128, 8, 104)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 512, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(24, 22016, 2048, 128, 8, 104)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 512, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(16, 22016, 2048, 128, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 512, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(8, 22016, 2048, 128, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 512, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4, 22016, 2048, 128, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 512, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2, 22016, 2048, 128, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 512, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(64, 5120, 5120, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(48, 5120, 5120, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(32, 5120, 5120, 64, 8, 104)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(24, 5120, 5120, 64, 8, 104)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(16, 5120, 5120, 64, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(8, 5120, 5120, 64, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4, 5120, 5120, 64, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2, 5120, 5120, 64, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(64, 5120, 5120, 5120, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(48, 5120, 5120, 5120, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(32, 5120, 5120, 5120, 1, 408)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(24, 5120, 5120, 5120, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(16, 5120, 5120, 5120, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 512, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(8, 5120, 5120, 5120, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 512, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4, 5120, 5120, 5120, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 512, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2, 5120, 5120, 5120, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 512, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(64, 5120, 5120, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(48, 5120, 5120, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(32, 5120, 5120, 128, 8, 104)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(24, 5120, 5120, 128, 8, 104)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(16, 5120, 5120, 128, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(8, 5120, 5120, 128, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4, 5120, 5120, 128, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2, 5120, 5120, 128, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(64, 7168, 5120, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(48, 7168, 5120, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(32, 7168, 5120, 64, 8, 104)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(24, 7168, 5120, 64, 8, 104)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 512, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(16, 7168, 5120, 64, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 512, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(8, 7168, 5120, 64, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 512, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4, 7168, 5120, 64, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 512, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2, 7168, 5120, 64, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 512, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(64, 7168, 5120, 5120, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(48, 7168, 5120, 5120, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(32, 7168, 5120, 5120, 1, 408)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(24, 7168, 5120, 5120, 1, 408)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(16, 7168, 5120, 5120, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(8, 7168, 5120, 5120, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4, 7168, 5120, 5120, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2, 7168, 5120, 5120, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(64, 7168, 5120, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(48, 7168, 5120, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(32, 7168, 5120, 128, 8, 104)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(24, 7168, 5120, 128, 8, 104)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 512, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(16, 7168, 5120, 128, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 512, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(8, 7168, 5120, 128, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 512, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4, 7168, 5120, 128, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 512, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2, 7168, 5120, 128, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 512, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(64, 5120, 13824, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(48, 5120, 13824, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(32, 5120, 13824, 64, 8, 104)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(24, 5120, 13824, 64, 8, 104)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(16, 5120, 13824, 64, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(8, 5120, 13824, 64, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4, 5120, 13824, 64, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2, 5120, 13824, 64, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(64, 5120, 13824, 13824, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(48, 5120, 13824, 13824, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(32, 5120, 13824, 13824, 1, 408)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 512, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(24, 5120, 13824, 13824, 1, 408)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 512, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(16, 5120, 13824, 13824, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 512, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(8, 5120, 13824, 13824, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 512, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4, 5120, 13824, 13824, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 512, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2, 5120, 13824, 13824, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 512, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(64, 5120, 13824, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(48, 5120, 13824, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(32, 5120, 13824, 128, 8, 104)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(24, 5120, 13824, 128, 8, 104)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(16, 5120, 13824, 128, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(8, 5120, 13824, 128, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4, 5120, 13824, 128, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2, 5120, 13824, 128, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(64, 27648, 5120, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(48, 27648, 5120, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(32, 27648, 5120, 64, 8, 104)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 512, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 4, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(24, 27648, 5120, 64, 8, 104)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 512, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(16, 27648, 5120, 64, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 512, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(8, 27648, 5120, 64, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 512, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4, 27648, 5120, 64, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 512, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2, 27648, 5120, 64, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 512, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(64, 27648, 5120, 5120, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 2, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(48, 27648, 5120, 5120, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 2, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(32, 27648, 5120, 5120, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 2, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(24, 27648, 5120, 5120, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 2, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(16, 27648, 5120, 5120, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 2, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(8, 27648, 5120, 5120, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 2, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4, 27648, 5120, 5120, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 2, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2, 27648, 5120, 5120, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 2, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(64, 27648, 5120, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(48, 27648, 5120, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(32, 27648, 5120, 128, 8, 104)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 512, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 4, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(24, 27648, 5120, 128, 8, 104)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 512, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(16, 27648, 5120, 128, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 512, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(8, 27648, 5120, 128, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 512, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4, 27648, 5120, 128, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 512, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2, 27648, 5120, 128, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 512, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(64, 2048, 3840, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(48, 2048, 3840, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(32, 2048, 3840, 64, 8, 104)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(24, 2048, 3840, 64, 8, 104)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(16, 2048, 3840, 64, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(8, 2048, 3840, 64, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4, 2048, 3840, 64, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2, 2048, 3840, 64, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(64, 2048, 3840, 3840, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(48, 2048, 3840, 3840, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(32, 2048, 3840, 3840, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(24, 2048, 3840, 3840, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(16, 2048, 3840, 3840, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(8, 2048, 3840, 3840, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4, 2048, 3840, 3840, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 512, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2, 2048, 3840, 3840, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(64, 4096, 3840, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(32, 4096, 3840, 64, 8, 104)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 4, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(16, 4096, 3840, 64, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(8, 4096, 3840, 64, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(64, 4096, 3840, 3840, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(32, 4096, 3840, 3840, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(16, 4096, 3840, 3840, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(8, 4096, 3840, 3840, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(64, 8192, 3840, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 4, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(32, 8192, 3840, 64, 8, 104)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 4, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(16, 8192, 3840, 64, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(8, 8192, 3840, 64, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(64, 8192, 3840, 3840, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(32, 8192, 3840, 3840, 1, 408)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(16, 8192, 3840, 3840, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(8, 8192, 3840, 3840, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(64, 3840, 4096, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(32, 3840, 4096, 64, 8, 104)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(16, 3840, 4096, 64, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(8, 3840, 4096, 64, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(64, 3840, 4096, 4096, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(32, 3840, 4096, 4096, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 512, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(16, 3840, 4096, 4096, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 512, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(8, 3840, 4096, 4096, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 512, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(64, 3840, 15360, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(32, 3840, 15360, 64, 8, 104)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(16, 3840, 15360, 64, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(8, 3840, 15360, 64, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 16, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(64, 3840, 15360, 15360, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 512, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(32, 3840, 15360, 15360, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 512, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(16, 3840, 15360, 15360, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 512, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(8, 3840, 15360, 15360, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 512, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(64, 30720, 3840, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(32, 30720, 3840, 64, 8, 104)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 512, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 4, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(16, 30720, 3840, 64, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 512, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 4, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(8, 30720, 3840, 64, 8, 104)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 512, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "SPLIT_K": 4, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(64, 30720, 3840, 3840, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 2, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(32, 30720, 3840, 3840, 1, 408)": {"BLOCK_SIZE_M": 32, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 2, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(16, 30720, 3840, 3840, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 2, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(8, 30720, 3840, 3840, 1, 408)": {"BLOCK_SIZE_M": 16, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "SPLIT_K": 1, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 2, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}}, "GEMM": {"(4096, 4096, 4096, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(3072, 4096, 4096, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2048, 4096, 4096, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1536, 4096, 4096, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1024, 4096, 4096, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(768, 4096, 4096, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(512, 4096, 4096, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(384, 4096, 4096, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(256, 4096, 4096, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(192, 4096, 4096, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(128, 4096, 4096, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(96, 4096, 4096, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4096, 4096, 4096, 4096, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(3072, 4096, 4096, 4096, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2048, 4096, 4096, 4096, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1536, 4096, 4096, 4096, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1024, 4096, 4096, 4096, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(768, 4096, 4096, 4096, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(512, 4096, 4096, 4096, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(384, 4096, 4096, 4096, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(256, 4096, 4096, 4096, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(192, 4096, 4096, 4096, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(128, 4096, 4096, 4096, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(96, 4096, 4096, 4096, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4096, 4096, 4096, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(3072, 4096, 4096, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2048, 4096, 4096, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1536, 4096, 4096, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1024, 4096, 4096, 128, 8, 104)": {"BLOCK_SIZE_M": 256, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(768, 4096, 4096, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(512, 4096, 4096, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(384, 4096, 4096, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(256, 4096, 4096, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(192, 4096, 4096, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(128, 4096, 4096, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(96, 4096, 4096, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4096, 6144, 4096, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(3072, 6144, 4096, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2048, 6144, 4096, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1536, 6144, 4096, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1024, 6144, 4096, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(768, 6144, 4096, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(512, 6144, 4096, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(384, 6144, 4096, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(256, 6144, 4096, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(192, 6144, 4096, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(128, 6144, 4096, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(96, 6144, 4096, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4096, 6144, 4096, 4096, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(3072, 6144, 4096, 4096, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2048, 6144, 4096, 4096, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1536, 6144, 4096, 4096, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1024, 6144, 4096, 4096, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(768, 6144, 4096, 4096, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(512, 6144, 4096, 4096, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(384, 6144, 4096, 4096, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(256, 6144, 4096, 4096, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(192, 6144, 4096, 4096, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(128, 6144, 4096, 4096, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(96, 6144, 4096, 4096, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4096, 6144, 4096, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(3072, 6144, 4096, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2048, 6144, 4096, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1536, 6144, 4096, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1024, 6144, 4096, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(768, 6144, 4096, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(512, 6144, 4096, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(384, 6144, 4096, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(256, 6144, 4096, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(192, 6144, 4096, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(128, 6144, 4096, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(96, 6144, 4096, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4096, 4096, 14336, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(3072, 4096, 14336, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2048, 4096, 14336, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1536, 4096, 14336, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1024, 4096, 14336, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(768, 4096, 14336, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(512, 4096, 14336, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(384, 4096, 14336, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(256, 4096, 14336, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(192, 4096, 14336, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(128, 4096, 14336, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(96, 4096, 14336, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4096, 4096, 14336, 14336, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(3072, 4096, 14336, 14336, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2048, 4096, 14336, 14336, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1536, 4096, 14336, 14336, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1024, 4096, 14336, 14336, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(768, 4096, 14336, 14336, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(512, 4096, 14336, 14336, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(384, 4096, 14336, 14336, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(256, 4096, 14336, 14336, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(192, 4096, 14336, 14336, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(128, 4096, 14336, 14336, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(96, 4096, 14336, 14336, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4096, 4096, 14336, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(3072, 4096, 14336, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2048, 4096, 14336, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1536, 4096, 14336, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1024, 4096, 14336, 128, 8, 104)": {"BLOCK_SIZE_M": 256, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(768, 4096, 14336, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(512, 4096, 14336, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(384, 4096, 14336, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(256, 4096, 14336, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(192, 4096, 14336, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(128, 4096, 14336, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(96, 4096, 14336, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4096, 28672, 4096, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(3072, 28672, 4096, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2048, 28672, 4096, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1536, 28672, 4096, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1024, 28672, 4096, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(768, 28672, 4096, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(512, 28672, 4096, 64, 8, 104)": {"BLOCK_SIZE_M": 256, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(384, 28672, 4096, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(256, 28672, 4096, 64, 8, 104)": {"BLOCK_SIZE_M": 256, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(192, 28672, 4096, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(128, 28672, 4096, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(96, 28672, 4096, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4096, 28672, 4096, 4096, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(3072, 28672, 4096, 4096, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2048, 28672, 4096, 4096, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1536, 28672, 4096, 4096, 1, 408)": {"BLOCK_SIZE_M": 256, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1024, 28672, 4096, 4096, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(768, 28672, 4096, 4096, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(512, 28672, 4096, 4096, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(384, 28672, 4096, 4096, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(256, 28672, 4096, 4096, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(192, 28672, 4096, 4096, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(128, 28672, 4096, 4096, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 512, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 3, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(96, 28672, 4096, 4096, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 512, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 3, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4096, 28672, 4096, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(3072, 28672, 4096, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2048, 28672, 4096, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1536, 28672, 4096, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1024, 28672, 4096, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(768, 28672, 4096, 128, 8, 104)": {"BLOCK_SIZE_M": 256, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(512, 28672, 4096, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(384, 28672, 4096, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(256, 28672, 4096, 128, 8, 104)": {"BLOCK_SIZE_M": 256, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(192, 28672, 4096, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(128, 28672, 4096, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(96, 28672, 4096, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4096, 3584, 3584, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(3072, 3584, 3584, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2048, 3584, 3584, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1536, 3584, 3584, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1024, 3584, 3584, 64, 8, 104)": {"BLOCK_SIZE_M": 256, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(768, 3584, 3584, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(512, 3584, 3584, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(384, 3584, 3584, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(256, 3584, 3584, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(192, 3584, 3584, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(128, 3584, 3584, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(96, 3584, 3584, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4096, 3584, 3584, 3584, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(3072, 3584, 3584, 3584, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2048, 3584, 3584, 3584, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1536, 3584, 3584, 3584, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1024, 3584, 3584, 3584, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(768, 3584, 3584, 3584, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(512, 3584, 3584, 3584, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(384, 3584, 3584, 3584, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(256, 3584, 3584, 3584, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(192, 3584, 3584, 3584, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(128, 3584, 3584, 3584, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(96, 3584, 3584, 3584, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4096, 3584, 3584, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(3072, 3584, 3584, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2048, 3584, 3584, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1536, 3584, 3584, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1024, 3584, 3584, 128, 8, 104)": {"BLOCK_SIZE_M": 256, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(768, 3584, 3584, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(512, 3584, 3584, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(384, 3584, 3584, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(256, 3584, 3584, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(192, 3584, 3584, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(128, 3584, 3584, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(96, 3584, 3584, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4096, 4608, 3584, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(3072, 4608, 3584, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2048, 4608, 3584, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1536, 4608, 3584, 64, 8, 104)": {"BLOCK_SIZE_M": 256, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1024, 4608, 3584, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(768, 4608, 3584, 64, 8, 104)": {"BLOCK_SIZE_M": 256, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(512, 4608, 3584, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(384, 4608, 3584, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(256, 4608, 3584, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(192, 4608, 3584, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(128, 4608, 3584, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(96, 4608, 3584, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4096, 4608, 3584, 3584, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(3072, 4608, 3584, 3584, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2048, 4608, 3584, 3584, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1536, 4608, 3584, 3584, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1024, 4608, 3584, 3584, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(768, 4608, 3584, 3584, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(512, 4608, 3584, 3584, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(384, 4608, 3584, 3584, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(256, 4608, 3584, 3584, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(192, 4608, 3584, 3584, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(128, 4608, 3584, 3584, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(96, 4608, 3584, 3584, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4096, 4608, 3584, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(3072, 4608, 3584, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2048, 4608, 3584, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1536, 4608, 3584, 128, 8, 104)": {"BLOCK_SIZE_M": 256, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1024, 4608, 3584, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(768, 4608, 3584, 128, 8, 104)": {"BLOCK_SIZE_M": 256, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(512, 4608, 3584, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(384, 4608, 3584, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(256, 4608, 3584, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(192, 4608, 3584, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(128, 4608, 3584, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(96, 4608, 3584, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4096, 3584, 18944, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(3072, 3584, 18944, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2048, 3584, 18944, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1536, 3584, 18944, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1024, 3584, 18944, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(768, 3584, 18944, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(512, 3584, 18944, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(384, 3584, 18944, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(256, 3584, 18944, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(192, 3584, 18944, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(128, 3584, 18944, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(96, 3584, 18944, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4096, 3584, 18944, 18944, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(3072, 3584, 18944, 18944, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2048, 3584, 18944, 18944, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1536, 3584, 18944, 18944, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1024, 3584, 18944, 18944, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(768, 3584, 18944, 18944, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(512, 3584, 18944, 18944, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(384, 3584, 18944, 18944, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(256, 3584, 18944, 18944, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(192, 3584, 18944, 18944, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(128, 3584, 18944, 18944, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(96, 3584, 18944, 18944, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4096, 3584, 18944, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(3072, 3584, 18944, 128, 8, 104)": {"BLOCK_SIZE_M": 256, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2048, 3584, 18944, 128, 8, 104)": {"BLOCK_SIZE_M": 256, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1536, 3584, 18944, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1024, 3584, 18944, 128, 8, 104)": {"BLOCK_SIZE_M": 256, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(768, 3584, 18944, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(512, 3584, 18944, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(384, 3584, 18944, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(256, 3584, 18944, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(192, 3584, 18944, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(128, 3584, 18944, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(96, 3584, 18944, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4096, 37888, 3584, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(3072, 37888, 3584, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2048, 37888, 3584, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1536, 37888, 3584, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1024, 37888, 3584, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(768, 37888, 3584, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(512, 37888, 3584, 64, 8, 104)": {"BLOCK_SIZE_M": 256, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(384, 37888, 3584, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(256, 37888, 3584, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(192, 37888, 3584, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(128, 37888, 3584, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(96, 37888, 3584, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4096, 37888, 3584, 3584, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(3072, 37888, 3584, 3584, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2048, 37888, 3584, 3584, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1536, 37888, 3584, 3584, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1024, 37888, 3584, 3584, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(768, 37888, 3584, 3584, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(512, 37888, 3584, 3584, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(384, 37888, 3584, 3584, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(256, 37888, 3584, 3584, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(192, 37888, 3584, 3584, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(128, 37888, 3584, 3584, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(96, 37888, 3584, 3584, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4096, 37888, 3584, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(3072, 37888, 3584, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2048, 37888, 3584, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1536, 37888, 3584, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1024, 37888, 3584, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(768, 37888, 3584, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(512, 37888, 3584, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(384, 37888, 3584, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(256, 37888, 3584, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(192, 37888, 3584, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(128, 37888, 3584, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(96, 37888, 3584, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4096, 3072, 3072, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(3072, 3072, 3072, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2048, 3072, 3072, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1536, 3072, 3072, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1024, 3072, 3072, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(768, 3072, 3072, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(512, 3072, 3072, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(384, 3072, 3072, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(256, 3072, 3072, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(192, 3072, 3072, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(128, 3072, 3072, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(96, 3072, 3072, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4096, 3072, 3072, 3072, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(3072, 3072, 3072, 3072, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2048, 3072, 3072, 3072, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1536, 3072, 3072, 3072, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1024, 3072, 3072, 3072, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(768, 3072, 3072, 3072, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(512, 3072, 3072, 3072, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(384, 3072, 3072, 3072, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(256, 3072, 3072, 3072, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(192, 3072, 3072, 3072, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(128, 3072, 3072, 3072, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(96, 3072, 3072, 3072, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4096, 3072, 3072, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(3072, 3072, 3072, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2048, 3072, 3072, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1536, 3072, 3072, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1024, 3072, 3072, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(768, 3072, 3072, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(512, 3072, 3072, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(384, 3072, 3072, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(256, 3072, 3072, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(192, 3072, 3072, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(128, 3072, 3072, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(96, 3072, 3072, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4096, 5120, 3072, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(3072, 5120, 3072, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2048, 5120, 3072, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1536, 5120, 3072, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1024, 5120, 3072, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(768, 5120, 3072, 64, 8, 104)": {"BLOCK_SIZE_M": 256, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(512, 5120, 3072, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(384, 5120, 3072, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(256, 5120, 3072, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(192, 5120, 3072, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(128, 5120, 3072, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(96, 5120, 3072, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4096, 1024, 4096, 64, 8, 104)": {"BLOCK_SIZE_M": 256, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(3072, 1024, 4096, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2048, 1024, 4096, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1536, 1024, 4096, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1024, 1024, 4096, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(768, 1024, 4096, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(512, 1024, 4096, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(384, 1024, 4096, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(256, 1024, 4096, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(192, 1024, 4096, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(128, 1024, 4096, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(96, 1024, 4096, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4096, 1024, 4096, 4096, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(3072, 1024, 4096, 4096, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2048, 1024, 4096, 4096, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1536, 1024, 4096, 4096, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1024, 1024, 4096, 4096, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(768, 1024, 4096, 4096, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(512, 1024, 4096, 4096, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(384, 1024, 4096, 4096, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(256, 1024, 4096, 4096, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(192, 1024, 4096, 4096, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(128, 1024, 4096, 4096, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(96, 1024, 4096, 4096, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4096, 1024, 4096, 128, 8, 104)": {"BLOCK_SIZE_M": 256, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(3072, 1024, 4096, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2048, 1024, 4096, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1536, 1024, 4096, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1024, 1024, 4096, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(768, 1024, 4096, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(512, 1024, 4096, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(384, 1024, 4096, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(256, 1024, 4096, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(192, 1024, 4096, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(128, 1024, 4096, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(96, 1024, 4096, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4096, 14336, 4096, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(3072, 14336, 4096, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2048, 14336, 4096, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1536, 14336, 4096, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1024, 14336, 4096, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(768, 14336, 4096, 64, 8, 104)": {"BLOCK_SIZE_M": 256, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(512, 14336, 4096, 64, 8, 104)": {"BLOCK_SIZE_M": 256, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(384, 14336, 4096, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(256, 14336, 4096, 64, 8, 104)": {"BLOCK_SIZE_M": 256, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(192, 14336, 4096, 64, 8, 104)": {"BLOCK_SIZE_M": 256, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(128, 14336, 4096, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(96, 14336, 4096, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4096, 14336, 4096, 4096, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(3072, 14336, 4096, 4096, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2048, 14336, 4096, 4096, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1536, 14336, 4096, 4096, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1024, 14336, 4096, 4096, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(768, 14336, 4096, 4096, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(512, 14336, 4096, 4096, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(384, 14336, 4096, 4096, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(256, 14336, 4096, 4096, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(192, 14336, 4096, 4096, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(128, 14336, 4096, 4096, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(96, 14336, 4096, 4096, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4096, 14336, 4096, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(3072, 14336, 4096, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2048, 14336, 4096, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1536, 14336, 4096, 128, 8, 104)": {"BLOCK_SIZE_M": 256, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1024, 14336, 4096, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(768, 14336, 4096, 128, 8, 104)": {"BLOCK_SIZE_M": 256, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(512, 14336, 4096, 128, 8, 104)": {"BLOCK_SIZE_M": 256, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(384, 14336, 4096, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(256, 14336, 4096, 128, 8, 104)": {"BLOCK_SIZE_M": 256, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(192, 14336, 4096, 128, 8, 104)": {"BLOCK_SIZE_M": 256, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(128, 14336, 4096, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(96, 14336, 4096, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4096, 512, 3584, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(3072, 512, 3584, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2048, 512, 3584, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1536, 512, 3584, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1024, 512, 3584, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(768, 512, 3584, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(512, 512, 3584, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(384, 512, 3584, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(256, 512, 3584, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(192, 512, 3584, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(128, 512, 3584, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(96, 512, 3584, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4096, 512, 3584, 3584, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(3072, 512, 3584, 3584, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2048, 512, 3584, 3584, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1536, 512, 3584, 3584, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1024, 512, 3584, 3584, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(768, 512, 3584, 3584, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(512, 512, 3584, 3584, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(384, 512, 3584, 3584, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(256, 512, 3584, 3584, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(192, 512, 3584, 3584, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(128, 512, 3584, 3584, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(96, 512, 3584, 3584, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4096, 512, 3584, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(3072, 512, 3584, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2048, 512, 3584, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1536, 512, 3584, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1024, 512, 3584, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(768, 512, 3584, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(512, 512, 3584, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(384, 512, 3584, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(256, 512, 3584, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(192, 512, 3584, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(128, 512, 3584, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(96, 512, 3584, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4096, 18944, 3584, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(3072, 18944, 3584, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2048, 18944, 3584, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1536, 18944, 3584, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1024, 18944, 3584, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(768, 18944, 3584, 64, 8, 104)": {"BLOCK_SIZE_M": 256, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(512, 18944, 3584, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(384, 18944, 3584, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(256, 18944, 3584, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(192, 18944, 3584, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(128, 18944, 3584, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(96, 18944, 3584, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4096, 18944, 3584, 3584, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(3072, 18944, 3584, 3584, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2048, 18944, 3584, 3584, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1536, 18944, 3584, 3584, 1, 408)": {"BLOCK_SIZE_M": 256, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1024, 18944, 3584, 3584, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(768, 18944, 3584, 3584, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(512, 18944, 3584, 3584, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(384, 18944, 3584, 3584, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(256, 18944, 3584, 3584, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(192, 18944, 3584, 3584, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(128, 18944, 3584, 3584, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(96, 18944, 3584, 3584, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4096, 18944, 3584, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(3072, 18944, 3584, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2048, 18944, 3584, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1536, 18944, 3584, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1024, 18944, 3584, 128, 8, 104)": {"BLOCK_SIZE_M": 256, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(768, 18944, 3584, 128, 8, 104)": {"BLOCK_SIZE_M": 256, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(512, 18944, 3584, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(384, 18944, 3584, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(256, 18944, 3584, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(192, 18944, 3584, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(128, 18944, 3584, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(96, 18944, 3584, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4096, 5120, 3072, 3072, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(3072, 5120, 3072, 3072, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2048, 5120, 3072, 3072, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1536, 5120, 3072, 3072, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1024, 5120, 3072, 3072, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(768, 5120, 3072, 3072, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(512, 5120, 3072, 3072, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(384, 5120, 3072, 3072, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(256, 5120, 3072, 3072, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(192, 5120, 3072, 3072, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(128, 5120, 3072, 3072, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(96, 5120, 3072, 3072, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4096, 5120, 3072, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(3072, 5120, 3072, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2048, 5120, 3072, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1536, 5120, 3072, 128, 8, 104)": {"BLOCK_SIZE_M": 256, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1024, 5120, 3072, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(768, 5120, 3072, 128, 8, 104)": {"BLOCK_SIZE_M": 256, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(512, 5120, 3072, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(384, 5120, 3072, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(256, 5120, 3072, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(192, 5120, 3072, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(128, 5120, 3072, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(96, 5120, 3072, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4096, 3072, 8192, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(3072, 3072, 8192, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2048, 3072, 8192, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1536, 3072, 8192, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1024, 3072, 8192, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(768, 3072, 8192, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(512, 3072, 8192, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(384, 3072, 8192, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(256, 3072, 8192, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(192, 3072, 8192, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(128, 3072, 8192, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(96, 3072, 8192, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4096, 3072, 8192, 8192, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(3072, 3072, 8192, 8192, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2048, 3072, 8192, 8192, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1536, 3072, 8192, 8192, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1024, 3072, 8192, 8192, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(768, 3072, 8192, 8192, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(512, 3072, 8192, 8192, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(384, 3072, 8192, 8192, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(256, 3072, 8192, 8192, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(192, 3072, 8192, 8192, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(128, 3072, 8192, 8192, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(96, 3072, 8192, 8192, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4096, 3072, 8192, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(3072, 3072, 8192, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2048, 3072, 8192, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1536, 3072, 8192, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1024, 3072, 8192, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(768, 3072, 8192, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(512, 3072, 8192, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(384, 3072, 8192, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(256, 3072, 8192, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(192, 3072, 8192, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(128, 3072, 8192, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(96, 3072, 8192, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4096, 16384, 3072, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(3072, 16384, 3072, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2048, 16384, 3072, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1536, 16384, 3072, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1024, 16384, 3072, 64, 8, 104)": {"BLOCK_SIZE_M": 256, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(768, 16384, 3072, 64, 8, 104)": {"BLOCK_SIZE_M": 256, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(512, 16384, 3072, 64, 8, 104)": {"BLOCK_SIZE_M": 256, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(384, 16384, 3072, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(256, 16384, 3072, 64, 8, 104)": {"BLOCK_SIZE_M": 256, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(192, 16384, 3072, 64, 8, 104)": {"BLOCK_SIZE_M": 256, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(128, 16384, 3072, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(96, 16384, 3072, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4096, 16384, 3072, 3072, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(3072, 16384, 3072, 3072, 1, 408)": {"BLOCK_SIZE_M": 256, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2048, 16384, 3072, 3072, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1536, 16384, 3072, 3072, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1024, 16384, 3072, 3072, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(768, 16384, 3072, 3072, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(512, 16384, 3072, 3072, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(384, 16384, 3072, 3072, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(256, 16384, 3072, 3072, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(192, 16384, 3072, 3072, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(128, 16384, 3072, 3072, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(96, 16384, 3072, 3072, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4096, 16384, 3072, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(3072, 16384, 3072, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2048, 16384, 3072, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1536, 16384, 3072, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1024, 16384, 3072, 128, 8, 104)": {"BLOCK_SIZE_M": 256, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(768, 16384, 3072, 128, 8, 104)": {"BLOCK_SIZE_M": 256, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(512, 16384, 3072, 128, 8, 104)": {"BLOCK_SIZE_M": 256, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(384, 16384, 3072, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(256, 16384, 3072, 128, 8, 104)": {"BLOCK_SIZE_M": 256, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(192, 16384, 3072, 128, 8, 104)": {"BLOCK_SIZE_M": 256, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(128, 16384, 3072, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(96, 16384, 3072, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4096, 2048, 2048, 64, 8, 104)": {"BLOCK_SIZE_M": 256, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(3072, 2048, 2048, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2048, 2048, 2048, 64, 8, 104)": {"BLOCK_SIZE_M": 256, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1536, 2048, 2048, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1024, 2048, 2048, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(768, 2048, 2048, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(512, 2048, 2048, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(384, 2048, 2048, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(256, 2048, 2048, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(192, 2048, 2048, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(128, 2048, 2048, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(96, 2048, 2048, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4096, 2048, 2048, 2048, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(3072, 2048, 2048, 2048, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2048, 2048, 2048, 2048, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1536, 2048, 2048, 2048, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1024, 2048, 2048, 2048, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(768, 2048, 2048, 2048, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(512, 2048, 2048, 2048, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(384, 2048, 2048, 2048, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(256, 2048, 2048, 2048, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(192, 2048, 2048, 2048, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(128, 2048, 2048, 2048, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(96, 2048, 2048, 2048, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4096, 2048, 2048, 128, 8, 104)": {"BLOCK_SIZE_M": 256, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(3072, 2048, 2048, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2048, 2048, 2048, 128, 8, 104)": {"BLOCK_SIZE_M": 256, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1536, 2048, 2048, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1024, 2048, 2048, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(768, 2048, 2048, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(512, 2048, 2048, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(384, 2048, 2048, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(256, 2048, 2048, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(192, 2048, 2048, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(128, 2048, 2048, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(96, 2048, 2048, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4096, 2560, 2048, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(3072, 2560, 2048, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2048, 2560, 2048, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1536, 2560, 2048, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1024, 2560, 2048, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(768, 2560, 2048, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(512, 2560, 2048, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(384, 2560, 2048, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(256, 2560, 2048, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(192, 2560, 2048, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(128, 2560, 2048, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(96, 2560, 2048, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4096, 2560, 2048, 2048, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(3072, 2560, 2048, 2048, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2048, 2560, 2048, 2048, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1536, 2560, 2048, 2048, 1, 408)": {"BLOCK_SIZE_M": 256, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1024, 2560, 2048, 2048, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(768, 2560, 2048, 2048, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(512, 2560, 2048, 2048, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(384, 2560, 2048, 2048, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(256, 2560, 2048, 2048, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(192, 2560, 2048, 2048, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(128, 2560, 2048, 2048, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(96, 2560, 2048, 2048, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4096, 2560, 2048, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(3072, 2560, 2048, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2048, 2560, 2048, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1536, 2560, 2048, 128, 8, 104)": {"BLOCK_SIZE_M": 256, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1024, 2560, 2048, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(768, 2560, 2048, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(512, 2560, 2048, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(384, 2560, 2048, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(256, 2560, 2048, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(192, 2560, 2048, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(128, 2560, 2048, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(96, 2560, 2048, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4096, 2048, 11008, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(3072, 2048, 11008, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2048, 2048, 11008, 64, 8, 104)": {"BLOCK_SIZE_M": 256, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1536, 2048, 11008, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1024, 2048, 11008, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(768, 2048, 11008, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(512, 2048, 11008, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(384, 2048, 11008, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(256, 2048, 11008, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(192, 2048, 11008, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(128, 2048, 11008, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(96, 2048, 11008, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4096, 2048, 11008, 11008, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(3072, 2048, 11008, 11008, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2048, 2048, 11008, 11008, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1536, 2048, 11008, 11008, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1024, 2048, 11008, 11008, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(768, 2048, 11008, 11008, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(512, 2048, 11008, 11008, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(384, 2048, 11008, 11008, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(256, 2048, 11008, 11008, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(192, 2048, 11008, 11008, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(128, 2048, 11008, 11008, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 512, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(96, 2048, 11008, 11008, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 512, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4096, 2048, 11008, 128, 8, 104)": {"BLOCK_SIZE_M": 256, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(3072, 2048, 11008, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2048, 2048, 11008, 128, 8, 104)": {"BLOCK_SIZE_M": 256, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1536, 2048, 11008, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1024, 2048, 11008, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(768, 2048, 11008, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(512, 2048, 11008, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(384, 2048, 11008, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(256, 2048, 11008, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(192, 2048, 11008, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(128, 2048, 11008, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(96, 2048, 11008, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4096, 22016, 2048, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(3072, 22016, 2048, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2048, 22016, 2048, 64, 8, 104)": {"BLOCK_SIZE_M": 256, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1536, 22016, 2048, 64, 8, 104)": {"BLOCK_SIZE_M": 256, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1024, 22016, 2048, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(768, 22016, 2048, 64, 8, 104)": {"BLOCK_SIZE_M": 256, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(512, 22016, 2048, 64, 8, 104)": {"BLOCK_SIZE_M": 256, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(384, 22016, 2048, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(256, 22016, 2048, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(192, 22016, 2048, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(128, 22016, 2048, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(96, 22016, 2048, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4096, 22016, 2048, 2048, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(3072, 22016, 2048, 2048, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2048, 22016, 2048, 2048, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1536, 22016, 2048, 2048, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1024, 22016, 2048, 2048, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(768, 22016, 2048, 2048, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(512, 22016, 2048, 2048, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(384, 22016, 2048, 2048, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(256, 22016, 2048, 2048, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(192, 22016, 2048, 2048, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 512, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 3, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(128, 22016, 2048, 2048, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(96, 22016, 2048, 2048, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4096, 22016, 2048, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(3072, 22016, 2048, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2048, 22016, 2048, 128, 8, 104)": {"BLOCK_SIZE_M": 256, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1536, 22016, 2048, 128, 8, 104)": {"BLOCK_SIZE_M": 256, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1024, 22016, 2048, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(768, 22016, 2048, 128, 8, 104)": {"BLOCK_SIZE_M": 256, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(512, 22016, 2048, 128, 8, 104)": {"BLOCK_SIZE_M": 256, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(384, 22016, 2048, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(256, 22016, 2048, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(192, 22016, 2048, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(128, 22016, 2048, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(96, 22016, 2048, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4096, 5120, 5120, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(3072, 5120, 5120, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2048, 5120, 5120, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1536, 5120, 5120, 64, 8, 104)": {"BLOCK_SIZE_M": 256, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1024, 5120, 5120, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(768, 5120, 5120, 64, 8, 104)": {"BLOCK_SIZE_M": 256, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(512, 5120, 5120, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(384, 5120, 5120, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(256, 5120, 5120, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(192, 5120, 5120, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(128, 5120, 5120, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(96, 5120, 5120, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4096, 5120, 5120, 5120, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(3072, 5120, 5120, 5120, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2048, 5120, 5120, 5120, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1536, 5120, 5120, 5120, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1024, 5120, 5120, 5120, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(768, 5120, 5120, 5120, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(512, 5120, 5120, 5120, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(384, 5120, 5120, 5120, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(256, 5120, 5120, 5120, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(192, 5120, 5120, 5120, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(128, 5120, 5120, 5120, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(96, 5120, 5120, 5120, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4096, 5120, 5120, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(3072, 5120, 5120, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2048, 5120, 5120, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1536, 5120, 5120, 128, 8, 104)": {"BLOCK_SIZE_M": 256, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1024, 5120, 5120, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(768, 5120, 5120, 128, 8, 104)": {"BLOCK_SIZE_M": 256, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(512, 5120, 5120, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(384, 5120, 5120, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(256, 5120, 5120, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(192, 5120, 5120, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(128, 5120, 5120, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(96, 5120, 5120, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4096, 7168, 5120, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(3072, 7168, 5120, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2048, 7168, 5120, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1536, 7168, 5120, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1024, 7168, 5120, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(768, 7168, 5120, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(512, 7168, 5120, 64, 8, 104)": {"BLOCK_SIZE_M": 256, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(384, 7168, 5120, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(256, 7168, 5120, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(192, 7168, 5120, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(128, 7168, 5120, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(96, 7168, 5120, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4096, 7168, 5120, 5120, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(3072, 7168, 5120, 5120, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2048, 7168, 5120, 5120, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1536, 7168, 5120, 5120, 1, 408)": {"BLOCK_SIZE_M": 256, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1024, 7168, 5120, 5120, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(768, 7168, 5120, 5120, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(512, 7168, 5120, 5120, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(384, 7168, 5120, 5120, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(256, 7168, 5120, 5120, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(192, 7168, 5120, 5120, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(128, 7168, 5120, 5120, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(96, 7168, 5120, 5120, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4096, 7168, 5120, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(3072, 7168, 5120, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2048, 7168, 5120, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1536, 7168, 5120, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1024, 7168, 5120, 128, 8, 104)": {"BLOCK_SIZE_M": 256, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(768, 7168, 5120, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(512, 7168, 5120, 128, 8, 104)": {"BLOCK_SIZE_M": 256, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(384, 7168, 5120, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(256, 7168, 5120, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(192, 7168, 5120, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(128, 7168, 5120, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(96, 7168, 5120, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4096, 5120, 13824, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(3072, 5120, 13824, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2048, 5120, 13824, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1536, 5120, 13824, 64, 8, 104)": {"BLOCK_SIZE_M": 256, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1024, 5120, 13824, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(768, 5120, 13824, 64, 8, 104)": {"BLOCK_SIZE_M": 256, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(512, 5120, 13824, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(384, 5120, 13824, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(256, 5120, 13824, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(192, 5120, 13824, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(128, 5120, 13824, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(96, 5120, 13824, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4096, 5120, 13824, 13824, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(3072, 5120, 13824, 13824, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2048, 5120, 13824, 13824, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1536, 5120, 13824, 13824, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1024, 5120, 13824, 13824, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(768, 5120, 13824, 13824, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(512, 5120, 13824, 13824, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(384, 5120, 13824, 13824, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(256, 5120, 13824, 13824, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(192, 5120, 13824, 13824, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(128, 5120, 13824, 13824, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(96, 5120, 13824, 13824, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4096, 5120, 13824, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(3072, 5120, 13824, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2048, 5120, 13824, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1536, 5120, 13824, 128, 8, 104)": {"BLOCK_SIZE_M": 256, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1024, 5120, 13824, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(768, 5120, 13824, 128, 8, 104)": {"BLOCK_SIZE_M": 256, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(512, 5120, 13824, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(384, 5120, 13824, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(256, 5120, 13824, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(192, 5120, 13824, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(128, 5120, 13824, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(96, 5120, 13824, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4096, 27648, 5120, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(3072, 27648, 5120, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2048, 27648, 5120, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1536, 27648, 5120, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1024, 27648, 5120, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(768, 27648, 5120, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(512, 27648, 5120, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(384, 27648, 5120, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(256, 27648, 5120, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(192, 27648, 5120, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(128, 27648, 5120, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(96, 27648, 5120, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4096, 27648, 5120, 5120, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(3072, 27648, 5120, 5120, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2048, 27648, 5120, 5120, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1536, 27648, 5120, 5120, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1024, 27648, 5120, 5120, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(768, 27648, 5120, 5120, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(512, 27648, 5120, 5120, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(384, 27648, 5120, 5120, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(256, 27648, 5120, 5120, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(192, 27648, 5120, 5120, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(128, 27648, 5120, 5120, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 512, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 3, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(96, 27648, 5120, 5120, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 512, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 3, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4096, 27648, 5120, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(3072, 27648, 5120, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2048, 27648, 5120, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1536, 27648, 5120, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1024, 27648, 5120, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(768, 27648, 5120, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(512, 27648, 5120, 128, 8, 104)": {"BLOCK_SIZE_M": 256, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(384, 27648, 5120, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(256, 27648, 5120, 128, 8, 104)": {"BLOCK_SIZE_M": 256, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(192, 27648, 5120, 128, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(128, 27648, 5120, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(96, 27648, 5120, 128, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4096, 2048, 3840, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(3072, 2048, 3840, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2048, 2048, 3840, 64, 8, 104)": {"BLOCK_SIZE_M": 256, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1536, 2048, 3840, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1024, 2048, 3840, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(768, 2048, 3840, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(512, 2048, 3840, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(384, 2048, 3840, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(256, 2048, 3840, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(192, 2048, 3840, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(128, 2048, 3840, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(96, 2048, 3840, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(4096, 2048, 3840, 3840, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(3072, 2048, 3840, 3840, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(2048, 2048, 3840, 3840, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1536, 2048, 3840, 3840, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(1024, 2048, 3840, 3840, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(768, 2048, 3840, 3840, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(512, 2048, 3840, 3840, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(384, 2048, 3840, 3840, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(256, 2048, 3840, 3840, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(192, 2048, 3840, 3840, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(128, 2048, 3840, 3840, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(96, 2048, 3840, 3840, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(512, 4096, 3840, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(128, 4096, 3840, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(512, 4096, 3840, 3840, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(128, 4096, 3840, 3840, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(512, 8192, 3840, 64, 8, 104)": {"BLOCK_SIZE_M": 256, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(128, 8192, 3840, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(512, 8192, 3840, 3840, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(128, 8192, 3840, 3840, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(512, 3840, 4096, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(128, 3840, 4096, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(512, 3840, 4096, 4096, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(128, 3840, 4096, 4096, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(512, 3840, 15360, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(128, 3840, 15360, 64, 8, 104)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 32, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(512, 3840, 15360, 15360, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(128, 3840, 15360, 15360, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 256, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 4, "num_ctas": 1, "num_stages": 5, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(512, 30720, 3840, 64, 8, 104)": {"BLOCK_SIZE_M": 256, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "num_warps": 4, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(128, 30720, 3840, 64, 8, 104)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 128, "BLOCK_SIZE_K": 32, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 1, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(512, 30720, 3840, 3840, 1, 408)": {"BLOCK_SIZE_M": 128, "BLOCK_SIZE_N": 256, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(128, 30720, 3840, 3840, 1, 408)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 512, "BLOCK_SIZE_K": 128, "GROUP_SIZE_M": 8, "A_load_order": 2, "num_warps": 8, "num_ctas": 1, "num_stages": 3, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}, "(512, 3072, 3072, 128, 4, 102)": {"BLOCK_SIZE_M": 64, "BLOCK_SIZE_N": 64, "BLOCK_SIZE_K": 64, "GROUP_SIZE_M": 8, "A_load_order": 0, "NUM_STAGES": 4, "num_warps": 4, "num_ctas": 1, "num_stages": 4, "num_buffers_warp_spec": 0, "num_consumer_groups": 0, "reg_dec_producer": 0, "reg_inc_consumer": 0}}} \ No newline at end of file diff --git a/image/gemlite/prism-ml/bonsai-image-ternary-4B-gemlite-2bit/transformer-gemlite-int2/quantization_config.json b/image/gemlite/prism-ml/bonsai-image-ternary-4B-gemlite-2bit/transformer-gemlite-int2/quantization_config.json new file mode 100644 index 0000000..c93579e --- /dev/null +++ b/image/gemlite/prism-ml/bonsai-image-ternary-4B-gemlite-2bit/transformer-gemlite-int2/quantization_config.json @@ -0,0 +1,163 @@ +{ + "format": "gemlite-int2-ternary-g128", + "bits": 2, + "group_size": 128, + "packing_bitwidth": 8, + "solver": "ternary", + "input_dtype": "fp16", + "output_dtype": "fp16", + "skip_patterns": [ + "proj_out", + "x_embedder", + "context_embedder", + "time_text_embed", + "time_guidance_embed", + "norm_out", + "double_stream_modulation_img", + "double_stream_modulation_txt", + "single_stream_modulation" + ], + "quantized_count": 100, + "skipped_count": 9, + "quantized_fqns": [ + "transformer_blocks.0.attn.to_q", + "transformer_blocks.0.attn.to_k", + "transformer_blocks.0.attn.to_v", + "transformer_blocks.0.attn.add_q_proj", + "transformer_blocks.0.attn.add_k_proj", + "transformer_blocks.0.attn.add_v_proj", + "transformer_blocks.0.attn.to_add_out", + "transformer_blocks.0.attn.to_out.0", + "transformer_blocks.0.ff.linear_in", + "transformer_blocks.0.ff.linear_out", + "transformer_blocks.0.ff_context.linear_in", + "transformer_blocks.0.ff_context.linear_out", + "transformer_blocks.1.attn.to_q", + "transformer_blocks.1.attn.to_k", + "transformer_blocks.1.attn.to_v", + "transformer_blocks.1.attn.add_q_proj", + "transformer_blocks.1.attn.add_k_proj", + "transformer_blocks.1.attn.add_v_proj", + "transformer_blocks.1.attn.to_add_out", + "transformer_blocks.1.attn.to_out.0", + "transformer_blocks.1.ff.linear_in", + "transformer_blocks.1.ff.linear_out", + "transformer_blocks.1.ff_context.linear_in", + "transformer_blocks.1.ff_context.linear_out", + "transformer_blocks.2.attn.to_q", + "transformer_blocks.2.attn.to_k", + "transformer_blocks.2.attn.to_v", + "transformer_blocks.2.attn.add_q_proj", + "transformer_blocks.2.attn.add_k_proj", + "transformer_blocks.2.attn.add_v_proj", + "transformer_blocks.2.attn.to_add_out", + "transformer_blocks.2.attn.to_out.0", + "transformer_blocks.2.ff.linear_in", + "transformer_blocks.2.ff.linear_out", + "transformer_blocks.2.ff_context.linear_in", + "transformer_blocks.2.ff_context.linear_out", + "transformer_blocks.3.attn.to_q", + "transformer_blocks.3.attn.to_k", + "transformer_blocks.3.attn.to_v", + "transformer_blocks.3.attn.add_q_proj", + "transformer_blocks.3.attn.add_k_proj", + "transformer_blocks.3.attn.add_v_proj", + "transformer_blocks.3.attn.to_add_out", + "transformer_blocks.3.attn.to_out.0", + "transformer_blocks.3.ff.linear_in", + "transformer_blocks.3.ff.linear_out", + "transformer_blocks.3.ff_context.linear_in", + "transformer_blocks.3.ff_context.linear_out", + "transformer_blocks.4.attn.to_q", + "transformer_blocks.4.attn.to_k", + "transformer_blocks.4.attn.to_v", + "transformer_blocks.4.attn.add_q_proj", + "transformer_blocks.4.attn.add_k_proj", + "transformer_blocks.4.attn.add_v_proj", + "transformer_blocks.4.attn.to_add_out", + "transformer_blocks.4.attn.to_out.0", + "transformer_blocks.4.ff.linear_in", + "transformer_blocks.4.ff.linear_out", + "transformer_blocks.4.ff_context.linear_in", + "transformer_blocks.4.ff_context.linear_out", + "single_transformer_blocks.0.attn.to_qkv_mlp_proj", + "single_transformer_blocks.0.attn.to_out", + "single_transformer_blocks.1.attn.to_qkv_mlp_proj", + "single_transformer_blocks.1.attn.to_out", + "single_transformer_blocks.2.attn.to_qkv_mlp_proj", + "single_transformer_blocks.2.attn.to_out", + "single_transformer_blocks.3.attn.to_qkv_mlp_proj", + "single_transformer_blocks.3.attn.to_out", + "single_transformer_blocks.4.attn.to_qkv_mlp_proj", + "single_transformer_blocks.4.attn.to_out", + "single_transformer_blocks.5.attn.to_qkv_mlp_proj", + "single_transformer_blocks.5.attn.to_out", + "single_transformer_blocks.6.attn.to_qkv_mlp_proj", + "single_transformer_blocks.6.attn.to_out", + "single_transformer_blocks.7.attn.to_qkv_mlp_proj", + "single_transformer_blocks.7.attn.to_out", + "single_transformer_blocks.8.attn.to_qkv_mlp_proj", + "single_transformer_blocks.8.attn.to_out", + "single_transformer_blocks.9.attn.to_qkv_mlp_proj", + "single_transformer_blocks.9.attn.to_out", + "single_transformer_blocks.10.attn.to_qkv_mlp_proj", + "single_transformer_blocks.10.attn.to_out", + "single_transformer_blocks.11.attn.to_qkv_mlp_proj", + "single_transformer_blocks.11.attn.to_out", + "single_transformer_blocks.12.attn.to_qkv_mlp_proj", + "single_transformer_blocks.12.attn.to_out", + "single_transformer_blocks.13.attn.to_qkv_mlp_proj", + "single_transformer_blocks.13.attn.to_out", + "single_transformer_blocks.14.attn.to_qkv_mlp_proj", + "single_transformer_blocks.14.attn.to_out", + "single_transformer_blocks.15.attn.to_qkv_mlp_proj", + "single_transformer_blocks.15.attn.to_out", + "single_transformer_blocks.16.attn.to_qkv_mlp_proj", + "single_transformer_blocks.16.attn.to_out", + "single_transformer_blocks.17.attn.to_qkv_mlp_proj", + "single_transformer_blocks.17.attn.to_out", + "single_transformer_blocks.18.attn.to_qkv_mlp_proj", + "single_transformer_blocks.18.attn.to_out", + "single_transformer_blocks.19.attn.to_qkv_mlp_proj", + "single_transformer_blocks.19.attn.to_out" + ], + "skipped": [ + { + "fqn": "x_embedder", + "reason": "x_embedder" + }, + { + "fqn": "context_embedder", + "reason": "context_embedder" + }, + { + "fqn": "proj_out", + "reason": "proj_out" + }, + { + "fqn": "time_guidance_embed.timestep_embedder.linear_1", + "reason": "time_guidance_embed" + }, + { + "fqn": "time_guidance_embed.timestep_embedder.linear_2", + "reason": "time_guidance_embed" + }, + { + "fqn": "double_stream_modulation_img.linear", + "reason": "double_stream_modulation_img" + }, + { + "fqn": "double_stream_modulation_txt.linear", + "reason": "double_stream_modulation_txt" + }, + { + "fqn": "single_stream_modulation.linear", + "reason": "single_stream_modulation" + }, + { + "fqn": "norm_out.linear", + "reason": "norm_out" + } + ], + "pack_seconds": 150.48 +} diff --git a/image/gemlite/prism-ml/bonsai-image-ternary-4B-gemlite-2bit/transformer-gemlite-int2/state_dict.pt b/image/gemlite/prism-ml/bonsai-image-ternary-4B-gemlite-2bit/transformer-gemlite-int2/state_dict.pt new file mode 100644 index 0000000..b4d1f2b --- /dev/null +++ b/image/gemlite/prism-ml/bonsai-image-ternary-4B-gemlite-2bit/transformer-gemlite-int2/state_dict.pt @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:a3a7df8a90374fea24afce3b36f00b4c728d0254717143d61f912a7b3070e7ac +size 1540457482 diff --git a/image/gemlite/prism-ml/bonsai-image-ternary-4B-gemlite-2bit/vae/config.json b/image/gemlite/prism-ml/bonsai-image-ternary-4B-gemlite-2bit/vae/config.json new file mode 100644 index 0000000..2f6c253 --- /dev/null +++ b/image/gemlite/prism-ml/bonsai-image-ternary-4B-gemlite-2bit/vae/config.json @@ -0,0 +1,41 @@ +{ + "_class_name": "AutoencoderKLFlux2", + "_diffusers_version": "0.37.1", + "_name_or_path": "black-forest-labs/FLUX.2-klein-base-4B", + "act_fn": "silu", + "batch_norm_eps": 0.0001, + "batch_norm_momentum": 0.1, + "block_out_channels": [ + 128, + 256, + 512, + 512 + ], + "decoder_block_out_channels": null, + "down_block_types": [ + "DownEncoderBlock2D", + "DownEncoderBlock2D", + "DownEncoderBlock2D", + "DownEncoderBlock2D" + ], + "force_upcast": true, + "in_channels": 3, + "latent_channels": 32, + "layers_per_block": 2, + "mid_block_add_attention": true, + "norm_num_groups": 32, + "out_channels": 3, + "patch_size": [ + 2, + 2 + ], + "sample_size": 1024, + "up_block_types": [ + "UpDecoderBlock2D", + "UpDecoderBlock2D", + "UpDecoderBlock2D", + "UpDecoderBlock2D" + ], + "use_post_quant_conv": true, + "use_quant_conv": true +} diff --git a/image/gemlite/prism-ml/bonsai-image-ternary-4B-gemlite-2bit/vae/diffusion_pytorch_model.safetensors b/image/gemlite/prism-ml/bonsai-image-ternary-4B-gemlite-2bit/vae/diffusion_pytorch_model.safetensors new file mode 100644 index 0000000..0654e17 --- /dev/null +++ b/image/gemlite/prism-ml/bonsai-image-ternary-4B-gemlite-2bit/vae/diffusion_pytorch_model.safetensors @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:ca70d2202afe6415bdbcb8793ba8cd99fd159cfe6192381504d6c4d3036e0f04 +size 168120878 diff --git a/image/mlx/prism-ml/bonsai-image-binary-4B-mlx-1bit/.gitattributes b/image/mlx/prism-ml/bonsai-image-binary-4B-mlx-1bit/.gitattributes new file mode 100644 index 0000000..74614b5 --- /dev/null +++ b/image/mlx/prism-ml/bonsai-image-binary-4B-mlx-1bit/.gitattributes @@ -0,0 +1,37 @@ +*.7z filter=lfs diff=lfs merge=lfs -text +*.arrow filter=lfs diff=lfs merge=lfs -text +*.bin filter=lfs diff=lfs merge=lfs -text +*.bz2 filter=lfs diff=lfs merge=lfs -text +*.ckpt filter=lfs diff=lfs merge=lfs -text +*.ftz filter=lfs diff=lfs merge=lfs -text +*.gz filter=lfs diff=lfs merge=lfs -text +*.h5 filter=lfs diff=lfs merge=lfs -text +*.joblib filter=lfs diff=lfs merge=lfs -text +*.lfs.* filter=lfs diff=lfs merge=lfs -text +*.mlmodel filter=lfs diff=lfs merge=lfs -text +*.model filter=lfs diff=lfs merge=lfs -text +*.msgpack filter=lfs diff=lfs merge=lfs -text +*.npy filter=lfs diff=lfs merge=lfs -text +*.npz filter=lfs diff=lfs merge=lfs -text +*.onnx filter=lfs diff=lfs merge=lfs -text +*.ot filter=lfs diff=lfs merge=lfs -text +*.parquet filter=lfs diff=lfs merge=lfs -text +*.pb filter=lfs diff=lfs merge=lfs -text +*.pickle filter=lfs diff=lfs merge=lfs -text +*.pkl filter=lfs diff=lfs merge=lfs -text +*.pt filter=lfs diff=lfs merge=lfs -text +*.pth filter=lfs diff=lfs merge=lfs -text +*.rar filter=lfs diff=lfs merge=lfs -text +*.safetensors filter=lfs diff=lfs merge=lfs -text +saved_model/**/* filter=lfs diff=lfs merge=lfs -text +*.tar.* filter=lfs diff=lfs merge=lfs -text +*.tar filter=lfs diff=lfs merge=lfs -text +*.tflite filter=lfs diff=lfs merge=lfs -text +*.tgz filter=lfs diff=lfs merge=lfs -text +*.wasm filter=lfs diff=lfs merge=lfs -text +*.xz filter=lfs diff=lfs merge=lfs -text +*.zip filter=lfs diff=lfs merge=lfs -text +*.zst filter=lfs diff=lfs merge=lfs -text +*tfevents* filter=lfs diff=lfs merge=lfs -text +text_encoder-mlx-4bit/tokenizer.json filter=lfs diff=lfs merge=lfs -text +tokenizer/tokenizer.json filter=lfs diff=lfs merge=lfs -text diff --git a/image/mlx/prism-ml/bonsai-image-binary-4B-mlx-1bit/LICENSE b/image/mlx/prism-ml/bonsai-image-binary-4B-mlx-1bit/LICENSE new file mode 100644 index 0000000..66a27ec --- /dev/null +++ b/image/mlx/prism-ml/bonsai-image-binary-4B-mlx-1bit/LICENSE @@ -0,0 +1,177 @@ + Apache License + Version 2.0, January 2004 + http://www.apache.org/licenses/ + + TERMS AND CONDITIONS FOR USE, REPRODUCTION, AND DISTRIBUTION + + 1. Definitions. + + "License" shall mean the terms and conditions for use, reproduction, + and distribution as defined by Sections 1 through 9 of this document. + + "Licensor" shall mean the copyright owner or entity authorized by + the copyright owner that is granting the License. + + "Legal Entity" shall mean the union of the acting entity and all + other entities that control, are controlled by, or are under common + control with that entity. For the purposes of this definition, + "control" means (i) the power, direct or indirect, to cause the + direction or management of such entity, whether by contract or + otherwise, or (ii) ownership of fifty percent (50%) or more of the + outstanding shares, or (iii) beneficial ownership of such entity. + + "You" (or "Your") shall mean an individual or Legal Entity + exercising permissions granted by this License. + + "Source" form shall mean the preferred form for making modifications, + including but not limited to software source code, documentation + source, and configuration files. + + "Object" form shall mean any form resulting from mechanical + transformation or translation of a Source form, including but + not limited to compiled object code, generated documentation, + and conversions to other media types. + + "Work" shall mean the work of authorship, whether in Source or + Object form, made available under the License, as indicated by a + copyright notice that is included in or attached to the work + (an example is provided in the Appendix below). + + "Derivative Works" shall mean any work, whether in Source or Object + form, that is based on (or derived from) the Work and for which the + editorial revisions, annotations, elaborations, or other modifications + represent, as a whole, an original work of authorship. For the purposes + of this License, Derivative Works shall not include works that remain + separable from, or merely link (or bind by name) to the interfaces of, + the Work and Derivative Works thereof. + + "Contribution" shall mean any work of authorship, including + the original version of the Work and any modifications or additions + to that Work or Derivative Works thereof, that is intentionally + submitted to Licensor for inclusion in the Work by the copyright owner + or by an individual or Legal Entity authorized to submit on behalf of + the copyright owner. For the purposes of this definition, "submitted" + means any form of electronic, verbal, or written communication sent + to the Licensor or its representatives, including but not limited to + communication on electronic mailing lists, source code control systems, + and issue tracking systems that are managed by, or on behalf of, the + Licensor for the purpose of discussing and improving the Work, but + excluding communication that is conspicuously marked or otherwise + designated in writing by the copyright owner as "Not a Contribution." + + "Contributor" shall mean Licensor and any individual or Legal Entity + on behalf of whom a Contribution has been received by Licensor and + subsequently incorporated within the Work. + + 2. Grant of Copyright License. Subject to the terms and conditions of + this License, each Contributor hereby grants to You a perpetual, + worldwide, non-exclusive, no-charge, royalty-free, irrevocable + copyright license to reproduce, prepare Derivative Works of, + publicly display, publicly perform, sublicense, and distribute the + Work and such Derivative Works in Source or Object form. + + 3. Grant of Patent License. Subject to the terms and conditions of + this License, each Contributor hereby grants to You a perpetual, + worldwide, non-exclusive, no-charge, royalty-free, irrevocable + (except as stated in this section) patent license to make, have made, + use, offer to sell, sell, import, and otherwise transfer the Work, + where such license applies only to those patent claims licensable + by such Contributor that are necessarily infringed by their + Contribution(s) alone or by combination of their Contribution(s) + with the Work to which such Contribution(s) was submitted. If You + institute patent litigation against any entity (including a + cross-claim or counterclaim in a lawsuit) alleging that the Work + or a Contribution incorporated within the Work constitutes direct + or contributory patent infringement, then any patent licenses + granted to You under this License for that Work shall terminate + as of the date such litigation is filed. + + 4. Redistribution. You may reproduce and distribute copies of the + Work or Derivative Works thereof in any medium, with or without + modifications, and in Source or Object form, provided that You + meet the following conditions: + + (a) You must give any other recipients of the Work or + Derivative Works a copy of this License; and + + (b) You must cause any modified files to carry prominent notices + stating that You changed the files; and + + (c) You must retain, in the Source form of any Derivative Works + that You distribute, all copyright, patent, trademark, and + attribution notices from the Source form of the Work, + excluding those notices that do not pertain to any part of + the Derivative Works; and + + (d) If the Work includes a "NOTICE" text file as part of its + distribution, then any Derivative Works that You distribute must + include a readable copy of the attribution notices contained + within such NOTICE file, excluding those notices that do not + pertain to any part of the Derivative Works, in at least one + of the following places: within a NOTICE text file distributed + as part of the Derivative Works; within the Source form or + documentation, if provided along with the Derivative Works; or, + within a display generated by the Derivative Works, if and + wherever such third-party notices normally appear. The contents + of the NOTICE file are for informational purposes only and + do not modify the License. You may add Your own attribution + notices within Derivative Works that You distribute, alongside + or as an addendum to the NOTICE text from the Work, provided + that such additional attribution notices cannot be construed + as modifying the License. + + You may add Your own copyright statement to Your modifications and + may provide additional or different license terms and conditions + for use, reproduction, or distribution of Your modifications, or + for any such Derivative Works as a whole, provided Your use, + reproduction, and distribution of the Work otherwise complies with + the conditions stated in this License. + + 5. Submission of Contributions. Unless You explicitly state otherwise, + any Contribution intentionally submitted for inclusion in the Work + by You to the Licensor shall be under the terms and conditions of + this License, without any additional terms or conditions. + Notwithstanding the above, nothing herein shall supersede or modify + the terms of any separate license agreement you may have executed + with Licensor regarding such Contributions. + + 6. Trademarks. This License does not grant permission to use the trade + names, trademarks, service marks, or product names of the Licensor, + except as required for reasonable and customary use in describing the + origin of the Work and reproducing the content of the NOTICE file. + + 7. Disclaimer of Warranty. Unless required by applicable law or + agreed to in writing, Licensor provides the Work (and each + Contributor provides its Contributions) on an "AS IS" BASIS, + WITHOUT WARRANTIES OR CONDITIONS OF ANY KIND, either express or + implied, including, without limitation, any warranties or conditions + of TITLE, NON-INFRINGEMENT, MERCHANTABILITY, or FITNESS FOR A + PARTICULAR PURPOSE. You are solely responsible for determining the + appropriateness of using or redistributing the Work and assume any + risks associated with Your exercise of permissions under this License. + + 8. Limitation of Liability. In no event and under no legal theory, + whether in tort (including negligence), contract, or otherwise, + unless required by applicable law (such as deliberate and grossly + negligent acts) or agreed to in writing, shall any Contributor be + liable to You for damages, including any direct, indirect, special, + incidental, or consequential damages of any character arising as a + result of this License or out of the use or inability to use the + Work (including but not limited to damages for loss of goodwill, + work stoppage, computer failure or malfunction, or any and all + other commercial damages or losses), even if such Contributor + has been advised of the possibility of such damages. + + 9. Accepting Warranty or Additional Liability. While redistributing + the Work or Derivative Works thereof, You may choose to offer, + and charge a fee for, acceptance of support, warranty, indemnity, + or other liability obligations and/or rights consistent with this + License. However, in accepting such obligations, You may act only + on Your own behalf and on Your sole responsibility, not on behalf + of any other Contributor, and only if You agree to indemnify, + defend, and hold each Contributor harmless for any liability + incurred by, or claims asserted against, such Contributor by reason + of your accepting any such warranty or additional liability. + + END OF TERMS AND CONDITIONS + diff --git a/image/mlx/prism-ml/bonsai-image-binary-4B-mlx-1bit/NOTICE.md b/image/mlx/prism-ml/bonsai-image-binary-4B-mlx-1bit/NOTICE.md new file mode 100644 index 0000000..ef55b08 --- /dev/null +++ b/image/mlx/prism-ml/bonsai-image-binary-4B-mlx-1bit/NOTICE.md @@ -0,0 +1,6 @@ +This software is copyright 2026-present Prism ML, Inc. It is available under the Apache 2.0 license. +If you publicly deploy or redistribute this software, we would appreciate attribution such as: "Created using Bonsai Image by Prism ML." + +This software is built from FLUX.2 [klein] 4B, Copyright 2026 Black Forest Labs, which is available under the Apache 2.0 License: https://huggingface.co/black-forest-labs/FLUX.2-klein-4B/blob/main/LICENSE.md + +The text encoder is built from Qwen3-4B, Copyright 2024 Alibaba Cloud, which is available under the Apache 2.0 License: https://huggingface.co/Qwen/Qwen3-4B/blob/main/LICENSE diff --git a/image/mlx/prism-ml/bonsai-image-binary-4B-mlx-1bit/README.md b/image/mlx/prism-ml/bonsai-image-binary-4B-mlx-1bit/README.md new file mode 100644 index 0000000..98dad38 --- /dev/null +++ b/image/mlx/prism-ml/bonsai-image-binary-4B-mlx-1bit/README.md @@ -0,0 +1,207 @@ +--- +license: apache-2.0 +pipeline_tag: text-to-image +tags: +- 1-bit +- mlx +- apple-silicon +- on-device +- text-to-image +- diffusion +- flux +- prismml +- bonsai +base_model: +- prism-ml/bonsai-image-binary-4B-unpacked +--- + +

+ Bonsai Image +

+ +

+ Prism ML Website  |  + Whitepaper  |  + Demo & Examples  |  + Discord +

+ +# bonsai-image-binary-4B-mlx-1bit + +Binary weight (1-bit) text-to-image diffusion transformer deployment for Apple Silicon + +> **0.93 GB transformer** | **8.3×** smaller than FP16 | **9.4 s / 512²** on iPhone 17 Pro Max | **6 s / 512²** on M4 Pro | runs on Mac, iPhone, iPad + +## Highlights + +- **0.93 GB** diffusion transformer, down from **7.75 GB** for the FP16 FLUX.2 Klein 4B transformer +- Binary {−1, +1} transformer weights with FP16 group-wise scaling in the matrix-heavy transformer layers (Q/K/V projections, output projections, MLP weights) +- 3.42 GB Apple Silicon deployment payload including the 4-bit text encoder and FP16 VAE — text encoder is offloaded after prompt encode, so the denoising loop only keeps the compact transformer and VAE resident +- 4-step FlowMatch-Euler sampler with guidance = 1.0 and shift = 3.0 — no CFG, no negative prompts needed +- MLX-native 1-bit format for Apple Silicon, the same kernel path as our 1-bit language-model releases +- Cross-platform companion: also available as [gemlite 1-bit](https://huggingface.co/prism-ml/bonsai-image-binary-4B-gemlite-1bit) for NVIDIA GPUs + +## Resources + +- **[Whitepaper](https://github.com/PrismML-Eng/Bonsai-Image-Demo/blob/main/bonsai-image-4b-whitepaper.pdf)** — full benchmarks, kernels, and memory analysis +- **[Demo repo](https://github.com/PrismML-Eng/Bonsai-Image-Demo)** — one-command setup for Mac / Linux / Windows +- **[Discord](https://discord.gg/prismml)** — community + support +- **Kernels**: [MLX fork](https://github.com/PrismML-Eng/mlx) (Apple Silicon) · [mlx-swift fork](https://github.com/PrismML-Eng/mlx-swift) (iOS / macOS) — upstream PRs pending + +## Model Overview + +| Item | Specification | +| :-------------------- | :-------------------------------------------------------------------------------------| +| Base architecture | FLUX.2 Klein 4B (MMDiT diffusion transformer) | +| Parameters | ~4.0B (transformer trunk) | +| Blocks | 25 MMDiT blocks: 5 double-stream + 20 single-stream | +| Sampler | FlowMatchEuler, **4 steps**, guidance = 1.0, shift = 3.0 | +| Text encoder | Qwen3-4B at 4-bit (≈ 2.28 GB on-device, offloaded after prompt encode) | +| VAE | Flux2 32-channel latent, tiled decode (128 px tiles) | +| Native resolution | 1024×1024 (also supports 512×512 and arbitrary multiples of 32) | +| Weight format | MLX 1-bit g128, binary values + FP16 group-wise scales | +| **Transformer size** | **0.93 GB** (8.3× smaller than 7.75 GB FP16) | +| Total payload | **3.42 GB** (4.7x smaller than the 15.97 GB FP16 transformer + text encoder + VAE) | +| 1-bit coverage | All 100 matmul-heavy linears in the 25 MMDiT blocks | +| License | Apache 2.0 | + +## Binary Weight Representation: 1-bit g128 + +Each binary weight takes a value from {−1, +1} with one shared FP16 scale per group of 128 weights: + +``` +w_i = scale_g * b_i, b_i in {−1, +1} +``` + +Binary values carry exactly 1 bit of information per weight. With one FP16 scale per group of 128, the effective storage is + +``` +b_eff ≈ 1 + 16/128 ≈ 1.125 bits/weight +``` + +This gives an idealized **14.2× reduction** relative to FP16 for the binary transformer layers. A small set of precision-sensitive supporting tensors remains in FP16, so the final 1-bit Bonsai Image 4B diffusion transformer is **0.93 GB**, an 8.3× reduction from the 7.75 GB FP16 FLUX.2 Klein 4B transformer. + +The binary representation is applied to the matrix-heavy transformer layers, including Q / K / V projections, output projections, MLP linears, and the double-stream add-K / Q / V linears. Supporting tensors (less than 5% of the total parameters) such as modulation streams, embedders, output norm, and output projection remain FP16 for image quality and stability. + +### Memory + +| Format | Transformer size | Reduction | Ratio | +| :------------------------- | ---------------: | --------: | -------: | +| FP16 FLUX.2 Klein 4B | 7.75 GB | — | 1.0× | +| **1-bit Bonsai Image 4B** | **0.93 GB** | **88.0%** | **8.3×** | + +Apple Silicon deployment: + +| Component | Size | +| :------------------------------ | ------: | +| MLX 1-bit diffusion transformer | 0.97 GB | +| Compressed text encoder | 2.28 GB | +| FP16 VAE | 0.17 GB | +| **Total payload** | **3.42 GB** | + +At runtime, the text encoder is offloaded after prompt encoding. During denoising, the repeated image-generation loop is dominated by the compact binary diffusion transformer and active image-generation components rather than the full payload. + +End-to-end Mac M4 Pro mean-active memory pressure at 1024² is **1.95 GB** — a **7.4×** reduction vs the stock FP16 MFLUX pipeline (14.39 GB). + +## Best Practices + +- Sampler: FlowMatchEuler-discrete with 4 steps, guidance = 1.0 (no classifier-free guidance), shift = 3.0. The model is designed for 4 steps; running more steps does not improve quality significantly and can introduce artifacts. +- Resolution: native 1024² is the design target; 512² works for quick previews. +- Aspect ratios: multiples of 32 are supported, including 832×1248 and 1248×832. +- Prompting: natural-language prompts. Negative prompts are not required. +- Runtime memory: the text encoder is offloaded after prompt encoding, so the denoising loop is memory-light. + +## Quickstart + +### MLX (Python) + +The simplest path is the [Bonsai Image Demo repo](https://github.com/PrismML-Eng/Bonsai-Image-Demo), which sets up the full Bonsai Studio (FastAPI backend + Next.js frontend): + +```bash +git clone https://github.com/PrismML-Eng/Bonsai-Image-Demo.git +cd Bonsai-Image-Demo +./setup.sh +BONSAI_VARIANT=binary ./scripts/download_model.sh +BONSAI_VARIANT=binary ./scripts/serve.sh +``` + +For a one-shot render without the studio frontend: + +```bash +BONSAI_VARIANT=binary ./scripts/generate.sh --prompt "A bonsai tree in a quiet ceramic studio, soft morning light" +``` + +### MLX Swift (iOS / macOS) + +Binary Bonsai Image 4B runs natively on iPhone and iPad via MLX Swift. Bonsai Studio for iPhone is available on the App Store; under the hood, it loads this model with the kernels in our [mlx-swift fork](https://github.com/PrismML-Eng/mlx-swift). + +## Throughput (MLX / Apple Silicon) + +Mac M4 Pro (48 GB unified memory), 4 denoising steps, fixed prompt and seed: + +| Resolution | s / step | s / image (mean ± std) | vs stock MFLUX FP16 | +| :------------ | -------: | ---------------------: | ------------------: | +| 512 × 512 | 1.50 | 6.01 ± 0.31 s | **3.03×** | +| 1024 × 1024 | 6.02 | **24.07 ± 0.03 s** | **5.60×** | + +iPhone 17 Pro Max (A19 Pro, 12 GB unified memory), MLX Swift, same methodology: + +| Resolution | s / step | s / image | +| :------------ | -------: | --------: | +| 128 × 128 | 0.68 | 2.7 s | +| 256 × 256 | 0.95 | 3.8 s | +| 512 × 512 | 2.35 | **9.4 s** | +| 1024 × 1024 | 8.15 | **32.6 s**| + +Stock FP16 FLUX.2 Klein 4B does not fit within iPhone 17 Pro Max's 12 GB unified memory budget; Bonsai Image 4B models do. + +## Benchmarks + +Evaluated with matched generation settings across the comparison set on H100. GenEval uses the official 512x512 protocol. For HPSv3 and DPG-Bench, larger-backbone rows are evaluated at 1024x1024, while smaller-backbone rows are evaluated at their native 512x512 setting. Higher is better for all three benchmarks. + +| Model | Transformer (GB) | GenEval | HPSv3 | DPG-Bench | +| :-------------------------- | ---------------: | ------: | -----: | --------: | +| **Bonsai Image · Binary 4B**| **0.93** | **0.671** | **11.15** | **0.822** | +| **Bonsai Image · Ternary 4B** | **1.21** | **0.723** | **12.22** | **0.851** | +| FLUX.2 Klein 4B | 7.75 | 0.819 | 12.84 | 0.853 | +| FLUX.1-schnell | 23.8 | 0.716 | 12.67 | 0.848 | +| SDXL | 5.14 | 0.300 | 10.05 | 0.740 | +| PixArt-Σ XL 2 | 1.20 | 0.541 | 11.93 | 0.769 | +| Stable Diffusion 1.5 | 1.72 | 0.396 | 4.20 | 0.601 | +| BK-SDM-Small | 0.98 | 0.297 | 3.05 | 0.559 | + +The benchmark results show the intended quality-footprint trade-off. 1-bit Bonsai Image 4B is the footprint-oriented variant: it reduces the diffusion transformer below 1 GB while still delivering strong GenEval, HPSv3, and DPG-Bench results. The ternary companion is the quality-oriented variant, using a slightly larger representation to achieve very close visual quality and prompt fidelity to the original FLUX.2 Klein 4B model. + +Together, the Bonsai Image variants move the quality-footprint frontier: they bring modern diffusion-transformer behavior into a memory range previously occupied by much smaller, lower-capability models. + +## Use Cases + +- **Local creative tooling**: image generation directly on Mac, iPhone, and iPad +- **Private generation**: prompts and generated assets can remain local +- **Rapid iteration**: lower local latency and no remote queue for iterative creative workflows +- **Mobile deployment**: image generation on devices with unified-memory, thermal, and connectivity constraints +- **Commodity-GPU serving**: lower transformer footprint and reduced memory pressure for serving on CUDA GPUs +- **Enterprise and controlled inference**: local or private environments for data residency and compliance-sensitive workflows + +## Limitations + +- 1-bit Bonsai Image 4B is not bit-identical to the FP16 FLUX.2 Klein 4B model; it is a compact binary-weight deployment designed to deliver similar practical behavior at much smaller size. +- Image-generation quality remains prompt- and workflow-dependent. Small text, fine details, object counts, and strict compositional constraints should be evaluated for the target use case. +- Current commodity inference stacks do not yet expose fully native binary execution as a standard hardware path. This release uses practical MLX low-bit kernel paths on Apple Silicon and Gemlite low-bit GEMM on CUDA. +- After the diffusion transformer is made compact, other components such as the VAE can become more visible memory bottlenecks. The runtime mitigates this with text-encoder offload and tiled VAE decoding. + +## Citation + +```bibtex +@techreport{bonsaiimage4b, + title = {Bonsai Image 4B: Low-Bit Diffusion on Apple Silicon and Consumer GPUs}, + author = {Prism ML}, + year = {2026}, + month = {May}, + url = {https://prismml.com} +} +``` + +## Contact + +For questions, feedback, or collaboration inquiries: **contact@prismml.com** \ No newline at end of file diff --git a/image/mlx/prism-ml/bonsai-image-binary-4B-mlx-1bit/assets/bonsai-logo.svg b/image/mlx/prism-ml/bonsai-image-binary-4B-mlx-1bit/assets/bonsai-logo.svg new file mode 100644 index 0000000..2cfef2b --- /dev/null +++ b/image/mlx/prism-ml/bonsai-image-binary-4B-mlx-1bit/assets/bonsai-logo.svg @@ -0,0 +1 @@ + diff --git a/image/mlx/prism-ml/bonsai-image-binary-4B-mlx-1bit/manifest.json b/image/mlx/prism-ml/bonsai-image-binary-4B-mlx-1bit/manifest.json new file mode 100644 index 0000000..25ddcda --- /dev/null +++ b/image/mlx/prism-ml/bonsai-image-binary-4B-mlx-1bit/manifest.json @@ -0,0 +1,136 @@ +{ + "model_version": "binary g128 (Apple Silicon mlx-1bit deployment)", + "total_bytes": 3428210856, + "files": [ + { + "remote_path": "LICENSE", + "size": 10174, + "sha256": "69849221bfb90053de2134ef5e6d540287b4b98062326492f1f96f5da685524b" + }, + { + "remote_path": "NOTICE.md", + "size": 623, + "sha256": "bbefa4a26b836efc040c1a0f155a425d1d833eae1b2534ffc414b1eada3cd922" + }, + { + "remote_path": "README.md", + "size": 11996, + "sha256": "1527258bbdd58161a3241245985c78ad5503635fd32bc2d0d37634c192a574e5" + }, + { + "remote_path": "model_index.json", + "size": 81, + "sha256": "ecb4735e37691a8733f62957fd6c548f841af40624905bb24fa639756153c8a1" + }, + { + "remote_path": "scheduler/scheduler_config.json", + "size": 486, + "sha256": "067afb012cef64553a763447d1efd93daeffcc0123ca7e25b09f8de20b90762e" + }, + { + "remote_path": "text_encoder-mlx-4bit/added_tokens.json", + "size": 707, + "sha256": "c0284b582e14987fbd3d5a2cb2bd139084371ed9acbae488829a1c900833c680" + }, + { + "remote_path": "text_encoder-mlx-4bit/config.json", + "size": 937, + "sha256": "b5efdcf3b0035a3638e7228dad4d85f5c4a23f156eb7cdb0b44c8366a5d34d9b" + }, + { + "remote_path": "text_encoder-mlx-4bit/merges.txt", + "size": 1671853, + "sha256": "8831e4f1a044471340f7c0a83d7bd71306a5b867e95fd870f74d0c5308a904d5" + }, + { + "remote_path": "text_encoder-mlx-4bit/model.safetensors", + "size": 2263022529, + "sha256": "e240c0bdc0ebb0681bf0da0f98d9719fd6ebe269a3633f81542c13e81345651d" + }, + { + "remote_path": "text_encoder-mlx-4bit/model.safetensors.index.json", + "size": 63924, + "sha256": "f7825defe5865d179c3b593173d37056be5f202dcb7153985cf74e75ecf1628b" + }, + { + "remote_path": "text_encoder-mlx-4bit/special_tokens_map.json", + "size": 613, + "sha256": "76862e765266b85aa9459767e33cbaf13970f327a0e88d1c65846c2ddd3a1ecd" + }, + { + "remote_path": "text_encoder-mlx-4bit/tokenizer.json", + "size": 11422654, + "sha256": "aeb13307a71acd8fe81861d94ad54ab689df773318809eed3cbe794b4492dae4" + }, + { + "remote_path": "text_encoder-mlx-4bit/tokenizer_config.json", + "size": 9706, + "sha256": "253153d0738ceb4c668d2eff957714dd2bea0b56de772a9fdccd96cbf517e6a0" + }, + { + "remote_path": "text_encoder-mlx-4bit/vocab.json", + "size": 2776833, + "sha256": "ca10d7e9fb3ed18575dd1e277a2579c16d108e32f27439684afa0e10b1440910" + }, + { + "remote_path": "tokenizer/added_tokens.json", + "size": 707, + "sha256": "c0284b582e14987fbd3d5a2cb2bd139084371ed9acbae488829a1c900833c680" + }, + { + "remote_path": "tokenizer/chat_template.jinja", + "size": 4168, + "sha256": "a55ee1b1660128b7098723e0abcd92caa0788061051c62d51cbe87d9cf1974d8" + }, + { + "remote_path": "tokenizer/merges.txt", + "size": 1671853, + "sha256": "8831e4f1a044471340f7c0a83d7bd71306a5b867e95fd870f74d0c5308a904d5" + }, + { + "remote_path": "tokenizer/special_tokens_map.json", + "size": 613, + "sha256": "76862e765266b85aa9459767e33cbaf13970f327a0e88d1c65846c2ddd3a1ecd" + }, + { + "remote_path": "tokenizer/tokenizer.json", + "size": 11422654, + "sha256": "aeb13307a71acd8fe81861d94ad54ab689df773318809eed3cbe794b4492dae4" + }, + { + "remote_path": "tokenizer/tokenizer_config.json", + "size": 5404, + "sha256": "443bfa629eb16387a12edbf92a76f6a6f10b2af3b53d87ba1550adfcf45f7fa0" + }, + { + "remote_path": "tokenizer/vocab.json", + "size": 2776833, + "sha256": "ca10d7e9fb3ed18575dd1e277a2579c16d108e32f27439684afa0e10b1440910" + }, + { + "remote_path": "transformer-packed-mflux/config.json", + "size": 619, + "sha256": "14c6d8314d28cc027ce636d52dfb98cecc11b65c1455bd51b394a971f4b7b49e" + }, + { + "remote_path": "transformer-packed-mflux/diffusion_pytorch_model.safetensors", + "size": 965208136, + "sha256": "1792b31d857d95fcbe32df8e6d2fc96b30e800a195e295565d033deccea2dd75" + }, + { + "remote_path": "transformer-packed-mflux/quantization_config.json", + "size": 5054, + "sha256": "ff8e78812e547f25868eff7b9a86cbcf7a91bee95f81f2bf0e039f198dbbabf0" + }, + { + "remote_path": "vae/config.json", + "size": 821, + "sha256": "0d6dfb69ae95a5e2ac9836284bbb63d8b38ce67b25ba2dff380752b2a10ab948" + }, + { + "remote_path": "vae/diffusion_pytorch_model.safetensors", + "size": 168120878, + "sha256": "ca70d2202afe6415bdbcb8793ba8cd99fd159cfe6192381504d6c4d3036e0f04" + } + ] +} diff --git a/image/mlx/prism-ml/bonsai-image-binary-4B-mlx-1bit/model_index.json b/image/mlx/prism-ml/bonsai-image-binary-4B-mlx-1bit/model_index.json new file mode 100644 index 0000000..23fc542 --- /dev/null +++ b/image/mlx/prism-ml/bonsai-image-binary-4B-mlx-1bit/model_index.json @@ -0,0 +1,4 @@ +{ + "_class_name": "Flux2KleinPipeline", + "_diffusers_version": "0.37.0.dev0" +} diff --git a/image/mlx/prism-ml/bonsai-image-binary-4B-mlx-1bit/scheduler/scheduler_config.json b/image/mlx/prism-ml/bonsai-image-binary-4B-mlx-1bit/scheduler/scheduler_config.json new file mode 100644 index 0000000..7e53605 --- /dev/null +++ b/image/mlx/prism-ml/bonsai-image-binary-4B-mlx-1bit/scheduler/scheduler_config.json @@ -0,0 +1,18 @@ +{ + "_class_name": "FlowMatchEulerDiscreteScheduler", + "_diffusers_version": "0.37.0.dev0", + "base_image_seq_len": 256, + "base_shift": 0.5, + "invert_sigmas": false, + "max_image_seq_len": 4096, + "max_shift": 1.15, + "num_train_timesteps": 1000, + "shift": 3.0, + "shift_terminal": null, + "stochastic_sampling": false, + "time_shift_type": "exponential", + "use_beta_sigmas": false, + "use_dynamic_shifting": true, + "use_exponential_sigmas": false, + "use_karras_sigmas": false +} diff --git a/image/mlx/prism-ml/bonsai-image-binary-4B-mlx-1bit/text_encoder-mlx-4bit/added_tokens.json b/image/mlx/prism-ml/bonsai-image-binary-4B-mlx-1bit/text_encoder-mlx-4bit/added_tokens.json new file mode 100644 index 0000000..b54f913 --- /dev/null +++ b/image/mlx/prism-ml/bonsai-image-binary-4B-mlx-1bit/text_encoder-mlx-4bit/added_tokens.json @@ -0,0 +1,28 @@ +{ + "": 151668, + "
": 151658, + "": 151666, + "": 151667, + "": 151657, + "": 151665, + "<|box_end|>": 151649, + "<|box_start|>": 151648, + "<|endoftext|>": 151643, + "<|file_sep|>": 151664, + "<|fim_middle|>": 151660, + "<|fim_pad|>": 151662, + "<|fim_prefix|>": 151659, + "<|fim_suffix|>": 151661, + "<|im_end|>": 151645, + "<|im_start|>": 151644, + "<|image_pad|>": 151655, + "<|object_ref_end|>": 151647, + "<|object_ref_start|>": 151646, + "<|quad_end|>": 151651, + "<|quad_start|>": 151650, + "<|repo_name|>": 151663, + "<|video_pad|>": 151656, + "<|vision_end|>": 151653, + "<|vision_pad|>": 151654, + "<|vision_start|>": 151652 +} diff --git a/image/mlx/prism-ml/bonsai-image-binary-4B-mlx-1bit/text_encoder-mlx-4bit/config.json b/image/mlx/prism-ml/bonsai-image-binary-4B-mlx-1bit/text_encoder-mlx-4bit/config.json new file mode 100644 index 0000000..032ad32 --- /dev/null +++ b/image/mlx/prism-ml/bonsai-image-binary-4B-mlx-1bit/text_encoder-mlx-4bit/config.json @@ -0,0 +1,38 @@ +{ + "architectures": [ + "Qwen3ForCausalLM" + ], + "attention_bias": false, + "attention_dropout": 0.0, + "bos_token_id": 151643, + "eos_token_id": 151645, + "head_dim": 128, + "hidden_act": "silu", + "hidden_size": 2560, + "initializer_range": 0.02, + "intermediate_size": 9728, + "max_position_embeddings": 40960, + "max_window_layers": 36, + "model_type": "qwen3", + "num_attention_heads": 32, + "num_hidden_layers": 36, + "num_key_value_heads": 8, + "quantization": { + "group_size": 64, + "bits": 4 + }, + "quantization_config": { + "group_size": 64, + "bits": 4 + }, + "rms_norm_eps": 1e-06, + "rope_scaling": null, + "rope_theta": 1000000, + "sliding_window": null, + "tie_word_embeddings": true, + "torch_dtype": "bfloat16", + "transformers_version": "4.51.0", + "use_cache": true, + "use_sliding_window": false, + "vocab_size": 151936 +} \ No newline at end of file diff --git a/image/mlx/prism-ml/bonsai-image-binary-4B-mlx-1bit/text_encoder-mlx-4bit/merges.txt b/image/mlx/prism-ml/bonsai-image-binary-4B-mlx-1bit/text_encoder-mlx-4bit/merges.txt new file mode 100644 index 0000000..80c1a19 --- /dev/null +++ b/image/mlx/prism-ml/bonsai-image-binary-4B-mlx-1bit/text_encoder-mlx-4bit/merges.txt @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:8831e4f1a044471340f7c0a83d7bd71306a5b867e95fd870f74d0c5308a904d5 +size 1671853 diff --git a/image/mlx/prism-ml/bonsai-image-binary-4B-mlx-1bit/text_encoder-mlx-4bit/model.safetensors b/image/mlx/prism-ml/bonsai-image-binary-4B-mlx-1bit/text_encoder-mlx-4bit/model.safetensors new file mode 100644 index 0000000..bb9a979 --- /dev/null +++ b/image/mlx/prism-ml/bonsai-image-binary-4B-mlx-1bit/text_encoder-mlx-4bit/model.safetensors @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:e240c0bdc0ebb0681bf0da0f98d9719fd6ebe269a3633f81542c13e81345651d +size 2263022529 diff --git a/image/mlx/prism-ml/bonsai-image-binary-4B-mlx-1bit/text_encoder-mlx-4bit/model.safetensors.index.json b/image/mlx/prism-ml/bonsai-image-binary-4B-mlx-1bit/text_encoder-mlx-4bit/model.safetensors.index.json new file mode 100644 index 0000000..07e230a --- /dev/null +++ b/image/mlx/prism-ml/bonsai-image-binary-4B-mlx-1bit/text_encoder-mlx-4bit/model.safetensors.index.json @@ -0,0 +1,911 @@ +{ + "metadata": { + "total_size": 2262920192 + }, + "weight_map": { + "model.embed_tokens.biases": "model.safetensors", + "model.embed_tokens.scales": "model.safetensors", + "model.embed_tokens.weight": "model.safetensors", + "model.layers.0.input_layernorm.weight": "model.safetensors", + "model.layers.0.mlp.down_proj.biases": "model.safetensors", + "model.layers.0.mlp.down_proj.scales": "model.safetensors", + "model.layers.0.mlp.down_proj.weight": "model.safetensors", + "model.layers.0.mlp.gate_proj.biases": "model.safetensors", + "model.layers.0.mlp.gate_proj.scales": "model.safetensors", + "model.layers.0.mlp.gate_proj.weight": "model.safetensors", + "model.layers.0.mlp.up_proj.biases": "model.safetensors", + "model.layers.0.mlp.up_proj.scales": "model.safetensors", + "model.layers.0.mlp.up_proj.weight": "model.safetensors", + "model.layers.0.post_attention_layernorm.weight": "model.safetensors", + "model.layers.0.self_attn.k_norm.weight": "model.safetensors", + "model.layers.0.self_attn.k_proj.biases": "model.safetensors", + "model.layers.0.self_attn.k_proj.scales": "model.safetensors", + "model.layers.0.self_attn.k_proj.weight": "model.safetensors", + "model.layers.0.self_attn.o_proj.biases": "model.safetensors", + "model.layers.0.self_attn.o_proj.scales": "model.safetensors", + "model.layers.0.self_attn.o_proj.weight": "model.safetensors", + "model.layers.0.self_attn.q_norm.weight": "model.safetensors", + "model.layers.0.self_attn.q_proj.biases": "model.safetensors", + "model.layers.0.self_attn.q_proj.scales": "model.safetensors", + "model.layers.0.self_attn.q_proj.weight": "model.safetensors", + "model.layers.0.self_attn.v_proj.biases": "model.safetensors", + "model.layers.0.self_attn.v_proj.scales": "model.safetensors", + "model.layers.0.self_attn.v_proj.weight": "model.safetensors", + "model.layers.1.input_layernorm.weight": "model.safetensors", + "model.layers.1.mlp.down_proj.biases": "model.safetensors", + "model.layers.1.mlp.down_proj.scales": "model.safetensors", + "model.layers.1.mlp.down_proj.weight": "model.safetensors", + "model.layers.1.mlp.gate_proj.biases": "model.safetensors", + "model.layers.1.mlp.gate_proj.scales": "model.safetensors", + "model.layers.1.mlp.gate_proj.weight": "model.safetensors", + "model.layers.1.mlp.up_proj.biases": "model.safetensors", + "model.layers.1.mlp.up_proj.scales": "model.safetensors", + "model.layers.1.mlp.up_proj.weight": "model.safetensors", + "model.layers.1.post_attention_layernorm.weight": "model.safetensors", + "model.layers.1.self_attn.k_norm.weight": "model.safetensors", + "model.layers.1.self_attn.k_proj.biases": "model.safetensors", + "model.layers.1.self_attn.k_proj.scales": "model.safetensors", + "model.layers.1.self_attn.k_proj.weight": "model.safetensors", + "model.layers.1.self_attn.o_proj.biases": "model.safetensors", + "model.layers.1.self_attn.o_proj.scales": "model.safetensors", + "model.layers.1.self_attn.o_proj.weight": "model.safetensors", + "model.layers.1.self_attn.q_norm.weight": "model.safetensors", + "model.layers.1.self_attn.q_proj.biases": "model.safetensors", + "model.layers.1.self_attn.q_proj.scales": "model.safetensors", + "model.layers.1.self_attn.q_proj.weight": "model.safetensors", + "model.layers.1.self_attn.v_proj.biases": "model.safetensors", + "model.layers.1.self_attn.v_proj.scales": "model.safetensors", + "model.layers.1.self_attn.v_proj.weight": "model.safetensors", + "model.layers.10.input_layernorm.weight": "model.safetensors", + "model.layers.10.mlp.down_proj.biases": "model.safetensors", + "model.layers.10.mlp.down_proj.scales": "model.safetensors", + "model.layers.10.mlp.down_proj.weight": "model.safetensors", + "model.layers.10.mlp.gate_proj.biases": "model.safetensors", + "model.layers.10.mlp.gate_proj.scales": "model.safetensors", + "model.layers.10.mlp.gate_proj.weight": "model.safetensors", + "model.layers.10.mlp.up_proj.biases": "model.safetensors", + "model.layers.10.mlp.up_proj.scales": "model.safetensors", + "model.layers.10.mlp.up_proj.weight": "model.safetensors", + "model.layers.10.post_attention_layernorm.weight": "model.safetensors", + "model.layers.10.self_attn.k_norm.weight": "model.safetensors", + "model.layers.10.self_attn.k_proj.biases": "model.safetensors", + "model.layers.10.self_attn.k_proj.scales": "model.safetensors", + "model.layers.10.self_attn.k_proj.weight": "model.safetensors", + "model.layers.10.self_attn.o_proj.biases": "model.safetensors", + "model.layers.10.self_attn.o_proj.scales": "model.safetensors", + "model.layers.10.self_attn.o_proj.weight": "model.safetensors", + "model.layers.10.self_attn.q_norm.weight": "model.safetensors", + "model.layers.10.self_attn.q_proj.biases": "model.safetensors", + "model.layers.10.self_attn.q_proj.scales": "model.safetensors", + "model.layers.10.self_attn.q_proj.weight": "model.safetensors", + "model.layers.10.self_attn.v_proj.biases": "model.safetensors", + "model.layers.10.self_attn.v_proj.scales": "model.safetensors", + "model.layers.10.self_attn.v_proj.weight": "model.safetensors", + "model.layers.11.input_layernorm.weight": "model.safetensors", + "model.layers.11.mlp.down_proj.biases": "model.safetensors", + "model.layers.11.mlp.down_proj.scales": "model.safetensors", + "model.layers.11.mlp.down_proj.weight": "model.safetensors", + "model.layers.11.mlp.gate_proj.biases": "model.safetensors", + "model.layers.11.mlp.gate_proj.scales": "model.safetensors", + "model.layers.11.mlp.gate_proj.weight": "model.safetensors", + "model.layers.11.mlp.up_proj.biases": "model.safetensors", + "model.layers.11.mlp.up_proj.scales": "model.safetensors", + "model.layers.11.mlp.up_proj.weight": "model.safetensors", + "model.layers.11.post_attention_layernorm.weight": "model.safetensors", + "model.layers.11.self_attn.k_norm.weight": "model.safetensors", + "model.layers.11.self_attn.k_proj.biases": "model.safetensors", + "model.layers.11.self_attn.k_proj.scales": "model.safetensors", + "model.layers.11.self_attn.k_proj.weight": "model.safetensors", + "model.layers.11.self_attn.o_proj.biases": "model.safetensors", + "model.layers.11.self_attn.o_proj.scales": "model.safetensors", + "model.layers.11.self_attn.o_proj.weight": "model.safetensors", + "model.layers.11.self_attn.q_norm.weight": "model.safetensors", + "model.layers.11.self_attn.q_proj.biases": "model.safetensors", + "model.layers.11.self_attn.q_proj.scales": "model.safetensors", + "model.layers.11.self_attn.q_proj.weight": "model.safetensors", + "model.layers.11.self_attn.v_proj.biases": "model.safetensors", + "model.layers.11.self_attn.v_proj.scales": "model.safetensors", + "model.layers.11.self_attn.v_proj.weight": "model.safetensors", + "model.layers.12.input_layernorm.weight": "model.safetensors", + "model.layers.12.mlp.down_proj.biases": "model.safetensors", + "model.layers.12.mlp.down_proj.scales": "model.safetensors", + "model.layers.12.mlp.down_proj.weight": "model.safetensors", + "model.layers.12.mlp.gate_proj.biases": "model.safetensors", + "model.layers.12.mlp.gate_proj.scales": "model.safetensors", + "model.layers.12.mlp.gate_proj.weight": "model.safetensors", + "model.layers.12.mlp.up_proj.biases": "model.safetensors", + "model.layers.12.mlp.up_proj.scales": "model.safetensors", + "model.layers.12.mlp.up_proj.weight": "model.safetensors", + "model.layers.12.post_attention_layernorm.weight": "model.safetensors", + "model.layers.12.self_attn.k_norm.weight": "model.safetensors", + "model.layers.12.self_attn.k_proj.biases": "model.safetensors", + "model.layers.12.self_attn.k_proj.scales": "model.safetensors", + "model.layers.12.self_attn.k_proj.weight": "model.safetensors", + "model.layers.12.self_attn.o_proj.biases": "model.safetensors", + "model.layers.12.self_attn.o_proj.scales": "model.safetensors", + "model.layers.12.self_attn.o_proj.weight": "model.safetensors", + "model.layers.12.self_attn.q_norm.weight": "model.safetensors", + "model.layers.12.self_attn.q_proj.biases": "model.safetensors", + "model.layers.12.self_attn.q_proj.scales": "model.safetensors", + "model.layers.12.self_attn.q_proj.weight": "model.safetensors", + "model.layers.12.self_attn.v_proj.biases": "model.safetensors", + "model.layers.12.self_attn.v_proj.scales": "model.safetensors", + "model.layers.12.self_attn.v_proj.weight": "model.safetensors", + "model.layers.13.input_layernorm.weight": "model.safetensors", + "model.layers.13.mlp.down_proj.biases": "model.safetensors", + "model.layers.13.mlp.down_proj.scales": "model.safetensors", + "model.layers.13.mlp.down_proj.weight": "model.safetensors", + "model.layers.13.mlp.gate_proj.biases": "model.safetensors", + "model.layers.13.mlp.gate_proj.scales": "model.safetensors", + "model.layers.13.mlp.gate_proj.weight": "model.safetensors", + "model.layers.13.mlp.up_proj.biases": "model.safetensors", + "model.layers.13.mlp.up_proj.scales": "model.safetensors", + "model.layers.13.mlp.up_proj.weight": "model.safetensors", + "model.layers.13.post_attention_layernorm.weight": "model.safetensors", + "model.layers.13.self_attn.k_norm.weight": "model.safetensors", + "model.layers.13.self_attn.k_proj.biases": "model.safetensors", + "model.layers.13.self_attn.k_proj.scales": "model.safetensors", + "model.layers.13.self_attn.k_proj.weight": "model.safetensors", + "model.layers.13.self_attn.o_proj.biases": "model.safetensors", + "model.layers.13.self_attn.o_proj.scales": "model.safetensors", + "model.layers.13.self_attn.o_proj.weight": "model.safetensors", + "model.layers.13.self_attn.q_norm.weight": "model.safetensors", + "model.layers.13.self_attn.q_proj.biases": "model.safetensors", + "model.layers.13.self_attn.q_proj.scales": "model.safetensors", + "model.layers.13.self_attn.q_proj.weight": "model.safetensors", + "model.layers.13.self_attn.v_proj.biases": "model.safetensors", + "model.layers.13.self_attn.v_proj.scales": "model.safetensors", + "model.layers.13.self_attn.v_proj.weight": "model.safetensors", + "model.layers.14.input_layernorm.weight": "model.safetensors", + "model.layers.14.mlp.down_proj.biases": "model.safetensors", + "model.layers.14.mlp.down_proj.scales": "model.safetensors", + "model.layers.14.mlp.down_proj.weight": "model.safetensors", + "model.layers.14.mlp.gate_proj.biases": "model.safetensors", + "model.layers.14.mlp.gate_proj.scales": "model.safetensors", + "model.layers.14.mlp.gate_proj.weight": "model.safetensors", + "model.layers.14.mlp.up_proj.biases": "model.safetensors", + "model.layers.14.mlp.up_proj.scales": "model.safetensors", + "model.layers.14.mlp.up_proj.weight": "model.safetensors", + "model.layers.14.post_attention_layernorm.weight": "model.safetensors", + "model.layers.14.self_attn.k_norm.weight": "model.safetensors", + "model.layers.14.self_attn.k_proj.biases": "model.safetensors", + "model.layers.14.self_attn.k_proj.scales": "model.safetensors", + "model.layers.14.self_attn.k_proj.weight": "model.safetensors", + "model.layers.14.self_attn.o_proj.biases": "model.safetensors", + "model.layers.14.self_attn.o_proj.scales": "model.safetensors", + "model.layers.14.self_attn.o_proj.weight": "model.safetensors", + "model.layers.14.self_attn.q_norm.weight": "model.safetensors", + "model.layers.14.self_attn.q_proj.biases": "model.safetensors", + "model.layers.14.self_attn.q_proj.scales": "model.safetensors", + "model.layers.14.self_attn.q_proj.weight": "model.safetensors", + "model.layers.14.self_attn.v_proj.biases": "model.safetensors", + "model.layers.14.self_attn.v_proj.scales": "model.safetensors", + "model.layers.14.self_attn.v_proj.weight": "model.safetensors", + "model.layers.15.input_layernorm.weight": "model.safetensors", + "model.layers.15.mlp.down_proj.biases": "model.safetensors", + "model.layers.15.mlp.down_proj.scales": "model.safetensors", + "model.layers.15.mlp.down_proj.weight": "model.safetensors", + "model.layers.15.mlp.gate_proj.biases": "model.safetensors", + "model.layers.15.mlp.gate_proj.scales": "model.safetensors", + "model.layers.15.mlp.gate_proj.weight": "model.safetensors", + "model.layers.15.mlp.up_proj.biases": "model.safetensors", + "model.layers.15.mlp.up_proj.scales": "model.safetensors", + "model.layers.15.mlp.up_proj.weight": "model.safetensors", + "model.layers.15.post_attention_layernorm.weight": "model.safetensors", + "model.layers.15.self_attn.k_norm.weight": "model.safetensors", + "model.layers.15.self_attn.k_proj.biases": "model.safetensors", + "model.layers.15.self_attn.k_proj.scales": "model.safetensors", + "model.layers.15.self_attn.k_proj.weight": "model.safetensors", + "model.layers.15.self_attn.o_proj.biases": "model.safetensors", + "model.layers.15.self_attn.o_proj.scales": "model.safetensors", + "model.layers.15.self_attn.o_proj.weight": "model.safetensors", + "model.layers.15.self_attn.q_norm.weight": "model.safetensors", + "model.layers.15.self_attn.q_proj.biases": "model.safetensors", + "model.layers.15.self_attn.q_proj.scales": "model.safetensors", + "model.layers.15.self_attn.q_proj.weight": "model.safetensors", + "model.layers.15.self_attn.v_proj.biases": "model.safetensors", + "model.layers.15.self_attn.v_proj.scales": "model.safetensors", + "model.layers.15.self_attn.v_proj.weight": "model.safetensors", + "model.layers.16.input_layernorm.weight": "model.safetensors", + "model.layers.16.mlp.down_proj.biases": "model.safetensors", + "model.layers.16.mlp.down_proj.scales": "model.safetensors", + "model.layers.16.mlp.down_proj.weight": "model.safetensors", + "model.layers.16.mlp.gate_proj.biases": "model.safetensors", + "model.layers.16.mlp.gate_proj.scales": "model.safetensors", + "model.layers.16.mlp.gate_proj.weight": "model.safetensors", + "model.layers.16.mlp.up_proj.biases": "model.safetensors", + "model.layers.16.mlp.up_proj.scales": "model.safetensors", + "model.layers.16.mlp.up_proj.weight": "model.safetensors", + "model.layers.16.post_attention_layernorm.weight": "model.safetensors", + "model.layers.16.self_attn.k_norm.weight": "model.safetensors", + "model.layers.16.self_attn.k_proj.biases": "model.safetensors", + "model.layers.16.self_attn.k_proj.scales": "model.safetensors", + "model.layers.16.self_attn.k_proj.weight": "model.safetensors", + "model.layers.16.self_attn.o_proj.biases": "model.safetensors", + "model.layers.16.self_attn.o_proj.scales": "model.safetensors", + "model.layers.16.self_attn.o_proj.weight": "model.safetensors", + "model.layers.16.self_attn.q_norm.weight": "model.safetensors", + "model.layers.16.self_attn.q_proj.biases": "model.safetensors", + "model.layers.16.self_attn.q_proj.scales": "model.safetensors", + "model.layers.16.self_attn.q_proj.weight": "model.safetensors", + "model.layers.16.self_attn.v_proj.biases": "model.safetensors", + "model.layers.16.self_attn.v_proj.scales": "model.safetensors", + "model.layers.16.self_attn.v_proj.weight": "model.safetensors", + "model.layers.17.input_layernorm.weight": "model.safetensors", + "model.layers.17.mlp.down_proj.biases": "model.safetensors", + "model.layers.17.mlp.down_proj.scales": "model.safetensors", + "model.layers.17.mlp.down_proj.weight": "model.safetensors", + "model.layers.17.mlp.gate_proj.biases": "model.safetensors", + "model.layers.17.mlp.gate_proj.scales": "model.safetensors", + "model.layers.17.mlp.gate_proj.weight": "model.safetensors", + "model.layers.17.mlp.up_proj.biases": "model.safetensors", + "model.layers.17.mlp.up_proj.scales": "model.safetensors", + "model.layers.17.mlp.up_proj.weight": "model.safetensors", + "model.layers.17.post_attention_layernorm.weight": "model.safetensors", + "model.layers.17.self_attn.k_norm.weight": "model.safetensors", + "model.layers.17.self_attn.k_proj.biases": "model.safetensors", + "model.layers.17.self_attn.k_proj.scales": "model.safetensors", + "model.layers.17.self_attn.k_proj.weight": "model.safetensors", + "model.layers.17.self_attn.o_proj.biases": "model.safetensors", + "model.layers.17.self_attn.o_proj.scales": "model.safetensors", + "model.layers.17.self_attn.o_proj.weight": "model.safetensors", + "model.layers.17.self_attn.q_norm.weight": "model.safetensors", + "model.layers.17.self_attn.q_proj.biases": "model.safetensors", + "model.layers.17.self_attn.q_proj.scales": "model.safetensors", + "model.layers.17.self_attn.q_proj.weight": "model.safetensors", + "model.layers.17.self_attn.v_proj.biases": "model.safetensors", + "model.layers.17.self_attn.v_proj.scales": "model.safetensors", + "model.layers.17.self_attn.v_proj.weight": "model.safetensors", + "model.layers.18.input_layernorm.weight": "model.safetensors", + "model.layers.18.mlp.down_proj.biases": "model.safetensors", + "model.layers.18.mlp.down_proj.scales": "model.safetensors", + "model.layers.18.mlp.down_proj.weight": "model.safetensors", + "model.layers.18.mlp.gate_proj.biases": "model.safetensors", + "model.layers.18.mlp.gate_proj.scales": "model.safetensors", + "model.layers.18.mlp.gate_proj.weight": "model.safetensors", + "model.layers.18.mlp.up_proj.biases": "model.safetensors", + "model.layers.18.mlp.up_proj.scales": "model.safetensors", + "model.layers.18.mlp.up_proj.weight": "model.safetensors", + "model.layers.18.post_attention_layernorm.weight": "model.safetensors", + "model.layers.18.self_attn.k_norm.weight": "model.safetensors", + "model.layers.18.self_attn.k_proj.biases": "model.safetensors", + "model.layers.18.self_attn.k_proj.scales": "model.safetensors", + "model.layers.18.self_attn.k_proj.weight": "model.safetensors", + "model.layers.18.self_attn.o_proj.biases": "model.safetensors", + "model.layers.18.self_attn.o_proj.scales": "model.safetensors", + "model.layers.18.self_attn.o_proj.weight": "model.safetensors", + "model.layers.18.self_attn.q_norm.weight": "model.safetensors", + "model.layers.18.self_attn.q_proj.biases": "model.safetensors", + "model.layers.18.self_attn.q_proj.scales": "model.safetensors", + "model.layers.18.self_attn.q_proj.weight": "model.safetensors", + "model.layers.18.self_attn.v_proj.biases": "model.safetensors", + "model.layers.18.self_attn.v_proj.scales": "model.safetensors", + "model.layers.18.self_attn.v_proj.weight": "model.safetensors", + "model.layers.19.input_layernorm.weight": "model.safetensors", + "model.layers.19.mlp.down_proj.biases": "model.safetensors", + "model.layers.19.mlp.down_proj.scales": "model.safetensors", + "model.layers.19.mlp.down_proj.weight": "model.safetensors", + "model.layers.19.mlp.gate_proj.biases": "model.safetensors", + "model.layers.19.mlp.gate_proj.scales": "model.safetensors", + "model.layers.19.mlp.gate_proj.weight": "model.safetensors", + "model.layers.19.mlp.up_proj.biases": "model.safetensors", + "model.layers.19.mlp.up_proj.scales": "model.safetensors", + "model.layers.19.mlp.up_proj.weight": "model.safetensors", + "model.layers.19.post_attention_layernorm.weight": "model.safetensors", + "model.layers.19.self_attn.k_norm.weight": "model.safetensors", + "model.layers.19.self_attn.k_proj.biases": "model.safetensors", + "model.layers.19.self_attn.k_proj.scales": "model.safetensors", + "model.layers.19.self_attn.k_proj.weight": "model.safetensors", + "model.layers.19.self_attn.o_proj.biases": "model.safetensors", + "model.layers.19.self_attn.o_proj.scales": "model.safetensors", + "model.layers.19.self_attn.o_proj.weight": "model.safetensors", + "model.layers.19.self_attn.q_norm.weight": "model.safetensors", + "model.layers.19.self_attn.q_proj.biases": "model.safetensors", + "model.layers.19.self_attn.q_proj.scales": "model.safetensors", + "model.layers.19.self_attn.q_proj.weight": "model.safetensors", + "model.layers.19.self_attn.v_proj.biases": "model.safetensors", + "model.layers.19.self_attn.v_proj.scales": "model.safetensors", + "model.layers.19.self_attn.v_proj.weight": "model.safetensors", + "model.layers.2.input_layernorm.weight": "model.safetensors", + "model.layers.2.mlp.down_proj.biases": "model.safetensors", + "model.layers.2.mlp.down_proj.scales": "model.safetensors", + "model.layers.2.mlp.down_proj.weight": "model.safetensors", + "model.layers.2.mlp.gate_proj.biases": "model.safetensors", + "model.layers.2.mlp.gate_proj.scales": "model.safetensors", + "model.layers.2.mlp.gate_proj.weight": "model.safetensors", + "model.layers.2.mlp.up_proj.biases": "model.safetensors", + "model.layers.2.mlp.up_proj.scales": "model.safetensors", + "model.layers.2.mlp.up_proj.weight": "model.safetensors", + "model.layers.2.post_attention_layernorm.weight": "model.safetensors", + "model.layers.2.self_attn.k_norm.weight": "model.safetensors", + "model.layers.2.self_attn.k_proj.biases": "model.safetensors", + "model.layers.2.self_attn.k_proj.scales": "model.safetensors", + "model.layers.2.self_attn.k_proj.weight": "model.safetensors", + "model.layers.2.self_attn.o_proj.biases": "model.safetensors", + "model.layers.2.self_attn.o_proj.scales": "model.safetensors", + "model.layers.2.self_attn.o_proj.weight": "model.safetensors", + "model.layers.2.self_attn.q_norm.weight": "model.safetensors", + "model.layers.2.self_attn.q_proj.biases": "model.safetensors", + "model.layers.2.self_attn.q_proj.scales": "model.safetensors", + "model.layers.2.self_attn.q_proj.weight": "model.safetensors", + "model.layers.2.self_attn.v_proj.biases": "model.safetensors", + "model.layers.2.self_attn.v_proj.scales": "model.safetensors", + "model.layers.2.self_attn.v_proj.weight": "model.safetensors", + "model.layers.20.input_layernorm.weight": "model.safetensors", + "model.layers.20.mlp.down_proj.biases": "model.safetensors", + "model.layers.20.mlp.down_proj.scales": "model.safetensors", + "model.layers.20.mlp.down_proj.weight": "model.safetensors", + "model.layers.20.mlp.gate_proj.biases": "model.safetensors", + "model.layers.20.mlp.gate_proj.scales": "model.safetensors", + "model.layers.20.mlp.gate_proj.weight": "model.safetensors", + "model.layers.20.mlp.up_proj.biases": "model.safetensors", + "model.layers.20.mlp.up_proj.scales": "model.safetensors", + "model.layers.20.mlp.up_proj.weight": "model.safetensors", + "model.layers.20.post_attention_layernorm.weight": "model.safetensors", + "model.layers.20.self_attn.k_norm.weight": "model.safetensors", + "model.layers.20.self_attn.k_proj.biases": "model.safetensors", + "model.layers.20.self_attn.k_proj.scales": "model.safetensors", + "model.layers.20.self_attn.k_proj.weight": "model.safetensors", + "model.layers.20.self_attn.o_proj.biases": "model.safetensors", + "model.layers.20.self_attn.o_proj.scales": "model.safetensors", + "model.layers.20.self_attn.o_proj.weight": "model.safetensors", + "model.layers.20.self_attn.q_norm.weight": "model.safetensors", + "model.layers.20.self_attn.q_proj.biases": "model.safetensors", + "model.layers.20.self_attn.q_proj.scales": "model.safetensors", + "model.layers.20.self_attn.q_proj.weight": "model.safetensors", + "model.layers.20.self_attn.v_proj.biases": "model.safetensors", + "model.layers.20.self_attn.v_proj.scales": "model.safetensors", + "model.layers.20.self_attn.v_proj.weight": "model.safetensors", + "model.layers.21.input_layernorm.weight": "model.safetensors", + "model.layers.21.mlp.down_proj.biases": "model.safetensors", + "model.layers.21.mlp.down_proj.scales": "model.safetensors", + "model.layers.21.mlp.down_proj.weight": "model.safetensors", + "model.layers.21.mlp.gate_proj.biases": "model.safetensors", + "model.layers.21.mlp.gate_proj.scales": "model.safetensors", + "model.layers.21.mlp.gate_proj.weight": "model.safetensors", + "model.layers.21.mlp.up_proj.biases": "model.safetensors", + "model.layers.21.mlp.up_proj.scales": "model.safetensors", + "model.layers.21.mlp.up_proj.weight": "model.safetensors", + "model.layers.21.post_attention_layernorm.weight": "model.safetensors", + "model.layers.21.self_attn.k_norm.weight": "model.safetensors", + "model.layers.21.self_attn.k_proj.biases": "model.safetensors", + "model.layers.21.self_attn.k_proj.scales": "model.safetensors", + "model.layers.21.self_attn.k_proj.weight": "model.safetensors", + "model.layers.21.self_attn.o_proj.biases": "model.safetensors", + "model.layers.21.self_attn.o_proj.scales": "model.safetensors", + "model.layers.21.self_attn.o_proj.weight": "model.safetensors", + "model.layers.21.self_attn.q_norm.weight": "model.safetensors", + "model.layers.21.self_attn.q_proj.biases": "model.safetensors", + "model.layers.21.self_attn.q_proj.scales": "model.safetensors", + "model.layers.21.self_attn.q_proj.weight": "model.safetensors", + "model.layers.21.self_attn.v_proj.biases": "model.safetensors", + "model.layers.21.self_attn.v_proj.scales": "model.safetensors", + "model.layers.21.self_attn.v_proj.weight": "model.safetensors", + "model.layers.22.input_layernorm.weight": "model.safetensors", + "model.layers.22.mlp.down_proj.biases": "model.safetensors", + "model.layers.22.mlp.down_proj.scales": "model.safetensors", + "model.layers.22.mlp.down_proj.weight": "model.safetensors", + "model.layers.22.mlp.gate_proj.biases": "model.safetensors", + "model.layers.22.mlp.gate_proj.scales": "model.safetensors", + "model.layers.22.mlp.gate_proj.weight": "model.safetensors", + "model.layers.22.mlp.up_proj.biases": "model.safetensors", + "model.layers.22.mlp.up_proj.scales": "model.safetensors", + "model.layers.22.mlp.up_proj.weight": "model.safetensors", + "model.layers.22.post_attention_layernorm.weight": "model.safetensors", + "model.layers.22.self_attn.k_norm.weight": "model.safetensors", + "model.layers.22.self_attn.k_proj.biases": "model.safetensors", + "model.layers.22.self_attn.k_proj.scales": "model.safetensors", + "model.layers.22.self_attn.k_proj.weight": "model.safetensors", + "model.layers.22.self_attn.o_proj.biases": "model.safetensors", + "model.layers.22.self_attn.o_proj.scales": "model.safetensors", + "model.layers.22.self_attn.o_proj.weight": "model.safetensors", + "model.layers.22.self_attn.q_norm.weight": "model.safetensors", + "model.layers.22.self_attn.q_proj.biases": "model.safetensors", + "model.layers.22.self_attn.q_proj.scales": "model.safetensors", + "model.layers.22.self_attn.q_proj.weight": "model.safetensors", + "model.layers.22.self_attn.v_proj.biases": "model.safetensors", + "model.layers.22.self_attn.v_proj.scales": "model.safetensors", + "model.layers.22.self_attn.v_proj.weight": "model.safetensors", + "model.layers.23.input_layernorm.weight": "model.safetensors", + "model.layers.23.mlp.down_proj.biases": "model.safetensors", + "model.layers.23.mlp.down_proj.scales": "model.safetensors", + "model.layers.23.mlp.down_proj.weight": "model.safetensors", + "model.layers.23.mlp.gate_proj.biases": "model.safetensors", + "model.layers.23.mlp.gate_proj.scales": "model.safetensors", + "model.layers.23.mlp.gate_proj.weight": "model.safetensors", + "model.layers.23.mlp.up_proj.biases": "model.safetensors", + "model.layers.23.mlp.up_proj.scales": "model.safetensors", + "model.layers.23.mlp.up_proj.weight": "model.safetensors", + "model.layers.23.post_attention_layernorm.weight": "model.safetensors", + "model.layers.23.self_attn.k_norm.weight": "model.safetensors", + "model.layers.23.self_attn.k_proj.biases": "model.safetensors", + "model.layers.23.self_attn.k_proj.scales": "model.safetensors", + "model.layers.23.self_attn.k_proj.weight": "model.safetensors", + "model.layers.23.self_attn.o_proj.biases": "model.safetensors", + "model.layers.23.self_attn.o_proj.scales": "model.safetensors", + "model.layers.23.self_attn.o_proj.weight": "model.safetensors", + "model.layers.23.self_attn.q_norm.weight": "model.safetensors", + "model.layers.23.self_attn.q_proj.biases": "model.safetensors", + "model.layers.23.self_attn.q_proj.scales": "model.safetensors", + "model.layers.23.self_attn.q_proj.weight": "model.safetensors", + "model.layers.23.self_attn.v_proj.biases": "model.safetensors", + "model.layers.23.self_attn.v_proj.scales": "model.safetensors", + "model.layers.23.self_attn.v_proj.weight": "model.safetensors", + "model.layers.24.input_layernorm.weight": "model.safetensors", + "model.layers.24.mlp.down_proj.biases": "model.safetensors", + "model.layers.24.mlp.down_proj.scales": "model.safetensors", + "model.layers.24.mlp.down_proj.weight": "model.safetensors", + "model.layers.24.mlp.gate_proj.biases": "model.safetensors", + "model.layers.24.mlp.gate_proj.scales": "model.safetensors", + "model.layers.24.mlp.gate_proj.weight": "model.safetensors", + "model.layers.24.mlp.up_proj.biases": "model.safetensors", + "model.layers.24.mlp.up_proj.scales": "model.safetensors", + "model.layers.24.mlp.up_proj.weight": "model.safetensors", + "model.layers.24.post_attention_layernorm.weight": "model.safetensors", + "model.layers.24.self_attn.k_norm.weight": "model.safetensors", + "model.layers.24.self_attn.k_proj.biases": "model.safetensors", + "model.layers.24.self_attn.k_proj.scales": "model.safetensors", + "model.layers.24.self_attn.k_proj.weight": "model.safetensors", + "model.layers.24.self_attn.o_proj.biases": "model.safetensors", + "model.layers.24.self_attn.o_proj.scales": "model.safetensors", + "model.layers.24.self_attn.o_proj.weight": "model.safetensors", + "model.layers.24.self_attn.q_norm.weight": "model.safetensors", + "model.layers.24.self_attn.q_proj.biases": "model.safetensors", + "model.layers.24.self_attn.q_proj.scales": "model.safetensors", + "model.layers.24.self_attn.q_proj.weight": "model.safetensors", + "model.layers.24.self_attn.v_proj.biases": "model.safetensors", + "model.layers.24.self_attn.v_proj.scales": "model.safetensors", + "model.layers.24.self_attn.v_proj.weight": "model.safetensors", + "model.layers.25.input_layernorm.weight": "model.safetensors", + "model.layers.25.mlp.down_proj.biases": "model.safetensors", + "model.layers.25.mlp.down_proj.scales": "model.safetensors", + "model.layers.25.mlp.down_proj.weight": "model.safetensors", + "model.layers.25.mlp.gate_proj.biases": "model.safetensors", + "model.layers.25.mlp.gate_proj.scales": "model.safetensors", + "model.layers.25.mlp.gate_proj.weight": "model.safetensors", + "model.layers.25.mlp.up_proj.biases": "model.safetensors", + "model.layers.25.mlp.up_proj.scales": "model.safetensors", + "model.layers.25.mlp.up_proj.weight": "model.safetensors", + "model.layers.25.post_attention_layernorm.weight": "model.safetensors", + "model.layers.25.self_attn.k_norm.weight": "model.safetensors", + "model.layers.25.self_attn.k_proj.biases": "model.safetensors", + "model.layers.25.self_attn.k_proj.scales": "model.safetensors", + "model.layers.25.self_attn.k_proj.weight": "model.safetensors", + "model.layers.25.self_attn.o_proj.biases": "model.safetensors", + "model.layers.25.self_attn.o_proj.scales": "model.safetensors", + "model.layers.25.self_attn.o_proj.weight": "model.safetensors", + "model.layers.25.self_attn.q_norm.weight": "model.safetensors", + "model.layers.25.self_attn.q_proj.biases": "model.safetensors", + "model.layers.25.self_attn.q_proj.scales": "model.safetensors", + "model.layers.25.self_attn.q_proj.weight": "model.safetensors", + "model.layers.25.self_attn.v_proj.biases": "model.safetensors", + "model.layers.25.self_attn.v_proj.scales": "model.safetensors", + "model.layers.25.self_attn.v_proj.weight": "model.safetensors", + "model.layers.26.input_layernorm.weight": "model.safetensors", + "model.layers.26.mlp.down_proj.biases": "model.safetensors", + "model.layers.26.mlp.down_proj.scales": "model.safetensors", + "model.layers.26.mlp.down_proj.weight": "model.safetensors", + "model.layers.26.mlp.gate_proj.biases": "model.safetensors", + "model.layers.26.mlp.gate_proj.scales": "model.safetensors", + "model.layers.26.mlp.gate_proj.weight": "model.safetensors", + "model.layers.26.mlp.up_proj.biases": "model.safetensors", + "model.layers.26.mlp.up_proj.scales": "model.safetensors", + "model.layers.26.mlp.up_proj.weight": "model.safetensors", + "model.layers.26.post_attention_layernorm.weight": "model.safetensors", + "model.layers.26.self_attn.k_norm.weight": "model.safetensors", + "model.layers.26.self_attn.k_proj.biases": "model.safetensors", + "model.layers.26.self_attn.k_proj.scales": "model.safetensors", + "model.layers.26.self_attn.k_proj.weight": "model.safetensors", + "model.layers.26.self_attn.o_proj.biases": "model.safetensors", + "model.layers.26.self_attn.o_proj.scales": "model.safetensors", + "model.layers.26.self_attn.o_proj.weight": "model.safetensors", + "model.layers.26.self_attn.q_norm.weight": "model.safetensors", + "model.layers.26.self_attn.q_proj.biases": "model.safetensors", + "model.layers.26.self_attn.q_proj.scales": "model.safetensors", + "model.layers.26.self_attn.q_proj.weight": "model.safetensors", + "model.layers.26.self_attn.v_proj.biases": "model.safetensors", + "model.layers.26.self_attn.v_proj.scales": "model.safetensors", + "model.layers.26.self_attn.v_proj.weight": "model.safetensors", + "model.layers.27.input_layernorm.weight": "model.safetensors", + "model.layers.27.mlp.down_proj.biases": "model.safetensors", + "model.layers.27.mlp.down_proj.scales": "model.safetensors", + "model.layers.27.mlp.down_proj.weight": "model.safetensors", + "model.layers.27.mlp.gate_proj.biases": "model.safetensors", + "model.layers.27.mlp.gate_proj.scales": "model.safetensors", + "model.layers.27.mlp.gate_proj.weight": "model.safetensors", + "model.layers.27.mlp.up_proj.biases": "model.safetensors", + "model.layers.27.mlp.up_proj.scales": "model.safetensors", + "model.layers.27.mlp.up_proj.weight": "model.safetensors", + "model.layers.27.post_attention_layernorm.weight": "model.safetensors", + "model.layers.27.self_attn.k_norm.weight": "model.safetensors", + "model.layers.27.self_attn.k_proj.biases": "model.safetensors", + "model.layers.27.self_attn.k_proj.scales": "model.safetensors", + "model.layers.27.self_attn.k_proj.weight": "model.safetensors", + "model.layers.27.self_attn.o_proj.biases": "model.safetensors", + "model.layers.27.self_attn.o_proj.scales": "model.safetensors", + "model.layers.27.self_attn.o_proj.weight": "model.safetensors", + "model.layers.27.self_attn.q_norm.weight": "model.safetensors", + "model.layers.27.self_attn.q_proj.biases": "model.safetensors", + "model.layers.27.self_attn.q_proj.scales": "model.safetensors", + "model.layers.27.self_attn.q_proj.weight": "model.safetensors", + "model.layers.27.self_attn.v_proj.biases": "model.safetensors", + "model.layers.27.self_attn.v_proj.scales": "model.safetensors", + "model.layers.27.self_attn.v_proj.weight": "model.safetensors", + "model.layers.28.input_layernorm.weight": "model.safetensors", + "model.layers.28.mlp.down_proj.biases": "model.safetensors", + "model.layers.28.mlp.down_proj.scales": "model.safetensors", + "model.layers.28.mlp.down_proj.weight": "model.safetensors", + "model.layers.28.mlp.gate_proj.biases": "model.safetensors", + "model.layers.28.mlp.gate_proj.scales": "model.safetensors", + "model.layers.28.mlp.gate_proj.weight": "model.safetensors", + "model.layers.28.mlp.up_proj.biases": "model.safetensors", + "model.layers.28.mlp.up_proj.scales": "model.safetensors", + "model.layers.28.mlp.up_proj.weight": "model.safetensors", + "model.layers.28.post_attention_layernorm.weight": "model.safetensors", + "model.layers.28.self_attn.k_norm.weight": "model.safetensors", + "model.layers.28.self_attn.k_proj.biases": "model.safetensors", + "model.layers.28.self_attn.k_proj.scales": "model.safetensors", + "model.layers.28.self_attn.k_proj.weight": "model.safetensors", + "model.layers.28.self_attn.o_proj.biases": "model.safetensors", + "model.layers.28.self_attn.o_proj.scales": "model.safetensors", + "model.layers.28.self_attn.o_proj.weight": "model.safetensors", + "model.layers.28.self_attn.q_norm.weight": "model.safetensors", + "model.layers.28.self_attn.q_proj.biases": "model.safetensors", + "model.layers.28.self_attn.q_proj.scales": "model.safetensors", + "model.layers.28.self_attn.q_proj.weight": "model.safetensors", + "model.layers.28.self_attn.v_proj.biases": "model.safetensors", + "model.layers.28.self_attn.v_proj.scales": "model.safetensors", + "model.layers.28.self_attn.v_proj.weight": "model.safetensors", + "model.layers.29.input_layernorm.weight": "model.safetensors", + "model.layers.29.mlp.down_proj.biases": "model.safetensors", + "model.layers.29.mlp.down_proj.scales": "model.safetensors", + "model.layers.29.mlp.down_proj.weight": "model.safetensors", + "model.layers.29.mlp.gate_proj.biases": "model.safetensors", + "model.layers.29.mlp.gate_proj.scales": "model.safetensors", + "model.layers.29.mlp.gate_proj.weight": "model.safetensors", + "model.layers.29.mlp.up_proj.biases": "model.safetensors", + "model.layers.29.mlp.up_proj.scales": "model.safetensors", + "model.layers.29.mlp.up_proj.weight": "model.safetensors", + "model.layers.29.post_attention_layernorm.weight": "model.safetensors", + "model.layers.29.self_attn.k_norm.weight": "model.safetensors", + "model.layers.29.self_attn.k_proj.biases": "model.safetensors", + "model.layers.29.self_attn.k_proj.scales": "model.safetensors", + "model.layers.29.self_attn.k_proj.weight": "model.safetensors", + "model.layers.29.self_attn.o_proj.biases": "model.safetensors", + "model.layers.29.self_attn.o_proj.scales": "model.safetensors", + "model.layers.29.self_attn.o_proj.weight": "model.safetensors", + "model.layers.29.self_attn.q_norm.weight": "model.safetensors", + "model.layers.29.self_attn.q_proj.biases": "model.safetensors", + "model.layers.29.self_attn.q_proj.scales": "model.safetensors", + "model.layers.29.self_attn.q_proj.weight": "model.safetensors", + "model.layers.29.self_attn.v_proj.biases": "model.safetensors", + "model.layers.29.self_attn.v_proj.scales": "model.safetensors", + "model.layers.29.self_attn.v_proj.weight": "model.safetensors", + "model.layers.3.input_layernorm.weight": "model.safetensors", + "model.layers.3.mlp.down_proj.biases": "model.safetensors", + "model.layers.3.mlp.down_proj.scales": "model.safetensors", + "model.layers.3.mlp.down_proj.weight": "model.safetensors", + "model.layers.3.mlp.gate_proj.biases": "model.safetensors", + "model.layers.3.mlp.gate_proj.scales": "model.safetensors", + "model.layers.3.mlp.gate_proj.weight": "model.safetensors", + "model.layers.3.mlp.up_proj.biases": "model.safetensors", + "model.layers.3.mlp.up_proj.scales": "model.safetensors", + "model.layers.3.mlp.up_proj.weight": "model.safetensors", + "model.layers.3.post_attention_layernorm.weight": "model.safetensors", + "model.layers.3.self_attn.k_norm.weight": "model.safetensors", + "model.layers.3.self_attn.k_proj.biases": "model.safetensors", + "model.layers.3.self_attn.k_proj.scales": "model.safetensors", + "model.layers.3.self_attn.k_proj.weight": "model.safetensors", + "model.layers.3.self_attn.o_proj.biases": "model.safetensors", + "model.layers.3.self_attn.o_proj.scales": "model.safetensors", + "model.layers.3.self_attn.o_proj.weight": "model.safetensors", + "model.layers.3.self_attn.q_norm.weight": "model.safetensors", + "model.layers.3.self_attn.q_proj.biases": "model.safetensors", + "model.layers.3.self_attn.q_proj.scales": "model.safetensors", + "model.layers.3.self_attn.q_proj.weight": "model.safetensors", + "model.layers.3.self_attn.v_proj.biases": "model.safetensors", + "model.layers.3.self_attn.v_proj.scales": "model.safetensors", + "model.layers.3.self_attn.v_proj.weight": "model.safetensors", + "model.layers.30.input_layernorm.weight": "model.safetensors", + "model.layers.30.mlp.down_proj.biases": "model.safetensors", + "model.layers.30.mlp.down_proj.scales": "model.safetensors", + "model.layers.30.mlp.down_proj.weight": "model.safetensors", + "model.layers.30.mlp.gate_proj.biases": "model.safetensors", + "model.layers.30.mlp.gate_proj.scales": "model.safetensors", + "model.layers.30.mlp.gate_proj.weight": "model.safetensors", + "model.layers.30.mlp.up_proj.biases": "model.safetensors", + "model.layers.30.mlp.up_proj.scales": "model.safetensors", + "model.layers.30.mlp.up_proj.weight": "model.safetensors", + "model.layers.30.post_attention_layernorm.weight": "model.safetensors", + "model.layers.30.self_attn.k_norm.weight": "model.safetensors", + "model.layers.30.self_attn.k_proj.biases": "model.safetensors", + "model.layers.30.self_attn.k_proj.scales": "model.safetensors", + "model.layers.30.self_attn.k_proj.weight": "model.safetensors", + "model.layers.30.self_attn.o_proj.biases": "model.safetensors", + "model.layers.30.self_attn.o_proj.scales": "model.safetensors", + "model.layers.30.self_attn.o_proj.weight": "model.safetensors", + "model.layers.30.self_attn.q_norm.weight": "model.safetensors", + "model.layers.30.self_attn.q_proj.biases": "model.safetensors", + "model.layers.30.self_attn.q_proj.scales": "model.safetensors", + "model.layers.30.self_attn.q_proj.weight": "model.safetensors", + "model.layers.30.self_attn.v_proj.biases": "model.safetensors", + "model.layers.30.self_attn.v_proj.scales": "model.safetensors", + "model.layers.30.self_attn.v_proj.weight": "model.safetensors", + "model.layers.31.input_layernorm.weight": "model.safetensors", + "model.layers.31.mlp.down_proj.biases": "model.safetensors", + "model.layers.31.mlp.down_proj.scales": "model.safetensors", + "model.layers.31.mlp.down_proj.weight": "model.safetensors", + "model.layers.31.mlp.gate_proj.biases": "model.safetensors", + "model.layers.31.mlp.gate_proj.scales": "model.safetensors", + "model.layers.31.mlp.gate_proj.weight": "model.safetensors", + "model.layers.31.mlp.up_proj.biases": "model.safetensors", + "model.layers.31.mlp.up_proj.scales": "model.safetensors", + "model.layers.31.mlp.up_proj.weight": "model.safetensors", + "model.layers.31.post_attention_layernorm.weight": "model.safetensors", + "model.layers.31.self_attn.k_norm.weight": "model.safetensors", + "model.layers.31.self_attn.k_proj.biases": "model.safetensors", + "model.layers.31.self_attn.k_proj.scales": "model.safetensors", + "model.layers.31.self_attn.k_proj.weight": "model.safetensors", + "model.layers.31.self_attn.o_proj.biases": "model.safetensors", + "model.layers.31.self_attn.o_proj.scales": "model.safetensors", + "model.layers.31.self_attn.o_proj.weight": "model.safetensors", + "model.layers.31.self_attn.q_norm.weight": "model.safetensors", + "model.layers.31.self_attn.q_proj.biases": "model.safetensors", + "model.layers.31.self_attn.q_proj.scales": "model.safetensors", + "model.layers.31.self_attn.q_proj.weight": "model.safetensors", + "model.layers.31.self_attn.v_proj.biases": "model.safetensors", + "model.layers.31.self_attn.v_proj.scales": "model.safetensors", + "model.layers.31.self_attn.v_proj.weight": "model.safetensors", + "model.layers.32.input_layernorm.weight": "model.safetensors", + "model.layers.32.mlp.down_proj.biases": "model.safetensors", + "model.layers.32.mlp.down_proj.scales": "model.safetensors", + "model.layers.32.mlp.down_proj.weight": "model.safetensors", + "model.layers.32.mlp.gate_proj.biases": "model.safetensors", + "model.layers.32.mlp.gate_proj.scales": "model.safetensors", + "model.layers.32.mlp.gate_proj.weight": "model.safetensors", + "model.layers.32.mlp.up_proj.biases": "model.safetensors", + "model.layers.32.mlp.up_proj.scales": "model.safetensors", + "model.layers.32.mlp.up_proj.weight": "model.safetensors", + "model.layers.32.post_attention_layernorm.weight": "model.safetensors", + "model.layers.32.self_attn.k_norm.weight": "model.safetensors", + "model.layers.32.self_attn.k_proj.biases": "model.safetensors", + "model.layers.32.self_attn.k_proj.scales": "model.safetensors", + "model.layers.32.self_attn.k_proj.weight": "model.safetensors", + "model.layers.32.self_attn.o_proj.biases": "model.safetensors", + "model.layers.32.self_attn.o_proj.scales": "model.safetensors", + "model.layers.32.self_attn.o_proj.weight": "model.safetensors", + "model.layers.32.self_attn.q_norm.weight": "model.safetensors", + "model.layers.32.self_attn.q_proj.biases": "model.safetensors", + "model.layers.32.self_attn.q_proj.scales": "model.safetensors", + "model.layers.32.self_attn.q_proj.weight": "model.safetensors", + "model.layers.32.self_attn.v_proj.biases": "model.safetensors", + "model.layers.32.self_attn.v_proj.scales": "model.safetensors", + "model.layers.32.self_attn.v_proj.weight": "model.safetensors", + "model.layers.33.input_layernorm.weight": "model.safetensors", + "model.layers.33.mlp.down_proj.biases": "model.safetensors", + "model.layers.33.mlp.down_proj.scales": "model.safetensors", + "model.layers.33.mlp.down_proj.weight": "model.safetensors", + "model.layers.33.mlp.gate_proj.biases": "model.safetensors", + "model.layers.33.mlp.gate_proj.scales": "model.safetensors", + "model.layers.33.mlp.gate_proj.weight": "model.safetensors", + "model.layers.33.mlp.up_proj.biases": "model.safetensors", + "model.layers.33.mlp.up_proj.scales": "model.safetensors", + "model.layers.33.mlp.up_proj.weight": "model.safetensors", + "model.layers.33.post_attention_layernorm.weight": "model.safetensors", + "model.layers.33.self_attn.k_norm.weight": "model.safetensors", + "model.layers.33.self_attn.k_proj.biases": "model.safetensors", + "model.layers.33.self_attn.k_proj.scales": "model.safetensors", + "model.layers.33.self_attn.k_proj.weight": "model.safetensors", + "model.layers.33.self_attn.o_proj.biases": "model.safetensors", + "model.layers.33.self_attn.o_proj.scales": "model.safetensors", + "model.layers.33.self_attn.o_proj.weight": "model.safetensors", + "model.layers.33.self_attn.q_norm.weight": "model.safetensors", + "model.layers.33.self_attn.q_proj.biases": "model.safetensors", + "model.layers.33.self_attn.q_proj.scales": "model.safetensors", + "model.layers.33.self_attn.q_proj.weight": "model.safetensors", + "model.layers.33.self_attn.v_proj.biases": "model.safetensors", + "model.layers.33.self_attn.v_proj.scales": "model.safetensors", + "model.layers.33.self_attn.v_proj.weight": "model.safetensors", + "model.layers.34.input_layernorm.weight": "model.safetensors", + "model.layers.34.mlp.down_proj.biases": "model.safetensors", + "model.layers.34.mlp.down_proj.scales": "model.safetensors", + "model.layers.34.mlp.down_proj.weight": "model.safetensors", + "model.layers.34.mlp.gate_proj.biases": "model.safetensors", + "model.layers.34.mlp.gate_proj.scales": "model.safetensors", + "model.layers.34.mlp.gate_proj.weight": "model.safetensors", + "model.layers.34.mlp.up_proj.biases": "model.safetensors", + "model.layers.34.mlp.up_proj.scales": "model.safetensors", + "model.layers.34.mlp.up_proj.weight": "model.safetensors", + "model.layers.34.post_attention_layernorm.weight": "model.safetensors", + "model.layers.34.self_attn.k_norm.weight": "model.safetensors", + "model.layers.34.self_attn.k_proj.biases": "model.safetensors", + "model.layers.34.self_attn.k_proj.scales": "model.safetensors", + "model.layers.34.self_attn.k_proj.weight": "model.safetensors", + "model.layers.34.self_attn.o_proj.biases": "model.safetensors", + "model.layers.34.self_attn.o_proj.scales": "model.safetensors", + "model.layers.34.self_attn.o_proj.weight": "model.safetensors", + "model.layers.34.self_attn.q_norm.weight": "model.safetensors", + "model.layers.34.self_attn.q_proj.biases": "model.safetensors", + "model.layers.34.self_attn.q_proj.scales": "model.safetensors", + "model.layers.34.self_attn.q_proj.weight": "model.safetensors", + "model.layers.34.self_attn.v_proj.biases": "model.safetensors", + "model.layers.34.self_attn.v_proj.scales": "model.safetensors", + "model.layers.34.self_attn.v_proj.weight": "model.safetensors", + "model.layers.35.input_layernorm.weight": "model.safetensors", + "model.layers.35.mlp.down_proj.biases": "model.safetensors", + "model.layers.35.mlp.down_proj.scales": "model.safetensors", + "model.layers.35.mlp.down_proj.weight": "model.safetensors", + "model.layers.35.mlp.gate_proj.biases": "model.safetensors", + "model.layers.35.mlp.gate_proj.scales": "model.safetensors", + "model.layers.35.mlp.gate_proj.weight": "model.safetensors", + "model.layers.35.mlp.up_proj.biases": "model.safetensors", + "model.layers.35.mlp.up_proj.scales": "model.safetensors", + "model.layers.35.mlp.up_proj.weight": "model.safetensors", + "model.layers.35.post_attention_layernorm.weight": "model.safetensors", + "model.layers.35.self_attn.k_norm.weight": "model.safetensors", + "model.layers.35.self_attn.k_proj.biases": "model.safetensors", + "model.layers.35.self_attn.k_proj.scales": "model.safetensors", + "model.layers.35.self_attn.k_proj.weight": "model.safetensors", + "model.layers.35.self_attn.o_proj.biases": "model.safetensors", + "model.layers.35.self_attn.o_proj.scales": "model.safetensors", + "model.layers.35.self_attn.o_proj.weight": "model.safetensors", + "model.layers.35.self_attn.q_norm.weight": "model.safetensors", + "model.layers.35.self_attn.q_proj.biases": "model.safetensors", + "model.layers.35.self_attn.q_proj.scales": "model.safetensors", + "model.layers.35.self_attn.q_proj.weight": "model.safetensors", + "model.layers.35.self_attn.v_proj.biases": "model.safetensors", + "model.layers.35.self_attn.v_proj.scales": "model.safetensors", + "model.layers.35.self_attn.v_proj.weight": "model.safetensors", + "model.layers.4.input_layernorm.weight": "model.safetensors", + "model.layers.4.mlp.down_proj.biases": "model.safetensors", + "model.layers.4.mlp.down_proj.scales": "model.safetensors", + "model.layers.4.mlp.down_proj.weight": "model.safetensors", + "model.layers.4.mlp.gate_proj.biases": "model.safetensors", + "model.layers.4.mlp.gate_proj.scales": "model.safetensors", + "model.layers.4.mlp.gate_proj.weight": "model.safetensors", + "model.layers.4.mlp.up_proj.biases": "model.safetensors", + "model.layers.4.mlp.up_proj.scales": "model.safetensors", + "model.layers.4.mlp.up_proj.weight": "model.safetensors", + "model.layers.4.post_attention_layernorm.weight": "model.safetensors", + "model.layers.4.self_attn.k_norm.weight": "model.safetensors", + "model.layers.4.self_attn.k_proj.biases": "model.safetensors", + "model.layers.4.self_attn.k_proj.scales": "model.safetensors", + "model.layers.4.self_attn.k_proj.weight": "model.safetensors", + "model.layers.4.self_attn.o_proj.biases": "model.safetensors", + "model.layers.4.self_attn.o_proj.scales": "model.safetensors", + "model.layers.4.self_attn.o_proj.weight": "model.safetensors", + "model.layers.4.self_attn.q_norm.weight": "model.safetensors", + "model.layers.4.self_attn.q_proj.biases": "model.safetensors", + "model.layers.4.self_attn.q_proj.scales": "model.safetensors", + "model.layers.4.self_attn.q_proj.weight": "model.safetensors", + "model.layers.4.self_attn.v_proj.biases": "model.safetensors", + "model.layers.4.self_attn.v_proj.scales": "model.safetensors", + "model.layers.4.self_attn.v_proj.weight": "model.safetensors", + "model.layers.5.input_layernorm.weight": "model.safetensors", + "model.layers.5.mlp.down_proj.biases": "model.safetensors", + "model.layers.5.mlp.down_proj.scales": "model.safetensors", + "model.layers.5.mlp.down_proj.weight": "model.safetensors", + "model.layers.5.mlp.gate_proj.biases": "model.safetensors", + "model.layers.5.mlp.gate_proj.scales": "model.safetensors", + "model.layers.5.mlp.gate_proj.weight": "model.safetensors", + "model.layers.5.mlp.up_proj.biases": "model.safetensors", + "model.layers.5.mlp.up_proj.scales": "model.safetensors", + "model.layers.5.mlp.up_proj.weight": "model.safetensors", + "model.layers.5.post_attention_layernorm.weight": "model.safetensors", + "model.layers.5.self_attn.k_norm.weight": "model.safetensors", + "model.layers.5.self_attn.k_proj.biases": "model.safetensors", + "model.layers.5.self_attn.k_proj.scales": "model.safetensors", + "model.layers.5.self_attn.k_proj.weight": "model.safetensors", + "model.layers.5.self_attn.o_proj.biases": "model.safetensors", + "model.layers.5.self_attn.o_proj.scales": "model.safetensors", + "model.layers.5.self_attn.o_proj.weight": "model.safetensors", + "model.layers.5.self_attn.q_norm.weight": "model.safetensors", + "model.layers.5.self_attn.q_proj.biases": "model.safetensors", + "model.layers.5.self_attn.q_proj.scales": "model.safetensors", + "model.layers.5.self_attn.q_proj.weight": "model.safetensors", + "model.layers.5.self_attn.v_proj.biases": "model.safetensors", + "model.layers.5.self_attn.v_proj.scales": "model.safetensors", + "model.layers.5.self_attn.v_proj.weight": "model.safetensors", + "model.layers.6.input_layernorm.weight": "model.safetensors", + "model.layers.6.mlp.down_proj.biases": "model.safetensors", + "model.layers.6.mlp.down_proj.scales": "model.safetensors", + "model.layers.6.mlp.down_proj.weight": "model.safetensors", + "model.layers.6.mlp.gate_proj.biases": "model.safetensors", + "model.layers.6.mlp.gate_proj.scales": "model.safetensors", + "model.layers.6.mlp.gate_proj.weight": "model.safetensors", + "model.layers.6.mlp.up_proj.biases": "model.safetensors", + "model.layers.6.mlp.up_proj.scales": "model.safetensors", + "model.layers.6.mlp.up_proj.weight": "model.safetensors", + "model.layers.6.post_attention_layernorm.weight": "model.safetensors", + "model.layers.6.self_attn.k_norm.weight": "model.safetensors", + "model.layers.6.self_attn.k_proj.biases": "model.safetensors", + "model.layers.6.self_attn.k_proj.scales": "model.safetensors", + "model.layers.6.self_attn.k_proj.weight": "model.safetensors", + "model.layers.6.self_attn.o_proj.biases": "model.safetensors", + "model.layers.6.self_attn.o_proj.scales": "model.safetensors", + "model.layers.6.self_attn.o_proj.weight": "model.safetensors", + "model.layers.6.self_attn.q_norm.weight": "model.safetensors", + "model.layers.6.self_attn.q_proj.biases": "model.safetensors", + "model.layers.6.self_attn.q_proj.scales": "model.safetensors", + "model.layers.6.self_attn.q_proj.weight": "model.safetensors", + "model.layers.6.self_attn.v_proj.biases": "model.safetensors", + "model.layers.6.self_attn.v_proj.scales": "model.safetensors", + "model.layers.6.self_attn.v_proj.weight": "model.safetensors", + "model.layers.7.input_layernorm.weight": "model.safetensors", + "model.layers.7.mlp.down_proj.biases": "model.safetensors", + "model.layers.7.mlp.down_proj.scales": "model.safetensors", + "model.layers.7.mlp.down_proj.weight": "model.safetensors", + "model.layers.7.mlp.gate_proj.biases": "model.safetensors", + "model.layers.7.mlp.gate_proj.scales": "model.safetensors", + "model.layers.7.mlp.gate_proj.weight": "model.safetensors", + "model.layers.7.mlp.up_proj.biases": "model.safetensors", + "model.layers.7.mlp.up_proj.scales": "model.safetensors", + "model.layers.7.mlp.up_proj.weight": "model.safetensors", + "model.layers.7.post_attention_layernorm.weight": "model.safetensors", + "model.layers.7.self_attn.k_norm.weight": "model.safetensors", + "model.layers.7.self_attn.k_proj.biases": "model.safetensors", + "model.layers.7.self_attn.k_proj.scales": "model.safetensors", + "model.layers.7.self_attn.k_proj.weight": "model.safetensors", + "model.layers.7.self_attn.o_proj.biases": "model.safetensors", + "model.layers.7.self_attn.o_proj.scales": "model.safetensors", + "model.layers.7.self_attn.o_proj.weight": "model.safetensors", + "model.layers.7.self_attn.q_norm.weight": "model.safetensors", + "model.layers.7.self_attn.q_proj.biases": "model.safetensors", + "model.layers.7.self_attn.q_proj.scales": "model.safetensors", + "model.layers.7.self_attn.q_proj.weight": "model.safetensors", + "model.layers.7.self_attn.v_proj.biases": "model.safetensors", + "model.layers.7.self_attn.v_proj.scales": "model.safetensors", + "model.layers.7.self_attn.v_proj.weight": "model.safetensors", + "model.layers.8.input_layernorm.weight": "model.safetensors", + "model.layers.8.mlp.down_proj.biases": "model.safetensors", + "model.layers.8.mlp.down_proj.scales": "model.safetensors", + "model.layers.8.mlp.down_proj.weight": "model.safetensors", + "model.layers.8.mlp.gate_proj.biases": "model.safetensors", + "model.layers.8.mlp.gate_proj.scales": "model.safetensors", + "model.layers.8.mlp.gate_proj.weight": "model.safetensors", + "model.layers.8.mlp.up_proj.biases": "model.safetensors", + "model.layers.8.mlp.up_proj.scales": "model.safetensors", + "model.layers.8.mlp.up_proj.weight": "model.safetensors", + "model.layers.8.post_attention_layernorm.weight": "model.safetensors", + "model.layers.8.self_attn.k_norm.weight": "model.safetensors", + "model.layers.8.self_attn.k_proj.biases": "model.safetensors", + "model.layers.8.self_attn.k_proj.scales": "model.safetensors", + "model.layers.8.self_attn.k_proj.weight": "model.safetensors", + "model.layers.8.self_attn.o_proj.biases": "model.safetensors", + "model.layers.8.self_attn.o_proj.scales": "model.safetensors", + "model.layers.8.self_attn.o_proj.weight": "model.safetensors", + "model.layers.8.self_attn.q_norm.weight": "model.safetensors", + "model.layers.8.self_attn.q_proj.biases": "model.safetensors", + "model.layers.8.self_attn.q_proj.scales": "model.safetensors", + "model.layers.8.self_attn.q_proj.weight": "model.safetensors", + "model.layers.8.self_attn.v_proj.biases": "model.safetensors", + "model.layers.8.self_attn.v_proj.scales": "model.safetensors", + "model.layers.8.self_attn.v_proj.weight": "model.safetensors", + "model.layers.9.input_layernorm.weight": "model.safetensors", + "model.layers.9.mlp.down_proj.biases": "model.safetensors", + "model.layers.9.mlp.down_proj.scales": "model.safetensors", + "model.layers.9.mlp.down_proj.weight": "model.safetensors", + "model.layers.9.mlp.gate_proj.biases": "model.safetensors", + "model.layers.9.mlp.gate_proj.scales": "model.safetensors", + "model.layers.9.mlp.gate_proj.weight": "model.safetensors", + "model.layers.9.mlp.up_proj.biases": "model.safetensors", + "model.layers.9.mlp.up_proj.scales": "model.safetensors", + "model.layers.9.mlp.up_proj.weight": "model.safetensors", + "model.layers.9.post_attention_layernorm.weight": "model.safetensors", + "model.layers.9.self_attn.k_norm.weight": "model.safetensors", + "model.layers.9.self_attn.k_proj.biases": "model.safetensors", + "model.layers.9.self_attn.k_proj.scales": "model.safetensors", + "model.layers.9.self_attn.k_proj.weight": "model.safetensors", + "model.layers.9.self_attn.o_proj.biases": "model.safetensors", + "model.layers.9.self_attn.o_proj.scales": "model.safetensors", + "model.layers.9.self_attn.o_proj.weight": "model.safetensors", + "model.layers.9.self_attn.q_norm.weight": "model.safetensors", + "model.layers.9.self_attn.q_proj.biases": "model.safetensors", + "model.layers.9.self_attn.q_proj.scales": "model.safetensors", + "model.layers.9.self_attn.q_proj.weight": "model.safetensors", + "model.layers.9.self_attn.v_proj.biases": "model.safetensors", + "model.layers.9.self_attn.v_proj.scales": "model.safetensors", + "model.layers.9.self_attn.v_proj.weight": "model.safetensors", + "model.norm.weight": "model.safetensors" + } +} \ No newline at end of file diff --git a/image/mlx/prism-ml/bonsai-image-binary-4B-mlx-1bit/text_encoder-mlx-4bit/special_tokens_map.json b/image/mlx/prism-ml/bonsai-image-binary-4B-mlx-1bit/text_encoder-mlx-4bit/special_tokens_map.json new file mode 100644 index 0000000..ac23c0a --- /dev/null +++ b/image/mlx/prism-ml/bonsai-image-binary-4B-mlx-1bit/text_encoder-mlx-4bit/special_tokens_map.json @@ -0,0 +1,31 @@ +{ + "additional_special_tokens": [ + "<|im_start|>", + "<|im_end|>", + "<|object_ref_start|>", + "<|object_ref_end|>", + "<|box_start|>", + "<|box_end|>", + "<|quad_start|>", + "<|quad_end|>", + "<|vision_start|>", + "<|vision_end|>", + "<|vision_pad|>", + "<|image_pad|>", + "<|video_pad|>" + ], + "eos_token": { + "content": "<|im_end|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false + }, + "pad_token": { + "content": "<|endoftext|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false + } +} diff --git a/image/mlx/prism-ml/bonsai-image-binary-4B-mlx-1bit/text_encoder-mlx-4bit/tokenizer.json b/image/mlx/prism-ml/bonsai-image-binary-4B-mlx-1bit/text_encoder-mlx-4bit/tokenizer.json new file mode 100644 index 0000000..cd71f61 --- /dev/null +++ b/image/mlx/prism-ml/bonsai-image-binary-4B-mlx-1bit/text_encoder-mlx-4bit/tokenizer.json @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:aeb13307a71acd8fe81861d94ad54ab689df773318809eed3cbe794b4492dae4 +size 11422654 diff --git a/image/mlx/prism-ml/bonsai-image-binary-4B-mlx-1bit/text_encoder-mlx-4bit/tokenizer_config.json b/image/mlx/prism-ml/bonsai-image-binary-4B-mlx-1bit/text_encoder-mlx-4bit/tokenizer_config.json new file mode 100644 index 0000000..7345216 --- /dev/null +++ b/image/mlx/prism-ml/bonsai-image-binary-4B-mlx-1bit/text_encoder-mlx-4bit/tokenizer_config.json @@ -0,0 +1,240 @@ +{ + "add_bos_token": false, + "add_prefix_space": false, + "added_tokens_decoder": { + "151643": { + "content": "<|endoftext|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "151644": { + "content": "<|im_start|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "151645": { + "content": "<|im_end|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "151646": { + "content": "<|object_ref_start|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "151647": { + "content": "<|object_ref_end|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "151648": { + "content": "<|box_start|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "151649": { + "content": "<|box_end|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "151650": { + "content": "<|quad_start|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "151651": { + "content": "<|quad_end|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "151652": { + "content": "<|vision_start|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "151653": { + "content": "<|vision_end|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "151654": { + "content": "<|vision_pad|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "151655": { + "content": "<|image_pad|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "151656": { + "content": "<|video_pad|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "151657": { + "content": "", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": false + }, + "151658": { + "content": "", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": false + }, + "151659": { + "content": "<|fim_prefix|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": false + }, + "151660": { + "content": "<|fim_middle|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": false + }, + "151661": { + "content": "<|fim_suffix|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": false + }, + "151662": { + "content": "<|fim_pad|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": false + }, + "151663": { + "content": "<|repo_name|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": false + }, + "151664": { + "content": "<|file_sep|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": false + }, + "151665": { + "content": "", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": false + }, + "151666": { + "content": "", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": false + }, + "151667": { + "content": "", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": false + }, + "151668": { + "content": "", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": false + } + }, + "additional_special_tokens": [ + "<|im_start|>", + "<|im_end|>", + "<|object_ref_start|>", + "<|object_ref_end|>", + "<|box_start|>", + "<|box_end|>", + "<|quad_start|>", + "<|quad_end|>", + "<|vision_start|>", + "<|vision_end|>", + "<|vision_pad|>", + "<|image_pad|>", + "<|video_pad|>" + ], + "bos_token": null, + "chat_template": "{%- if tools %}\n {{- '<|im_start|>system\\n' }}\n {%- if messages[0].role == 'system' %}\n {{- messages[0].content + '\\n\\n' }}\n {%- endif %}\n {{- \"# Tools\\n\\nYou may call one or more functions to assist with the user query.\\n\\nYou are provided with function signatures within XML tags:\\n\" }}\n {%- for tool in tools %}\n {{- \"\\n\" }}\n {{- tool | tojson }}\n {%- endfor %}\n {{- \"\\n\\n\\nFor each function call, return a json object with function name and arguments within XML tags:\\n\\n{\\\"name\\\": , \\\"arguments\\\": }\\n<|im_end|>\\n\" }}\n{%- else %}\n {%- if messages[0].role == 'system' %}\n {{- '<|im_start|>system\\n' + messages[0].content + '<|im_end|>\\n' }}\n {%- endif %}\n{%- endif %}\n{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %}\n{%- for message in messages[::-1] %}\n {%- set index = (messages|length - 1) - loop.index0 %}\n {%- if ns.multi_step_tool and message.role == \"user\" and not(message.content.startswith('') and message.content.endswith('')) %}\n {%- set ns.multi_step_tool = false %}\n {%- set ns.last_query_index = index %}\n {%- endif %}\n{%- endfor %}\n{%- for message in messages %}\n {%- if (message.role == \"user\") or (message.role == \"system\" and not loop.first) %}\n {{- '<|im_start|>' + message.role + '\\n' + message.content + '<|im_end|>' + '\\n' }}\n {%- elif message.role == \"assistant\" %}\n {%- set content = message.content %}\n {%- set reasoning_content = '' %}\n {%- if message.reasoning_content is defined and message.reasoning_content is not none %}\n {%- set reasoning_content = message.reasoning_content %}\n {%- else %}\n {%- if '' in message.content %}\n {%- set content = message.content.split('')[-1].lstrip('\\n') %}\n {%- set reasoning_content = message.content.split('')[0].rstrip('\\n').split('')[-1].lstrip('\\n') %}\n {%- endif %}\n {%- endif %}\n {%- if loop.index0 > ns.last_query_index %}\n {%- if loop.last or (not loop.last and reasoning_content) %}\n {{- '<|im_start|>' + message.role + '\\n\\n' + reasoning_content.strip('\\n') + '\\n\\n\\n' + content.lstrip('\\n') }}\n {%- else %}\n {{- '<|im_start|>' + message.role + '\\n' + content }}\n {%- endif %}\n {%- else %}\n {{- '<|im_start|>' + message.role + '\\n' + content }}\n {%- endif %}\n {%- if message.tool_calls %}\n {%- for tool_call in message.tool_calls %}\n {%- if (loop.first and content) or (not loop.first) %}\n {{- '\\n' }}\n {%- endif %}\n {%- if tool_call.function %}\n {%- set tool_call = tool_call.function %}\n {%- endif %}\n {{- '\\n{\"name\": \"' }}\n {{- tool_call.name }}\n {{- '\", \"arguments\": ' }}\n {%- if tool_call.arguments is string %}\n {{- tool_call.arguments }}\n {%- else %}\n {{- tool_call.arguments | tojson }}\n {%- endif %}\n {{- '}\\n' }}\n {%- endfor %}\n {%- endif %}\n {{- '<|im_end|>\\n' }}\n {%- elif message.role == \"tool\" %}\n {%- if loop.first or (messages[loop.index0 - 1].role != \"tool\") %}\n {{- '<|im_start|>user' }}\n {%- endif %}\n {{- '\\n\\n' }}\n {{- message.content }}\n {{- '\\n' }}\n {%- if loop.last or (messages[loop.index0 + 1].role != \"tool\") %}\n {{- '<|im_end|>\\n' }}\n {%- endif %}\n {%- endif %}\n{%- endfor %}\n{%- if add_generation_prompt %}\n {{- '<|im_start|>assistant\\n' }}\n {%- if enable_thinking is defined and enable_thinking is false %}\n {{- '\\n\\n\\n\\n' }}\n {%- endif %}\n{%- endif %}", + "clean_up_tokenization_spaces": false, + "eos_token": "<|im_end|>", + "errors": "replace", + "extra_special_tokens": {}, + "model_max_length": 131072, + "pad_token": "<|endoftext|>", + "split_special_tokens": false, + "tokenizer_class": "Qwen2Tokenizer", + "unk_token": null +} diff --git a/image/mlx/prism-ml/bonsai-image-binary-4B-mlx-1bit/text_encoder-mlx-4bit/vocab.json b/image/mlx/prism-ml/bonsai-image-binary-4B-mlx-1bit/text_encoder-mlx-4bit/vocab.json new file mode 100644 index 0000000..6c49fc6 --- /dev/null +++ b/image/mlx/prism-ml/bonsai-image-binary-4B-mlx-1bit/text_encoder-mlx-4bit/vocab.json @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:ca10d7e9fb3ed18575dd1e277a2579c16d108e32f27439684afa0e10b1440910 +size 2776833 diff --git a/image/mlx/prism-ml/bonsai-image-binary-4B-mlx-1bit/tokenizer/added_tokens.json b/image/mlx/prism-ml/bonsai-image-binary-4B-mlx-1bit/tokenizer/added_tokens.json new file mode 100644 index 0000000..b54f913 --- /dev/null +++ b/image/mlx/prism-ml/bonsai-image-binary-4B-mlx-1bit/tokenizer/added_tokens.json @@ -0,0 +1,28 @@ +{ + "": 151668, + "
": 151658, + "": 151666, + "": 151667, + "": 151657, + "": 151665, + "<|box_end|>": 151649, + "<|box_start|>": 151648, + "<|endoftext|>": 151643, + "<|file_sep|>": 151664, + "<|fim_middle|>": 151660, + "<|fim_pad|>": 151662, + "<|fim_prefix|>": 151659, + "<|fim_suffix|>": 151661, + "<|im_end|>": 151645, + "<|im_start|>": 151644, + "<|image_pad|>": 151655, + "<|object_ref_end|>": 151647, + "<|object_ref_start|>": 151646, + "<|quad_end|>": 151651, + "<|quad_start|>": 151650, + "<|repo_name|>": 151663, + "<|video_pad|>": 151656, + "<|vision_end|>": 151653, + "<|vision_pad|>": 151654, + "<|vision_start|>": 151652 +} diff --git a/image/mlx/prism-ml/bonsai-image-binary-4B-mlx-1bit/tokenizer/chat_template.jinja b/image/mlx/prism-ml/bonsai-image-binary-4B-mlx-1bit/tokenizer/chat_template.jinja new file mode 100644 index 0000000..01be9b3 --- /dev/null +++ b/image/mlx/prism-ml/bonsai-image-binary-4B-mlx-1bit/tokenizer/chat_template.jinja @@ -0,0 +1,89 @@ +{%- if tools %} + {{- '<|im_start|>system\n' }} + {%- if messages[0].role == 'system' %} + {{- messages[0].content + '\n\n' }} + {%- endif %} + {{- "# Tools\n\nYou may call one or more functions to assist with the user query.\n\nYou are provided with function signatures within XML tags:\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n\n\nFor each function call, return a json object with function name and arguments within XML tags:\n\n{\"name\": , \"arguments\": }\n<|im_end|>\n" }} +{%- else %} + {%- if messages[0].role == 'system' %} + {{- '<|im_start|>system\n' + messages[0].content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" and message.content is string and not(message.content.startswith('') and message.content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} +{%- endfor %} +{%- for message in messages %} + {%- if message.content is string %} + {%- set content = message.content %} + {%- else %} + {%- set content = '' %} + {%- endif %} + {%- if (message.role == "user") or (message.role == "system" and not loop.first) %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- if loop.index0 > ns.last_query_index %} + {%- if loop.last or (not loop.last and reasoning_content) %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content.strip('\n') + '\n\n\n' + content.lstrip('\n') }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls %} + {%- for tool_call in message.tool_calls %} + {%- if (loop.first and content) or (not loop.first) %} + {{- '\n' }} + {%- endif %} + {%- if tool_call.function %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {{- '\n{"name": "' }} + {{- tool_call.name }} + {{- '", "arguments": ' }} + {%- if tool_call.arguments is string %} + {{- tool_call.arguments }} + {%- else %} + {{- tool_call.arguments | tojson }} + {%- endif %} + {{- '}\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.first or (messages[loop.index0 - 1].role != "tool") %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if loop.last or (messages[loop.index0 + 1].role != "tool") %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/image/mlx/prism-ml/bonsai-image-binary-4B-mlx-1bit/tokenizer/merges.txt b/image/mlx/prism-ml/bonsai-image-binary-4B-mlx-1bit/tokenizer/merges.txt new file mode 100644 index 0000000..80c1a19 --- /dev/null +++ b/image/mlx/prism-ml/bonsai-image-binary-4B-mlx-1bit/tokenizer/merges.txt @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:8831e4f1a044471340f7c0a83d7bd71306a5b867e95fd870f74d0c5308a904d5 +size 1671853 diff --git a/image/mlx/prism-ml/bonsai-image-binary-4B-mlx-1bit/tokenizer/special_tokens_map.json b/image/mlx/prism-ml/bonsai-image-binary-4B-mlx-1bit/tokenizer/special_tokens_map.json new file mode 100644 index 0000000..ac23c0a --- /dev/null +++ b/image/mlx/prism-ml/bonsai-image-binary-4B-mlx-1bit/tokenizer/special_tokens_map.json @@ -0,0 +1,31 @@ +{ + "additional_special_tokens": [ + "<|im_start|>", + "<|im_end|>", + "<|object_ref_start|>", + "<|object_ref_end|>", + "<|box_start|>", + "<|box_end|>", + "<|quad_start|>", + "<|quad_end|>", + "<|vision_start|>", + "<|vision_end|>", + "<|vision_pad|>", + "<|image_pad|>", + "<|video_pad|>" + ], + "eos_token": { + "content": "<|im_end|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false + }, + "pad_token": { + "content": "<|endoftext|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false + } +} diff --git a/image/mlx/prism-ml/bonsai-image-binary-4B-mlx-1bit/tokenizer/tokenizer.json b/image/mlx/prism-ml/bonsai-image-binary-4B-mlx-1bit/tokenizer/tokenizer.json new file mode 100644 index 0000000..cd71f61 --- /dev/null +++ b/image/mlx/prism-ml/bonsai-image-binary-4B-mlx-1bit/tokenizer/tokenizer.json @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:aeb13307a71acd8fe81861d94ad54ab689df773318809eed3cbe794b4492dae4 +size 11422654 diff --git a/image/mlx/prism-ml/bonsai-image-binary-4B-mlx-1bit/tokenizer/tokenizer_config.json b/image/mlx/prism-ml/bonsai-image-binary-4B-mlx-1bit/tokenizer/tokenizer_config.json new file mode 100644 index 0000000..ddaf698 --- /dev/null +++ b/image/mlx/prism-ml/bonsai-image-binary-4B-mlx-1bit/tokenizer/tokenizer_config.json @@ -0,0 +1,239 @@ +{ + "add_bos_token": false, + "add_prefix_space": false, + "added_tokens_decoder": { + "151643": { + "content": "<|endoftext|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "151644": { + "content": "<|im_start|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "151645": { + "content": "<|im_end|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "151646": { + "content": "<|object_ref_start|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "151647": { + "content": "<|object_ref_end|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "151648": { + "content": "<|box_start|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "151649": { + "content": "<|box_end|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "151650": { + "content": "<|quad_start|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "151651": { + "content": "<|quad_end|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "151652": { + "content": "<|vision_start|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "151653": { + "content": "<|vision_end|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "151654": { + "content": "<|vision_pad|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "151655": { + "content": "<|image_pad|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "151656": { + "content": "<|video_pad|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "151657": { + "content": "", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": false + }, + "151658": { + "content": "", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": false + }, + "151659": { + "content": "<|fim_prefix|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": false + }, + "151660": { + "content": "<|fim_middle|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": false + }, + "151661": { + "content": "<|fim_suffix|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": false + }, + "151662": { + "content": "<|fim_pad|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": false + }, + "151663": { + "content": "<|repo_name|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": false + }, + "151664": { + "content": "<|file_sep|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": false + }, + "151665": { + "content": "", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": false + }, + "151666": { + "content": "", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": false + }, + "151667": { + "content": "", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": false + }, + "151668": { + "content": "", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": false + } + }, + "additional_special_tokens": [ + "<|im_start|>", + "<|im_end|>", + "<|object_ref_start|>", + "<|object_ref_end|>", + "<|box_start|>", + "<|box_end|>", + "<|quad_start|>", + "<|quad_end|>", + "<|vision_start|>", + "<|vision_end|>", + "<|vision_pad|>", + "<|image_pad|>", + "<|video_pad|>" + ], + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|im_end|>", + "errors": "replace", + "extra_special_tokens": {}, + "model_max_length": 131072, + "pad_token": "<|endoftext|>", + "split_special_tokens": false, + "tokenizer_class": "Qwen2Tokenizer", + "unk_token": null +} diff --git a/image/mlx/prism-ml/bonsai-image-binary-4B-mlx-1bit/tokenizer/vocab.json b/image/mlx/prism-ml/bonsai-image-binary-4B-mlx-1bit/tokenizer/vocab.json new file mode 100644 index 0000000..6c49fc6 --- /dev/null +++ b/image/mlx/prism-ml/bonsai-image-binary-4B-mlx-1bit/tokenizer/vocab.json @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:ca10d7e9fb3ed18575dd1e277a2579c16d108e32f27439684afa0e10b1440910 +size 2776833 diff --git a/image/mlx/prism-ml/bonsai-image-binary-4B-mlx-1bit/transformer-packed-mflux/config.json b/image/mlx/prism-ml/bonsai-image-binary-4B-mlx-1bit/transformer-packed-mflux/config.json new file mode 100644 index 0000000..b8badc8 --- /dev/null +++ b/image/mlx/prism-ml/bonsai-image-binary-4B-mlx-1bit/transformer-packed-mflux/config.json @@ -0,0 +1,27 @@ +{ + "_class_name": "Flux2Transformer2DModel", + "_diffusers_version": "0.37.1", + "_name_or_path": "black-forest-labs/FLUX.2-klein-4B", + "attention_head_dim": 128, + "axes_dims_rope": [ + 32, + 32, + 32, + 32 + ], + "enable_time_sign_embed": false, + "eps": 1e-06, + "guidance_embeds": false, + "in_channels": 128, + "joint_attention_dim": 7680, + "mlp_ratio": 3.0, + "musubi_block_swap_device": "cpu", + "musubi_blocks_to_swap": 0, + "num_attention_heads": 24, + "num_layers": 5, + "num_single_layers": 20, + "out_channels": null, + "patch_size": 1, + "rope_theta": 2000, + "timestep_guidance_channels": 256 +} \ No newline at end of file diff --git a/image/mlx/prism-ml/bonsai-image-binary-4B-mlx-1bit/transformer-packed-mflux/diffusion_pytorch_model.safetensors b/image/mlx/prism-ml/bonsai-image-binary-4B-mlx-1bit/transformer-packed-mflux/diffusion_pytorch_model.safetensors new file mode 100644 index 0000000..0a63d50 --- /dev/null +++ b/image/mlx/prism-ml/bonsai-image-binary-4B-mlx-1bit/transformer-packed-mflux/diffusion_pytorch_model.safetensors @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:1792b31d857d95fcbe32df8e6d2fc96b30e800a195e295565d033deccea2dd75 +size 965208136 diff --git a/image/mlx/prism-ml/bonsai-image-binary-4B-mlx-1bit/transformer-packed-mflux/quantization_config.json b/image/mlx/prism-ml/bonsai-image-binary-4B-mlx-1bit/transformer-packed-mflux/quantization_config.json new file mode 100644 index 0000000..8ca5572 --- /dev/null +++ b/image/mlx/prism-ml/bonsai-image-binary-4B-mlx-1bit/transformer-packed-mflux/quantization_config.json @@ -0,0 +1,120 @@ +{ + "format": "prism-packed-affine", + "solver": "affine", + "bits": 1, + "group_size": 128, + "scale_dtype": "bfloat16", + "skip_patterns": [ + "proj_out", + "x_embedder", + "context_embedder", + "time_text_embed", + "time_guidance_embed", + "norm_out", + "double_stream_modulation_img", + "double_stream_modulation_txt", + "single_stream_modulation" + ], + "quantized_modules": [ + "single_transformer_blocks.0.attn.to_out", + "single_transformer_blocks.0.attn.to_qkv_mlp_proj", + "single_transformer_blocks.1.attn.to_out", + "single_transformer_blocks.1.attn.to_qkv_mlp_proj", + "single_transformer_blocks.10.attn.to_out", + "single_transformer_blocks.10.attn.to_qkv_mlp_proj", + "single_transformer_blocks.11.attn.to_out", + "single_transformer_blocks.11.attn.to_qkv_mlp_proj", + "single_transformer_blocks.12.attn.to_out", + "single_transformer_blocks.12.attn.to_qkv_mlp_proj", + "single_transformer_blocks.13.attn.to_out", + "single_transformer_blocks.13.attn.to_qkv_mlp_proj", + "single_transformer_blocks.14.attn.to_out", + "single_transformer_blocks.14.attn.to_qkv_mlp_proj", + "single_transformer_blocks.15.attn.to_out", + "single_transformer_blocks.15.attn.to_qkv_mlp_proj", + "single_transformer_blocks.16.attn.to_out", + "single_transformer_blocks.16.attn.to_qkv_mlp_proj", + "single_transformer_blocks.17.attn.to_out", + "single_transformer_blocks.17.attn.to_qkv_mlp_proj", + "single_transformer_blocks.18.attn.to_out", + "single_transformer_blocks.18.attn.to_qkv_mlp_proj", + "single_transformer_blocks.19.attn.to_out", + "single_transformer_blocks.19.attn.to_qkv_mlp_proj", + "single_transformer_blocks.2.attn.to_out", + "single_transformer_blocks.2.attn.to_qkv_mlp_proj", + "single_transformer_blocks.3.attn.to_out", + "single_transformer_blocks.3.attn.to_qkv_mlp_proj", + "single_transformer_blocks.4.attn.to_out", + "single_transformer_blocks.4.attn.to_qkv_mlp_proj", + "single_transformer_blocks.5.attn.to_out", + "single_transformer_blocks.5.attn.to_qkv_mlp_proj", + "single_transformer_blocks.6.attn.to_out", + "single_transformer_blocks.6.attn.to_qkv_mlp_proj", + "single_transformer_blocks.7.attn.to_out", + "single_transformer_blocks.7.attn.to_qkv_mlp_proj", + "single_transformer_blocks.8.attn.to_out", + "single_transformer_blocks.8.attn.to_qkv_mlp_proj", + "single_transformer_blocks.9.attn.to_out", + "single_transformer_blocks.9.attn.to_qkv_mlp_proj", + "transformer_blocks.0.attn.add_k_proj", + "transformer_blocks.0.attn.add_q_proj", + "transformer_blocks.0.attn.add_v_proj", + "transformer_blocks.0.attn.to_add_out", + "transformer_blocks.0.attn.to_k", + "transformer_blocks.0.attn.to_out.0", + "transformer_blocks.0.attn.to_q", + "transformer_blocks.0.attn.to_v", + "transformer_blocks.0.ff.linear_in", + "transformer_blocks.0.ff.linear_out", + "transformer_blocks.0.ff_context.linear_in", + "transformer_blocks.0.ff_context.linear_out", + "transformer_blocks.1.attn.add_k_proj", + "transformer_blocks.1.attn.add_q_proj", + "transformer_blocks.1.attn.add_v_proj", + "transformer_blocks.1.attn.to_add_out", + "transformer_blocks.1.attn.to_k", + "transformer_blocks.1.attn.to_out.0", + "transformer_blocks.1.attn.to_q", + "transformer_blocks.1.attn.to_v", + "transformer_blocks.1.ff.linear_in", + "transformer_blocks.1.ff.linear_out", + "transformer_blocks.1.ff_context.linear_in", + "transformer_blocks.1.ff_context.linear_out", + "transformer_blocks.2.attn.add_k_proj", + "transformer_blocks.2.attn.add_q_proj", + "transformer_blocks.2.attn.add_v_proj", + "transformer_blocks.2.attn.to_add_out", + "transformer_blocks.2.attn.to_k", + "transformer_blocks.2.attn.to_out.0", + "transformer_blocks.2.attn.to_q", + "transformer_blocks.2.attn.to_v", + "transformer_blocks.2.ff.linear_in", + "transformer_blocks.2.ff.linear_out", + "transformer_blocks.2.ff_context.linear_in", + "transformer_blocks.2.ff_context.linear_out", + "transformer_blocks.3.attn.add_k_proj", + "transformer_blocks.3.attn.add_q_proj", + "transformer_blocks.3.attn.add_v_proj", + "transformer_blocks.3.attn.to_add_out", + "transformer_blocks.3.attn.to_k", + "transformer_blocks.3.attn.to_out.0", + "transformer_blocks.3.attn.to_q", + "transformer_blocks.3.attn.to_v", + "transformer_blocks.3.ff.linear_in", + "transformer_blocks.3.ff.linear_out", + "transformer_blocks.3.ff_context.linear_in", + "transformer_blocks.3.ff_context.linear_out", + "transformer_blocks.4.attn.add_k_proj", + "transformer_blocks.4.attn.add_q_proj", + "transformer_blocks.4.attn.add_v_proj", + "transformer_blocks.4.attn.to_add_out", + "transformer_blocks.4.attn.to_k", + "transformer_blocks.4.attn.to_out.0", + "transformer_blocks.4.attn.to_q", + "transformer_blocks.4.attn.to_v", + "transformer_blocks.4.ff.linear_in", + "transformer_blocks.4.ff.linear_out", + "transformer_blocks.4.ff_context.linear_in", + "transformer_blocks.4.ff_context.linear_out" + ] +} \ No newline at end of file diff --git a/image/mlx/prism-ml/bonsai-image-binary-4B-mlx-1bit/vae/config.json b/image/mlx/prism-ml/bonsai-image-binary-4B-mlx-1bit/vae/config.json new file mode 100644 index 0000000..c3f38eb --- /dev/null +++ b/image/mlx/prism-ml/bonsai-image-binary-4B-mlx-1bit/vae/config.json @@ -0,0 +1,40 @@ +{ + "_class_name": "AutoencoderKLFlux2", + "_diffusers_version": "0.37.0.dev0", + "_name_or_path": "black-forest-labs/FLUX.2-dev", + "act_fn": "silu", + "batch_norm_eps": 0.0001, + "batch_norm_momentum": 0.1, + "block_out_channels": [ + 128, + 256, + 512, + 512 + ], + "down_block_types": [ + "DownEncoderBlock2D", + "DownEncoderBlock2D", + "DownEncoderBlock2D", + "DownEncoderBlock2D" + ], + "force_upcast": true, + "in_channels": 3, + "latent_channels": 32, + "layers_per_block": 2, + "mid_block_add_attention": true, + "norm_num_groups": 32, + "out_channels": 3, + "patch_size": [ + 2, + 2 + ], + "sample_size": 1024, + "up_block_types": [ + "UpDecoderBlock2D", + "UpDecoderBlock2D", + "UpDecoderBlock2D", + "UpDecoderBlock2D" + ], + "use_post_quant_conv": true, + "use_quant_conv": true +} diff --git a/image/mlx/prism-ml/bonsai-image-binary-4B-mlx-1bit/vae/diffusion_pytorch_model.safetensors b/image/mlx/prism-ml/bonsai-image-binary-4B-mlx-1bit/vae/diffusion_pytorch_model.safetensors new file mode 100644 index 0000000..0654e17 --- /dev/null +++ b/image/mlx/prism-ml/bonsai-image-binary-4B-mlx-1bit/vae/diffusion_pytorch_model.safetensors @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:ca70d2202afe6415bdbcb8793ba8cd99fd159cfe6192381504d6c4d3036e0f04 +size 168120878 diff --git a/image/mlx/prism-ml/bonsai-image-ternary-4B-mlx-2bit/.gitattributes b/image/mlx/prism-ml/bonsai-image-ternary-4B-mlx-2bit/.gitattributes new file mode 100644 index 0000000..74614b5 --- /dev/null +++ b/image/mlx/prism-ml/bonsai-image-ternary-4B-mlx-2bit/.gitattributes @@ -0,0 +1,37 @@ +*.7z filter=lfs diff=lfs merge=lfs -text +*.arrow filter=lfs diff=lfs merge=lfs -text +*.bin filter=lfs diff=lfs merge=lfs -text +*.bz2 filter=lfs diff=lfs merge=lfs -text +*.ckpt filter=lfs diff=lfs merge=lfs -text +*.ftz filter=lfs diff=lfs merge=lfs -text +*.gz filter=lfs diff=lfs merge=lfs -text +*.h5 filter=lfs diff=lfs merge=lfs -text +*.joblib filter=lfs diff=lfs merge=lfs -text +*.lfs.* filter=lfs diff=lfs merge=lfs -text +*.mlmodel filter=lfs diff=lfs merge=lfs -text +*.model filter=lfs diff=lfs merge=lfs -text +*.msgpack filter=lfs diff=lfs merge=lfs -text +*.npy filter=lfs diff=lfs merge=lfs -text +*.npz filter=lfs diff=lfs merge=lfs -text +*.onnx filter=lfs diff=lfs merge=lfs -text +*.ot filter=lfs diff=lfs merge=lfs -text +*.parquet filter=lfs diff=lfs merge=lfs -text +*.pb filter=lfs diff=lfs merge=lfs -text +*.pickle filter=lfs diff=lfs merge=lfs -text +*.pkl filter=lfs diff=lfs merge=lfs -text +*.pt filter=lfs diff=lfs merge=lfs -text +*.pth filter=lfs diff=lfs merge=lfs -text +*.rar filter=lfs diff=lfs merge=lfs -text +*.safetensors filter=lfs diff=lfs merge=lfs -text +saved_model/**/* filter=lfs diff=lfs merge=lfs -text +*.tar.* filter=lfs diff=lfs merge=lfs -text +*.tar filter=lfs diff=lfs merge=lfs -text +*.tflite filter=lfs diff=lfs merge=lfs -text +*.tgz filter=lfs diff=lfs merge=lfs -text +*.wasm filter=lfs diff=lfs merge=lfs -text +*.xz filter=lfs diff=lfs merge=lfs -text +*.zip filter=lfs diff=lfs merge=lfs -text +*.zst filter=lfs diff=lfs merge=lfs -text +*tfevents* filter=lfs diff=lfs merge=lfs -text +text_encoder-mlx-4bit/tokenizer.json filter=lfs diff=lfs merge=lfs -text +tokenizer/tokenizer.json filter=lfs diff=lfs merge=lfs -text diff --git a/image/mlx/prism-ml/bonsai-image-ternary-4B-mlx-2bit/LICENSE b/image/mlx/prism-ml/bonsai-image-ternary-4B-mlx-2bit/LICENSE new file mode 100644 index 0000000..66a27ec --- /dev/null +++ b/image/mlx/prism-ml/bonsai-image-ternary-4B-mlx-2bit/LICENSE @@ -0,0 +1,177 @@ + Apache License + Version 2.0, January 2004 + http://www.apache.org/licenses/ + + TERMS AND CONDITIONS FOR USE, REPRODUCTION, AND DISTRIBUTION + + 1. Definitions. + + "License" shall mean the terms and conditions for use, reproduction, + and distribution as defined by Sections 1 through 9 of this document. + + "Licensor" shall mean the copyright owner or entity authorized by + the copyright owner that is granting the License. + + "Legal Entity" shall mean the union of the acting entity and all + other entities that control, are controlled by, or are under common + control with that entity. For the purposes of this definition, + "control" means (i) the power, direct or indirect, to cause the + direction or management of such entity, whether by contract or + otherwise, or (ii) ownership of fifty percent (50%) or more of the + outstanding shares, or (iii) beneficial ownership of such entity. + + "You" (or "Your") shall mean an individual or Legal Entity + exercising permissions granted by this License. + + "Source" form shall mean the preferred form for making modifications, + including but not limited to software source code, documentation + source, and configuration files. + + "Object" form shall mean any form resulting from mechanical + transformation or translation of a Source form, including but + not limited to compiled object code, generated documentation, + and conversions to other media types. + + "Work" shall mean the work of authorship, whether in Source or + Object form, made available under the License, as indicated by a + copyright notice that is included in or attached to the work + (an example is provided in the Appendix below). + + "Derivative Works" shall mean any work, whether in Source or Object + form, that is based on (or derived from) the Work and for which the + editorial revisions, annotations, elaborations, or other modifications + represent, as a whole, an original work of authorship. For the purposes + of this License, Derivative Works shall not include works that remain + separable from, or merely link (or bind by name) to the interfaces of, + the Work and Derivative Works thereof. + + "Contribution" shall mean any work of authorship, including + the original version of the Work and any modifications or additions + to that Work or Derivative Works thereof, that is intentionally + submitted to Licensor for inclusion in the Work by the copyright owner + or by an individual or Legal Entity authorized to submit on behalf of + the copyright owner. For the purposes of this definition, "submitted" + means any form of electronic, verbal, or written communication sent + to the Licensor or its representatives, including but not limited to + communication on electronic mailing lists, source code control systems, + and issue tracking systems that are managed by, or on behalf of, the + Licensor for the purpose of discussing and improving the Work, but + excluding communication that is conspicuously marked or otherwise + designated in writing by the copyright owner as "Not a Contribution." + + "Contributor" shall mean Licensor and any individual or Legal Entity + on behalf of whom a Contribution has been received by Licensor and + subsequently incorporated within the Work. + + 2. Grant of Copyright License. Subject to the terms and conditions of + this License, each Contributor hereby grants to You a perpetual, + worldwide, non-exclusive, no-charge, royalty-free, irrevocable + copyright license to reproduce, prepare Derivative Works of, + publicly display, publicly perform, sublicense, and distribute the + Work and such Derivative Works in Source or Object form. + + 3. Grant of Patent License. Subject to the terms and conditions of + this License, each Contributor hereby grants to You a perpetual, + worldwide, non-exclusive, no-charge, royalty-free, irrevocable + (except as stated in this section) patent license to make, have made, + use, offer to sell, sell, import, and otherwise transfer the Work, + where such license applies only to those patent claims licensable + by such Contributor that are necessarily infringed by their + Contribution(s) alone or by combination of their Contribution(s) + with the Work to which such Contribution(s) was submitted. If You + institute patent litigation against any entity (including a + cross-claim or counterclaim in a lawsuit) alleging that the Work + or a Contribution incorporated within the Work constitutes direct + or contributory patent infringement, then any patent licenses + granted to You under this License for that Work shall terminate + as of the date such litigation is filed. + + 4. Redistribution. You may reproduce and distribute copies of the + Work or Derivative Works thereof in any medium, with or without + modifications, and in Source or Object form, provided that You + meet the following conditions: + + (a) You must give any other recipients of the Work or + Derivative Works a copy of this License; and + + (b) You must cause any modified files to carry prominent notices + stating that You changed the files; and + + (c) You must retain, in the Source form of any Derivative Works + that You distribute, all copyright, patent, trademark, and + attribution notices from the Source form of the Work, + excluding those notices that do not pertain to any part of + the Derivative Works; and + + (d) If the Work includes a "NOTICE" text file as part of its + distribution, then any Derivative Works that You distribute must + include a readable copy of the attribution notices contained + within such NOTICE file, excluding those notices that do not + pertain to any part of the Derivative Works, in at least one + of the following places: within a NOTICE text file distributed + as part of the Derivative Works; within the Source form or + documentation, if provided along with the Derivative Works; or, + within a display generated by the Derivative Works, if and + wherever such third-party notices normally appear. The contents + of the NOTICE file are for informational purposes only and + do not modify the License. You may add Your own attribution + notices within Derivative Works that You distribute, alongside + or as an addendum to the NOTICE text from the Work, provided + that such additional attribution notices cannot be construed + as modifying the License. + + You may add Your own copyright statement to Your modifications and + may provide additional or different license terms and conditions + for use, reproduction, or distribution of Your modifications, or + for any such Derivative Works as a whole, provided Your use, + reproduction, and distribution of the Work otherwise complies with + the conditions stated in this License. + + 5. Submission of Contributions. Unless You explicitly state otherwise, + any Contribution intentionally submitted for inclusion in the Work + by You to the Licensor shall be under the terms and conditions of + this License, without any additional terms or conditions. + Notwithstanding the above, nothing herein shall supersede or modify + the terms of any separate license agreement you may have executed + with Licensor regarding such Contributions. + + 6. Trademarks. This License does not grant permission to use the trade + names, trademarks, service marks, or product names of the Licensor, + except as required for reasonable and customary use in describing the + origin of the Work and reproducing the content of the NOTICE file. + + 7. Disclaimer of Warranty. Unless required by applicable law or + agreed to in writing, Licensor provides the Work (and each + Contributor provides its Contributions) on an "AS IS" BASIS, + WITHOUT WARRANTIES OR CONDITIONS OF ANY KIND, either express or + implied, including, without limitation, any warranties or conditions + of TITLE, NON-INFRINGEMENT, MERCHANTABILITY, or FITNESS FOR A + PARTICULAR PURPOSE. You are solely responsible for determining the + appropriateness of using or redistributing the Work and assume any + risks associated with Your exercise of permissions under this License. + + 8. Limitation of Liability. In no event and under no legal theory, + whether in tort (including negligence), contract, or otherwise, + unless required by applicable law (such as deliberate and grossly + negligent acts) or agreed to in writing, shall any Contributor be + liable to You for damages, including any direct, indirect, special, + incidental, or consequential damages of any character arising as a + result of this License or out of the use or inability to use the + Work (including but not limited to damages for loss of goodwill, + work stoppage, computer failure or malfunction, or any and all + other commercial damages or losses), even if such Contributor + has been advised of the possibility of such damages. + + 9. Accepting Warranty or Additional Liability. While redistributing + the Work or Derivative Works thereof, You may choose to offer, + and charge a fee for, acceptance of support, warranty, indemnity, + or other liability obligations and/or rights consistent with this + License. However, in accepting such obligations, You may act only + on Your own behalf and on Your sole responsibility, not on behalf + of any other Contributor, and only if You agree to indemnify, + defend, and hold each Contributor harmless for any liability + incurred by, or claims asserted against, such Contributor by reason + of your accepting any such warranty or additional liability. + + END OF TERMS AND CONDITIONS + diff --git a/image/mlx/prism-ml/bonsai-image-ternary-4B-mlx-2bit/NOTICE.md b/image/mlx/prism-ml/bonsai-image-ternary-4B-mlx-2bit/NOTICE.md new file mode 100644 index 0000000..ef55b08 --- /dev/null +++ b/image/mlx/prism-ml/bonsai-image-ternary-4B-mlx-2bit/NOTICE.md @@ -0,0 +1,6 @@ +This software is copyright 2026-present Prism ML, Inc. It is available under the Apache 2.0 license. +If you publicly deploy or redistribute this software, we would appreciate attribution such as: "Created using Bonsai Image by Prism ML." + +This software is built from FLUX.2 [klein] 4B, Copyright 2026 Black Forest Labs, which is available under the Apache 2.0 License: https://huggingface.co/black-forest-labs/FLUX.2-klein-4B/blob/main/LICENSE.md + +The text encoder is built from Qwen3-4B, Copyright 2024 Alibaba Cloud, which is available under the Apache 2.0 License: https://huggingface.co/Qwen/Qwen3-4B/blob/main/LICENSE diff --git a/image/mlx/prism-ml/bonsai-image-ternary-4B-mlx-2bit/README.md b/image/mlx/prism-ml/bonsai-image-ternary-4B-mlx-2bit/README.md new file mode 100644 index 0000000..b06739a --- /dev/null +++ b/image/mlx/prism-ml/bonsai-image-ternary-4B-mlx-2bit/README.md @@ -0,0 +1,213 @@ +--- +license: apache-2.0 +pipeline_tag: text-to-image +tags: +- ternary +- 1.58-bit +- mlx +- apple-silicon +- on-device +- text-to-image +- diffusion +- flux +- prismml +- bonsai +base_model: +- prism-ml/bonsai-image-ternary-4B-unpacked +--- + +

+ Bonsai Image +

+ +

+ Prism ML Website  |  + White Paper  |  + Demo & Examples  |  + Discord +

+ +# bonsai-image-ternary-4B-mlx-2bit + +Ternary weight (1.58-bit) text-to-image diffusion transformer deployment for Apple Silicon + +> **1.21 GB transformer** | **6.4×** smaller than FP16 | **9.4 s / 512²** on iPhone 17 Pro Max | **~6 s / 512²** on M4 Pro | runs on Mac, iPhone, iPad + +## Highlights + +- **1.21 GB** diffusion transformer, down from **7.75 GB** for the FP16 FLUX.2 Klein 4B transformer +- Ternary {−1, 0, +1} transformer weights with FP16 group-wise scaling in the matrix-heavy transformer layers (Q/K/V projections, output projections, MLP weights) +- Quality-oriented Bonsai Image variant: the additional zero state improves visual quality and prompt fidelity while keeping the transformer compact +- 3.88 GB Apple Silicon deployment payload including the 4-bit text encoder and FP16 VAE — text encoder is offloaded after prompt encode, so the denoising loop only keeps the compact transformer and VAE resident +- 4-step FlowMatch-Euler sampler with guidance = 1.0 and shift = 3.0 — no CFG, no negative prompts needed +- MLX-native 2-bit format for Apple Silicon, the same kernel path as our ternary language-model releases +- Cross-platform companion: also available as [gemlite 2-bit](https://huggingface.co/prism-ml/bonsai-image-ternary-4B-gemlite-2bit) for NVIDIA GPUs + +## Resources + +- **[White Paper](https://github.com/PrismML-Eng/Bonsai-Image-Demo/blob/main/bonsai-image-4b-whitepaper.pdf)** — full benchmarks, kernels, and memory analysis +- **[Demo repo](https://github.com/PrismML-Eng/Bonsai-Image-Demo)** — one-command setup for Mac / Linux / Windows +- **[Discord](https://discord.gg/prismml)** — community + support +- **Kernels**: [MLX](https://github.com/ml-explore/mlx) (Apple Silicon) · [mlx-swift](https://github.com/ml-explore/mlx-swift) (iOS / macOS) — 2-bit format is supported out of the box + +## Model Overview + +| Item | Specification | +| :-------------------- | :-------------------------------------------------------------------------------------| +| Base architecture | FLUX.2 Klein 4B (MMDiT diffusion transformer) | +| Parameters | ~4.0B (transformer trunk) | +| Blocks | 25 MMDiT blocks: 5 double-stream + 20 single-stream | +| Sampler | FlowMatchEuler, **4 steps**, guidance = 1.0, shift = 3.0 | +| Text encoder | Qwen3-4B at 4-bit (≈ 2.28 GB on-device, offloaded after prompt encode) | +| VAE | Flux2 32-channel latent, tiled decode (128 px tiles) | +| Native resolution | 1024×1024 (also supports 512×512 and arbitrary multiples of 32) | +| Weight format | MLX 2-bit g128, ternary values + FP16 group-wise scales | +| **Transformer size** | **1.21 GB** (6.4× smaller than 7.75 GB FP16) | +| Total payload | **3.88 GB** (4.1x smaller than the 15.97 GB FP16 transformer + text encoder + VAE) | +| Ternary coverage | All 100 matmul-heavy linears in the 25 MMDiT blocks | +| License | Apache 2.0 | + +## Ternary Weight Representation: 1.58-bit g128 + +Each ternary weight takes a value from {−1, 0, +1} with one shared FP16 scale per group of 128 weights: + +``` +w_i = scale_g * t_i, t_i in {−1, 0, +1} +``` + +Ternary values carry log₂(3) ≈ 1.585 bits of information per weight. With one FP16 scale per group of 128, the effective storage is + +``` +b_eff ≈ log2(3) + 16/128 ≈ 1.585 + 0.125 ≈ 1.71 bits/weight +``` + +This gives an idealized **9.4× reduction** relative to FP16 for the ternary transformer layers. A small set of precision-sensitive supporting tensors remains in FP16, so the final Ternary Bonsai Image 4B diffusion transformer is **1.21 GB**, a 6.4× reduction from the 7.75 GB FP16 FLUX.2 Klein 4B transformer. + +The ternary representation is applied to the matrix-heavy transformer layers, including Q / K / V projections, output projections, MLP linears, and the double-stream add-K / Q / V linears. Supporting tensors (less than 5% of the total parameters) such as modulation streams, embedders, output norm, and output projection remain FP16 for image quality and stability. + +The MLX deployment uses a 2-bit packed format. Ternary values are stored in 2-bit slots, with the fourth code unused. The model-level Bonsai representation is **1.21 GB**; the deployed MLX pack is **1.43 GB** on disk due to runtime packing and alignment overhead in the current MLX path. + +### Memory + +| Format | Transformer size | Reduction | Ratio | +| :------------------------------ | ---------------: | --------: | -------: | +| FP16 FLUX.2 Klein 4B | 7.75 GB | — | 1.0× | +| **Ternary Bonsai Image 4B** | **1.21 GB** | **84.4%** | **6.4×** | + +Apple Silicon deployment: + +| Component | Size | +| :------------------------------ | ------: | +| MLX 2-bit diffusion transformer | 1.43 GB | +| Compressed text encoder | 2.28 GB | +| FP16 VAE | 0.17 GB | +| **Total payload** | **3.88 GB** | + +At runtime, the text encoder is offloaded after prompt encoding. During denoising, the repeated image-generation loop is dominated by the compact ternary diffusion transformer and active image-generation components rather than the full payload. + +End-to-end Mac M4 Pro mean-active memory pressure at 1024² is **2.38 GB** — a **6.0×** reduction vs the stock FP16 MFLUX pipeline (14.39 GB). + + +## Best Practices + +- Sampler: FlowMatchEuler-discrete with 4 steps, guidance = 1.0 (no classifier-free guidance), shift = 3.0. The model is designed for 4 steps; running more steps does not improve quality significantly and can introduce artifacts. +- Resolution: native 1024² is the design target; 512² works for quick previews. +- Aspect ratios: multiples of 32 are supported, including 832×1248 and 1248×832. +- Prompting: natural-language prompts. Negative prompts are not required. +- Runtime memory: the text encoder is offloaded after prompt encoding, so the denoising loop is memory-light. + +## Quickstart + +### MLX (Python) + +The simplest path is the [Bonsai Image Demo repo](https://github.com/PrismML-Eng/Bonsai-Image-Demo), which sets up the full Bonsai Studio (FastAPI backend + Next.js frontend): + +```bash +git clone https://github.com/PrismML-Eng/Bonsai-Image-Demo.git +cd Bonsai-Image-Demo +./setup.sh +./scripts/download_model.sh # ternary is the default +./scripts/serve.sh +``` + +For a one-shot render without the studio frontend: + +```bash +./scripts/generate.sh --prompt "A bonsai tree in a quiet ceramic studio, soft morning light" +``` + +### MLX Swift (iOS / macOS) + +Ternary Bonsai Image 4B runs natively on iPhone and iPad via MLX Swift. Bonsai Studio for iPhone is available on the App Store and ships ternary as the default variant. + +## Throughput (MLX / Apple Silicon) + +Mac M4 Pro (48 GB unified memory), 4 denoising steps, fixed prompt and seed: + +| Resolution | s / step | s / image (mean ± std) | vs stock MFLUX FP16 | +| :------------ | -------: | ---------------------: | ------------------: | +| 512 × 512 | 1.44 | 5.78 ± 0.08 s | **3.15×** | +| 1024 × 1024 | 6.06 | **24.26 ± 0.24 s** | **5.56×** | + +iPhone 17 Pro Max (A19 Pro, 12 GB unified memory), MLX Swift, same methodology: + +| Resolution | s / step | s / image | +| :------------ | -------: | --------: | +| 128 × 128 | 0.68 | 2.7 s | +| 256 × 256 | 1.00 | 4.0 s | +| 512 × 512 | 2.35 | **9.4 s** | +| 1024 × 1024 | 8.50 | **34.0 s**| + +Stock FP16 FLUX.2 Klein 4B does not fit within iPhone 17 Pro Max's 12 GB unified memory budget; Bonsai Image 4B models do. + +## Benchmarks + +Evaluated with matched generation settings across the comparison set on H100. GenEval uses the official 512x512 protocol. For HPSv3 and DPG-Bench, larger-backbone rows are evaluated at 1024x1024, while smaller-backbone rows are evaluated at their native 512x512 setting. Higher is better for all three benchmarks. + +| Model | Transformer (GB) | GenEval | HPSv3 | DPG-Bench | +| :--------------------------- | ---------------: | ------: | -----: | --------: | +| **Bonsai Image · Ternary 4B**| **1.21** | **0.723** | **12.22** | **0.851** | +| **Bonsai Image · Binary 4B** | **0.93** | **0.671** | **11.15** | **0.822** | +| FLUX.2 Klein 4B | 7.75 | 0.819 | 12.84 | 0.853 | +| FLUX.1-schnell | 23.8 | 0.716 | 12.67 | 0.848 | +| SDXL | 5.14 | 0.300 | 10.05 | 0.740 | +| PixArt-Σ XL 2 | 1.20 | 0.541 | 11.93 | 0.769 | +| Stable Diffusion 1.5 | 1.72 | 0.396 | 4.20 | 0.601 | +| BK-SDM-Small | 0.98 | 0.297 | 3.05 | 0.559 | + +The benchmark results show the intended quality-footprint trade-off. Ternary Bonsai Image 4B is the quality-oriented variant: at 1.21 GB, it sits very close to FLUX.2 Klein 4B across GenEval, HPSv3, and DPG-Bench while reducing the diffusion transformer footprint by 6.4x. The binary companion is the footprint-oriented variant, reducing the diffusion transformer below 1 GB while still delivering strong benchmark results. + +Together, the Bonsai Image variants move the quality-footprint frontier: they bring modern diffusion-transformer behavior into a memory range previously occupied by much smaller, lower-capability models. + +## Use Cases + +- **Local creative tooling**: image generation directly on Mac, iPhone, and iPad +- **Private generation**: prompts and generated assets can remain local +- **Rapid iteration**: lower local latency and no remote queue for iterative creative workflows +- **Mobile deployment**: image generation on devices with unified-memory, thermal, and connectivity constraints +- **Commodity-GPU serving**: lower transformer footprint and reduced memory pressure through the companion CUDA deployment +- **Enterprise and controlled inference**: local or private environments for data residency and compliance-sensitive workflows + +## Limitations + +- Ternary Bonsai Image 4B is not bit-identical to the FP16 FLUX.2 Klein 4B model; it is a compact ternary-weight deployment designed to deliver similar practical behavior at much smaller size. +- Image-generation quality remains prompt- and workflow-dependent. Small text, fine details, object counts, and strict compositional constraints should be evaluated for the target use case. +- Current commodity inference stacks do not yet expose fully native ternary execution as a standard hardware path. This release uses practical MLX low-bit kernel paths on Apple Silicon and Gemlite low-bit GEMM on CUDA. +- After the diffusion transformer is made compact, other components such as the VAE can become more visible memory bottlenecks. The runtime mitigates this with text-encoder offload and tiled VAE decoding. + + +## Citation + +```bibtex +@techreport{bonsaiimage4b, + title = {Bonsai Image 4B: Low-Bit Diffusion on Apple Silicon and Consumer GPUs}, + author = {Prism ML}, + year = {2026}, + month = {May}, + url = {https://prismml.com} +} +``` + +## Contact + +For questions, feedback, or collaboration inquiries: **contact@prismml.com** \ No newline at end of file diff --git a/image/mlx/prism-ml/bonsai-image-ternary-4B-mlx-2bit/assets/bonsai-logo.svg b/image/mlx/prism-ml/bonsai-image-ternary-4B-mlx-2bit/assets/bonsai-logo.svg new file mode 100644 index 0000000..2cfef2b --- /dev/null +++ b/image/mlx/prism-ml/bonsai-image-ternary-4B-mlx-2bit/assets/bonsai-logo.svg @@ -0,0 +1 @@ + diff --git a/image/mlx/prism-ml/bonsai-image-ternary-4B-mlx-2bit/manifest.json b/image/mlx/prism-ml/bonsai-image-ternary-4B-mlx-2bit/manifest.json new file mode 100644 index 0000000..f4507c5 --- /dev/null +++ b/image/mlx/prism-ml/bonsai-image-ternary-4B-mlx-2bit/manifest.json @@ -0,0 +1,136 @@ +{ + "model_version": "ternary g128 (Apple Silicon mlx-2bit deployment)", + "total_bytes": 3888274639, + "files": [ + { + "remote_path": "LICENSE", + "size": 10174, + "sha256": "69849221bfb90053de2134ef5e6d540287b4b98062326492f1f96f5da685524b" + }, + { + "remote_path": "NOTICE.md", + "size": 623, + "sha256": "bbefa4a26b836efc040c1a0f155a425d1d833eae1b2534ffc414b1eada3cd922" + }, + { + "remote_path": "README.md", + "size": 12443, + "sha256": "4017f9c74fc1f89212a8b736a29bcc742fe1fe4679fbeb1a5818bf395f80d55e" + }, + { + "remote_path": "model_index.json", + "size": 81, + "sha256": "ecb4735e37691a8733f62957fd6c548f841af40624905bb24fa639756153c8a1" + }, + { + "remote_path": "scheduler/scheduler_config.json", + "size": 486, + "sha256": "067afb012cef64553a763447d1efd93daeffcc0123ca7e25b09f8de20b90762e" + }, + { + "remote_path": "text_encoder-mlx-4bit/added_tokens.json", + "size": 707, + "sha256": "c0284b582e14987fbd3d5a2cb2bd139084371ed9acbae488829a1c900833c680" + }, + { + "remote_path": "text_encoder-mlx-4bit/config.json", + "size": 937, + "sha256": "b5efdcf3b0035a3638e7228dad4d85f5c4a23f156eb7cdb0b44c8366a5d34d9b" + }, + { + "remote_path": "text_encoder-mlx-4bit/merges.txt", + "size": 1671853, + "sha256": "8831e4f1a044471340f7c0a83d7bd71306a5b867e95fd870f74d0c5308a904d5" + }, + { + "remote_path": "text_encoder-mlx-4bit/model.safetensors", + "size": 2263022529, + "sha256": "e240c0bdc0ebb0681bf0da0f98d9719fd6ebe269a3633f81542c13e81345651d" + }, + { + "remote_path": "text_encoder-mlx-4bit/model.safetensors.index.json", + "size": 63924, + "sha256": "f7825defe5865d179c3b593173d37056be5f202dcb7153985cf74e75ecf1628b" + }, + { + "remote_path": "text_encoder-mlx-4bit/special_tokens_map.json", + "size": 613, + "sha256": "76862e765266b85aa9459767e33cbaf13970f327a0e88d1c65846c2ddd3a1ecd" + }, + { + "remote_path": "text_encoder-mlx-4bit/tokenizer.json", + "size": 11422654, + "sha256": "aeb13307a71acd8fe81861d94ad54ab689df773318809eed3cbe794b4492dae4" + }, + { + "remote_path": "text_encoder-mlx-4bit/tokenizer_config.json", + "size": 9706, + "sha256": "253153d0738ceb4c668d2eff957714dd2bea0b56de772a9fdccd96cbf517e6a0" + }, + { + "remote_path": "text_encoder-mlx-4bit/vocab.json", + "size": 2776833, + "sha256": "ca10d7e9fb3ed18575dd1e277a2579c16d108e32f27439684afa0e10b1440910" + }, + { + "remote_path": "tokenizer/added_tokens.json", + "size": 707, + "sha256": "c0284b582e14987fbd3d5a2cb2bd139084371ed9acbae488829a1c900833c680" + }, + { + "remote_path": "tokenizer/chat_template.jinja", + "size": 4168, + "sha256": "a55ee1b1660128b7098723e0abcd92caa0788061051c62d51cbe87d9cf1974d8" + }, + { + "remote_path": "tokenizer/merges.txt", + "size": 1671853, + "sha256": "8831e4f1a044471340f7c0a83d7bd71306a5b867e95fd870f74d0c5308a904d5" + }, + { + "remote_path": "tokenizer/special_tokens_map.json", + "size": 613, + "sha256": "76862e765266b85aa9459767e33cbaf13970f327a0e88d1c65846c2ddd3a1ecd" + }, + { + "remote_path": "tokenizer/tokenizer.json", + "size": 11422654, + "sha256": "aeb13307a71acd8fe81861d94ad54ab689df773318809eed3cbe794b4492dae4" + }, + { + "remote_path": "tokenizer/tokenizer_config.json", + "size": 5404, + "sha256": "443bfa629eb16387a12edbf92a76f6a6f10b2af3b53d87ba1550adfcf45f7fa0" + }, + { + "remote_path": "tokenizer/vocab.json", + "size": 2776833, + "sha256": "ca10d7e9fb3ed18575dd1e277a2579c16d108e32f27439684afa0e10b1440910" + }, + { + "remote_path": "transformer-packed-mflux/config.json", + "size": 619, + "sha256": "14c6d8314d28cc027ce636d52dfb98cecc11b65c1455bd51b394a971f4b7b49e" + }, + { + "remote_path": "transformer-packed-mflux/diffusion_pytorch_model.safetensors", + "size": 1425271472, + "sha256": "b21737bdf02690b7d662907781c4dc8b8bf22a2c98b823b1ca3336f48371a84f" + }, + { + "remote_path": "transformer-packed-mflux/quantization_config.json", + "size": 5054, + "sha256": "6a792a07051e534b177aefaac5222796ec13bbdd1a597a2b08695b4c6c75fec7" + }, + { + "remote_path": "vae/config.json", + "size": 821, + "sha256": "0d6dfb69ae95a5e2ac9836284bbb63d8b38ce67b25ba2dff380752b2a10ab948" + }, + { + "remote_path": "vae/diffusion_pytorch_model.safetensors", + "size": 168120878, + "sha256": "ca70d2202afe6415bdbcb8793ba8cd99fd159cfe6192381504d6c4d3036e0f04" + } + ] +} diff --git a/image/mlx/prism-ml/bonsai-image-ternary-4B-mlx-2bit/model_index.json b/image/mlx/prism-ml/bonsai-image-ternary-4B-mlx-2bit/model_index.json new file mode 100644 index 0000000..23fc542 --- /dev/null +++ b/image/mlx/prism-ml/bonsai-image-ternary-4B-mlx-2bit/model_index.json @@ -0,0 +1,4 @@ +{ + "_class_name": "Flux2KleinPipeline", + "_diffusers_version": "0.37.0.dev0" +} diff --git a/image/mlx/prism-ml/bonsai-image-ternary-4B-mlx-2bit/scheduler/scheduler_config.json b/image/mlx/prism-ml/bonsai-image-ternary-4B-mlx-2bit/scheduler/scheduler_config.json new file mode 100644 index 0000000..7e53605 --- /dev/null +++ b/image/mlx/prism-ml/bonsai-image-ternary-4B-mlx-2bit/scheduler/scheduler_config.json @@ -0,0 +1,18 @@ +{ + "_class_name": "FlowMatchEulerDiscreteScheduler", + "_diffusers_version": "0.37.0.dev0", + "base_image_seq_len": 256, + "base_shift": 0.5, + "invert_sigmas": false, + "max_image_seq_len": 4096, + "max_shift": 1.15, + "num_train_timesteps": 1000, + "shift": 3.0, + "shift_terminal": null, + "stochastic_sampling": false, + "time_shift_type": "exponential", + "use_beta_sigmas": false, + "use_dynamic_shifting": true, + "use_exponential_sigmas": false, + "use_karras_sigmas": false +} diff --git a/image/mlx/prism-ml/bonsai-image-ternary-4B-mlx-2bit/text_encoder-mlx-4bit/added_tokens.json b/image/mlx/prism-ml/bonsai-image-ternary-4B-mlx-2bit/text_encoder-mlx-4bit/added_tokens.json new file mode 100644 index 0000000..b54f913 --- /dev/null +++ b/image/mlx/prism-ml/bonsai-image-ternary-4B-mlx-2bit/text_encoder-mlx-4bit/added_tokens.json @@ -0,0 +1,28 @@ +{ + "": 151668, + "
": 151658, + "": 151666, + "": 151667, + "": 151657, + "": 151665, + "<|box_end|>": 151649, + "<|box_start|>": 151648, + "<|endoftext|>": 151643, + "<|file_sep|>": 151664, + "<|fim_middle|>": 151660, + "<|fim_pad|>": 151662, + "<|fim_prefix|>": 151659, + "<|fim_suffix|>": 151661, + "<|im_end|>": 151645, + "<|im_start|>": 151644, + "<|image_pad|>": 151655, + "<|object_ref_end|>": 151647, + "<|object_ref_start|>": 151646, + "<|quad_end|>": 151651, + "<|quad_start|>": 151650, + "<|repo_name|>": 151663, + "<|video_pad|>": 151656, + "<|vision_end|>": 151653, + "<|vision_pad|>": 151654, + "<|vision_start|>": 151652 +} diff --git a/image/mlx/prism-ml/bonsai-image-ternary-4B-mlx-2bit/text_encoder-mlx-4bit/config.json b/image/mlx/prism-ml/bonsai-image-ternary-4B-mlx-2bit/text_encoder-mlx-4bit/config.json new file mode 100644 index 0000000..032ad32 --- /dev/null +++ b/image/mlx/prism-ml/bonsai-image-ternary-4B-mlx-2bit/text_encoder-mlx-4bit/config.json @@ -0,0 +1,38 @@ +{ + "architectures": [ + "Qwen3ForCausalLM" + ], + "attention_bias": false, + "attention_dropout": 0.0, + "bos_token_id": 151643, + "eos_token_id": 151645, + "head_dim": 128, + "hidden_act": "silu", + "hidden_size": 2560, + "initializer_range": 0.02, + "intermediate_size": 9728, + "max_position_embeddings": 40960, + "max_window_layers": 36, + "model_type": "qwen3", + "num_attention_heads": 32, + "num_hidden_layers": 36, + "num_key_value_heads": 8, + "quantization": { + "group_size": 64, + "bits": 4 + }, + "quantization_config": { + "group_size": 64, + "bits": 4 + }, + "rms_norm_eps": 1e-06, + "rope_scaling": null, + "rope_theta": 1000000, + "sliding_window": null, + "tie_word_embeddings": true, + "torch_dtype": "bfloat16", + "transformers_version": "4.51.0", + "use_cache": true, + "use_sliding_window": false, + "vocab_size": 151936 +} \ No newline at end of file diff --git a/image/mlx/prism-ml/bonsai-image-ternary-4B-mlx-2bit/text_encoder-mlx-4bit/merges.txt b/image/mlx/prism-ml/bonsai-image-ternary-4B-mlx-2bit/text_encoder-mlx-4bit/merges.txt new file mode 100644 index 0000000..80c1a19 --- /dev/null +++ b/image/mlx/prism-ml/bonsai-image-ternary-4B-mlx-2bit/text_encoder-mlx-4bit/merges.txt @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:8831e4f1a044471340f7c0a83d7bd71306a5b867e95fd870f74d0c5308a904d5 +size 1671853 diff --git a/image/mlx/prism-ml/bonsai-image-ternary-4B-mlx-2bit/text_encoder-mlx-4bit/model.safetensors b/image/mlx/prism-ml/bonsai-image-ternary-4B-mlx-2bit/text_encoder-mlx-4bit/model.safetensors new file mode 100644 index 0000000..bb9a979 --- /dev/null +++ b/image/mlx/prism-ml/bonsai-image-ternary-4B-mlx-2bit/text_encoder-mlx-4bit/model.safetensors @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:e240c0bdc0ebb0681bf0da0f98d9719fd6ebe269a3633f81542c13e81345651d +size 2263022529 diff --git a/image/mlx/prism-ml/bonsai-image-ternary-4B-mlx-2bit/text_encoder-mlx-4bit/model.safetensors.index.json b/image/mlx/prism-ml/bonsai-image-ternary-4B-mlx-2bit/text_encoder-mlx-4bit/model.safetensors.index.json new file mode 100644 index 0000000..07e230a --- /dev/null +++ b/image/mlx/prism-ml/bonsai-image-ternary-4B-mlx-2bit/text_encoder-mlx-4bit/model.safetensors.index.json @@ -0,0 +1,911 @@ +{ + "metadata": { + "total_size": 2262920192 + }, + "weight_map": { + "model.embed_tokens.biases": "model.safetensors", + "model.embed_tokens.scales": "model.safetensors", + "model.embed_tokens.weight": "model.safetensors", + "model.layers.0.input_layernorm.weight": "model.safetensors", + "model.layers.0.mlp.down_proj.biases": "model.safetensors", + "model.layers.0.mlp.down_proj.scales": "model.safetensors", + "model.layers.0.mlp.down_proj.weight": "model.safetensors", + "model.layers.0.mlp.gate_proj.biases": "model.safetensors", + "model.layers.0.mlp.gate_proj.scales": "model.safetensors", + "model.layers.0.mlp.gate_proj.weight": "model.safetensors", + "model.layers.0.mlp.up_proj.biases": "model.safetensors", + "model.layers.0.mlp.up_proj.scales": "model.safetensors", + "model.layers.0.mlp.up_proj.weight": "model.safetensors", + "model.layers.0.post_attention_layernorm.weight": "model.safetensors", + "model.layers.0.self_attn.k_norm.weight": "model.safetensors", + "model.layers.0.self_attn.k_proj.biases": "model.safetensors", + "model.layers.0.self_attn.k_proj.scales": "model.safetensors", + "model.layers.0.self_attn.k_proj.weight": "model.safetensors", + "model.layers.0.self_attn.o_proj.biases": "model.safetensors", + "model.layers.0.self_attn.o_proj.scales": "model.safetensors", + "model.layers.0.self_attn.o_proj.weight": "model.safetensors", + "model.layers.0.self_attn.q_norm.weight": "model.safetensors", + "model.layers.0.self_attn.q_proj.biases": "model.safetensors", + "model.layers.0.self_attn.q_proj.scales": "model.safetensors", + "model.layers.0.self_attn.q_proj.weight": "model.safetensors", + "model.layers.0.self_attn.v_proj.biases": "model.safetensors", + "model.layers.0.self_attn.v_proj.scales": "model.safetensors", + "model.layers.0.self_attn.v_proj.weight": "model.safetensors", + "model.layers.1.input_layernorm.weight": "model.safetensors", + "model.layers.1.mlp.down_proj.biases": "model.safetensors", + "model.layers.1.mlp.down_proj.scales": "model.safetensors", + "model.layers.1.mlp.down_proj.weight": "model.safetensors", + "model.layers.1.mlp.gate_proj.biases": "model.safetensors", + "model.layers.1.mlp.gate_proj.scales": "model.safetensors", + "model.layers.1.mlp.gate_proj.weight": "model.safetensors", + "model.layers.1.mlp.up_proj.biases": "model.safetensors", + "model.layers.1.mlp.up_proj.scales": "model.safetensors", + "model.layers.1.mlp.up_proj.weight": "model.safetensors", + "model.layers.1.post_attention_layernorm.weight": "model.safetensors", + "model.layers.1.self_attn.k_norm.weight": "model.safetensors", + "model.layers.1.self_attn.k_proj.biases": "model.safetensors", + "model.layers.1.self_attn.k_proj.scales": "model.safetensors", + "model.layers.1.self_attn.k_proj.weight": "model.safetensors", + "model.layers.1.self_attn.o_proj.biases": "model.safetensors", + "model.layers.1.self_attn.o_proj.scales": "model.safetensors", + "model.layers.1.self_attn.o_proj.weight": "model.safetensors", + "model.layers.1.self_attn.q_norm.weight": "model.safetensors", + "model.layers.1.self_attn.q_proj.biases": "model.safetensors", + "model.layers.1.self_attn.q_proj.scales": "model.safetensors", + "model.layers.1.self_attn.q_proj.weight": "model.safetensors", + "model.layers.1.self_attn.v_proj.biases": "model.safetensors", + "model.layers.1.self_attn.v_proj.scales": "model.safetensors", + "model.layers.1.self_attn.v_proj.weight": "model.safetensors", + "model.layers.10.input_layernorm.weight": "model.safetensors", + "model.layers.10.mlp.down_proj.biases": "model.safetensors", + "model.layers.10.mlp.down_proj.scales": "model.safetensors", + "model.layers.10.mlp.down_proj.weight": "model.safetensors", + "model.layers.10.mlp.gate_proj.biases": "model.safetensors", + "model.layers.10.mlp.gate_proj.scales": "model.safetensors", + "model.layers.10.mlp.gate_proj.weight": "model.safetensors", + "model.layers.10.mlp.up_proj.biases": "model.safetensors", + "model.layers.10.mlp.up_proj.scales": "model.safetensors", + "model.layers.10.mlp.up_proj.weight": "model.safetensors", + "model.layers.10.post_attention_layernorm.weight": "model.safetensors", + "model.layers.10.self_attn.k_norm.weight": "model.safetensors", + "model.layers.10.self_attn.k_proj.biases": "model.safetensors", + "model.layers.10.self_attn.k_proj.scales": "model.safetensors", + "model.layers.10.self_attn.k_proj.weight": "model.safetensors", + "model.layers.10.self_attn.o_proj.biases": "model.safetensors", + "model.layers.10.self_attn.o_proj.scales": "model.safetensors", + "model.layers.10.self_attn.o_proj.weight": "model.safetensors", + "model.layers.10.self_attn.q_norm.weight": "model.safetensors", + "model.layers.10.self_attn.q_proj.biases": "model.safetensors", + "model.layers.10.self_attn.q_proj.scales": "model.safetensors", + "model.layers.10.self_attn.q_proj.weight": "model.safetensors", + "model.layers.10.self_attn.v_proj.biases": "model.safetensors", + "model.layers.10.self_attn.v_proj.scales": "model.safetensors", + "model.layers.10.self_attn.v_proj.weight": "model.safetensors", + "model.layers.11.input_layernorm.weight": "model.safetensors", + "model.layers.11.mlp.down_proj.biases": "model.safetensors", + "model.layers.11.mlp.down_proj.scales": "model.safetensors", + "model.layers.11.mlp.down_proj.weight": "model.safetensors", + "model.layers.11.mlp.gate_proj.biases": "model.safetensors", + "model.layers.11.mlp.gate_proj.scales": "model.safetensors", + "model.layers.11.mlp.gate_proj.weight": "model.safetensors", + "model.layers.11.mlp.up_proj.biases": "model.safetensors", + "model.layers.11.mlp.up_proj.scales": "model.safetensors", + "model.layers.11.mlp.up_proj.weight": "model.safetensors", + "model.layers.11.post_attention_layernorm.weight": "model.safetensors", + "model.layers.11.self_attn.k_norm.weight": "model.safetensors", + "model.layers.11.self_attn.k_proj.biases": "model.safetensors", + "model.layers.11.self_attn.k_proj.scales": "model.safetensors", + "model.layers.11.self_attn.k_proj.weight": "model.safetensors", + "model.layers.11.self_attn.o_proj.biases": "model.safetensors", + "model.layers.11.self_attn.o_proj.scales": "model.safetensors", + "model.layers.11.self_attn.o_proj.weight": "model.safetensors", + "model.layers.11.self_attn.q_norm.weight": "model.safetensors", + "model.layers.11.self_attn.q_proj.biases": "model.safetensors", + "model.layers.11.self_attn.q_proj.scales": "model.safetensors", + "model.layers.11.self_attn.q_proj.weight": "model.safetensors", + "model.layers.11.self_attn.v_proj.biases": "model.safetensors", + "model.layers.11.self_attn.v_proj.scales": "model.safetensors", + "model.layers.11.self_attn.v_proj.weight": "model.safetensors", + "model.layers.12.input_layernorm.weight": "model.safetensors", + "model.layers.12.mlp.down_proj.biases": "model.safetensors", + "model.layers.12.mlp.down_proj.scales": "model.safetensors", + "model.layers.12.mlp.down_proj.weight": "model.safetensors", + "model.layers.12.mlp.gate_proj.biases": "model.safetensors", + "model.layers.12.mlp.gate_proj.scales": "model.safetensors", + "model.layers.12.mlp.gate_proj.weight": "model.safetensors", + "model.layers.12.mlp.up_proj.biases": "model.safetensors", + "model.layers.12.mlp.up_proj.scales": "model.safetensors", + "model.layers.12.mlp.up_proj.weight": "model.safetensors", + "model.layers.12.post_attention_layernorm.weight": "model.safetensors", + "model.layers.12.self_attn.k_norm.weight": "model.safetensors", + "model.layers.12.self_attn.k_proj.biases": "model.safetensors", + "model.layers.12.self_attn.k_proj.scales": "model.safetensors", + "model.layers.12.self_attn.k_proj.weight": "model.safetensors", + "model.layers.12.self_attn.o_proj.biases": "model.safetensors", + "model.layers.12.self_attn.o_proj.scales": "model.safetensors", + "model.layers.12.self_attn.o_proj.weight": "model.safetensors", + "model.layers.12.self_attn.q_norm.weight": "model.safetensors", + "model.layers.12.self_attn.q_proj.biases": "model.safetensors", + "model.layers.12.self_attn.q_proj.scales": "model.safetensors", + "model.layers.12.self_attn.q_proj.weight": "model.safetensors", + "model.layers.12.self_attn.v_proj.biases": "model.safetensors", + "model.layers.12.self_attn.v_proj.scales": "model.safetensors", + "model.layers.12.self_attn.v_proj.weight": "model.safetensors", + "model.layers.13.input_layernorm.weight": "model.safetensors", + "model.layers.13.mlp.down_proj.biases": "model.safetensors", + "model.layers.13.mlp.down_proj.scales": "model.safetensors", + "model.layers.13.mlp.down_proj.weight": "model.safetensors", + "model.layers.13.mlp.gate_proj.biases": "model.safetensors", + "model.layers.13.mlp.gate_proj.scales": "model.safetensors", + "model.layers.13.mlp.gate_proj.weight": "model.safetensors", + "model.layers.13.mlp.up_proj.biases": "model.safetensors", + "model.layers.13.mlp.up_proj.scales": "model.safetensors", + "model.layers.13.mlp.up_proj.weight": "model.safetensors", + "model.layers.13.post_attention_layernorm.weight": "model.safetensors", + "model.layers.13.self_attn.k_norm.weight": "model.safetensors", + "model.layers.13.self_attn.k_proj.biases": "model.safetensors", + "model.layers.13.self_attn.k_proj.scales": "model.safetensors", + "model.layers.13.self_attn.k_proj.weight": "model.safetensors", + "model.layers.13.self_attn.o_proj.biases": "model.safetensors", + "model.layers.13.self_attn.o_proj.scales": "model.safetensors", + "model.layers.13.self_attn.o_proj.weight": "model.safetensors", + "model.layers.13.self_attn.q_norm.weight": "model.safetensors", + "model.layers.13.self_attn.q_proj.biases": "model.safetensors", + "model.layers.13.self_attn.q_proj.scales": "model.safetensors", + "model.layers.13.self_attn.q_proj.weight": "model.safetensors", + "model.layers.13.self_attn.v_proj.biases": "model.safetensors", + "model.layers.13.self_attn.v_proj.scales": "model.safetensors", + "model.layers.13.self_attn.v_proj.weight": "model.safetensors", + "model.layers.14.input_layernorm.weight": "model.safetensors", + "model.layers.14.mlp.down_proj.biases": "model.safetensors", + "model.layers.14.mlp.down_proj.scales": "model.safetensors", + "model.layers.14.mlp.down_proj.weight": "model.safetensors", + "model.layers.14.mlp.gate_proj.biases": "model.safetensors", + "model.layers.14.mlp.gate_proj.scales": "model.safetensors", + "model.layers.14.mlp.gate_proj.weight": "model.safetensors", + "model.layers.14.mlp.up_proj.biases": "model.safetensors", + "model.layers.14.mlp.up_proj.scales": "model.safetensors", + "model.layers.14.mlp.up_proj.weight": "model.safetensors", + "model.layers.14.post_attention_layernorm.weight": "model.safetensors", + "model.layers.14.self_attn.k_norm.weight": "model.safetensors", + "model.layers.14.self_attn.k_proj.biases": "model.safetensors", + "model.layers.14.self_attn.k_proj.scales": "model.safetensors", + "model.layers.14.self_attn.k_proj.weight": "model.safetensors", + "model.layers.14.self_attn.o_proj.biases": "model.safetensors", + "model.layers.14.self_attn.o_proj.scales": "model.safetensors", + "model.layers.14.self_attn.o_proj.weight": "model.safetensors", + "model.layers.14.self_attn.q_norm.weight": "model.safetensors", + "model.layers.14.self_attn.q_proj.biases": "model.safetensors", + "model.layers.14.self_attn.q_proj.scales": "model.safetensors", + "model.layers.14.self_attn.q_proj.weight": "model.safetensors", + "model.layers.14.self_attn.v_proj.biases": "model.safetensors", + "model.layers.14.self_attn.v_proj.scales": "model.safetensors", + "model.layers.14.self_attn.v_proj.weight": "model.safetensors", + "model.layers.15.input_layernorm.weight": "model.safetensors", + "model.layers.15.mlp.down_proj.biases": "model.safetensors", + "model.layers.15.mlp.down_proj.scales": "model.safetensors", + "model.layers.15.mlp.down_proj.weight": "model.safetensors", + "model.layers.15.mlp.gate_proj.biases": "model.safetensors", + "model.layers.15.mlp.gate_proj.scales": "model.safetensors", + "model.layers.15.mlp.gate_proj.weight": "model.safetensors", + "model.layers.15.mlp.up_proj.biases": "model.safetensors", + "model.layers.15.mlp.up_proj.scales": "model.safetensors", + "model.layers.15.mlp.up_proj.weight": "model.safetensors", + "model.layers.15.post_attention_layernorm.weight": "model.safetensors", + "model.layers.15.self_attn.k_norm.weight": "model.safetensors", + "model.layers.15.self_attn.k_proj.biases": "model.safetensors", + "model.layers.15.self_attn.k_proj.scales": "model.safetensors", + "model.layers.15.self_attn.k_proj.weight": "model.safetensors", + "model.layers.15.self_attn.o_proj.biases": "model.safetensors", + "model.layers.15.self_attn.o_proj.scales": "model.safetensors", + "model.layers.15.self_attn.o_proj.weight": "model.safetensors", + "model.layers.15.self_attn.q_norm.weight": "model.safetensors", + "model.layers.15.self_attn.q_proj.biases": "model.safetensors", + "model.layers.15.self_attn.q_proj.scales": "model.safetensors", + "model.layers.15.self_attn.q_proj.weight": "model.safetensors", + "model.layers.15.self_attn.v_proj.biases": "model.safetensors", + "model.layers.15.self_attn.v_proj.scales": "model.safetensors", + "model.layers.15.self_attn.v_proj.weight": "model.safetensors", + "model.layers.16.input_layernorm.weight": "model.safetensors", + "model.layers.16.mlp.down_proj.biases": "model.safetensors", + "model.layers.16.mlp.down_proj.scales": "model.safetensors", + "model.layers.16.mlp.down_proj.weight": "model.safetensors", + "model.layers.16.mlp.gate_proj.biases": "model.safetensors", + "model.layers.16.mlp.gate_proj.scales": "model.safetensors", + "model.layers.16.mlp.gate_proj.weight": "model.safetensors", + "model.layers.16.mlp.up_proj.biases": "model.safetensors", + "model.layers.16.mlp.up_proj.scales": "model.safetensors", + "model.layers.16.mlp.up_proj.weight": "model.safetensors", + "model.layers.16.post_attention_layernorm.weight": "model.safetensors", + "model.layers.16.self_attn.k_norm.weight": "model.safetensors", + "model.layers.16.self_attn.k_proj.biases": "model.safetensors", + "model.layers.16.self_attn.k_proj.scales": "model.safetensors", + "model.layers.16.self_attn.k_proj.weight": "model.safetensors", + "model.layers.16.self_attn.o_proj.biases": "model.safetensors", + "model.layers.16.self_attn.o_proj.scales": "model.safetensors", + "model.layers.16.self_attn.o_proj.weight": "model.safetensors", + "model.layers.16.self_attn.q_norm.weight": "model.safetensors", + "model.layers.16.self_attn.q_proj.biases": "model.safetensors", + "model.layers.16.self_attn.q_proj.scales": "model.safetensors", + "model.layers.16.self_attn.q_proj.weight": "model.safetensors", + "model.layers.16.self_attn.v_proj.biases": "model.safetensors", + "model.layers.16.self_attn.v_proj.scales": "model.safetensors", + "model.layers.16.self_attn.v_proj.weight": "model.safetensors", + "model.layers.17.input_layernorm.weight": "model.safetensors", + "model.layers.17.mlp.down_proj.biases": "model.safetensors", + "model.layers.17.mlp.down_proj.scales": "model.safetensors", + "model.layers.17.mlp.down_proj.weight": "model.safetensors", + "model.layers.17.mlp.gate_proj.biases": "model.safetensors", + "model.layers.17.mlp.gate_proj.scales": "model.safetensors", + "model.layers.17.mlp.gate_proj.weight": "model.safetensors", + "model.layers.17.mlp.up_proj.biases": "model.safetensors", + "model.layers.17.mlp.up_proj.scales": "model.safetensors", + "model.layers.17.mlp.up_proj.weight": "model.safetensors", + "model.layers.17.post_attention_layernorm.weight": "model.safetensors", + "model.layers.17.self_attn.k_norm.weight": "model.safetensors", + "model.layers.17.self_attn.k_proj.biases": "model.safetensors", + "model.layers.17.self_attn.k_proj.scales": "model.safetensors", + "model.layers.17.self_attn.k_proj.weight": "model.safetensors", + "model.layers.17.self_attn.o_proj.biases": "model.safetensors", + "model.layers.17.self_attn.o_proj.scales": "model.safetensors", + "model.layers.17.self_attn.o_proj.weight": "model.safetensors", + "model.layers.17.self_attn.q_norm.weight": "model.safetensors", + "model.layers.17.self_attn.q_proj.biases": "model.safetensors", + "model.layers.17.self_attn.q_proj.scales": "model.safetensors", + "model.layers.17.self_attn.q_proj.weight": "model.safetensors", + "model.layers.17.self_attn.v_proj.biases": "model.safetensors", + "model.layers.17.self_attn.v_proj.scales": "model.safetensors", + "model.layers.17.self_attn.v_proj.weight": "model.safetensors", + "model.layers.18.input_layernorm.weight": "model.safetensors", + "model.layers.18.mlp.down_proj.biases": "model.safetensors", + "model.layers.18.mlp.down_proj.scales": "model.safetensors", + "model.layers.18.mlp.down_proj.weight": "model.safetensors", + "model.layers.18.mlp.gate_proj.biases": "model.safetensors", + "model.layers.18.mlp.gate_proj.scales": "model.safetensors", + "model.layers.18.mlp.gate_proj.weight": "model.safetensors", + "model.layers.18.mlp.up_proj.biases": "model.safetensors", + "model.layers.18.mlp.up_proj.scales": "model.safetensors", + "model.layers.18.mlp.up_proj.weight": "model.safetensors", + "model.layers.18.post_attention_layernorm.weight": "model.safetensors", + "model.layers.18.self_attn.k_norm.weight": "model.safetensors", + "model.layers.18.self_attn.k_proj.biases": "model.safetensors", + "model.layers.18.self_attn.k_proj.scales": "model.safetensors", + "model.layers.18.self_attn.k_proj.weight": "model.safetensors", + "model.layers.18.self_attn.o_proj.biases": "model.safetensors", + "model.layers.18.self_attn.o_proj.scales": "model.safetensors", + "model.layers.18.self_attn.o_proj.weight": "model.safetensors", + "model.layers.18.self_attn.q_norm.weight": "model.safetensors", + "model.layers.18.self_attn.q_proj.biases": "model.safetensors", + "model.layers.18.self_attn.q_proj.scales": "model.safetensors", + "model.layers.18.self_attn.q_proj.weight": "model.safetensors", + "model.layers.18.self_attn.v_proj.biases": "model.safetensors", + "model.layers.18.self_attn.v_proj.scales": "model.safetensors", + "model.layers.18.self_attn.v_proj.weight": "model.safetensors", + "model.layers.19.input_layernorm.weight": "model.safetensors", + "model.layers.19.mlp.down_proj.biases": "model.safetensors", + "model.layers.19.mlp.down_proj.scales": "model.safetensors", + "model.layers.19.mlp.down_proj.weight": "model.safetensors", + "model.layers.19.mlp.gate_proj.biases": "model.safetensors", + "model.layers.19.mlp.gate_proj.scales": "model.safetensors", + "model.layers.19.mlp.gate_proj.weight": "model.safetensors", + "model.layers.19.mlp.up_proj.biases": "model.safetensors", + "model.layers.19.mlp.up_proj.scales": "model.safetensors", + "model.layers.19.mlp.up_proj.weight": "model.safetensors", + "model.layers.19.post_attention_layernorm.weight": "model.safetensors", + "model.layers.19.self_attn.k_norm.weight": "model.safetensors", + "model.layers.19.self_attn.k_proj.biases": "model.safetensors", + "model.layers.19.self_attn.k_proj.scales": "model.safetensors", + "model.layers.19.self_attn.k_proj.weight": "model.safetensors", + "model.layers.19.self_attn.o_proj.biases": "model.safetensors", + "model.layers.19.self_attn.o_proj.scales": "model.safetensors", + "model.layers.19.self_attn.o_proj.weight": "model.safetensors", + "model.layers.19.self_attn.q_norm.weight": "model.safetensors", + "model.layers.19.self_attn.q_proj.biases": "model.safetensors", + "model.layers.19.self_attn.q_proj.scales": "model.safetensors", + "model.layers.19.self_attn.q_proj.weight": "model.safetensors", + "model.layers.19.self_attn.v_proj.biases": "model.safetensors", + "model.layers.19.self_attn.v_proj.scales": "model.safetensors", + "model.layers.19.self_attn.v_proj.weight": "model.safetensors", + "model.layers.2.input_layernorm.weight": "model.safetensors", + "model.layers.2.mlp.down_proj.biases": "model.safetensors", + "model.layers.2.mlp.down_proj.scales": "model.safetensors", + "model.layers.2.mlp.down_proj.weight": "model.safetensors", + "model.layers.2.mlp.gate_proj.biases": "model.safetensors", + "model.layers.2.mlp.gate_proj.scales": "model.safetensors", + "model.layers.2.mlp.gate_proj.weight": "model.safetensors", + "model.layers.2.mlp.up_proj.biases": "model.safetensors", + "model.layers.2.mlp.up_proj.scales": "model.safetensors", + "model.layers.2.mlp.up_proj.weight": "model.safetensors", + "model.layers.2.post_attention_layernorm.weight": "model.safetensors", + "model.layers.2.self_attn.k_norm.weight": "model.safetensors", + "model.layers.2.self_attn.k_proj.biases": "model.safetensors", + "model.layers.2.self_attn.k_proj.scales": "model.safetensors", + "model.layers.2.self_attn.k_proj.weight": "model.safetensors", + "model.layers.2.self_attn.o_proj.biases": "model.safetensors", + "model.layers.2.self_attn.o_proj.scales": "model.safetensors", + "model.layers.2.self_attn.o_proj.weight": "model.safetensors", + "model.layers.2.self_attn.q_norm.weight": "model.safetensors", + "model.layers.2.self_attn.q_proj.biases": "model.safetensors", + "model.layers.2.self_attn.q_proj.scales": "model.safetensors", + "model.layers.2.self_attn.q_proj.weight": "model.safetensors", + "model.layers.2.self_attn.v_proj.biases": "model.safetensors", + "model.layers.2.self_attn.v_proj.scales": "model.safetensors", + "model.layers.2.self_attn.v_proj.weight": "model.safetensors", + "model.layers.20.input_layernorm.weight": "model.safetensors", + "model.layers.20.mlp.down_proj.biases": "model.safetensors", + "model.layers.20.mlp.down_proj.scales": "model.safetensors", + "model.layers.20.mlp.down_proj.weight": "model.safetensors", + "model.layers.20.mlp.gate_proj.biases": "model.safetensors", + "model.layers.20.mlp.gate_proj.scales": "model.safetensors", + "model.layers.20.mlp.gate_proj.weight": "model.safetensors", + "model.layers.20.mlp.up_proj.biases": "model.safetensors", + "model.layers.20.mlp.up_proj.scales": "model.safetensors", + "model.layers.20.mlp.up_proj.weight": "model.safetensors", + "model.layers.20.post_attention_layernorm.weight": "model.safetensors", + "model.layers.20.self_attn.k_norm.weight": "model.safetensors", + "model.layers.20.self_attn.k_proj.biases": "model.safetensors", + "model.layers.20.self_attn.k_proj.scales": "model.safetensors", + "model.layers.20.self_attn.k_proj.weight": "model.safetensors", + "model.layers.20.self_attn.o_proj.biases": "model.safetensors", + "model.layers.20.self_attn.o_proj.scales": "model.safetensors", + "model.layers.20.self_attn.o_proj.weight": "model.safetensors", + "model.layers.20.self_attn.q_norm.weight": "model.safetensors", + "model.layers.20.self_attn.q_proj.biases": "model.safetensors", + "model.layers.20.self_attn.q_proj.scales": "model.safetensors", + "model.layers.20.self_attn.q_proj.weight": "model.safetensors", + "model.layers.20.self_attn.v_proj.biases": "model.safetensors", + "model.layers.20.self_attn.v_proj.scales": "model.safetensors", + "model.layers.20.self_attn.v_proj.weight": "model.safetensors", + "model.layers.21.input_layernorm.weight": "model.safetensors", + "model.layers.21.mlp.down_proj.biases": "model.safetensors", + "model.layers.21.mlp.down_proj.scales": "model.safetensors", + "model.layers.21.mlp.down_proj.weight": "model.safetensors", + "model.layers.21.mlp.gate_proj.biases": "model.safetensors", + "model.layers.21.mlp.gate_proj.scales": "model.safetensors", + "model.layers.21.mlp.gate_proj.weight": "model.safetensors", + "model.layers.21.mlp.up_proj.biases": "model.safetensors", + "model.layers.21.mlp.up_proj.scales": "model.safetensors", + "model.layers.21.mlp.up_proj.weight": "model.safetensors", + "model.layers.21.post_attention_layernorm.weight": "model.safetensors", + "model.layers.21.self_attn.k_norm.weight": "model.safetensors", + "model.layers.21.self_attn.k_proj.biases": "model.safetensors", + "model.layers.21.self_attn.k_proj.scales": "model.safetensors", + "model.layers.21.self_attn.k_proj.weight": "model.safetensors", + "model.layers.21.self_attn.o_proj.biases": "model.safetensors", + "model.layers.21.self_attn.o_proj.scales": "model.safetensors", + "model.layers.21.self_attn.o_proj.weight": "model.safetensors", + "model.layers.21.self_attn.q_norm.weight": "model.safetensors", + "model.layers.21.self_attn.q_proj.biases": "model.safetensors", + "model.layers.21.self_attn.q_proj.scales": "model.safetensors", + "model.layers.21.self_attn.q_proj.weight": "model.safetensors", + "model.layers.21.self_attn.v_proj.biases": "model.safetensors", + "model.layers.21.self_attn.v_proj.scales": "model.safetensors", + "model.layers.21.self_attn.v_proj.weight": "model.safetensors", + "model.layers.22.input_layernorm.weight": "model.safetensors", + "model.layers.22.mlp.down_proj.biases": "model.safetensors", + "model.layers.22.mlp.down_proj.scales": "model.safetensors", + "model.layers.22.mlp.down_proj.weight": "model.safetensors", + "model.layers.22.mlp.gate_proj.biases": "model.safetensors", + "model.layers.22.mlp.gate_proj.scales": "model.safetensors", + "model.layers.22.mlp.gate_proj.weight": "model.safetensors", + "model.layers.22.mlp.up_proj.biases": "model.safetensors", + "model.layers.22.mlp.up_proj.scales": "model.safetensors", + "model.layers.22.mlp.up_proj.weight": "model.safetensors", + "model.layers.22.post_attention_layernorm.weight": "model.safetensors", + "model.layers.22.self_attn.k_norm.weight": "model.safetensors", + "model.layers.22.self_attn.k_proj.biases": "model.safetensors", + "model.layers.22.self_attn.k_proj.scales": "model.safetensors", + "model.layers.22.self_attn.k_proj.weight": "model.safetensors", + "model.layers.22.self_attn.o_proj.biases": "model.safetensors", + "model.layers.22.self_attn.o_proj.scales": "model.safetensors", + "model.layers.22.self_attn.o_proj.weight": "model.safetensors", + "model.layers.22.self_attn.q_norm.weight": "model.safetensors", + "model.layers.22.self_attn.q_proj.biases": "model.safetensors", + "model.layers.22.self_attn.q_proj.scales": "model.safetensors", + "model.layers.22.self_attn.q_proj.weight": "model.safetensors", + "model.layers.22.self_attn.v_proj.biases": "model.safetensors", + "model.layers.22.self_attn.v_proj.scales": "model.safetensors", + "model.layers.22.self_attn.v_proj.weight": "model.safetensors", + "model.layers.23.input_layernorm.weight": "model.safetensors", + "model.layers.23.mlp.down_proj.biases": "model.safetensors", + "model.layers.23.mlp.down_proj.scales": "model.safetensors", + "model.layers.23.mlp.down_proj.weight": "model.safetensors", + "model.layers.23.mlp.gate_proj.biases": "model.safetensors", + "model.layers.23.mlp.gate_proj.scales": "model.safetensors", + "model.layers.23.mlp.gate_proj.weight": "model.safetensors", + "model.layers.23.mlp.up_proj.biases": "model.safetensors", + "model.layers.23.mlp.up_proj.scales": "model.safetensors", + "model.layers.23.mlp.up_proj.weight": "model.safetensors", + "model.layers.23.post_attention_layernorm.weight": "model.safetensors", + "model.layers.23.self_attn.k_norm.weight": "model.safetensors", + "model.layers.23.self_attn.k_proj.biases": "model.safetensors", + "model.layers.23.self_attn.k_proj.scales": "model.safetensors", + "model.layers.23.self_attn.k_proj.weight": "model.safetensors", + "model.layers.23.self_attn.o_proj.biases": "model.safetensors", + "model.layers.23.self_attn.o_proj.scales": "model.safetensors", + "model.layers.23.self_attn.o_proj.weight": "model.safetensors", + "model.layers.23.self_attn.q_norm.weight": "model.safetensors", + "model.layers.23.self_attn.q_proj.biases": "model.safetensors", + "model.layers.23.self_attn.q_proj.scales": "model.safetensors", + "model.layers.23.self_attn.q_proj.weight": "model.safetensors", + "model.layers.23.self_attn.v_proj.biases": "model.safetensors", + "model.layers.23.self_attn.v_proj.scales": "model.safetensors", + "model.layers.23.self_attn.v_proj.weight": "model.safetensors", + "model.layers.24.input_layernorm.weight": "model.safetensors", + "model.layers.24.mlp.down_proj.biases": "model.safetensors", + "model.layers.24.mlp.down_proj.scales": "model.safetensors", + "model.layers.24.mlp.down_proj.weight": "model.safetensors", + "model.layers.24.mlp.gate_proj.biases": "model.safetensors", + "model.layers.24.mlp.gate_proj.scales": "model.safetensors", + "model.layers.24.mlp.gate_proj.weight": "model.safetensors", + "model.layers.24.mlp.up_proj.biases": "model.safetensors", + "model.layers.24.mlp.up_proj.scales": "model.safetensors", + "model.layers.24.mlp.up_proj.weight": "model.safetensors", + "model.layers.24.post_attention_layernorm.weight": "model.safetensors", + "model.layers.24.self_attn.k_norm.weight": "model.safetensors", + "model.layers.24.self_attn.k_proj.biases": "model.safetensors", + "model.layers.24.self_attn.k_proj.scales": "model.safetensors", + "model.layers.24.self_attn.k_proj.weight": "model.safetensors", + "model.layers.24.self_attn.o_proj.biases": "model.safetensors", + "model.layers.24.self_attn.o_proj.scales": "model.safetensors", + "model.layers.24.self_attn.o_proj.weight": "model.safetensors", + "model.layers.24.self_attn.q_norm.weight": "model.safetensors", + "model.layers.24.self_attn.q_proj.biases": "model.safetensors", + "model.layers.24.self_attn.q_proj.scales": "model.safetensors", + "model.layers.24.self_attn.q_proj.weight": "model.safetensors", + "model.layers.24.self_attn.v_proj.biases": "model.safetensors", + "model.layers.24.self_attn.v_proj.scales": "model.safetensors", + "model.layers.24.self_attn.v_proj.weight": "model.safetensors", + "model.layers.25.input_layernorm.weight": "model.safetensors", + "model.layers.25.mlp.down_proj.biases": "model.safetensors", + "model.layers.25.mlp.down_proj.scales": "model.safetensors", + "model.layers.25.mlp.down_proj.weight": "model.safetensors", + "model.layers.25.mlp.gate_proj.biases": "model.safetensors", + "model.layers.25.mlp.gate_proj.scales": "model.safetensors", + "model.layers.25.mlp.gate_proj.weight": "model.safetensors", + "model.layers.25.mlp.up_proj.biases": "model.safetensors", + "model.layers.25.mlp.up_proj.scales": "model.safetensors", + "model.layers.25.mlp.up_proj.weight": "model.safetensors", + "model.layers.25.post_attention_layernorm.weight": "model.safetensors", + "model.layers.25.self_attn.k_norm.weight": "model.safetensors", + "model.layers.25.self_attn.k_proj.biases": "model.safetensors", + "model.layers.25.self_attn.k_proj.scales": "model.safetensors", + "model.layers.25.self_attn.k_proj.weight": "model.safetensors", + "model.layers.25.self_attn.o_proj.biases": "model.safetensors", + "model.layers.25.self_attn.o_proj.scales": "model.safetensors", + "model.layers.25.self_attn.o_proj.weight": "model.safetensors", + "model.layers.25.self_attn.q_norm.weight": "model.safetensors", + "model.layers.25.self_attn.q_proj.biases": "model.safetensors", + "model.layers.25.self_attn.q_proj.scales": "model.safetensors", + "model.layers.25.self_attn.q_proj.weight": "model.safetensors", + "model.layers.25.self_attn.v_proj.biases": "model.safetensors", + "model.layers.25.self_attn.v_proj.scales": "model.safetensors", + "model.layers.25.self_attn.v_proj.weight": "model.safetensors", + "model.layers.26.input_layernorm.weight": "model.safetensors", + "model.layers.26.mlp.down_proj.biases": "model.safetensors", + "model.layers.26.mlp.down_proj.scales": "model.safetensors", + "model.layers.26.mlp.down_proj.weight": "model.safetensors", + "model.layers.26.mlp.gate_proj.biases": "model.safetensors", + "model.layers.26.mlp.gate_proj.scales": "model.safetensors", + "model.layers.26.mlp.gate_proj.weight": "model.safetensors", + "model.layers.26.mlp.up_proj.biases": "model.safetensors", + "model.layers.26.mlp.up_proj.scales": "model.safetensors", + "model.layers.26.mlp.up_proj.weight": "model.safetensors", + "model.layers.26.post_attention_layernorm.weight": "model.safetensors", + "model.layers.26.self_attn.k_norm.weight": "model.safetensors", + "model.layers.26.self_attn.k_proj.biases": "model.safetensors", + "model.layers.26.self_attn.k_proj.scales": "model.safetensors", + "model.layers.26.self_attn.k_proj.weight": "model.safetensors", + "model.layers.26.self_attn.o_proj.biases": "model.safetensors", + "model.layers.26.self_attn.o_proj.scales": "model.safetensors", + "model.layers.26.self_attn.o_proj.weight": "model.safetensors", + "model.layers.26.self_attn.q_norm.weight": "model.safetensors", + "model.layers.26.self_attn.q_proj.biases": "model.safetensors", + "model.layers.26.self_attn.q_proj.scales": "model.safetensors", + "model.layers.26.self_attn.q_proj.weight": "model.safetensors", + "model.layers.26.self_attn.v_proj.biases": "model.safetensors", + "model.layers.26.self_attn.v_proj.scales": "model.safetensors", + "model.layers.26.self_attn.v_proj.weight": "model.safetensors", + "model.layers.27.input_layernorm.weight": "model.safetensors", + "model.layers.27.mlp.down_proj.biases": "model.safetensors", + "model.layers.27.mlp.down_proj.scales": "model.safetensors", + "model.layers.27.mlp.down_proj.weight": "model.safetensors", + "model.layers.27.mlp.gate_proj.biases": "model.safetensors", + "model.layers.27.mlp.gate_proj.scales": "model.safetensors", + "model.layers.27.mlp.gate_proj.weight": "model.safetensors", + "model.layers.27.mlp.up_proj.biases": "model.safetensors", + "model.layers.27.mlp.up_proj.scales": "model.safetensors", + "model.layers.27.mlp.up_proj.weight": "model.safetensors", + "model.layers.27.post_attention_layernorm.weight": "model.safetensors", + "model.layers.27.self_attn.k_norm.weight": "model.safetensors", + "model.layers.27.self_attn.k_proj.biases": "model.safetensors", + "model.layers.27.self_attn.k_proj.scales": "model.safetensors", + "model.layers.27.self_attn.k_proj.weight": "model.safetensors", + "model.layers.27.self_attn.o_proj.biases": "model.safetensors", + "model.layers.27.self_attn.o_proj.scales": "model.safetensors", + "model.layers.27.self_attn.o_proj.weight": "model.safetensors", + "model.layers.27.self_attn.q_norm.weight": "model.safetensors", + "model.layers.27.self_attn.q_proj.biases": "model.safetensors", + "model.layers.27.self_attn.q_proj.scales": "model.safetensors", + "model.layers.27.self_attn.q_proj.weight": "model.safetensors", + "model.layers.27.self_attn.v_proj.biases": "model.safetensors", + "model.layers.27.self_attn.v_proj.scales": "model.safetensors", + "model.layers.27.self_attn.v_proj.weight": "model.safetensors", + "model.layers.28.input_layernorm.weight": "model.safetensors", + "model.layers.28.mlp.down_proj.biases": "model.safetensors", + "model.layers.28.mlp.down_proj.scales": "model.safetensors", + "model.layers.28.mlp.down_proj.weight": "model.safetensors", + "model.layers.28.mlp.gate_proj.biases": "model.safetensors", + "model.layers.28.mlp.gate_proj.scales": "model.safetensors", + "model.layers.28.mlp.gate_proj.weight": "model.safetensors", + "model.layers.28.mlp.up_proj.biases": "model.safetensors", + "model.layers.28.mlp.up_proj.scales": "model.safetensors", + "model.layers.28.mlp.up_proj.weight": "model.safetensors", + "model.layers.28.post_attention_layernorm.weight": "model.safetensors", + "model.layers.28.self_attn.k_norm.weight": "model.safetensors", + "model.layers.28.self_attn.k_proj.biases": "model.safetensors", + "model.layers.28.self_attn.k_proj.scales": "model.safetensors", + "model.layers.28.self_attn.k_proj.weight": "model.safetensors", + "model.layers.28.self_attn.o_proj.biases": "model.safetensors", + "model.layers.28.self_attn.o_proj.scales": "model.safetensors", + "model.layers.28.self_attn.o_proj.weight": "model.safetensors", + "model.layers.28.self_attn.q_norm.weight": "model.safetensors", + "model.layers.28.self_attn.q_proj.biases": "model.safetensors", + "model.layers.28.self_attn.q_proj.scales": "model.safetensors", + "model.layers.28.self_attn.q_proj.weight": "model.safetensors", + "model.layers.28.self_attn.v_proj.biases": "model.safetensors", + "model.layers.28.self_attn.v_proj.scales": "model.safetensors", + "model.layers.28.self_attn.v_proj.weight": "model.safetensors", + "model.layers.29.input_layernorm.weight": "model.safetensors", + "model.layers.29.mlp.down_proj.biases": "model.safetensors", + "model.layers.29.mlp.down_proj.scales": "model.safetensors", + "model.layers.29.mlp.down_proj.weight": "model.safetensors", + "model.layers.29.mlp.gate_proj.biases": "model.safetensors", + "model.layers.29.mlp.gate_proj.scales": "model.safetensors", + "model.layers.29.mlp.gate_proj.weight": "model.safetensors", + "model.layers.29.mlp.up_proj.biases": "model.safetensors", + "model.layers.29.mlp.up_proj.scales": "model.safetensors", + "model.layers.29.mlp.up_proj.weight": "model.safetensors", + "model.layers.29.post_attention_layernorm.weight": "model.safetensors", + "model.layers.29.self_attn.k_norm.weight": "model.safetensors", + "model.layers.29.self_attn.k_proj.biases": "model.safetensors", + "model.layers.29.self_attn.k_proj.scales": "model.safetensors", + "model.layers.29.self_attn.k_proj.weight": "model.safetensors", + "model.layers.29.self_attn.o_proj.biases": "model.safetensors", + "model.layers.29.self_attn.o_proj.scales": "model.safetensors", + "model.layers.29.self_attn.o_proj.weight": "model.safetensors", + "model.layers.29.self_attn.q_norm.weight": "model.safetensors", + "model.layers.29.self_attn.q_proj.biases": "model.safetensors", + "model.layers.29.self_attn.q_proj.scales": "model.safetensors", + "model.layers.29.self_attn.q_proj.weight": "model.safetensors", + "model.layers.29.self_attn.v_proj.biases": "model.safetensors", + "model.layers.29.self_attn.v_proj.scales": "model.safetensors", + "model.layers.29.self_attn.v_proj.weight": "model.safetensors", + "model.layers.3.input_layernorm.weight": "model.safetensors", + "model.layers.3.mlp.down_proj.biases": "model.safetensors", + "model.layers.3.mlp.down_proj.scales": "model.safetensors", + "model.layers.3.mlp.down_proj.weight": "model.safetensors", + "model.layers.3.mlp.gate_proj.biases": "model.safetensors", + "model.layers.3.mlp.gate_proj.scales": "model.safetensors", + "model.layers.3.mlp.gate_proj.weight": "model.safetensors", + "model.layers.3.mlp.up_proj.biases": "model.safetensors", + "model.layers.3.mlp.up_proj.scales": "model.safetensors", + "model.layers.3.mlp.up_proj.weight": "model.safetensors", + "model.layers.3.post_attention_layernorm.weight": "model.safetensors", + "model.layers.3.self_attn.k_norm.weight": "model.safetensors", + "model.layers.3.self_attn.k_proj.biases": "model.safetensors", + "model.layers.3.self_attn.k_proj.scales": "model.safetensors", + "model.layers.3.self_attn.k_proj.weight": "model.safetensors", + "model.layers.3.self_attn.o_proj.biases": "model.safetensors", + "model.layers.3.self_attn.o_proj.scales": "model.safetensors", + "model.layers.3.self_attn.o_proj.weight": "model.safetensors", + "model.layers.3.self_attn.q_norm.weight": "model.safetensors", + "model.layers.3.self_attn.q_proj.biases": "model.safetensors", + "model.layers.3.self_attn.q_proj.scales": "model.safetensors", + "model.layers.3.self_attn.q_proj.weight": "model.safetensors", + "model.layers.3.self_attn.v_proj.biases": "model.safetensors", + "model.layers.3.self_attn.v_proj.scales": "model.safetensors", + "model.layers.3.self_attn.v_proj.weight": "model.safetensors", + "model.layers.30.input_layernorm.weight": "model.safetensors", + "model.layers.30.mlp.down_proj.biases": "model.safetensors", + "model.layers.30.mlp.down_proj.scales": "model.safetensors", + "model.layers.30.mlp.down_proj.weight": "model.safetensors", + "model.layers.30.mlp.gate_proj.biases": "model.safetensors", + "model.layers.30.mlp.gate_proj.scales": "model.safetensors", + "model.layers.30.mlp.gate_proj.weight": "model.safetensors", + "model.layers.30.mlp.up_proj.biases": "model.safetensors", + "model.layers.30.mlp.up_proj.scales": "model.safetensors", + "model.layers.30.mlp.up_proj.weight": "model.safetensors", + "model.layers.30.post_attention_layernorm.weight": "model.safetensors", + "model.layers.30.self_attn.k_norm.weight": "model.safetensors", + "model.layers.30.self_attn.k_proj.biases": "model.safetensors", + "model.layers.30.self_attn.k_proj.scales": "model.safetensors", + "model.layers.30.self_attn.k_proj.weight": "model.safetensors", + "model.layers.30.self_attn.o_proj.biases": "model.safetensors", + "model.layers.30.self_attn.o_proj.scales": "model.safetensors", + "model.layers.30.self_attn.o_proj.weight": "model.safetensors", + "model.layers.30.self_attn.q_norm.weight": "model.safetensors", + "model.layers.30.self_attn.q_proj.biases": "model.safetensors", + "model.layers.30.self_attn.q_proj.scales": "model.safetensors", + "model.layers.30.self_attn.q_proj.weight": "model.safetensors", + "model.layers.30.self_attn.v_proj.biases": "model.safetensors", + "model.layers.30.self_attn.v_proj.scales": "model.safetensors", + "model.layers.30.self_attn.v_proj.weight": "model.safetensors", + "model.layers.31.input_layernorm.weight": "model.safetensors", + "model.layers.31.mlp.down_proj.biases": "model.safetensors", + "model.layers.31.mlp.down_proj.scales": "model.safetensors", + "model.layers.31.mlp.down_proj.weight": "model.safetensors", + "model.layers.31.mlp.gate_proj.biases": "model.safetensors", + "model.layers.31.mlp.gate_proj.scales": "model.safetensors", + "model.layers.31.mlp.gate_proj.weight": "model.safetensors", + "model.layers.31.mlp.up_proj.biases": "model.safetensors", + "model.layers.31.mlp.up_proj.scales": "model.safetensors", + "model.layers.31.mlp.up_proj.weight": "model.safetensors", + "model.layers.31.post_attention_layernorm.weight": "model.safetensors", + "model.layers.31.self_attn.k_norm.weight": "model.safetensors", + "model.layers.31.self_attn.k_proj.biases": "model.safetensors", + "model.layers.31.self_attn.k_proj.scales": "model.safetensors", + "model.layers.31.self_attn.k_proj.weight": "model.safetensors", + "model.layers.31.self_attn.o_proj.biases": "model.safetensors", + "model.layers.31.self_attn.o_proj.scales": "model.safetensors", + "model.layers.31.self_attn.o_proj.weight": "model.safetensors", + "model.layers.31.self_attn.q_norm.weight": "model.safetensors", + "model.layers.31.self_attn.q_proj.biases": "model.safetensors", + "model.layers.31.self_attn.q_proj.scales": "model.safetensors", + "model.layers.31.self_attn.q_proj.weight": "model.safetensors", + "model.layers.31.self_attn.v_proj.biases": "model.safetensors", + "model.layers.31.self_attn.v_proj.scales": "model.safetensors", + "model.layers.31.self_attn.v_proj.weight": "model.safetensors", + "model.layers.32.input_layernorm.weight": "model.safetensors", + "model.layers.32.mlp.down_proj.biases": "model.safetensors", + "model.layers.32.mlp.down_proj.scales": "model.safetensors", + "model.layers.32.mlp.down_proj.weight": "model.safetensors", + "model.layers.32.mlp.gate_proj.biases": "model.safetensors", + "model.layers.32.mlp.gate_proj.scales": "model.safetensors", + "model.layers.32.mlp.gate_proj.weight": "model.safetensors", + "model.layers.32.mlp.up_proj.biases": "model.safetensors", + "model.layers.32.mlp.up_proj.scales": "model.safetensors", + "model.layers.32.mlp.up_proj.weight": "model.safetensors", + "model.layers.32.post_attention_layernorm.weight": "model.safetensors", + "model.layers.32.self_attn.k_norm.weight": "model.safetensors", + "model.layers.32.self_attn.k_proj.biases": "model.safetensors", + "model.layers.32.self_attn.k_proj.scales": "model.safetensors", + "model.layers.32.self_attn.k_proj.weight": "model.safetensors", + "model.layers.32.self_attn.o_proj.biases": "model.safetensors", + "model.layers.32.self_attn.o_proj.scales": "model.safetensors", + "model.layers.32.self_attn.o_proj.weight": "model.safetensors", + "model.layers.32.self_attn.q_norm.weight": "model.safetensors", + "model.layers.32.self_attn.q_proj.biases": "model.safetensors", + "model.layers.32.self_attn.q_proj.scales": "model.safetensors", + "model.layers.32.self_attn.q_proj.weight": "model.safetensors", + "model.layers.32.self_attn.v_proj.biases": "model.safetensors", + "model.layers.32.self_attn.v_proj.scales": "model.safetensors", + "model.layers.32.self_attn.v_proj.weight": "model.safetensors", + "model.layers.33.input_layernorm.weight": "model.safetensors", + "model.layers.33.mlp.down_proj.biases": "model.safetensors", + "model.layers.33.mlp.down_proj.scales": "model.safetensors", + "model.layers.33.mlp.down_proj.weight": "model.safetensors", + "model.layers.33.mlp.gate_proj.biases": "model.safetensors", + "model.layers.33.mlp.gate_proj.scales": "model.safetensors", + "model.layers.33.mlp.gate_proj.weight": "model.safetensors", + "model.layers.33.mlp.up_proj.biases": "model.safetensors", + "model.layers.33.mlp.up_proj.scales": "model.safetensors", + "model.layers.33.mlp.up_proj.weight": "model.safetensors", + "model.layers.33.post_attention_layernorm.weight": "model.safetensors", + "model.layers.33.self_attn.k_norm.weight": "model.safetensors", + "model.layers.33.self_attn.k_proj.biases": "model.safetensors", + "model.layers.33.self_attn.k_proj.scales": "model.safetensors", + "model.layers.33.self_attn.k_proj.weight": "model.safetensors", + "model.layers.33.self_attn.o_proj.biases": "model.safetensors", + "model.layers.33.self_attn.o_proj.scales": "model.safetensors", + "model.layers.33.self_attn.o_proj.weight": "model.safetensors", + "model.layers.33.self_attn.q_norm.weight": "model.safetensors", + "model.layers.33.self_attn.q_proj.biases": "model.safetensors", + "model.layers.33.self_attn.q_proj.scales": "model.safetensors", + "model.layers.33.self_attn.q_proj.weight": "model.safetensors", + "model.layers.33.self_attn.v_proj.biases": "model.safetensors", + "model.layers.33.self_attn.v_proj.scales": "model.safetensors", + "model.layers.33.self_attn.v_proj.weight": "model.safetensors", + "model.layers.34.input_layernorm.weight": "model.safetensors", + "model.layers.34.mlp.down_proj.biases": "model.safetensors", + "model.layers.34.mlp.down_proj.scales": "model.safetensors", + "model.layers.34.mlp.down_proj.weight": "model.safetensors", + "model.layers.34.mlp.gate_proj.biases": "model.safetensors", + "model.layers.34.mlp.gate_proj.scales": "model.safetensors", + "model.layers.34.mlp.gate_proj.weight": "model.safetensors", + "model.layers.34.mlp.up_proj.biases": "model.safetensors", + "model.layers.34.mlp.up_proj.scales": "model.safetensors", + "model.layers.34.mlp.up_proj.weight": "model.safetensors", + "model.layers.34.post_attention_layernorm.weight": "model.safetensors", + "model.layers.34.self_attn.k_norm.weight": "model.safetensors", + "model.layers.34.self_attn.k_proj.biases": "model.safetensors", + "model.layers.34.self_attn.k_proj.scales": "model.safetensors", + "model.layers.34.self_attn.k_proj.weight": "model.safetensors", + "model.layers.34.self_attn.o_proj.biases": "model.safetensors", + "model.layers.34.self_attn.o_proj.scales": "model.safetensors", + "model.layers.34.self_attn.o_proj.weight": "model.safetensors", + "model.layers.34.self_attn.q_norm.weight": "model.safetensors", + "model.layers.34.self_attn.q_proj.biases": "model.safetensors", + "model.layers.34.self_attn.q_proj.scales": "model.safetensors", + "model.layers.34.self_attn.q_proj.weight": "model.safetensors", + "model.layers.34.self_attn.v_proj.biases": "model.safetensors", + "model.layers.34.self_attn.v_proj.scales": "model.safetensors", + "model.layers.34.self_attn.v_proj.weight": "model.safetensors", + "model.layers.35.input_layernorm.weight": "model.safetensors", + "model.layers.35.mlp.down_proj.biases": "model.safetensors", + "model.layers.35.mlp.down_proj.scales": "model.safetensors", + "model.layers.35.mlp.down_proj.weight": "model.safetensors", + "model.layers.35.mlp.gate_proj.biases": "model.safetensors", + "model.layers.35.mlp.gate_proj.scales": "model.safetensors", + "model.layers.35.mlp.gate_proj.weight": "model.safetensors", + "model.layers.35.mlp.up_proj.biases": "model.safetensors", + "model.layers.35.mlp.up_proj.scales": "model.safetensors", + "model.layers.35.mlp.up_proj.weight": "model.safetensors", + "model.layers.35.post_attention_layernorm.weight": "model.safetensors", + "model.layers.35.self_attn.k_norm.weight": "model.safetensors", + "model.layers.35.self_attn.k_proj.biases": "model.safetensors", + "model.layers.35.self_attn.k_proj.scales": "model.safetensors", + "model.layers.35.self_attn.k_proj.weight": "model.safetensors", + "model.layers.35.self_attn.o_proj.biases": "model.safetensors", + "model.layers.35.self_attn.o_proj.scales": "model.safetensors", + "model.layers.35.self_attn.o_proj.weight": "model.safetensors", + "model.layers.35.self_attn.q_norm.weight": "model.safetensors", + "model.layers.35.self_attn.q_proj.biases": "model.safetensors", + "model.layers.35.self_attn.q_proj.scales": "model.safetensors", + "model.layers.35.self_attn.q_proj.weight": "model.safetensors", + "model.layers.35.self_attn.v_proj.biases": "model.safetensors", + "model.layers.35.self_attn.v_proj.scales": "model.safetensors", + "model.layers.35.self_attn.v_proj.weight": "model.safetensors", + "model.layers.4.input_layernorm.weight": "model.safetensors", + "model.layers.4.mlp.down_proj.biases": "model.safetensors", + "model.layers.4.mlp.down_proj.scales": "model.safetensors", + "model.layers.4.mlp.down_proj.weight": "model.safetensors", + "model.layers.4.mlp.gate_proj.biases": "model.safetensors", + "model.layers.4.mlp.gate_proj.scales": "model.safetensors", + "model.layers.4.mlp.gate_proj.weight": "model.safetensors", + "model.layers.4.mlp.up_proj.biases": "model.safetensors", + "model.layers.4.mlp.up_proj.scales": "model.safetensors", + "model.layers.4.mlp.up_proj.weight": "model.safetensors", + "model.layers.4.post_attention_layernorm.weight": "model.safetensors", + "model.layers.4.self_attn.k_norm.weight": "model.safetensors", + "model.layers.4.self_attn.k_proj.biases": "model.safetensors", + "model.layers.4.self_attn.k_proj.scales": "model.safetensors", + "model.layers.4.self_attn.k_proj.weight": "model.safetensors", + "model.layers.4.self_attn.o_proj.biases": "model.safetensors", + "model.layers.4.self_attn.o_proj.scales": "model.safetensors", + "model.layers.4.self_attn.o_proj.weight": "model.safetensors", + "model.layers.4.self_attn.q_norm.weight": "model.safetensors", + "model.layers.4.self_attn.q_proj.biases": "model.safetensors", + "model.layers.4.self_attn.q_proj.scales": "model.safetensors", + "model.layers.4.self_attn.q_proj.weight": "model.safetensors", + "model.layers.4.self_attn.v_proj.biases": "model.safetensors", + "model.layers.4.self_attn.v_proj.scales": "model.safetensors", + "model.layers.4.self_attn.v_proj.weight": "model.safetensors", + "model.layers.5.input_layernorm.weight": "model.safetensors", + "model.layers.5.mlp.down_proj.biases": "model.safetensors", + "model.layers.5.mlp.down_proj.scales": "model.safetensors", + "model.layers.5.mlp.down_proj.weight": "model.safetensors", + "model.layers.5.mlp.gate_proj.biases": "model.safetensors", + "model.layers.5.mlp.gate_proj.scales": "model.safetensors", + "model.layers.5.mlp.gate_proj.weight": "model.safetensors", + "model.layers.5.mlp.up_proj.biases": "model.safetensors", + "model.layers.5.mlp.up_proj.scales": "model.safetensors", + "model.layers.5.mlp.up_proj.weight": "model.safetensors", + "model.layers.5.post_attention_layernorm.weight": "model.safetensors", + "model.layers.5.self_attn.k_norm.weight": "model.safetensors", + "model.layers.5.self_attn.k_proj.biases": "model.safetensors", + "model.layers.5.self_attn.k_proj.scales": "model.safetensors", + "model.layers.5.self_attn.k_proj.weight": "model.safetensors", + "model.layers.5.self_attn.o_proj.biases": "model.safetensors", + "model.layers.5.self_attn.o_proj.scales": "model.safetensors", + "model.layers.5.self_attn.o_proj.weight": "model.safetensors", + "model.layers.5.self_attn.q_norm.weight": "model.safetensors", + "model.layers.5.self_attn.q_proj.biases": "model.safetensors", + "model.layers.5.self_attn.q_proj.scales": "model.safetensors", + "model.layers.5.self_attn.q_proj.weight": "model.safetensors", + "model.layers.5.self_attn.v_proj.biases": "model.safetensors", + "model.layers.5.self_attn.v_proj.scales": "model.safetensors", + "model.layers.5.self_attn.v_proj.weight": "model.safetensors", + "model.layers.6.input_layernorm.weight": "model.safetensors", + "model.layers.6.mlp.down_proj.biases": "model.safetensors", + "model.layers.6.mlp.down_proj.scales": "model.safetensors", + "model.layers.6.mlp.down_proj.weight": "model.safetensors", + "model.layers.6.mlp.gate_proj.biases": "model.safetensors", + "model.layers.6.mlp.gate_proj.scales": "model.safetensors", + "model.layers.6.mlp.gate_proj.weight": "model.safetensors", + "model.layers.6.mlp.up_proj.biases": "model.safetensors", + "model.layers.6.mlp.up_proj.scales": "model.safetensors", + "model.layers.6.mlp.up_proj.weight": "model.safetensors", + "model.layers.6.post_attention_layernorm.weight": "model.safetensors", + "model.layers.6.self_attn.k_norm.weight": "model.safetensors", + "model.layers.6.self_attn.k_proj.biases": "model.safetensors", + "model.layers.6.self_attn.k_proj.scales": "model.safetensors", + "model.layers.6.self_attn.k_proj.weight": "model.safetensors", + "model.layers.6.self_attn.o_proj.biases": "model.safetensors", + "model.layers.6.self_attn.o_proj.scales": "model.safetensors", + "model.layers.6.self_attn.o_proj.weight": "model.safetensors", + "model.layers.6.self_attn.q_norm.weight": "model.safetensors", + "model.layers.6.self_attn.q_proj.biases": "model.safetensors", + "model.layers.6.self_attn.q_proj.scales": "model.safetensors", + "model.layers.6.self_attn.q_proj.weight": "model.safetensors", + "model.layers.6.self_attn.v_proj.biases": "model.safetensors", + "model.layers.6.self_attn.v_proj.scales": "model.safetensors", + "model.layers.6.self_attn.v_proj.weight": "model.safetensors", + "model.layers.7.input_layernorm.weight": "model.safetensors", + "model.layers.7.mlp.down_proj.biases": "model.safetensors", + "model.layers.7.mlp.down_proj.scales": "model.safetensors", + "model.layers.7.mlp.down_proj.weight": "model.safetensors", + "model.layers.7.mlp.gate_proj.biases": "model.safetensors", + "model.layers.7.mlp.gate_proj.scales": "model.safetensors", + "model.layers.7.mlp.gate_proj.weight": "model.safetensors", + "model.layers.7.mlp.up_proj.biases": "model.safetensors", + "model.layers.7.mlp.up_proj.scales": "model.safetensors", + "model.layers.7.mlp.up_proj.weight": "model.safetensors", + "model.layers.7.post_attention_layernorm.weight": "model.safetensors", + "model.layers.7.self_attn.k_norm.weight": "model.safetensors", + "model.layers.7.self_attn.k_proj.biases": "model.safetensors", + "model.layers.7.self_attn.k_proj.scales": "model.safetensors", + "model.layers.7.self_attn.k_proj.weight": "model.safetensors", + "model.layers.7.self_attn.o_proj.biases": "model.safetensors", + "model.layers.7.self_attn.o_proj.scales": "model.safetensors", + "model.layers.7.self_attn.o_proj.weight": "model.safetensors", + "model.layers.7.self_attn.q_norm.weight": "model.safetensors", + "model.layers.7.self_attn.q_proj.biases": "model.safetensors", + "model.layers.7.self_attn.q_proj.scales": "model.safetensors", + "model.layers.7.self_attn.q_proj.weight": "model.safetensors", + "model.layers.7.self_attn.v_proj.biases": "model.safetensors", + "model.layers.7.self_attn.v_proj.scales": "model.safetensors", + "model.layers.7.self_attn.v_proj.weight": "model.safetensors", + "model.layers.8.input_layernorm.weight": "model.safetensors", + "model.layers.8.mlp.down_proj.biases": "model.safetensors", + "model.layers.8.mlp.down_proj.scales": "model.safetensors", + "model.layers.8.mlp.down_proj.weight": "model.safetensors", + "model.layers.8.mlp.gate_proj.biases": "model.safetensors", + "model.layers.8.mlp.gate_proj.scales": "model.safetensors", + "model.layers.8.mlp.gate_proj.weight": "model.safetensors", + "model.layers.8.mlp.up_proj.biases": "model.safetensors", + "model.layers.8.mlp.up_proj.scales": "model.safetensors", + "model.layers.8.mlp.up_proj.weight": "model.safetensors", + "model.layers.8.post_attention_layernorm.weight": "model.safetensors", + "model.layers.8.self_attn.k_norm.weight": "model.safetensors", + "model.layers.8.self_attn.k_proj.biases": "model.safetensors", + "model.layers.8.self_attn.k_proj.scales": "model.safetensors", + "model.layers.8.self_attn.k_proj.weight": "model.safetensors", + "model.layers.8.self_attn.o_proj.biases": "model.safetensors", + "model.layers.8.self_attn.o_proj.scales": "model.safetensors", + "model.layers.8.self_attn.o_proj.weight": "model.safetensors", + "model.layers.8.self_attn.q_norm.weight": "model.safetensors", + "model.layers.8.self_attn.q_proj.biases": "model.safetensors", + "model.layers.8.self_attn.q_proj.scales": "model.safetensors", + "model.layers.8.self_attn.q_proj.weight": "model.safetensors", + "model.layers.8.self_attn.v_proj.biases": "model.safetensors", + "model.layers.8.self_attn.v_proj.scales": "model.safetensors", + "model.layers.8.self_attn.v_proj.weight": "model.safetensors", + "model.layers.9.input_layernorm.weight": "model.safetensors", + "model.layers.9.mlp.down_proj.biases": "model.safetensors", + "model.layers.9.mlp.down_proj.scales": "model.safetensors", + "model.layers.9.mlp.down_proj.weight": "model.safetensors", + "model.layers.9.mlp.gate_proj.biases": "model.safetensors", + "model.layers.9.mlp.gate_proj.scales": "model.safetensors", + "model.layers.9.mlp.gate_proj.weight": "model.safetensors", + "model.layers.9.mlp.up_proj.biases": "model.safetensors", + "model.layers.9.mlp.up_proj.scales": "model.safetensors", + "model.layers.9.mlp.up_proj.weight": "model.safetensors", + "model.layers.9.post_attention_layernorm.weight": "model.safetensors", + "model.layers.9.self_attn.k_norm.weight": "model.safetensors", + "model.layers.9.self_attn.k_proj.biases": "model.safetensors", + "model.layers.9.self_attn.k_proj.scales": "model.safetensors", + "model.layers.9.self_attn.k_proj.weight": "model.safetensors", + "model.layers.9.self_attn.o_proj.biases": "model.safetensors", + "model.layers.9.self_attn.o_proj.scales": "model.safetensors", + "model.layers.9.self_attn.o_proj.weight": "model.safetensors", + "model.layers.9.self_attn.q_norm.weight": "model.safetensors", + "model.layers.9.self_attn.q_proj.biases": "model.safetensors", + "model.layers.9.self_attn.q_proj.scales": "model.safetensors", + "model.layers.9.self_attn.q_proj.weight": "model.safetensors", + "model.layers.9.self_attn.v_proj.biases": "model.safetensors", + "model.layers.9.self_attn.v_proj.scales": "model.safetensors", + "model.layers.9.self_attn.v_proj.weight": "model.safetensors", + "model.norm.weight": "model.safetensors" + } +} \ No newline at end of file diff --git a/image/mlx/prism-ml/bonsai-image-ternary-4B-mlx-2bit/text_encoder-mlx-4bit/special_tokens_map.json b/image/mlx/prism-ml/bonsai-image-ternary-4B-mlx-2bit/text_encoder-mlx-4bit/special_tokens_map.json new file mode 100644 index 0000000..ac23c0a --- /dev/null +++ b/image/mlx/prism-ml/bonsai-image-ternary-4B-mlx-2bit/text_encoder-mlx-4bit/special_tokens_map.json @@ -0,0 +1,31 @@ +{ + "additional_special_tokens": [ + "<|im_start|>", + "<|im_end|>", + "<|object_ref_start|>", + "<|object_ref_end|>", + "<|box_start|>", + "<|box_end|>", + "<|quad_start|>", + "<|quad_end|>", + "<|vision_start|>", + "<|vision_end|>", + "<|vision_pad|>", + "<|image_pad|>", + "<|video_pad|>" + ], + "eos_token": { + "content": "<|im_end|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false + }, + "pad_token": { + "content": "<|endoftext|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false + } +} diff --git a/image/mlx/prism-ml/bonsai-image-ternary-4B-mlx-2bit/text_encoder-mlx-4bit/tokenizer.json b/image/mlx/prism-ml/bonsai-image-ternary-4B-mlx-2bit/text_encoder-mlx-4bit/tokenizer.json new file mode 100644 index 0000000..cd71f61 --- /dev/null +++ b/image/mlx/prism-ml/bonsai-image-ternary-4B-mlx-2bit/text_encoder-mlx-4bit/tokenizer.json @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:aeb13307a71acd8fe81861d94ad54ab689df773318809eed3cbe794b4492dae4 +size 11422654 diff --git a/image/mlx/prism-ml/bonsai-image-ternary-4B-mlx-2bit/text_encoder-mlx-4bit/tokenizer_config.json b/image/mlx/prism-ml/bonsai-image-ternary-4B-mlx-2bit/text_encoder-mlx-4bit/tokenizer_config.json new file mode 100644 index 0000000..7345216 --- /dev/null +++ b/image/mlx/prism-ml/bonsai-image-ternary-4B-mlx-2bit/text_encoder-mlx-4bit/tokenizer_config.json @@ -0,0 +1,240 @@ +{ + "add_bos_token": false, + "add_prefix_space": false, + "added_tokens_decoder": { + "151643": { + "content": "<|endoftext|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "151644": { + "content": "<|im_start|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "151645": { + "content": "<|im_end|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "151646": { + "content": "<|object_ref_start|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "151647": { + "content": "<|object_ref_end|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "151648": { + "content": "<|box_start|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "151649": { + "content": "<|box_end|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "151650": { + "content": "<|quad_start|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "151651": { + "content": "<|quad_end|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "151652": { + "content": "<|vision_start|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "151653": { + "content": "<|vision_end|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "151654": { + "content": "<|vision_pad|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "151655": { + "content": "<|image_pad|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "151656": { + "content": "<|video_pad|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "151657": { + "content": "", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": false + }, + "151658": { + "content": "", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": false + }, + "151659": { + "content": "<|fim_prefix|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": false + }, + "151660": { + "content": "<|fim_middle|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": false + }, + "151661": { + "content": "<|fim_suffix|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": false + }, + "151662": { + "content": "<|fim_pad|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": false + }, + "151663": { + "content": "<|repo_name|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": false + }, + "151664": { + "content": "<|file_sep|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": false + }, + "151665": { + "content": "", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": false + }, + "151666": { + "content": "", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": false + }, + "151667": { + "content": "", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": false + }, + "151668": { + "content": "", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": false + } + }, + "additional_special_tokens": [ + "<|im_start|>", + "<|im_end|>", + "<|object_ref_start|>", + "<|object_ref_end|>", + "<|box_start|>", + "<|box_end|>", + "<|quad_start|>", + "<|quad_end|>", + "<|vision_start|>", + "<|vision_end|>", + "<|vision_pad|>", + "<|image_pad|>", + "<|video_pad|>" + ], + "bos_token": null, + "chat_template": "{%- if tools %}\n {{- '<|im_start|>system\\n' }}\n {%- if messages[0].role == 'system' %}\n {{- messages[0].content + '\\n\\n' }}\n {%- endif %}\n {{- \"# Tools\\n\\nYou may call one or more functions to assist with the user query.\\n\\nYou are provided with function signatures within XML tags:\\n\" }}\n {%- for tool in tools %}\n {{- \"\\n\" }}\n {{- tool | tojson }}\n {%- endfor %}\n {{- \"\\n\\n\\nFor each function call, return a json object with function name and arguments within XML tags:\\n\\n{\\\"name\\\": , \\\"arguments\\\": }\\n<|im_end|>\\n\" }}\n{%- else %}\n {%- if messages[0].role == 'system' %}\n {{- '<|im_start|>system\\n' + messages[0].content + '<|im_end|>\\n' }}\n {%- endif %}\n{%- endif %}\n{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %}\n{%- for message in messages[::-1] %}\n {%- set index = (messages|length - 1) - loop.index0 %}\n {%- if ns.multi_step_tool and message.role == \"user\" and not(message.content.startswith('') and message.content.endswith('')) %}\n {%- set ns.multi_step_tool = false %}\n {%- set ns.last_query_index = index %}\n {%- endif %}\n{%- endfor %}\n{%- for message in messages %}\n {%- if (message.role == \"user\") or (message.role == \"system\" and not loop.first) %}\n {{- '<|im_start|>' + message.role + '\\n' + message.content + '<|im_end|>' + '\\n' }}\n {%- elif message.role == \"assistant\" %}\n {%- set content = message.content %}\n {%- set reasoning_content = '' %}\n {%- if message.reasoning_content is defined and message.reasoning_content is not none %}\n {%- set reasoning_content = message.reasoning_content %}\n {%- else %}\n {%- if '' in message.content %}\n {%- set content = message.content.split('')[-1].lstrip('\\n') %}\n {%- set reasoning_content = message.content.split('')[0].rstrip('\\n').split('')[-1].lstrip('\\n') %}\n {%- endif %}\n {%- endif %}\n {%- if loop.index0 > ns.last_query_index %}\n {%- if loop.last or (not loop.last and reasoning_content) %}\n {{- '<|im_start|>' + message.role + '\\n\\n' + reasoning_content.strip('\\n') + '\\n\\n\\n' + content.lstrip('\\n') }}\n {%- else %}\n {{- '<|im_start|>' + message.role + '\\n' + content }}\n {%- endif %}\n {%- else %}\n {{- '<|im_start|>' + message.role + '\\n' + content }}\n {%- endif %}\n {%- if message.tool_calls %}\n {%- for tool_call in message.tool_calls %}\n {%- if (loop.first and content) or (not loop.first) %}\n {{- '\\n' }}\n {%- endif %}\n {%- if tool_call.function %}\n {%- set tool_call = tool_call.function %}\n {%- endif %}\n {{- '\\n{\"name\": \"' }}\n {{- tool_call.name }}\n {{- '\", \"arguments\": ' }}\n {%- if tool_call.arguments is string %}\n {{- tool_call.arguments }}\n {%- else %}\n {{- tool_call.arguments | tojson }}\n {%- endif %}\n {{- '}\\n' }}\n {%- endfor %}\n {%- endif %}\n {{- '<|im_end|>\\n' }}\n {%- elif message.role == \"tool\" %}\n {%- if loop.first or (messages[loop.index0 - 1].role != \"tool\") %}\n {{- '<|im_start|>user' }}\n {%- endif %}\n {{- '\\n\\n' }}\n {{- message.content }}\n {{- '\\n' }}\n {%- if loop.last or (messages[loop.index0 + 1].role != \"tool\") %}\n {{- '<|im_end|>\\n' }}\n {%- endif %}\n {%- endif %}\n{%- endfor %}\n{%- if add_generation_prompt %}\n {{- '<|im_start|>assistant\\n' }}\n {%- if enable_thinking is defined and enable_thinking is false %}\n {{- '\\n\\n\\n\\n' }}\n {%- endif %}\n{%- endif %}", + "clean_up_tokenization_spaces": false, + "eos_token": "<|im_end|>", + "errors": "replace", + "extra_special_tokens": {}, + "model_max_length": 131072, + "pad_token": "<|endoftext|>", + "split_special_tokens": false, + "tokenizer_class": "Qwen2Tokenizer", + "unk_token": null +} diff --git a/image/mlx/prism-ml/bonsai-image-ternary-4B-mlx-2bit/text_encoder-mlx-4bit/vocab.json b/image/mlx/prism-ml/bonsai-image-ternary-4B-mlx-2bit/text_encoder-mlx-4bit/vocab.json new file mode 100644 index 0000000..6c49fc6 --- /dev/null +++ b/image/mlx/prism-ml/bonsai-image-ternary-4B-mlx-2bit/text_encoder-mlx-4bit/vocab.json @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:ca10d7e9fb3ed18575dd1e277a2579c16d108e32f27439684afa0e10b1440910 +size 2776833 diff --git a/image/mlx/prism-ml/bonsai-image-ternary-4B-mlx-2bit/tokenizer/added_tokens.json b/image/mlx/prism-ml/bonsai-image-ternary-4B-mlx-2bit/tokenizer/added_tokens.json new file mode 100644 index 0000000..b54f913 --- /dev/null +++ b/image/mlx/prism-ml/bonsai-image-ternary-4B-mlx-2bit/tokenizer/added_tokens.json @@ -0,0 +1,28 @@ +{ + "": 151668, + "
": 151658, + "": 151666, + "": 151667, + "": 151657, + "": 151665, + "<|box_end|>": 151649, + "<|box_start|>": 151648, + "<|endoftext|>": 151643, + "<|file_sep|>": 151664, + "<|fim_middle|>": 151660, + "<|fim_pad|>": 151662, + "<|fim_prefix|>": 151659, + "<|fim_suffix|>": 151661, + "<|im_end|>": 151645, + "<|im_start|>": 151644, + "<|image_pad|>": 151655, + "<|object_ref_end|>": 151647, + "<|object_ref_start|>": 151646, + "<|quad_end|>": 151651, + "<|quad_start|>": 151650, + "<|repo_name|>": 151663, + "<|video_pad|>": 151656, + "<|vision_end|>": 151653, + "<|vision_pad|>": 151654, + "<|vision_start|>": 151652 +} diff --git a/image/mlx/prism-ml/bonsai-image-ternary-4B-mlx-2bit/tokenizer/chat_template.jinja b/image/mlx/prism-ml/bonsai-image-ternary-4B-mlx-2bit/tokenizer/chat_template.jinja new file mode 100644 index 0000000..01be9b3 --- /dev/null +++ b/image/mlx/prism-ml/bonsai-image-ternary-4B-mlx-2bit/tokenizer/chat_template.jinja @@ -0,0 +1,89 @@ +{%- if tools %} + {{- '<|im_start|>system\n' }} + {%- if messages[0].role == 'system' %} + {{- messages[0].content + '\n\n' }} + {%- endif %} + {{- "# Tools\n\nYou may call one or more functions to assist with the user query.\n\nYou are provided with function signatures within XML tags:\n" }} + {%- for tool in tools %} + {{- "\n" }} + {{- tool | tojson }} + {%- endfor %} + {{- "\n\n\nFor each function call, return a json object with function name and arguments within XML tags:\n\n{\"name\": , \"arguments\": }\n<|im_end|>\n" }} +{%- else %} + {%- if messages[0].role == 'system' %} + {{- '<|im_start|>system\n' + messages[0].content + '<|im_end|>\n' }} + {%- endif %} +{%- endif %} +{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %} +{%- for message in messages[::-1] %} + {%- set index = (messages|length - 1) - loop.index0 %} + {%- if ns.multi_step_tool and message.role == "user" and message.content is string and not(message.content.startswith('') and message.content.endswith('')) %} + {%- set ns.multi_step_tool = false %} + {%- set ns.last_query_index = index %} + {%- endif %} +{%- endfor %} +{%- for message in messages %} + {%- if message.content is string %} + {%- set content = message.content %} + {%- else %} + {%- set content = '' %} + {%- endif %} + {%- if (message.role == "user") or (message.role == "system" and not loop.first) %} + {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }} + {%- elif message.role == "assistant" %} + {%- set reasoning_content = '' %} + {%- if message.reasoning_content is string %} + {%- set reasoning_content = message.reasoning_content %} + {%- else %} + {%- if '' in content %} + {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %} + {%- set content = content.split('')[-1].lstrip('\n') %} + {%- endif %} + {%- endif %} + {%- if loop.index0 > ns.last_query_index %} + {%- if loop.last or (not loop.last and reasoning_content) %} + {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content.strip('\n') + '\n\n\n' + content.lstrip('\n') }} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- else %} + {{- '<|im_start|>' + message.role + '\n' + content }} + {%- endif %} + {%- if message.tool_calls %} + {%- for tool_call in message.tool_calls %} + {%- if (loop.first and content) or (not loop.first) %} + {{- '\n' }} + {%- endif %} + {%- if tool_call.function %} + {%- set tool_call = tool_call.function %} + {%- endif %} + {{- '\n{"name": "' }} + {{- tool_call.name }} + {{- '", "arguments": ' }} + {%- if tool_call.arguments is string %} + {{- tool_call.arguments }} + {%- else %} + {{- tool_call.arguments | tojson }} + {%- endif %} + {{- '}\n' }} + {%- endfor %} + {%- endif %} + {{- '<|im_end|>\n' }} + {%- elif message.role == "tool" %} + {%- if loop.first or (messages[loop.index0 - 1].role != "tool") %} + {{- '<|im_start|>user' }} + {%- endif %} + {{- '\n\n' }} + {{- content }} + {{- '\n' }} + {%- if loop.last or (messages[loop.index0 + 1].role != "tool") %} + {{- '<|im_end|>\n' }} + {%- endif %} + {%- endif %} +{%- endfor %} +{%- if add_generation_prompt %} + {{- '<|im_start|>assistant\n' }} + {%- if enable_thinking is defined and enable_thinking is false %} + {{- '\n\n\n\n' }} + {%- endif %} +{%- endif %} \ No newline at end of file diff --git a/image/mlx/prism-ml/bonsai-image-ternary-4B-mlx-2bit/tokenizer/merges.txt b/image/mlx/prism-ml/bonsai-image-ternary-4B-mlx-2bit/tokenizer/merges.txt new file mode 100644 index 0000000..80c1a19 --- /dev/null +++ b/image/mlx/prism-ml/bonsai-image-ternary-4B-mlx-2bit/tokenizer/merges.txt @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:8831e4f1a044471340f7c0a83d7bd71306a5b867e95fd870f74d0c5308a904d5 +size 1671853 diff --git a/image/mlx/prism-ml/bonsai-image-ternary-4B-mlx-2bit/tokenizer/special_tokens_map.json b/image/mlx/prism-ml/bonsai-image-ternary-4B-mlx-2bit/tokenizer/special_tokens_map.json new file mode 100644 index 0000000..ac23c0a --- /dev/null +++ b/image/mlx/prism-ml/bonsai-image-ternary-4B-mlx-2bit/tokenizer/special_tokens_map.json @@ -0,0 +1,31 @@ +{ + "additional_special_tokens": [ + "<|im_start|>", + "<|im_end|>", + "<|object_ref_start|>", + "<|object_ref_end|>", + "<|box_start|>", + "<|box_end|>", + "<|quad_start|>", + "<|quad_end|>", + "<|vision_start|>", + "<|vision_end|>", + "<|vision_pad|>", + "<|image_pad|>", + "<|video_pad|>" + ], + "eos_token": { + "content": "<|im_end|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false + }, + "pad_token": { + "content": "<|endoftext|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false + } +} diff --git a/image/mlx/prism-ml/bonsai-image-ternary-4B-mlx-2bit/tokenizer/tokenizer.json b/image/mlx/prism-ml/bonsai-image-ternary-4B-mlx-2bit/tokenizer/tokenizer.json new file mode 100644 index 0000000..cd71f61 --- /dev/null +++ b/image/mlx/prism-ml/bonsai-image-ternary-4B-mlx-2bit/tokenizer/tokenizer.json @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:aeb13307a71acd8fe81861d94ad54ab689df773318809eed3cbe794b4492dae4 +size 11422654 diff --git a/image/mlx/prism-ml/bonsai-image-ternary-4B-mlx-2bit/tokenizer/tokenizer_config.json b/image/mlx/prism-ml/bonsai-image-ternary-4B-mlx-2bit/tokenizer/tokenizer_config.json new file mode 100644 index 0000000..ddaf698 --- /dev/null +++ b/image/mlx/prism-ml/bonsai-image-ternary-4B-mlx-2bit/tokenizer/tokenizer_config.json @@ -0,0 +1,239 @@ +{ + "add_bos_token": false, + "add_prefix_space": false, + "added_tokens_decoder": { + "151643": { + "content": "<|endoftext|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "151644": { + "content": "<|im_start|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "151645": { + "content": "<|im_end|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "151646": { + "content": "<|object_ref_start|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "151647": { + "content": "<|object_ref_end|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "151648": { + "content": "<|box_start|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "151649": { + "content": "<|box_end|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "151650": { + "content": "<|quad_start|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "151651": { + "content": "<|quad_end|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "151652": { + "content": "<|vision_start|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "151653": { + "content": "<|vision_end|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "151654": { + "content": "<|vision_pad|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "151655": { + "content": "<|image_pad|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "151656": { + "content": "<|video_pad|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": true + }, + "151657": { + "content": "", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": false + }, + "151658": { + "content": "", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": false + }, + "151659": { + "content": "<|fim_prefix|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": false + }, + "151660": { + "content": "<|fim_middle|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": false + }, + "151661": { + "content": "<|fim_suffix|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": false + }, + "151662": { + "content": "<|fim_pad|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": false + }, + "151663": { + "content": "<|repo_name|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": false + }, + "151664": { + "content": "<|file_sep|>", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": false + }, + "151665": { + "content": "", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": false + }, + "151666": { + "content": "", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": false + }, + "151667": { + "content": "", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": false + }, + "151668": { + "content": "", + "lstrip": false, + "normalized": false, + "rstrip": false, + "single_word": false, + "special": false + } + }, + "additional_special_tokens": [ + "<|im_start|>", + "<|im_end|>", + "<|object_ref_start|>", + "<|object_ref_end|>", + "<|box_start|>", + "<|box_end|>", + "<|quad_start|>", + "<|quad_end|>", + "<|vision_start|>", + "<|vision_end|>", + "<|vision_pad|>", + "<|image_pad|>", + "<|video_pad|>" + ], + "bos_token": null, + "clean_up_tokenization_spaces": false, + "eos_token": "<|im_end|>", + "errors": "replace", + "extra_special_tokens": {}, + "model_max_length": 131072, + "pad_token": "<|endoftext|>", + "split_special_tokens": false, + "tokenizer_class": "Qwen2Tokenizer", + "unk_token": null +} diff --git a/image/mlx/prism-ml/bonsai-image-ternary-4B-mlx-2bit/tokenizer/vocab.json b/image/mlx/prism-ml/bonsai-image-ternary-4B-mlx-2bit/tokenizer/vocab.json new file mode 100644 index 0000000..6c49fc6 --- /dev/null +++ b/image/mlx/prism-ml/bonsai-image-ternary-4B-mlx-2bit/tokenizer/vocab.json @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:ca10d7e9fb3ed18575dd1e277a2579c16d108e32f27439684afa0e10b1440910 +size 2776833 diff --git a/image/mlx/prism-ml/bonsai-image-ternary-4B-mlx-2bit/transformer-packed-mflux/config.json b/image/mlx/prism-ml/bonsai-image-ternary-4B-mlx-2bit/transformer-packed-mflux/config.json new file mode 100644 index 0000000..b8badc8 --- /dev/null +++ b/image/mlx/prism-ml/bonsai-image-ternary-4B-mlx-2bit/transformer-packed-mflux/config.json @@ -0,0 +1,27 @@ +{ + "_class_name": "Flux2Transformer2DModel", + "_diffusers_version": "0.37.1", + "_name_or_path": "black-forest-labs/FLUX.2-klein-4B", + "attention_head_dim": 128, + "axes_dims_rope": [ + 32, + 32, + 32, + 32 + ], + "enable_time_sign_embed": false, + "eps": 1e-06, + "guidance_embeds": false, + "in_channels": 128, + "joint_attention_dim": 7680, + "mlp_ratio": 3.0, + "musubi_block_swap_device": "cpu", + "musubi_blocks_to_swap": 0, + "num_attention_heads": 24, + "num_layers": 5, + "num_single_layers": 20, + "out_channels": null, + "patch_size": 1, + "rope_theta": 2000, + "timestep_guidance_channels": 256 +} \ No newline at end of file diff --git a/image/mlx/prism-ml/bonsai-image-ternary-4B-mlx-2bit/transformer-packed-mflux/diffusion_pytorch_model.safetensors b/image/mlx/prism-ml/bonsai-image-ternary-4B-mlx-2bit/transformer-packed-mflux/diffusion_pytorch_model.safetensors new file mode 100644 index 0000000..013b275 --- /dev/null +++ b/image/mlx/prism-ml/bonsai-image-ternary-4B-mlx-2bit/transformer-packed-mflux/diffusion_pytorch_model.safetensors @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:b21737bdf02690b7d662907781c4dc8b8bf22a2c98b823b1ca3336f48371a84f +size 1425271472 diff --git a/image/mlx/prism-ml/bonsai-image-ternary-4B-mlx-2bit/transformer-packed-mflux/quantization_config.json b/image/mlx/prism-ml/bonsai-image-ternary-4B-mlx-2bit/transformer-packed-mflux/quantization_config.json new file mode 100644 index 0000000..07ffa32 --- /dev/null +++ b/image/mlx/prism-ml/bonsai-image-ternary-4B-mlx-2bit/transformer-packed-mflux/quantization_config.json @@ -0,0 +1,120 @@ +{ + "format": "mlx-packed-affine", + "solver": "ternary", + "bits": 2, + "group_size": 128, + "scale_dtype": "bfloat16", + "skip_patterns": [ + "proj_out", + "x_embedder", + "context_embedder", + "time_text_embed", + "time_guidance_embed", + "norm_out", + "double_stream_modulation_img", + "double_stream_modulation_txt", + "single_stream_modulation" + ], + "quantized_modules": [ + "single_transformer_blocks.0.attn.to_out", + "single_transformer_blocks.0.attn.to_qkv_mlp_proj", + "single_transformer_blocks.1.attn.to_out", + "single_transformer_blocks.1.attn.to_qkv_mlp_proj", + "single_transformer_blocks.10.attn.to_out", + "single_transformer_blocks.10.attn.to_qkv_mlp_proj", + "single_transformer_blocks.11.attn.to_out", + "single_transformer_blocks.11.attn.to_qkv_mlp_proj", + "single_transformer_blocks.12.attn.to_out", + "single_transformer_blocks.12.attn.to_qkv_mlp_proj", + "single_transformer_blocks.13.attn.to_out", + "single_transformer_blocks.13.attn.to_qkv_mlp_proj", + "single_transformer_blocks.14.attn.to_out", + "single_transformer_blocks.14.attn.to_qkv_mlp_proj", + "single_transformer_blocks.15.attn.to_out", + "single_transformer_blocks.15.attn.to_qkv_mlp_proj", + "single_transformer_blocks.16.attn.to_out", + "single_transformer_blocks.16.attn.to_qkv_mlp_proj", + "single_transformer_blocks.17.attn.to_out", + "single_transformer_blocks.17.attn.to_qkv_mlp_proj", + "single_transformer_blocks.18.attn.to_out", + "single_transformer_blocks.18.attn.to_qkv_mlp_proj", + "single_transformer_blocks.19.attn.to_out", + "single_transformer_blocks.19.attn.to_qkv_mlp_proj", + "single_transformer_blocks.2.attn.to_out", + "single_transformer_blocks.2.attn.to_qkv_mlp_proj", + "single_transformer_blocks.3.attn.to_out", + "single_transformer_blocks.3.attn.to_qkv_mlp_proj", + "single_transformer_blocks.4.attn.to_out", + "single_transformer_blocks.4.attn.to_qkv_mlp_proj", + "single_transformer_blocks.5.attn.to_out", + "single_transformer_blocks.5.attn.to_qkv_mlp_proj", + "single_transformer_blocks.6.attn.to_out", + "single_transformer_blocks.6.attn.to_qkv_mlp_proj", + "single_transformer_blocks.7.attn.to_out", + "single_transformer_blocks.7.attn.to_qkv_mlp_proj", + "single_transformer_blocks.8.attn.to_out", + "single_transformer_blocks.8.attn.to_qkv_mlp_proj", + "single_transformer_blocks.9.attn.to_out", + "single_transformer_blocks.9.attn.to_qkv_mlp_proj", + "transformer_blocks.0.attn.add_k_proj", + "transformer_blocks.0.attn.add_q_proj", + "transformer_blocks.0.attn.add_v_proj", + "transformer_blocks.0.attn.to_add_out", + "transformer_blocks.0.attn.to_k", + "transformer_blocks.0.attn.to_out.0", + "transformer_blocks.0.attn.to_q", + "transformer_blocks.0.attn.to_v", + "transformer_blocks.0.ff.linear_in", + "transformer_blocks.0.ff.linear_out", + "transformer_blocks.0.ff_context.linear_in", + "transformer_blocks.0.ff_context.linear_out", + "transformer_blocks.1.attn.add_k_proj", + "transformer_blocks.1.attn.add_q_proj", + "transformer_blocks.1.attn.add_v_proj", + "transformer_blocks.1.attn.to_add_out", + "transformer_blocks.1.attn.to_k", + "transformer_blocks.1.attn.to_out.0", + "transformer_blocks.1.attn.to_q", + "transformer_blocks.1.attn.to_v", + "transformer_blocks.1.ff.linear_in", + "transformer_blocks.1.ff.linear_out", + "transformer_blocks.1.ff_context.linear_in", + "transformer_blocks.1.ff_context.linear_out", + "transformer_blocks.2.attn.add_k_proj", + "transformer_blocks.2.attn.add_q_proj", + "transformer_blocks.2.attn.add_v_proj", + "transformer_blocks.2.attn.to_add_out", + "transformer_blocks.2.attn.to_k", + "transformer_blocks.2.attn.to_out.0", + "transformer_blocks.2.attn.to_q", + "transformer_blocks.2.attn.to_v", + "transformer_blocks.2.ff.linear_in", + "transformer_blocks.2.ff.linear_out", + "transformer_blocks.2.ff_context.linear_in", + "transformer_blocks.2.ff_context.linear_out", + "transformer_blocks.3.attn.add_k_proj", + "transformer_blocks.3.attn.add_q_proj", + "transformer_blocks.3.attn.add_v_proj", + "transformer_blocks.3.attn.to_add_out", + "transformer_blocks.3.attn.to_k", + "transformer_blocks.3.attn.to_out.0", + "transformer_blocks.3.attn.to_q", + "transformer_blocks.3.attn.to_v", + "transformer_blocks.3.ff.linear_in", + "transformer_blocks.3.ff.linear_out", + "transformer_blocks.3.ff_context.linear_in", + "transformer_blocks.3.ff_context.linear_out", + "transformer_blocks.4.attn.add_k_proj", + "transformer_blocks.4.attn.add_q_proj", + "transformer_blocks.4.attn.add_v_proj", + "transformer_blocks.4.attn.to_add_out", + "transformer_blocks.4.attn.to_k", + "transformer_blocks.4.attn.to_out.0", + "transformer_blocks.4.attn.to_q", + "transformer_blocks.4.attn.to_v", + "transformer_blocks.4.ff.linear_in", + "transformer_blocks.4.ff.linear_out", + "transformer_blocks.4.ff_context.linear_in", + "transformer_blocks.4.ff_context.linear_out" + ] +} diff --git a/image/mlx/prism-ml/bonsai-image-ternary-4B-mlx-2bit/vae/config.json b/image/mlx/prism-ml/bonsai-image-ternary-4B-mlx-2bit/vae/config.json new file mode 100644 index 0000000..c3f38eb --- /dev/null +++ b/image/mlx/prism-ml/bonsai-image-ternary-4B-mlx-2bit/vae/config.json @@ -0,0 +1,40 @@ +{ + "_class_name": "AutoencoderKLFlux2", + "_diffusers_version": "0.37.0.dev0", + "_name_or_path": "black-forest-labs/FLUX.2-dev", + "act_fn": "silu", + "batch_norm_eps": 0.0001, + "batch_norm_momentum": 0.1, + "block_out_channels": [ + 128, + 256, + 512, + 512 + ], + "down_block_types": [ + "DownEncoderBlock2D", + "DownEncoderBlock2D", + "DownEncoderBlock2D", + "DownEncoderBlock2D" + ], + "force_upcast": true, + "in_channels": 3, + "latent_channels": 32, + "layers_per_block": 2, + "mid_block_add_attention": true, + "norm_num_groups": 32, + "out_channels": 3, + "patch_size": [ + 2, + 2 + ], + "sample_size": 1024, + "up_block_types": [ + "UpDecoderBlock2D", + "UpDecoderBlock2D", + "UpDecoderBlock2D", + "UpDecoderBlock2D" + ], + "use_post_quant_conv": true, + "use_quant_conv": true +} diff --git a/image/mlx/prism-ml/bonsai-image-ternary-4B-mlx-2bit/vae/diffusion_pytorch_model.safetensors b/image/mlx/prism-ml/bonsai-image-ternary-4B-mlx-2bit/vae/diffusion_pytorch_model.safetensors new file mode 100644 index 0000000..0654e17 --- /dev/null +++ b/image/mlx/prism-ml/bonsai-image-ternary-4B-mlx-2bit/vae/diffusion_pytorch_model.safetensors @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:ca70d2202afe6415bdbcb8793ba8cd99fd159cfe6192381504d6c4d3036e0f04 +size 168120878